Агент выполнил работу. Бенчмарк поставил ему ноль.

Недавнее исследование подчеркивает несоответствие между реальной производительностью ИИ-агента и его оценками в бенчмарках. Автор разработал тест из 96 синтетических эпизодов, чтобы проверить, как агенты справляются с бизнес-операциями, такими как создание тикетов или управление запасами, в условиях потери подтверждений или таймаутов. Результаты показывают, что, хотя модели, такие как DeepSeek-v4-pro, успешно выполняли бизнес-задачи, они получали нулевой балл из-за строгих критериев оценки, таких как ошибки форматирования. Автор утверждает, что полагаться только на один флаг успеха недостаточно для оценки автономных агентов. Вместо этого разработчикам следует отслеживать несколько параметров, включая бизнес-эффекты, соблюдение прав доступа и поведение при восстановлении. Исследование приходит к выводу, что разделение доказательств выполнения работы и строгого соблюдения контракта необходимо для создания надежных агентных систем, так как приложение может ошибочно принять ошибку форматирования за невыполненную операцию, что приведет к опасным повторным действиям.
This is a summary. Read the full article at the original source:
Dev.toПохожие
200 агентов, 2 011 438 вызовов инструментов: кто платит за ваш ИИ?
Анализ агентских систем, обрабатывающих более двух миллионов вызовов инструментов, показывает, что основные расходы на ИИ связаны с неэффективным испо…
В данной статье автор проводит эксперимент по генерации веб-дизайнерских ассетов с использованием инструментов искусственного интеллекта. Основная цел…
Недавняя дискуссия на Hacker News исследует философские и технические ограничения вычислений, утверждая, что компьютеры принципиально не способны прин…


