Назад
Искусственный интеллект и машинное обучение

Агент выполнил работу. Бенчмарк поставил ему ноль.

Dev.to
Advertisement468 × 90
Агент выполнил работу. Бенчмарк поставил ему ноль.

Недавнее исследование подчеркивает несоответствие между реальной производительностью ИИ-агента и его оценками в бенчмарках. Автор разработал тест из 96 синтетических эпизодов, чтобы проверить, как агенты справляются с бизнес-операциями, такими как создание тикетов или управление запасами, в условиях потери подтверждений или таймаутов. Результаты показывают, что, хотя модели, такие как DeepSeek-v4-pro, успешно выполняли бизнес-задачи, они получали нулевой балл из-за строгих критериев оценки, таких как ошибки форматирования. Автор утверждает, что полагаться только на один флаг успеха недостаточно для оценки автономных агентов. Вместо этого разработчикам следует отслеживать несколько параметров, включая бизнес-эффекты, соблюдение прав доступа и поведение при восстановлении. Исследование приходит к выводу, что разделение доказательств выполнения работы и строгого соблюдения контракта необходимо для создания надежных агентных систем, так как приложение может ошибочно принять ошибку форматирования за невыполненную операцию, что приведет к опасным повторным действиям.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Анализ агентских систем, обрабатывающих более двух миллионов вызовов инструментов, показывает, что основные расходы на ИИ связаны с неэффективным испо…

Dev.to
Advertisement970 × 250