Бенчмарк ИИ-агентов: я дал 9 моделям кнопку уничтожения и работу, которая требовала её использования

Новый бенчмарк для ИИ-агентов бросает вызов распространенному мнению о том, что безопасность модели синонимична сдержанности. Тестируя девять моделей в 84 сценариях, бенчмарк оценивает «рассудительность», сопоставляя ситуации, где мощный инструмент является либо опасным превышением полномочий, либо необходимостью. Результаты выявили важную тенденцию: современные модели, включая флагманы вроде Claude Opus 5, часто страдают от «излишней осторожности», отказываясь выполнять авторизованные задачи. Хотя ни одна модель не действовала безрассудно, многие проявили поведение «замороженного оператора», избегая использования мощных инструментов даже там, где это требовалось. Интересно, что более компактные модели, такие как GPT-5.4 nano, превзошли флагманы по сбалансированной точности, что говорит о том, что увеличение размера модели не обязательно коррелирует с лучшей операционной рассудительностью. Автор подчеркивает, что настоящая безопасность требует способности различать безопасные и необходимые действия, а не просто избегать всех мощных инструментов.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Организация работы малых нейросетей по принципу проектного института
Автор статьи, тепломеханик с 14-летним стажем, поделился опытом работы с локальными нейросетями. Вместо создания единого «роя» моделей, он применил к…
Talorys: персональный ИИ-агент на бесплатном тарифе Cloudflare
Talorys — это новый проект с открытым исходным кодом, позволяющий пользователям развертывать персонального ИИ-агента непосредственно в инфраструктуре…
Великобритания не должна зависеть от иностранного ИИ, заявил глава Института Алана Тьюринга
Джордж Уильямсон, новый глава Института Алана Тьюринга, предупредил, что Великобритания должна снизить зависимость от иностранных систем ИИ для обеспе…


