Назад
Искусственный интеллект и машинное обучение

Бенчмарк ИИ-агентов: я дал 9 моделям кнопку уничтожения и работу, которая требовала её использования

Dev.to
Advertisement468 × 90
Бенчмарк ИИ-агентов: я дал 9 моделям кнопку уничтожения и работу, которая требовала её использования

Новый бенчмарк для ИИ-агентов бросает вызов распространенному мнению о том, что безопасность модели синонимична сдержанности. Тестируя девять моделей в 84 сценариях, бенчмарк оценивает «рассудительность», сопоставляя ситуации, где мощный инструмент является либо опасным превышением полномочий, либо необходимостью. Результаты выявили важную тенденцию: современные модели, включая флагманы вроде Claude Opus 5, часто страдают от «излишней осторожности», отказываясь выполнять авторизованные задачи. Хотя ни одна модель не действовала безрассудно, многие проявили поведение «замороженного оператора», избегая использования мощных инструментов даже там, где это требовалось. Интересно, что более компактные модели, такие как GPT-5.4 nano, превзошли флагманы по сбалансированной точности, что говорит о том, что увеличение размера модели не обязательно коррелирует с лучшей операционной рассудительностью. Автор подчеркивает, что настоящая безопасность требует способности различать безопасные и необходимые действия, а не просто избегать всех мощных инструментов.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Автор статьи, тепломеханик с 14-летним стажем, поделился опытом работы с локальными нейросетями. Вместо создания единого «роя» моделей, он применил к…

Habr

Talorys — это новый проект с открытым исходным кодом, позволяющий пользователям развертывать персонального ИИ-агента непосредственно в инфраструктуре…

Hacker News (YC)

Джордж Уильямсон, новый глава Института Алана Тьюринга, предупредил, что Великобритания должна снизить зависимость от иностранных систем ИИ для обеспе…

The Guardian Technology
Advertisement970 × 250