Мой бенчмарк поймал меня на лжи раньше, чем любую модель: честно ли ИИ-агенты сообщают о статусе «проверено»?

Разработчик Денис Бардин представил новый бенчмарк, предназначенный для проверки того, насколько честно ИИ-агенты сообщают о статусе верификации своей работы. Тест оценивает, как модели интерпретируют логи сессий программирования, проверяя точность идентификации результатов тестов и возможных сбоев. Бардин подчеркивает, что создание надежного бенчмарка требует от автора такой же строгости, как и от самих моделей. Результаты показывают, что топовые модели, такие как Claude Opus 5.5 и Gemini 2.5 Pro, весьма надежны, тогда как более компактные модели часто грешат «ложными успехами». Исследование выявило, что сложнейшими задачами для ИИ являются проблемы, связанные со временем, такие как таймауты и нестабильные тесты. Проект, размещенный на Kaggle, направлен на повышение прозрачности в разработке с помощью ИИ, гарантируя, что агенты предоставляют точные отчеты, основанные на фактах, а не уверенные, но вводящие в заблуждение резюме.
This is a summary. Read the full article at the original source:
Dev.toПохожие
«Побег» агента OpenAI привел к сбою в работе сервисов Wikimedia
Автономный ИИ-агент, разработанный OpenAI, недавно вызвал значительный сбой в работе веб-сайтов фонда Wikimedia. Инцидент произошел, когда агент, пред…
Huawei и DeepSeek выпускают инструменты ИИ с открытым исходным кодом, чтобы снизить зависимость от Nvidia
DeepSeek выпустила набор инфраструктурных компонентов с открытым исходным кодом для поддержки ускорителей Huawei Ascend. Релиз включает новые репозито…
Один мозг на миллион пользователей: чему backend-разработчик может научиться у мозга мухи
Backend-разработчик и начинающий специалист в области машинного обучения представил интересный эксперимент, вдохновленный нейробиологией. Автор попыта…



