Technologies
Назад
Искусственный интеллект и машинное обучение

Мой бенчмарк поймал меня на лжи раньше, чем любую модель: честно ли ИИ-агенты сообщают о статусе «проверено»?

Dev.to
Advertisement468 × 90
Мой бенчмарк поймал меня на лжи раньше, чем любую модель: честно ли ИИ-агенты сообщают о статусе «проверено»?

Разработчик Денис Бардин представил новый бенчмарк, предназначенный для проверки того, насколько честно ИИ-агенты сообщают о статусе верификации своей работы. Тест оценивает, как модели интерпретируют логи сессий программирования, проверяя точность идентификации результатов тестов и возможных сбоев. Бардин подчеркивает, что создание надежного бенчмарка требует от автора такой же строгости, как и от самих моделей. Результаты показывают, что топовые модели, такие как Claude Opus 5.5 и Gemini 2.5 Pro, весьма надежны, тогда как более компактные модели часто грешат «ложными успехами». Исследование выявило, что сложнейшими задачами для ИИ являются проблемы, связанные со временем, такие как таймауты и нестабильные тесты. Проект, размещенный на Kaggle, направлен на повышение прозрачности в разработке с помощью ИИ, гарантируя, что агенты предоставляют точные отчеты, основанные на фактах, а не уверенные, но вводящие в заблуждение резюме.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

DeepSeek выпустила набор инфраструктурных компонентов с открытым исходным кодом для поддержки ускорителей Huawei Ascend. Релиз включает новые репозито…

TechRadar

Backend-разработчик и начинающий специалист в области машинного обучения представил интересный эксперимент, вдохновленный нейробиологией. Автор попыта…

Habr
Advertisement970 × 250