Я заставил два ИИ проверять код друг друга в течение 30 дней. Человек нашел баг за 5 минут.

Разработчик провел эксперимент с использованием двух ИИ-агентов для контроля качества кода: «автор» писал функции, а «скептик» проводил состязательную проверку. За 30 дней скептик успешно выявил 38 из 41 проблемы, включая архитектурные ошибки и состояния гонки. Однако система пропустила критические логические ошибки, такие как некорректный обработчик вебхуков, подтверждающий событие до записи в базу данных. Автор делает вывод, что хотя ИИ-ревью эффективно для рутинных задач, оно страдает от общих «слепых зон», когда оба агента принадлежат к одному семейству моделей. Эксперимент подчеркивает, что человеческий контроль остается необходимым, особенно для инженеров с опытом прошлых неудач, который ИИ не может воспроизвести. Автор утверждает, что для достижения истинной независимости при проверке кода необходимо использовать разные семейства моделей, состязательные промпты и финальную проверку человеком для обеспечения надежности системы.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Я заставил начальника AI-офиса материться на агентов. И только потом понял, что именно сработало
Автор статьи делится необычным опытом оптимизации работы AI-агентов. Столкнувшись с тем, что вежливые и старательные агенты выдают посредственные резу…
Я продаю API памяти и создаю бенчмарк. Вот как я пытаюсь избежать подтасовок
Разработчик из Wontopos по имени Woochan представил новый прозрачный бенчмарк для оценки возможностей памяти LLM. Проект призван решить проблему недов…
Статья «С кем согласовано?» исследует сложную и зачастую неоднозначную природу согласования ИИ. Автор оспаривает распространенный в индустрии нарратив…



