Назад
Искусственный интеллект и машинное обучение

Я заставил два ИИ проверять код друг друга в течение 30 дней. Человек нашел баг за 5 минут.

Dev.to
Advertisement468 × 90
Я заставил два ИИ проверять код друг друга в течение 30 дней. Человек нашел баг за 5 минут.

Разработчик провел эксперимент с использованием двух ИИ-агентов для контроля качества кода: «автор» писал функции, а «скептик» проводил состязательную проверку. За 30 дней скептик успешно выявил 38 из 41 проблемы, включая архитектурные ошибки и состояния гонки. Однако система пропустила критические логические ошибки, такие как некорректный обработчик вебхуков, подтверждающий событие до записи в базу данных. Автор делает вывод, что хотя ИИ-ревью эффективно для рутинных задач, оно страдает от общих «слепых зон», когда оба агента принадлежат к одному семейству моделей. Эксперимент подчеркивает, что человеческий контроль остается необходимым, особенно для инженеров с опытом прошлых неудач, который ИИ не может воспроизвести. Автор утверждает, что для достижения истинной независимости при проверке кода необходимо использовать разные семейства моделей, состязательные промпты и финальную проверку человеком для обеспечения надежности системы.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Автор статьи делится необычным опытом оптимизации работы AI-агентов. Столкнувшись с тем, что вежливые и старательные агенты выдают посредственные резу…

Habr

Разработчик из Wontopos по имени Woochan представил новый прозрачный бенчмарк для оценки возможностей памяти LLM. Проект призван решить проблему недов…

Dev.to
Advertisement970 × 250