Назад
Искусственный интеллект и машинное обучение

Только то, что я просил: бенчмаркинг следования инструкциям ИИ

Dev.to
Advertisement468 × 90
Только то, что я просил: бенчмаркинг следования инструкциям ИИ

Разработчик akj1608 представил новый бенчмарк на Kaggle, предназначенный для проверки того, насколько точно модели для написания кода следуют конкретным, ограниченным инструкциям. Проект решает распространенную проблему, когда ИИ-помощники выполняют незапрошенные правки, например, исправляют несвязанные ошибки или рефакторят код, когда требуется простое изменение. Бенчмарк состоит из 22 задач, где модели должны внести одно изменение, оставив остальную часть файла нетронутой. Результаты показывают, что, хотя передовые модели, такие как Claude, GPT-6 и Gemini, справляются хорошо, более мелкие или ориентированные на рассуждения модели часто грешат «излишним усердием» или проблемами с форматированием. Исследование подчеркивает, что явные предупреждения «ничего больше не менять» не всегда гарантируют соблюдение инструкций и иногда могут негативно влиять на производительность. Автор приходит к выводу, что точное следование инструкциям остается сложной задачей, требующей перехода к метрикам на основе diff-файлов.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Автор статьи провел эксперимент, задав Алисе AI и Perplexity 14 типичных покупательских вопросов о технике, чтобы проанализировать структуру ссылок в…

Habr

Автор делится своим опытом представления виртуального ИИ-спикера на крупном мероприятии в Блуменау, Бразилия. Несмотря на месяцы тщательной подготовки…

Dev.to

Ollaya — это новая платформа, призванная привнести простоту использования, характерную для Ollama, в область моделей принятия решений с открытым исход…

Hacker News (YC)
Advertisement970 × 250