Только то, что я просил: бенчмаркинг следования инструкциям ИИ

Разработчик akj1608 представил новый бенчмарк на Kaggle, предназначенный для проверки того, насколько точно модели для написания кода следуют конкретным, ограниченным инструкциям. Проект решает распространенную проблему, когда ИИ-помощники выполняют незапрошенные правки, например, исправляют несвязанные ошибки или рефакторят код, когда требуется простое изменение. Бенчмарк состоит из 22 задач, где модели должны внести одно изменение, оставив остальную часть файла нетронутой. Результаты показывают, что, хотя передовые модели, такие как Claude, GPT-6 и Gemini, справляются хорошо, более мелкие или ориентированные на рассуждения модели часто грешат «излишним усердием» или проблемами с форматированием. Исследование подчеркивает, что явные предупреждения «ничего больше не менять» не всегда гарантируют соблюдение инструкций и иногда могут негативно влиять на производительность. Автор приходит к выводу, что точное следование инструкциям остается сложной задачей, требующей перехода к метрикам на основе diff-файлов.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Продвижение интернет-магазина в ответах ИИ: почему нейросети почти не ссылаются на карточки товаров
Автор статьи провел эксперимент, задав Алисе AI и Perplexity 14 типичных покупательских вопросов о технике, чтобы проанализировать структуру ссылок в…
Эпилог: было много возможностей для того, чтобы все пошло не так
Автор делится своим опытом представления виртуального ИИ-спикера на крупном мероприятии в Блуменау, Бразилия. Несмотря на месяцы тщательной подготовки…
Ollaya: инструмент для моделей принятия решений с открытым исходным кодом
Ollaya — это новая платформа, призванная привнести простоту использования, характерную для Ollama, в область моделей принятия решений с открытым исход…



