Черновики, которые не вышли: считают ли LLM мертвые предложения реальными стандартами?

Новое исследование изучает, ошибочно ли большие языковые модели (LLM) воспринимают отклоненные или заброшенные технические предложения — такие как отозванные эмодзи, отложенные Python PEP и истекшие черновики IETF — как действующие стандарты. Были протестированы восемь моделей от пяти различных лабораторий. Результаты показывают, что модели часто выдают «мертвые» предложения за реальные: 26% ответов утверждают, что нереализованные стандарты существуют. Даже когда модели правильно определяют статус предложения, они часто включают их в сгенерированный код или цитаты, что приводит к ошибкам компиляции или вымышленным ссылкам на RFC. Исследование подчеркивает, что, хотя предоставление фактических доказательств в промптах значительно снижает количество ошибок, проблема остается актуальной как для малых, так и для крупных моделей, что указывает на то, что устаревшие спецификации в обучающих данных являются основным источником подобных технических галлюцинаций.
This is a summary. Read the full article at the original source:
Dev.toПохожие
ИИ создает «человеческую надбавку» для искусства, созданного людьми
По мере того как инструменты генеративного искусственного интеллекта становятся все более способными создавать высококачественные изображения, тексты…
Недавнее исследование инструментов для разработки игр на базе искусственного интеллекта от Google выявило текущие ограничения генеративных технологий…
Пилот ИИ-сериала за 900 рублей на GPU с Kandinsky 6: проверка диалогов персонажей
Автор статьи поделился опытом создания пилотного эпизода собственного сериала с использованием модели Kandinsky 6. Проект длительностью 52,2 секунды в…

