Правильно оформленное число — это не измерение: 13 дефектов в 7 инструментах оценки

Недавнее исследование выявило критическую проблему в программном обеспечении для оценки LLM и ИИ-агентов: склонность выдавать корректно оформленные числа, не имеющие под собой эмпирического обоснования. Автор проанализировал семь инструментов оценки с открытым исходным кодом, включая MLflow и DSPy, выявив 13 дефектов, при которых инструменты выдавали результаты, не подтвержденные доказательствами. Ошибки варьировались от неверных знаков в пороговых значениях до использования устаревших данных. Автор подчеркивает, что это не статистические проблемы, а фундаментальные ошибки измерения, когда программа дает внешне точный ответ на неверный вопрос. Классифицируя эти дефекты, отчет призван повысить надежность автоматизированных конвейеров оценки. Автор, разработчик инструмента Driftproof, призывает относиться к ПО для оценки с той же долей скептицизма, что и к любому научному прибору, проверяя, действительно ли код измеряет то, что заявлено в его результатах.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Стоит ли писать ИИ-агентам на английском ради экономии токенов?
Автор статьи решил проверить популярный совет о том, что использование английского языка при общении с ИИ-агентами значительно экономит токены по срав…
Протестующие переходят к прямым действиям против ИИ-компаний
Растущее движение анти-ИИ активистов все чаще прибегает к прямым действиям, протестуя против стремительного развития искусственного интеллекта. Такие…
Google может расширить функцию Gemini «Call for Me» на личные контакты
Google планирует расширить возможности своей функции «Call for Me» на базе искусственного интеллекта, которая в настоящее время помогает пользователям…

