Назад
Искусственный интеллект и машинное обучение

Правильно оформленное число — это не измерение: 13 дефектов в 7 инструментах оценки

Dev.to
Advertisement468 × 90
Правильно оформленное число — это не измерение: 13 дефектов в 7 инструментах оценки

Недавнее исследование выявило критическую проблему в программном обеспечении для оценки LLM и ИИ-агентов: склонность выдавать корректно оформленные числа, не имеющие под собой эмпирического обоснования. Автор проанализировал семь инструментов оценки с открытым исходным кодом, включая MLflow и DSPy, выявив 13 дефектов, при которых инструменты выдавали результаты, не подтвержденные доказательствами. Ошибки варьировались от неверных знаков в пороговых значениях до использования устаревших данных. Автор подчеркивает, что это не статистические проблемы, а фундаментальные ошибки измерения, когда программа дает внешне точный ответ на неверный вопрос. Классифицируя эти дефекты, отчет призван повысить надежность автоматизированных конвейеров оценки. Автор, разработчик инструмента Driftproof, призывает относиться к ПО для оценки с той же долей скептицизма, что и к любому научному прибору, проверяя, действительно ли код измеряет то, что заявлено в его результатах.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Автор статьи решил проверить популярный совет о том, что использование английского языка при общении с ИИ-агентами значительно экономит токены по срав…

Habr

Растущее движение анти-ИИ активистов все чаще прибегает к прямым действиям, протестуя против стремительного развития искусственного интеллекта. Такие…

The Guardian Technology
Advertisement970 × 250