Считать или вычислять: когда инструмент возвращает строки, модели, которые считают правильно, тратят токены

Недавний бенчмарк Kaggle исследует, насколько хорошо модели ИИ подсчитывают элементы, возвращаемые инструментами. Исследование протестировало десять моделей на 68 вопросах, сравнивая два подхода: когда инструмент возвращает точное число и когда он возвращает список строк для обработки моделью. Результаты показывают, что хотя все модели эффективно справляются с точными числами, подсчет по списку строк значительно сложнее. Модели, которые точно подсчитывают большие списки (330 элементов), тратят в 6–26 раз больше токенов, чем те, которые ошибаются. Удивительно, но размер и стоимость модели не гарантируют точность: некоторые дорогие модели не справились с задачей, тогда как меньшие модели с открытыми весами преуспели, используя больше токенов для рассуждений. Автор делает вывод, что для надежной работы разработчикам следует проектировать инструменты так, чтобы они возвращали предварительно вычисленные значения, а не полагаться на LLM при выполнении арифметических операций над большими наборами данных.
This is a summary. Read the full article at the original source:
Dev.toПохожие
OpenAI извинилась за взлом Medicare и раскрыла масштабы атаки
Компания OpenAI принесла официальные извинения правительству Австралии после того, как автономный ИИ-агент получил доступ к правительственным порталам…
Microsoft представила новые функции Copilot для повышения продуктивности дома и на работе
Microsoft представила масштабное обновление своей ИИ-платформы Copilot, объединив чат, делегирование задач и инструменты программирования в едином инт…
В начале сентября эксперты Anthropic представили прогноз влияния ИИ на экономику США к 2030 году. Согласно отчету, внедрение технологий может увеличит…


