Центы имеют значение: замечает ли модель изменение одного финансового факта?

Новый бенчмарк «Cents Matter / Centavos Importam» оценивает способность LLM к точному финансовому мышлению. Тест, созданный для Kaggle Benchmarking Challenge, включает 40 синтетических кейсов на бразильском португальском языке, разбитых на 20 минимальных пар, где меняется лишь один существенный факт. Модели должны без внешних инструментов выявлять расхождения в денежных расчетах. В исследовании тестировались Gemini 3.7 Flash, gpt-oss-20b и Claude Haiku 4.5. Результаты показали значительный разрыв: Gemini 3.7 Flash достиг точности 97.5%, тогда как Claude Haiku 4.5 показал 47.5%. Автор подчеркивает, что, хотя модели хорошо справляются с общими задачами, их логическая последовательность при изменении финансовых переменных остается нестабильной. Этот бенчмарк с открытым исходным кодом позволяет прозрачно увидеть, как различные архитектуры справляются с детерминированной финансовой логикой, подчеркивая, что высокий уровень рассуждений не всегда гарантирует точность в арифметике бухгалтерского типа.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Маленькая модель. Большие решения. Как я создал модель принятия решений на 144 млн параметров, которая снимает 82% нагрузки с LLM
Разработчик Перри Линк представил Phocinae-Largha-150M-v1 — специализированную модель на 144 миллиона параметров, предназначенную для обработки рутинн…
«ПО больше нет»: разработчик ИИ бросает вызов Adobe с помощью open-source клонов
Разработчик Брэндон Томас запустил амбициозный проект по замене Adobe Creative Suite набором из семи приложений с открытым исходным кодом. Используя м…
Google запустила Playground, платформу для создания браузерных игр на базе ИИ
Google представила Playground, экспериментальную платформу, призванную упростить разработку браузерных игр с помощью генеративного ИИ. Инструмент позв…



