Назад
Искусственный интеллект и машинное обучение

Центы имеют значение: замечает ли модель изменение одного финансового факта?

Dev.to
Advertisement468 × 90
Центы имеют значение: замечает ли модель изменение одного финансового факта?

Новый бенчмарк «Cents Matter / Centavos Importam» оценивает способность LLM к точному финансовому мышлению. Тест, созданный для Kaggle Benchmarking Challenge, включает 40 синтетических кейсов на бразильском португальском языке, разбитых на 20 минимальных пар, где меняется лишь один существенный факт. Модели должны без внешних инструментов выявлять расхождения в денежных расчетах. В исследовании тестировались Gemini 3.7 Flash, gpt-oss-20b и Claude Haiku 4.5. Результаты показали значительный разрыв: Gemini 3.7 Flash достиг точности 97.5%, тогда как Claude Haiku 4.5 показал 47.5%. Автор подчеркивает, что, хотя модели хорошо справляются с общими задачами, их логическая последовательность при изменении финансовых переменных остается нестабильной. Этот бенчмарк с открытым исходным кодом позволяет прозрачно увидеть, как различные архитектуры справляются с детерминированной финансовой логикой, подчеркивая, что высокий уровень рассуждений не всегда гарантирует точность в арифметике бухгалтерского типа.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Разработчик Перри Линк представил Phocinae-Largha-150M-v1 — специализированную модель на 144 миллиона параметров, предназначенную для обработки рутинн…

Dev.to

Разработчик Брэндон Томас запустил амбициозный проект по замене Adobe Creative Suite набором из семи приложений с открытым исходным кодом. Используя м…

Ars Technica

Google представила Playground, экспериментальную платформу, призванную упростить разработку браузерных игр с помощью генеративного ИИ. Инструмент позв…

Mashable
Advertisement970 × 250