LLM проходят тест по Data Science, но дают разные советы: бенчмарк Kaggle из 36 измеренных кейсов

Новое исследование Kaggle выявило значительный разрыв между тем, как большие языковые модели (LLM) справляются с тестами по Data Science и как они дают советы в реальных задачах. Протестировав 11 моделей на 36 кейсах, требующих экспертных суждений, исследование показало, что при точности 94–100% в тестах с выбором ответа, эффективность моделей резко падает в открытых сценариях. Исследование подчеркивает, что модели часто дают верные практические рекомендации, но опираются на неверную аргументацию или ошибочные эвристики. Автор отмечает, что модели успешно избегают классических «ловушек», но с трудом объясняют механизмы принятия решений. Этот бенчмарк, включающий модели от Google, Anthropic, OpenAI и других, показывает, что, хотя LLM отлично распознают стандартные решения, они остаются недостаточно надежными при предоставлении обоснованных рекомендаций для сложных, нестандартных задач в области анализа данных.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Мужчина приговорен к тюремному заключению за использование 1000 ботов для получения $8 млн на ИИ-музыке
Майкл Смит из Северной Каролины был приговорен к 18 месяцам тюремного заключения за организацию масштабной схемы мошенничества со стримингом. В период…
AskAnyModel предлагает пожизненный доступ к 50+ моделям ИИ за $29.97
Новое акционное предложение позволяет пользователям приобрести пожизненную подписку на план AskAnyModel AI Pro за $29.97, что значительно ниже стандар…
Разработчик нетекстовой ИИ-модели Jev оценен в $7,5 млрд через несколько недель после запуска
Стартап TypeSafe, создавший новую ИИ-модель Jev, достиг оценки в 7,5 миллиардов долларов всего через несколько недель после своего публичного дебюта.…



