Назад
Искусственный интеллект и машинное обучение

Gemini 4 победила в бенчмарках. Почему это всё меньше говорит о качестве модели

Habr
Advertisement468 × 90
Gemini 4 победила в бенчмарках. Почему это всё меньше говорит о качестве модели

Google представила Gemini 4 Argon, которая, согласно официальным данным, лидирует в 12 из 18 бенчмарков. Однако эксперты отмечают, что ситуация повторяет сценарий релиза Gemini 3.1 Pro, который впоследствии уступил конкурентам в реальных задачах. Статья подчеркивает, что результаты синтетических тестов становятся всё менее репрезентативными для оценки реальных возможностей больших языковых моделей. Несмотря на впечатляющие цифры в таблицах, разрыв между «бумажной» производительностью и практическим применением продолжает расти. Автор указывает на то, что индустрия ИИ всё чаще сталкивается с проблемой, когда бенчмарки перестают отражать истинное качество работы нейросетей, что делает их менее надежным инструментом для пользователей и разработчиков при выборе модели для реальных бизнес-задач.

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Trillium Labs, новая исследовательская организация в области искусственного интеллекта, бросает вызов отраслевой норме, согласно которой высокорискова…

Wired

Папа Лев XIV публично раскритиковал рост популярности искусства, созданного с помощью искусственного интеллекта, утверждая, что существует фундаментал…

TechCrunch
Advertisement970 × 250