Как я создал винный бенчмарк OenoBench на 3266 вопросов с помощью LLM

Автор статьи делится опытом создания OenoBench — масштабного бенчмарка для оценки знаний языковых моделей о вине. Проект включает 38 104 факта и 3 266 вопросов с вариантами ответов. Основная часть работы была автоматизирована: код писал Claude Code, вопросы генерировали пять различных LLM, а проверку осуществляли десять агентов аудита. Общие затраты на API составили около 800 долларов. В статье подробно разбираются технические сложности процесса: от проблем с «галлюцинациями» скраперов, которые полагались на внутреннюю память моделей, до анализа ошибок LLM-судей и методологии генерации вопросов. Автор также анализирует поведение 16 моделей на итоговом лидерборде и приходит к выводу, что самые сложные вопросы в сгенерированных бенчмарках часто оказываются наиболее проблемными с точки зрения качества данных. Этот кейс демонстрирует как возможности, так и ограничения использования AI-агентов для создания сложных оценочных наборов данных.
This is a summary. Read the full article at the original source:
HabrПохожие
«Морально обязывающее» соглашение Трампа по ИИ, рост ИИ-агентов и экстремисты в избирательных бюллетенях
В новом выпуске подкаста Uncanny Valley обсуждается меняющийся ландшафт искусственного интеллекта и его пересечение с политикой. Основное внимание уде…
Новая функция Google Guided Vision поможет вам читать мелкий шрифт
Google официально запустила новую функцию Guided Vision в Gemini Live на совместимых устройствах Android. Этот инструмент, ориентированный на доступно…
OpenAI представила новые функции для ChatGPT, ориентированные на шопинг, которые позволяют пользователям виртуально примерять одежду и аксессуары. Заг…



