Назад
Искусственный интеллект и машинное обучение

Как я создал винный бенчмарк OenoBench на 3266 вопросов с помощью LLM

Habr
Advertisement468 × 90
Как я создал винный бенчмарк OenoBench на 3266 вопросов с помощью LLM

Автор статьи делится опытом создания OenoBench — масштабного бенчмарка для оценки знаний языковых моделей о вине. Проект включает 38 104 факта и 3 266 вопросов с вариантами ответов. Основная часть работы была автоматизирована: код писал Claude Code, вопросы генерировали пять различных LLM, а проверку осуществляли десять агентов аудита. Общие затраты на API составили около 800 долларов. В статье подробно разбираются технические сложности процесса: от проблем с «галлюцинациями» скраперов, которые полагались на внутреннюю память моделей, до анализа ошибок LLM-судей и методологии генерации вопросов. Автор также анализирует поведение 16 моделей на итоговом лидерборде и приходит к выводу, что самые сложные вопросы в сгенерированных бенчмарках часто оказываются наиболее проблемными с точки зрения качества данных. Этот кейс демонстрирует как возможности, так и ограничения использования AI-агентов для создания сложных оценочных наборов данных.

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

В новом выпуске подкаста Uncanny Valley обсуждается меняющийся ландшафт искусственного интеллекта и его пересечение с политикой. Основное внимание уде…

Wired
Advertisement970 × 250