Я продаю API памяти и создаю бенчмарк. Вот как я пытаюсь избежать подтасовок

Разработчик из Wontopos по имени Woochan представил новый прозрачный бенчмарк для оценки возможностей памяти LLM. Проект призван решить проблему недоверия к метрикам производительности, публикуемым вендорами, предлагая справедливый и воспроизводимый стандарт. Бенчмарк использует корпус объемом 1,9 млн токенов и тестирует модели по 14 направлениям, включая работу с устаревшими фактами, противоречиями и многоязычный поиск. Чтобы исключить предвзятость, проект выпущен с открытым исходным кодом под лицензией Apache 2.0, а автор ввел строгие правила, такие как обязательная публикация результатов по каждому вопросу и независимая верификация. Также предложен нюансированный подход к измерению задержки, отделяющий сетевые издержки от реальной вычислительной мощности. Делая ставку на прозрачность и проверку сообществом, автор стремится предоставить разработчикам надежный инструмент для сравнения API памяти, свободный от влияния потенциально сфабрикованных маркетинговых заявлений.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Я заставил начальника AI-офиса материться на агентов. И только потом понял, что именно сработало
Автор статьи делится необычным опытом оптимизации работы AI-агентов. Столкнувшись с тем, что вежливые и старательные агенты выдают посредственные резу…
Я заставил два ИИ проверять код друг друга в течение 30 дней. Человек нашел баг за 5 минут.
Разработчик провел эксперимент с использованием двух ИИ-агентов для контроля качества кода: «автор» писал функции, а «скептик» проводил состязательную…
Статья «С кем согласовано?» исследует сложную и зачастую неоднозначную природу согласования ИИ. Автор оспаривает распространенный в индустрии нарратив…



