Наш Recall был 0.087, а модель была ни при чем: как доменная фильтрация удвоила результат

Разработчик CauterRule, инструмента с открытым исходным кодом для автоматизации восстановления после сбоев агентов, решил проблему, при которой метрики полноты (recall) оставались на низком уровне 0.087. Изначально команда подозревала калибровку алгоритма сопоставления, но расследование показало, что проблема кроется в методологии оценки. Использование глобального пула сравнения приводило к тому, что узкоспециализированные правила несправедливо штрафовались на фоне нерелевантных ошибок. Внедрение «доменного воспроизведения» — фильтрации пула ссылок в соответствии с доменом кандидата — позволило удвоить показатели recall без изменения самих моделей или промптов. Этот случай подчеркивает важность состава наборов для оценки, доказывая, что равномерно низкие результаты часто указывают на ошибку в тестировании, а не на предел возможностей модели. Обновление доступно в CauterRule v0.3.0, предлагая разработчикам улучшенные метрики и диагностические инструменты для работы с агентными рабочими процессами.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Недавний анализ производительности исследует распространенное мнение о том, что nginx буферизирует потоки Server-Sent Events (SSE), что часто заставля…
Статья на Habr исследует исторические причины, позволившие Царицыну (ныне Волгограду) стать ключевым индустриальным центром Нижнего Поволжья. Автор ан…
Мы запустили справочник — и через неделю выяснили, что главный ответ на нём неверный
Команда разработчиков создала справочник по регуляторной тематике всего за две недели, однако спустя семь дней после запуска обнаружила критическую ош…



