Назад
Разработка ПО и open source

Наш Recall был 0.087, а модель была ни при чем: как доменная фильтрация удвоила результат

Dev.to
Advertisement468 × 90
Наш Recall был 0.087, а модель была ни при чем: как доменная фильтрация удвоила результат

Разработчик CauterRule, инструмента с открытым исходным кодом для автоматизации восстановления после сбоев агентов, решил проблему, при которой метрики полноты (recall) оставались на низком уровне 0.087. Изначально команда подозревала калибровку алгоритма сопоставления, но расследование показало, что проблема кроется в методологии оценки. Использование глобального пула сравнения приводило к тому, что узкоспециализированные правила несправедливо штрафовались на фоне нерелевантных ошибок. Внедрение «доменного воспроизведения» — фильтрации пула ссылок в соответствии с доменом кандидата — позволило удвоить показатели recall без изменения самих моделей или промптов. Этот случай подчеркивает важность состава наборов для оценки, доказывая, что равномерно низкие результаты часто указывают на ошибку в тестировании, а не на предел возможностей модели. Обновление доступно в CauterRule v0.3.0, предлагая разработчикам улучшенные метрики и диагностические инструменты для работы с агентными рабочими процессами.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Разработка ПО и open source

Похожие

Статья на Habr исследует исторические причины, позволившие Царицыну (ныне Волгограду) стать ключевым индустриальным центром Нижнего Поволжья. Автор ан…

Habr

Команда разработчиков создала справочник по регуляторной тематике всего за две недели, однако спустя семь дней после запуска обнаружила критическую ош…

Habr
Advertisement970 × 250