Масштабирование действий на границе терминала эффективнее перезапуска траекторий

Новое исследование NVIDIA и KAIST, «Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents», предлагает более эффективный способ повышения производительности ИИ-агентов. Вместо дорогостоящего «масштабирования траекторий», при котором сессии перезапускаются целиком для исправления ошибок, авторы предлагают «масштабирование действий» на границе модели и терминала. Генерируя несколько вариантов bash-команд и выбирая лучший из них до выполнения, агенты избегают накопления ошибок, загрязняющих среду. Исследование показало, что дистиллированная модель с 9 млрд параметров при попарной верификации достигает более высоких результатов, чем при полном перезапуске траекторий, при этом значительно снижая затраты на вычисления. Кроме того, выяснилось, что верификация на основе логитов превосходит методы «цепочки рассуждений», так как исключает галлюцинации. Этот подход позволяет разработчикам повысить надежность агентов, существенно сокращая расходы на инференс.
This is a summary. Read the full article at the original source:
Dev.toПохожие
«Морально обязывающее» соглашение Трампа по ИИ, рост ИИ-агентов и экстремисты в избирательных бюллетенях
В новом выпуске подкаста Uncanny Valley обсуждается меняющийся ландшафт искусственного интеллекта и его пересечение с политикой. Основное внимание уде…
Новая функция Google Guided Vision поможет вам читать мелкий шрифт
Google официально запустила новую функцию Guided Vision в Gemini Live на совместимых устройствах Android. Этот инструмент, ориентированный на доступно…
OpenAI представила новые функции для ChatGPT, ориентированные на шопинг, которые позволяют пользователям виртуально примерять одежду и аксессуары. Заг…



