Сжатие контекста для ИИ-агентов: почему сжимают не ту часть промпта

Новое исследование Пекинского университета, посвященное «дистилляции контекста» для ИИ-агентов, указывает на критическую ошибку в методах сжатия данных. Исследователи утверждают, что сжатие всей истории взаимодействия, включая собственные действия и рассуждения агента, в латентные векторы приводит к деградации поведения и синтаксическим ошибкам. Авторы предлагают метод LOHA (Latent Observations, Hard Actions), который сохраняет действия агента и недавние выводы инструментов в исходном текстовом виде, сжимая только старые данные среды. Тестирование на бенчмарке SWE-bench Verified показало, что такой подход значительно повышает эффективность решения задач и экономию памяти по сравнению со стандартным усечением. Результаты доказывают, что для поддержания производительности разработчикам следует оставлять «черновик» и историю вызовов инструментов агента в несжатом виде, применяя сжатие с потерями только к историческим данным окружения.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Vibe coding с GPT-6 Astra: что получилось за 35 часов без присмотра
Армин Ронахер, создатель Flask, провел эксперимент, позволив GPT-6 Astra автономно работать над проектом в течение 35 часов. Результатом стали 79 комм…
Shopify открывает доступ к оформлению заказов для браузерных AI-агентов
Shopify объявила о значительном расширении поддержки WebMCP, распространив её на процесс оформления заказов. Это обновление позволяет браузерным AI-аг…
Локальный ассистент для Zoom: интеграция NVIDIA Nemotron 3 для ускорения диаризации
Автор продолжает цикл статей о создании локального ассистента для видеоконференций, фокусируясь на оптимизации процесса диаризации — разделения аудиоп…


