Снижает ли сжатие вывода инструментов расходы на API для ИИ-агентов?

Недавний эксперимент разработчиков фреймворка Torana был посвящен вопросу о том, может ли сжатие вывода инструментов снизить расходы на API для ИИ-агентов, пишущих код. Агенты обычно отправляют всю историю переписки, включая объемные логи инструментов, при каждом запросе. Исследование сравнило два метода сжатия — детерминированную фильтрацию по ключевым словам и суммаризацию через модель — с контрольной группой, использующей DeepSeek V4 Pro. Результаты показали, что сжатие дает незначительную экономию, в среднем около 2%. Основная причина заключается в эффективности современного кэширования промптов, что делает повторное использование контекста практически бесплатным. Перезапись промпта для включения сжатых данных часто аннулирует кэш, что приводит к дополнительным расходам, нивелирующим выгоду от сокращения токенов. Автор приходит к выводу, что хотя сжатие неэффективно при текущей экономике кэширования, оно может быть полезно для провайдеров с дорогим чтением из кэша или в условиях жестких ограничений контекстного окна.
This is a summary. Read the full article at the original source:
Dev.toПохожие
В статье на Habr инженер по информационной безопасности Selectel Антон рассматривает проблему уязвимости больших языковых моделей (LLM) к различным ти…
Что делать, если доступ к Claude пропал, а на нем уже завязан рабочий процесс?
С начала октября российские пользователи столкнулись с новой волной блокировок аккаунтов Claude. Для многих компаний это стало критической проблемой,…
OpenAI представила «Intelligent UI» — новую функцию для ChatGPT, позволяющую ИИ создавать интерактивные визуальные интерфейсы прямо в ходе диалога. Бл…



