Что такое дезагрегация prefill и decode в LLM-инференсе?

Инференс LLM состоит из двух фаз: prefill (вычисление, определяющее время до первого токена, TTFT) и decode (пропускная способность памяти, определяющая задержку между токенами, ITL). Традиционное совместное размещение этих фаз на одних и тех же GPU приводит к конфликтам ресурсов и нестабильной задержке. В статье рассматривается концепция дезагрегированного обслуживания, при которой задачи prefill и decode распределяются по разным пулам GPU. Это позволяет независимо оптимизировать аппаратное обеспечение для каждой фазы, значительно повышая производительность при высокой нагрузке. Несмотря на необходимость передачи KV-кэша между пулами, этот подход стал стандартом для промышленного использования LLM. Автор объясняет, как такие решения, как DigitalOcean Serverless Inference, используют эту архитектуру для соблюдения строгих требований к качеству обслуживания (SLO), и дает рекомендации по внедрению подобных систем на собственных GPU-инфраструктурах.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Следующее препятствие для ИИ-агентов: доступ к веб-сайтам
Персональные ИИ-агенты призваны упростить выполнение повседневных задач, таких как покупки, бронирование авиабилетов и управление заказами. Однако эти…
Новая ИИ-модель Mistral «Le Chonk» — большая, открытая и созданная для агентов
Компания Mistral AI представила свою новейшую большую языковую модель Mistral Large 4, получившую внутреннее прозвище «Le Chonk». Эта модель разработа…
ChatGPT генерирует поддельные карикатуры New Yorker с подписями художников
ChatGPT от OpenAI столкнулся с новой волной критики из-за плагиата: чат-бот создает изображения, имитирующие карикатуры New Yorker, включая поддельные…



