Назад
Искусственный интеллект и машинное обучение

Что такое дезагрегация prefill и decode в LLM-инференсе?

Dev.to
Advertisement468 × 90
Что такое дезагрегация prefill и decode в LLM-инференсе?

Инференс LLM состоит из двух фаз: prefill (вычисление, определяющее время до первого токена, TTFT) и decode (пропускная способность памяти, определяющая задержку между токенами, ITL). Традиционное совместное размещение этих фаз на одних и тех же GPU приводит к конфликтам ресурсов и нестабильной задержке. В статье рассматривается концепция дезагрегированного обслуживания, при которой задачи prefill и decode распределяются по разным пулам GPU. Это позволяет независимо оптимизировать аппаратное обеспечение для каждой фазы, значительно повышая производительность при высокой нагрузке. Несмотря на необходимость передачи KV-кэша между пулами, этот подход стал стандартом для промышленного использования LLM. Автор объясняет, как такие решения, как DigitalOcean Serverless Inference, используют эту архитектуру для соблюдения строгих требований к качеству обслуживания (SLO), и дает рекомендации по внедрению подобных систем на собственных GPU-инфраструктурах.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Персональные ИИ-агенты призваны упростить выполнение повседневных задач, таких как покупки, бронирование авиабилетов и управление заказами. Однако эти…

TechCrunch
Advertisement970 × 250