Назад
Искусственный интеллект и машинное обучение

Спекулятивное декодирование в vLLM на графических процессорах AMD

Hacker News (YC)
Advertisement468 × 90
Спекулятивное декодирование в vLLM на графических процессорах AMD

Проект vLLM объявил об официальной поддержке спекулятивного декодирования на графических процессорах AMD, что стало важной вехой для инференса больших языковых моделей с открытым исходным кодом. Спекулятивное декодирование — это метод, предназначенный для ускорения работы LLM за счет использования меньшей и более быстрой модели для предсказания последовательностей токенов, которые затем проверяются основной моделью. Расширяя эту оптимизацию на экосистему AMD ROCm, vLLM позволяет разработчикам достигать более высокой пропускной способности и меньших задержек на оборудовании, отличном от NVIDIA. Это обновление устраняет критический пробел в инфраструктуре ИИ, позволяя более эффективно развертывать генеративные модели на кластерах с процессорами AMD. Реализация использует специфические аппаратные возможности AMD для поддержания высокой производительности при снижении вычислительных затрат, обычно связанных с авторегрессионной генерацией. Ожидается, что это развитие расширит доступность высокопроизводительных инструментов ИИ для исследователей и предприятий, использующих различные аппаратные платформы.

This is a summary. Read the full article at the original source:

Hacker News (YC)
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Компания Meta представила свою последнюю разработку — ИИ-агента Muse, созданного для выполнения функций высокоперсонализированного помощника. Согласно…

CNET

Компания OpenAI недавно заявила о значительном прорыве в математике, связанном с уравнениями Навье-Стокса, которые описывают движение жидкостей и газо…

Engadget

Недавняя научная работа, опубликованная на OpenReview, исследует, как большие языковые модели (LLM) могут приобретать и проявлять новые социальные пре…

Hacker News (YC)
Advertisement970 × 250