Модели Qwen 2.5 72B и 32B теперь доступны на Cerebras со скоростью 1500 токенов/с
Компания Cerebras Systems объявила о доступности моделей Qwen 2.5 72B и 32B на своей платформе для инференса. Благодаря использованию специализированной технологии Wafer-Scale Engine, эти модели достигают высокой скорости вывода до 1500 токенов в секунду. Данная интеграция предоставляет разработчикам доступ к современным моделям с открытыми весами, позволяя избежать задержек, характерных для традиционной облачной инфраструктуры на базе GPU. Cerebras Inference API разработан для поддержки приложений с высокой пропускной способностью, что делает его подходящим для ИИ-агентов реального времени, сложной обработки данных и масштабных корпоративных развертываний. Оптимизируя аппаратно-программный стек специально для архитектур трансформеров, Cerebras продолжает укреплять свои позиции в качестве высокоскоростной альтернативы для организаций, стремящихся масштабировать свои возможности в области генеративного ИИ без ущерба для скорости или сложности моделей.
This is a summary. Read the full article at the original source:
Hacker News (YC)Похожие
Новый ИИ-агент Meta хочет стать вашим персональным помощником
Компания Meta представила свою последнюю разработку — ИИ-агента Muse, созданного для выполнения функций высокоперсонализированного помощника. Согласно…
Что происходит с OpenAI и спором вокруг уравнений Навье-Стокса?
Компания OpenAI недавно заявила о значительном прорыве в математике, связанном с уравнениями Навье-Стокса, которые описывают движение жидкостей и газо…
Большие языковые модели развивают новые социальные предубеждения через адаптивное исследование
Недавняя научная работа, опубликованная на OpenReview, исследует, как большие языковые модели (LLM) могут приобретать и проявлять новые социальные пре…


