Назад
Искусственный интеллект и машинное обучение

Запуск Qwen 3.8 Flash Next (125B) на потребительском оборудовании (RTX 4090) со скоростью 100 токенов/с

Hacker News (YC)
Advertisement468 × 90
Запуск Qwen 3.8 Flash Next (125B) на потребительском оборудовании (RTX 4090) со скоростью 100 токенов/с

Появился новый проект под названием Strata, позволяющий запускать массивную модель Qwen 3.8 Flash Next с 125 миллиардами параметров на потребительском оборудовании, в частности на видеокарте NVIDIA RTX 4090. Проект заявляет о достижении скорости вывода в 100 токенов в секунду, что является значительным достижением для локального развертывания больших языковых моделей. Используя передовые методы оптимизации, Strata сокращает разрыв между высокопроизводительной корпоративной инфраструктурой и персональными компьютерами. Эта разработка позволяет исследователям и разработчикам экспериментировать с современными моделями ИИ без необходимости использования дорогостоящих серверных кластеров. Репозиторий на GitHub предоставляет необходимые инструменты и документацию для локальной настройки. Поскольку производительность локальных LLM продолжает расти, этот прорыв подчеркивает быстрые темпы оптимизации в области ИИ, делая мощные генеративные инструменты все более доступными для энтузиастов и независимых разработчиков с ограниченными аппаратными ресурсами.

This is a summary. Read the full article at the original source:

Hacker News (YC)
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Поскольку ценообразование на ИИ-модели становится все более волатильным, разработчики сталкиваются с неэффективностью затрат, полагаясь на флагманские…

Dev.to

В статье рассматривается альтернативный подход к оркестрации AI-агентов, получивший название «Методология интерпретируемого контекста». Вместо использ…

Habr
Advertisement970 × 250