Xiaomi MiMo: триллион параметров, из которых работает четыре процента

Компания Xiaomi представила семейство языковых моделей MiMo, охватывающее широкий спектр конфигураций: от компактных моделей с 7 миллиардами параметров до масштабного решения с архитектурой Mixture of Experts (MoE), насчитывающего один триллион параметров. Ключевой особенностью анонса стала высокая эффективность использования вычислительных ресурсов: несмотря на колоссальный общий объем параметров, в процессе генерации текста задействуется лишь около четырех процентов из них. Такой подход позволяет значительно ускорить работу модели и снизить требования к «железу» без существенной потери качества ответов. Эксперты отмечают, что использование разреженных архитектур (sparse models) становится новым стандартом в индустрии, позволяя компаниям масштабировать возможности ИИ до триллионных значений, сохраняя при этом приемлемую скорость инференса. Данная разработка подчеркивает стремление Xiaomi укрепить свои позиции в сфере генеративного искусственного интеллекта, предлагая гибкие инструменты для различных задач.
This is a summary. Read the full article at the original source:
HabrПохожие
Jev: новая пограничная модель, которая в 40-400 раз дешевле и в 20-200 раз быстрее
Компания Typesafe AI представила Jev, новую пограничную модель, призванную значительно оптимизировать стоимость и скорость работы больших языковых мод…
Кладбище ИИ: список проектов и стартапов, которые не смогли добиться успеха
TechCrunch опубликовал подробный обзор текущего состояния индустрии ИИ, сосредоточившись на громких проектах и стартапах, которые не оправдали ожидани…
Система экстренных оповещений на 15 тысяч пользователей: LLM, PostGIS, Qdrant и Telegram
В статье описывается архитектура системы экстренного оповещения, обслуживающей 15 тысяч пользователей. Основная инженерная задача заключалась в автома…



