Я запустил DeepSeek V4 Flash на двух DGX Spark через Ethernet

Разработчик Кевин Танг успешно продемонстрировал, что два модуля NVIDIA DGX Spark могут запускать модель DeepSeek V4 Flash, используя стандартное соединение 10Gb Ethernet вместо рекомендуемой сети 200Gb. Настроив NCCL на использование TCP-сокетов через прямое Ethernet-соединение, Танг добился стабильного тензорного параллельного вывода. Хотя импровизированная настройка обеспечила лишь 40-46% производительности по сравнению с официальной спецификацией 200 Гбит/с, она оказалась работоспособной как для интерактивного чата, так и для пакетной обработки. Эксперимент показывает, что, хотя высокоскоростные соединения критически важны для приложений с низкой задержкой, стандартных сетевых возможностей может быть достаточно для задач, ограниченных по объему памяти. Настройка Танга позволила модели с 284 миллиардами параметров работать на объединенных 256 ГБ памяти, предоставляя жизнеспособную, пусть и более медленную альтернативу для пользователей, ожидающих специализированные кабели. Этот подход служит практическим доказательством концепции распределенного вывода LLM на кластерах оборудования.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Новый ИИ-агент Meta хочет стать вашим персональным помощником
Компания Meta представила свою последнюю разработку — ИИ-агента Muse, созданного для выполнения функций высокоперсонализированного помощника. Согласно…
Что происходит с OpenAI и спором вокруг уравнений Навье-Стокса?
Компания OpenAI недавно заявила о значительном прорыве в математике, связанном с уравнениями Навье-Стокса, которые описывают движение жидкостей и газо…
Большие языковые модели развивают новые социальные предубеждения через адаптивное исследование
Недавняя научная работа, опубликованная на OpenReview, исследует, как большие языковые модели (LLM) могут приобретать и проявлять новые социальные пре…


