Управление несколькими локальными LLM на ограниченном оборудовании с помощью GGUF Switchboard

Разработчик Прадип Гудипати представил GGUF Switchboard, инструмент с открытым исходным кодом для управления несколькими локальными большими языковыми моделями (LLM) на оборудовании с ограниченным объемом видеопамяти, например, NVIDIA RTX 3060. Столкнувшись с проблемой одновременного запуска специализированных моделей для кодинга, логических рассуждений и AI-агентов на 12 ГБ VRAM, автор создал планировщик, работающий как API-шлюз, совместимый с OpenAI. Система динамически управляет жизненным циклом моделей, выгружая и загружая их в зависимости от входящих запросов для оптимизации использования GPU. Абстрагируя инфраструктуру вывода, GGUF Switchboard позволяет разработчикам использовать несколько локальных моделей как общие ресурсы, не управляя вручную бэкендами вроде llama.cpp или vLLM. Проект призван сделать работу с коллекцией локальных моделей более эффективной для пользователей с ограниченным «железом», призывая сообщество к тестированию для улучшения поддержки различных конфигураций оборудования и моделей.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Новый ИИ-агент Meta хочет стать вашим персональным помощником
Компания Meta представила свою последнюю разработку — ИИ-агента Muse, созданного для выполнения функций высокоперсонализированного помощника. Согласно…
Что происходит с OpenAI и спором вокруг уравнений Навье-Стокса?
Компания OpenAI недавно заявила о значительном прорыве в математике, связанном с уравнениями Навье-Стокса, которые описывают движение жидкостей и газо…
Большие языковые модели развивают новые социальные предубеждения через адаптивное исследование
Недавняя научная работа, опубликованная на OpenReview, исследует, как большие языковые модели (LLM) могут приобретать и проявлять новые социальные пре…


