Назад
Искусственный интеллект и машинное обучение

Как мы подготовили TTS с клонированием голоса для работы на устройстве

Dev.to
Advertisement468 × 90
Как мы подготовили TTS с клонированием голоса для работы на устройстве

Команда VoxRT разработала компактную модель преобразования текста в речь (TTS) с 45 млн параметров, способную клонировать голос непосредственно на устройстве. Модель предназначена для работы на смартфонах и Raspberry Pi, исключая зависимость от облачных вычислений благодаря двухэтапной архитектуре. Заменив итеративную диффузию одношаговым сэмплером потока, разработчики добились скорости работы выше реального времени даже на бюджетном оборудовании. Проект освещает инженерные сложности создания локального ИИ, в частности, проблему «роботизированного» звучания одношаговых сэмплеров и риски нестабильности при обучении со смешанной точностью. Система, поддерживающая потоковую передачу и синтез с низкой задержкой, запланирована к выпуску в сентябре 2026 года. Эта разработка является важным шагом к обеспечению доступности качественного персонализированного синтеза голоса без необходимости использования серверной инфраструктуры или внешних API.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Компания Meta представила свою последнюю разработку — ИИ-агента Muse, созданного для выполнения функций высокоперсонализированного помощника. Согласно…

CNET

Компания OpenAI недавно заявила о значительном прорыве в математике, связанном с уравнениями Навье-Стокса, которые описывают движение жидкостей и газо…

Engadget

Недавняя научная работа, опубликованная на OpenReview, исследует, как большие языковые модели (LLM) могут приобретать и проявлять новые социальные пре…

Hacker News (YC)
Advertisement970 × 250