Назад
Искусственный интеллект и машинное обучение

Создание голосовых приложений в реальном времени с помощью Gemini 3.8 Live и 3.5 Transcribe

Dev.to
Advertisement468 × 90
Создание голосовых приложений в реальном времени с помощью Gemini 3.8 Live и 3.5 Transcribe

Google расширила свой набор инструментов для разработчиков, выпустив Gemini 3.8 Live и Gemini 3.5 Transcribe, предназначенные для создания голосовых приложений в реальном времени. Gemini 3.8 Live предлагает расширенные возможности преобразования речи в речь, включая модель «Extended Thinking» для сложных многошаговых рассуждений. Ключевые функции включают асинхронный вызов функций, визуальный контекст и поддержку более 97 языков. В дополнение к этому, Gemini 3.5 Transcribe обеспечивает высокоточное преобразование речи в текст с частотой ошибок 4.0%, поддерживая автоматическое переключение между языками и настройку словаря. Обе модели доступны через Gemini API и интегрируются с такими платформами, как LangChain, LiveKit и Vercel. Эти инструменты призваны упростить разработку разговорных агентов и систем аудиоаналитики, предоставляя разработчикам надежную инфраструктуру для создания сложных, контекстно-зависимых голосовых интерфейсов, способных как к глубоким рассуждениям, так и к точной транскрипции.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Искусственный интеллект и машинное обучение

Похожие

Исследователи представили Dream-RSI, новую структуру, предназначенную для содействия рекурсивному самосовершенствованию агентов искусственного интелле…

Hacker News (YC)

Последний выпуск новостной рассылки MIT Technology Review анализирует огромные финансовые ставки в индустрии ИИ. Профессор финансов Джессика Вахтер от…

MIT Technology Review

Mistral AI объявила о стратегическом партнерстве с Mozilla для интеграции своих передовых моделей искусственного интеллекта в экосистему Firefox. Это…

Hacker News (YC)
Advertisement970 × 250