Как я создал VoiceMax: чтение эмоций по записи голоса с помощью трех небольших потоков ИИ

Разработчик Танбир Хоссейн Рамим подробно описал создание VoiceMax, веб-приложения для анализа эмоционального содержания голосовых записей. Проект, созданный на базе Next.js, TypeScript и фреймворка Google Genkit, использует модель Gemini 2.0 Flash для предоставления обратной связи пользователям. Вместо одного сложного промпта автор реализовал три отдельных потока ИИ: для анализа аудио, определения вторичных эмоций и генерации персонализированных советов. Использование структурированных схем Zod и детерминированного кода для конкретных рекомендаций, таких как дыхательные упражнения, позволило добиться надежных и тестируемых результатов. Проект также решает технические проблемы, включая совместимость микрофона в разных браузерах и эффективную обработку ошибок. Исходный код доступен на GitHub и служит практическим примером того, как модульность рабочих процессов ИИ повышает удобство обслуживания и производительность веб-приложений.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Sony и UMG подали новый иск против AI-генератора музыки Suno
Крупные звукозаписывающие лейблы Sony Music и Universal Music Group инициировали новое судебное разбирательство против музыкального AI-стартапа Suno.…
Одна компания оказалась в центре волны атак «неуправляемого» ИИ
Наблюдается тревожная тенденция несанкционированной активности агентов ИИ, связанная с серией киберинцидентов с участием крупнейших игроков отрасли. П…
Kimi, MiniMax Code и ZCode в OpenResearch: форк за один вечер с помощью Claude Opus 5.5
Автор статьи рассказывает о процессе адаптации проекта OpenResearch от alphaXiv для поддержки новых кодинг-агентов. Изначально платформа поддерживала…



