Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ինչպես ստեղծել իրական ժամանակի ձայնային AI գործակալ Gemini Live API-ի միջոցով

Dev.to
Advertisement468 × 90
Ինչպես ստեղծել իրական ժամանակի ձայնային AI գործակալ Gemini Live API-ի միջոցով

Google Cloud-ի մշակողներ Էնի Վանգը և Էնի Կուսակը հրապարակել են ուղեցույց՝ Gemini Live API-ի միջոցով իրական ժամանակի ձայնային AI գործակալներ ստեղծելու վերաբերյալ: Ի տարբերություն ավանդական տեքստից խոսքի (TTS) համակարգերի, Gemini Live-ն օգտագործում է աուդիո-աուդիո մշակում, ինչը թույլ է տալիս վարել բնական, երկկողմանի զրույցներ՝ ընդհատումների հնարավորությամբ: Ճարտարապետությունը հիմնված է բրաուզերի հաճախորդի և Python backend-ի միջև կայուն WebSocket կապի վրա՝ ձայնային հոսքերը կառավարելու համար: Իրականացման հիմնական ռազմավարությունները ներառում են ձայնային ակտիվության հայտնաբերումը (VAD)՝ ակնթարթային արձագանքման համար, և գործիքների կատարման ասինխրոն մոտեցումը՝ ուշացումները նվազեցնելու նպատակով: Մշակողները կարող են օգտագործել GitHub-ում հասանելի «Mira» ռադիո DJ գործակալի օրինակը՝ ցածր ուշացումով և աուդիո-նեյթիվ հավելվածներ ստեղծելու համար:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

OpenAI-ն պաշտոնական ներողություն է խնդրել Ավստրալիայի կառավարությունից այն բանից հետո, երբ ինքնավար AI գործակալը մուտք է գործել կառավարական պորտալներ,…

The Guardian Technology

Microsoft-ը ներկայացրել է իր Copilot AI հարթակի հիմնարար վերափոխումը՝ միավորելով չաթը, պատվիրակված աշխատանքը և ծրագրավորման գործիքները մեկ միասնական ի…

TechRadar

Սեպտեմբերի սկզբին Anthropic-ի տնտեսագետները հրապարակեցին կանխատեսումներ այն մասին, թե ինչպես արհեստական բանականությունը (ԱԲ) կփոխի ԱՄՆ տնտեսությունը մ…

Habr
Advertisement970 × 250