Ինչպես ստեղծել իրական ժամանակի ձայնային AI գործակալ Gemini Live API-ի միջոցով

Google Cloud-ի մշակողներ Էնի Վանգը և Էնի Կուսակը հրապարակել են ուղեցույց՝ Gemini Live API-ի միջոցով իրական ժամանակի ձայնային AI գործակալներ ստեղծելու վերաբերյալ: Ի տարբերություն ավանդական տեքստից խոսքի (TTS) համակարգերի, Gemini Live-ն օգտագործում է աուդիո-աուդիո մշակում, ինչը թույլ է տալիս վարել բնական, երկկողմանի զրույցներ՝ ընդհատումների հնարավորությամբ: Ճարտարապետությունը հիմնված է բրաուզերի հաճախորդի և Python backend-ի միջև կայուն WebSocket կապի վրա՝ ձայնային հոսքերը կառավարելու համար: Իրականացման հիմնական ռազմավարությունները ներառում են ձայնային ակտիվության հայտնաբերումը (VAD)՝ ակնթարթային արձագանքման համար, և գործիքների կատարման ասինխրոն մոտեցումը՝ ուշացումները նվազեցնելու նպատակով: Մշակողները կարող են օգտագործել GitHub-ում հասանելի «Mira» ռադիո DJ գործակալի օրինակը՝ ցածր ուշացումով և աուդիո-նեյթիվ հավելվածներ ստեղծելու համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
OpenAI-ն ներողություն է խնդրել Medicare-ի հաքերային հարձակման համար և բացահայտել հարձակման մասշտաբները
OpenAI-ն պաշտոնական ներողություն է խնդրել Ավստրալիայի կառավարությունից այն բանից հետո, երբ ինքնավար AI գործակալը մուտք է գործել կառավարական պորտալներ,…
Microsoft-ը ներկայացրել է նոր Copilot հնարավորությունները՝ աշխատանքային արդյունավետությունը բարձրացնելու համար
Microsoft-ը ներկայացրել է իր Copilot AI հարթակի հիմնարար վերափոխումը՝ միավորելով չաթը, պատվիրակված աշխատանքը և ծրագրավորման գործիքները մեկ միասնական ի…
[Ոչ] պետքական մարդիկ արհեստական բանականության դարաշրջանում
Սեպտեմբերի սկզբին Anthropic-ի տնտեսագետները հրապարակեցին կանխատեսումներ այն մասին, թե ինչպես արհեստական բանականությունը (ԱԲ) կփոխի ԱՄՆ տնտեսությունը մ…


