Ստեղծեք իրական ժամանակի ձայնային հավելվածներ Gemini 3.8 Live և 3.5 Transcribe-ի միջոցով

Google-ն ընդլայնել է իր մշակողների գործիքակազմը՝ թողարկելով Gemini 3.8 Live և Gemini 3.5 Transcribe մոդելները, որոնք նախատեսված են իրական ժամանակի ձայնային հավելվածների համար: Gemini 3.8 Live-ն առաջարկում է խոսքից-խոսք (speech-to-speech) առաջադեմ հնարավորություններ, ներառյալ «Extended Thinking» մոդելը՝ բարդ, բազմաքայլ տրամաբանական խնդիրների համար: Հիմնական առանձնահատկություններից են ասինխրոն ֆունկցիաների կանչը, տեսողական համատեքստի ընկալումը և ավելի քան 97 լեզուների աջակցությունը: Ի լրումն, Gemini 3.5 Transcribe-ն ապահովում է բարձր ճշգրտության խոսքից-տեքստ փոխակերպում՝ 4.0% սխալի գործակցով: Երկու մոդելներն էլ հասանելի են Gemini API-ի միջոցով և ինտեգրվում են այնպիսի հարթակների հետ, ինչպիսիք են LangChain-ը, LiveKit-ը և Vercel-ը: Այս գործիքները նպատակ ունեն պարզեցնել խոսակցական գործակալների և իրական ժամանակի աուդիո վերլուծության համակարգերի մշակումը՝ առաջարկելով մշակողներին հզոր ենթակառուցվածք՝ բարդ և համատեքստային ձայնային փորձառություններ ստեղծելու համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Dream-RSI. Ռեկուրսիվ ինքնակատարելագործում զարգացող աշխարհների միջոցով
Հետազոտողները ներկայացրել են Dream-RSI-ը՝ նորարարական շրջանակ, որը նախատեսված է արհեստական բանականության գործակալների ռեկուրսիվ ինքնակատարելագործումը…
Ներբեռնում. AI-ի տրիլիոն դոլարանոց խաղադրույքը և OpenAI-ի կենսաբանական տվյալների հայտը
MIT Technology Review-ի վերջին թողարկումը քննարկում է արհեստական բանականության ոլորտի հսկայական ֆինանսական ռիսկերը։ Ֆինանսների պրոֆեսոր Ջեսիկա Վախտերը…
Mistral AI-ն համագործակցում է Mozilla-ի հետ՝ մասնավոր և բազմալեզու զննարկումը բարելավելու համար
Mistral AI-ն հայտարարել է Mozilla-ի հետ ռազմավարական համագործակցության մասին՝ իր առաջադեմ արհեստական բանականության մոդելները Firefox էկոհամակարգում ին…



