Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ստեղծեք իրական ժամանակի ձայնային հավելվածներ Gemini 3.8 Live և 3.5 Transcribe-ի միջոցով

Dev.to
Advertisement468 × 90
Ստեղծեք իրական ժամանակի ձայնային հավելվածներ Gemini 3.8 Live և 3.5 Transcribe-ի միջոցով

Google-ն ընդլայնել է իր մշակողների գործիքակազմը՝ թողարկելով Gemini 3.8 Live և Gemini 3.5 Transcribe մոդելները, որոնք նախատեսված են իրական ժամանակի ձայնային հավելվածների համար: Gemini 3.8 Live-ն առաջարկում է խոսքից-խոսք (speech-to-speech) առաջադեմ հնարավորություններ, ներառյալ «Extended Thinking» մոդելը՝ բարդ, բազմաքայլ տրամաբանական խնդիրների համար: Հիմնական առանձնահատկություններից են ասինխրոն ֆունկցիաների կանչը, տեսողական համատեքստի ընկալումը և ավելի քան 97 լեզուների աջակցությունը: Ի լրումն, Gemini 3.5 Transcribe-ն ապահովում է բարձր ճշգրտության խոսքից-տեքստ փոխակերպում՝ 4.0% սխալի գործակցով: Երկու մոդելներն էլ հասանելի են Gemini API-ի միջոցով և ինտեգրվում են այնպիսի հարթակների հետ, ինչպիսիք են LangChain-ը, LiveKit-ը և Vercel-ը: Այս գործիքները նպատակ ունեն պարզեցնել խոսակցական գործակալների և իրական ժամանակի աուդիո վերլուծության համակարգերի մշակումը՝ առաջարկելով մշակողներին հզոր ենթակառուցվածք՝ բարդ և համատեքստային ձայնային փորձառություններ ստեղծելու համար:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Հետազոտողները ներկայացրել են Dream-RSI-ը՝ նորարարական շրջանակ, որը նախատեսված է արհեստական բանականության գործակալների ռեկուրսիվ ինքնակատարելագործումը…

Hacker News (YC)

MIT Technology Review-ի վերջին թողարկումը քննարկում է արհեստական բանականության ոլորտի հսկայական ֆինանսական ռիսկերը։ Ֆինանսների պրոֆեսոր Ջեսիկա Վախտերը…

MIT Technology Review

Mistral AI-ն հայտարարել է Mozilla-ի հետ ռազմավարական համագործակցության մասին՝ իր առաջադեմ արհեստական բանականության մոդելները Firefox էկոհամակարգում ին…

Hacker News (YC)
Advertisement970 × 250