Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ինչպես մենք պատրաստեցինք ձայնի կլոնավորման TTS-ը սարքի վրա աշխատելու համար

Dev.to
Advertisement468 × 90
Ինչպես մենք պատրաստեցինք ձայնի կլոնավորման TTS-ը սարքի վրա աշխատելու համար

VoxRT-ի թիմը մշակել է 45 միլիոն պարամետր ունեցող տեքստից խոսքի (TTS) կոմպակտ մոդել, որը հնարավորություն է տալիս ձայնի կլոնավորում իրականացնել անմիջապես սարքի վրա: Նախատեսված լինելով սմարթֆոնների և Raspberry Pi-ի համար՝ մոդելը խուսափում է ամպային կախվածություններից՝ օգտագործելով երկփուլ ճարտարապետություն: Իտերատիվ դիֆուզիան մեկ քայլով ընտրանքային համակարգով փոխարինելու շնորհիվ մշակողները հասել են իրական ժամանակից արագ աշխատանքի: Նախագիծը լուսաբանում է սարքի վրա հիմնված AI-ի ինժեներական մարտահրավերները, մասնավորապես՝ մեկ քայլով աշխատող համակարգերի ռոբոտացված հնչողության և խառը ճշգրտությամբ ուսուցման ժամանակ առաջացող կայունության խնդիրները: Համակարգը, որն ապահովում է հոսքային և ցածր ուշացումով սինթեզ, նախատեսված է թողարկել 2026 թվականի սեպտեմբերին: Այս մշակումը կարևոր քայլ է բարձրորակ, անհատականացված ձայնային սինթեզը հասանելի դարձնելու համար՝ առանց սերվերային ենթակառուցվածքների կամ API-ների անհրաժեշտության:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Meta-ն ներկայացրել է իր վերջին նորարարությունը՝ Muse AI գործակալը, որը նախատեսված է որպես օգտատերերի համար խիստ անհատականացված օգնական հանդես գալու հա…

CNET

OpenAI-ը վերջերս հայտարարել է մաթեմատիկայի ոլորտում նշանակալի առաջընթացի մասին, որը վերաբերում է Նավիե-Ստոքսի հավասարումներին, որոնք նկարագրում են հեղ…

Engadget

OpenReview-ում հրապարակված վերջին գիտական աշխատանքը ուսումնասիրում է, թե ինչպես կարող են խոշոր լեզվական մոդելները (LLM) ձեռք բերել և դրսևորել նոր սոցի…

Hacker News (YC)
Advertisement970 × 250