Ինչպես մենք պատրաստեցինք ձայնի կլոնավորման TTS-ը սարքի վրա աշխատելու համար

VoxRT-ի թիմը մշակել է 45 միլիոն պարամետր ունեցող տեքստից խոսքի (TTS) կոմպակտ մոդել, որը հնարավորություն է տալիս ձայնի կլոնավորում իրականացնել անմիջապես սարքի վրա: Նախատեսված լինելով սմարթֆոնների և Raspberry Pi-ի համար՝ մոդելը խուսափում է ամպային կախվածություններից՝ օգտագործելով երկփուլ ճարտարապետություն: Իտերատիվ դիֆուզիան մեկ քայլով ընտրանքային համակարգով փոխարինելու շնորհիվ մշակողները հասել են իրական ժամանակից արագ աշխատանքի: Նախագիծը լուսաբանում է սարքի վրա հիմնված AI-ի ինժեներական մարտահրավերները, մասնավորապես՝ մեկ քայլով աշխատող համակարգերի ռոբոտացված հնչողության և խառը ճշգրտությամբ ուսուցման ժամանակ առաջացող կայունության խնդիրները: Համակարգը, որն ապահովում է հոսքային և ցածր ուշացումով սինթեզ, նախատեսված է թողարկել 2026 թվականի սեպտեմբերին: Այս մշակումը կարևոր քայլ է բարձրորակ, անհատականացված ձայնային սինթեզը հասանելի դարձնելու համար՝ առանց սերվերային ենթակառուցվածքների կամ API-ների անհրաժեշտության:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Meta-ի նոր AI գործակալը ցանկանում է ավելի անձնական դառնալ ձեզ համար
Meta-ն ներկայացրել է իր վերջին նորարարությունը՝ Muse AI գործակալը, որը նախատեսված է որպես օգտատերերի համար խիստ անհատականացված օգնական հանդես գալու հա…
Ի՞նչ է կատարվում OpenAI-ի և Նավիե-Ստոքսի հավասարումների շուրջ ծագած վեճի հետ
OpenAI-ը վերջերս հայտարարել է մաթեմատիկայի ոլորտում նշանակալի առաջընթացի մասին, որը վերաբերում է Նավիե-Ստոքսի հավասարումներին, որոնք նկարագրում են հեղ…
Խոշոր լեզվական մոդելները մշակում են նոր սոցիալական կողմնակալություններ՝ ադապտիվ ուսուցման միջոցով
OpenReview-ում հրապարակված վերջին գիտական աշխատանքը ուսումնասիրում է, թե ինչպես կարող են խոշոր լեզվական մոդելները (LLM) ձեռք բերել և դրսևորել նոր սոցի…


