Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Գործարկեք Qwen 3.8 Flash Next (125B) սպառողական սարքավորումների վրա (RTX 4090) 100 տոկեն/վրկ արագությամբ

Hacker News (YC)
Advertisement468 × 90
Գործարկեք Qwen 3.8 Flash Next (125B) սպառողական սարքավորումների վրա (RTX 4090) 100 տոկեն/վրկ արագությամբ

Strata անունով նոր նախագիծը թույլ է տալիս օգտատերերին գործարկել հսկայական 125 միլիարդ պարամետր ունեցող Qwen 3.8 Flash Next մոդելը սպառողական մակարդակի սարքավորումների՝ մասնավորապես NVIDIA RTX 4090-ի վրա: Նախագիծը պնդում է, որ հասնում է վայրկյանում 100 տոկեն արագության, ինչը նշանակալի ձեռքբերում է տեղային լեզվական մոդելների համար: Օպտիմալացման առաջադեմ մեթոդների կիրառմամբ՝ Strata-ն կրճատում է տարբերությունը բարձրակարգ կորպորատիվ ենթակառուցվածքների և անհատական համակարգիչների միջև: Այս զարգացումը հնարավորություն է տալիս հետազոտողներին և ծրագրավորողներին փորձարկել ժամանակակից AI մոդելներ՝ առանց թանկարժեք սերվերային կլաստերների անհրաժեշտության: GitHub-ում հասանելի այս նախագիծը տրամադրում է անհրաժեշտ գործիքներ տեղային կարգավորումների համար: Քանի որ տեղային LLM-ների արդյունավետությունը շարունակում է աճել, այս առաջընթացը ընդգծում է AI ոլորտում օպտիմալացման արագ տեմպերը՝ հզոր գեներատիվ գործիքները դարձնելով ավելի հասանելի անհատների համար:

This is a summary. Read the full article at the original source:

Hacker News (YC)
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Քանի որ AI մոդելների գնագոյացումը դառնում է ավելի անկայուն, մշակողները բախվում են ծախսերի անարդյունավետության՝ բոլոր առաջադրանքների համար հիմնական մոդ…

Dev.to

Հոդվածում ներկայացվում է AI գործակալների օրկեստրավորման այլընտրանքային մոտեցում, որը կոչվում է «Մեկնաբանելի համատեքստի մեթոդաբանություն»: LangChain կա…

Habr

Ծրագրավորող Թեջաս Ռաուոլը ներկայացրել է ATLAS-ը՝ արհեստական բանականության վրա հիմնված գիտելիքի ամբողջականության հարթակ, որը նախատեսված է դուրս գալու ա…

Dev.to
Advertisement970 × 250