Գործարկեք Qwen 3.8 Flash Next (125B) սպառողական սարքավորումների վրա (RTX 4090) 100 տոկեն/վրկ արագությամբ
Strata անունով նոր նախագիծը թույլ է տալիս օգտատերերին գործարկել հսկայական 125 միլիարդ պարամետր ունեցող Qwen 3.8 Flash Next մոդելը սպառողական մակարդակի սարքավորումների՝ մասնավորապես NVIDIA RTX 4090-ի վրա: Նախագիծը պնդում է, որ հասնում է վայրկյանում 100 տոկեն արագության, ինչը նշանակալի ձեռքբերում է տեղային լեզվական մոդելների համար: Օպտիմալացման առաջադեմ մեթոդների կիրառմամբ՝ Strata-ն կրճատում է տարբերությունը բարձրակարգ կորպորատիվ ենթակառուցվածքների և անհատական համակարգիչների միջև: Այս զարգացումը հնարավորություն է տալիս հետազոտողներին և ծրագրավորողներին փորձարկել ժամանակակից AI մոդելներ՝ առանց թանկարժեք սերվերային կլաստերների անհրաժեշտության: GitHub-ում հասանելի այս նախագիծը տրամադրում է անհրաժեշտ գործիքներ տեղային կարգավորումների համար: Քանի որ տեղային LLM-ների արդյունավետությունը շարունակում է աճել, այս առաջընթացը ընդգծում է AI ոլորտում օպտիմալացման արագ տեմպերը՝ հզոր գեներատիվ գործիքները դարձնելով ավելի հասանելի անհատների համար:
This is a summary. Read the full article at the original source:
Hacker News (YC)Կապակցված
Ձեր գործակալի հաշիվը արբիտրաժ է պարունակում. եռաստիճան աուդիտ
Քանի որ AI մոդելների գնագոյացումը դառնում է ավելի անկայուն, մշակողները բախվում են ծախսերի անարդյունավետության՝ բոլոր առաջադրանքների համար հիմնական մոդ…
Մեկնաբանելի համատեքստի մեթոդաբանություն. դիրեկտորիաների կառուցվածքը որպես AI գործակալի ճարտարապետություն
Հոդվածում ներկայացվում է AI գործակալների օրկեստրավորման այլընտրանքային մոտեցում, որը կոչվում է «Մեկնաբանելի համատեքստի մեթոդաբանություն»: LangChain կա…
Գիտելիքի ամբողջականության հարթակի ստեղծում Sanity-ի և AI-ի միջոցով
Ծրագրավորող Թեջաս Ռաուոլը ներկայացրել է ATLAS-ը՝ արհեստական բանականության վրա հիմնված գիտելիքի ամբողջականության հարթակ, որը նախատեսված է դուրս գալու ա…


