Տեռնարային LLM-ների համար 1.58-բիթանոց պատնեշի հաղթահարումը

Հետազոտողները ներկայացրել են տեռնարային (եռարժեք) մեծ լեզվական մոդելների (LLM) նոր մոտեցում, որը հաջողությամբ հաղթահարում է 1.58-բիթանոց քվանտացման ավանդական պատնեշը: Օպտիմալացնելով քաշերի բաշխումը և ակտիվացման ֆունկցիաները՝ ուսումնասիրությունը ցույց է տալիս, որ տեռնարային մոդելները, որոնք օգտագործում են միայն երեք արժեք (-1, 0, 1), կարող են հասնել լրիվ ճշգրտության մոդելներին համեմատելի արդյունավետության՝ զգալիորեն նվազեցնելով հիշողության և հաշվողական ռեսուրսների պահանջները: Այս առաջընթացը լուծում է ծայրահեղ քվանտացման հետ կապված տեղեկատվության կորստի խնդիրը՝ հնարավորություն տալով բարձր արդյունավետությամբ AI մոդելներ տեղակայել սահմանափակ ռեսուրսներ ունեցող սարքավորումների վրա: Մեթոդաբանությունը կենտրոնանում է ուսուցման փուլում քվանտացման սխալի նվազեցման վրա, ինչը թույլ է տալիս ավելի արդյունավետ եզրակացություններ անել՝ առանց ճշգրտությունը զոհաբերելու: Այս զարգացումը կարևոր քայլ է մոդելների սեղմման ոլորտում՝ հնարավոր դարձնելով բարդ LLM-ների ինտեգրումը սմարթֆոններում և ներդրված համակարգերում:
This is a summary. Read the full article at the original source:
Hacker News (YC)Կապակցված
Ինչպե՞ս կարող են AI գործակալները հանգեցնել ձեռնարկությունների համար անվերահսկելի ծախսերի
Քանի որ ձեռնարկություններն ավելի ու ավելի են ինտեգրում ինքնավար AI գործակալներն իրենց աշխատանքային գործընթացներում, ի հայտ է եկել ֆինանսական լուրջ ռիս…
AI-ի անվերահսկելի վտանգները կանխելու համար անհրաժեշտ է ավելին, քան պարզապես խոսակցություններ P(doom)-ի մասին
CNET-ի հյուրընկալված սյունակում հեղինակ Ջեյմի Բարթլեթը քննարկում է առաջադեմ արհեստական բանականության հետ կապված աճող ռիսկերը: Բարթլեթը պնդում է, որ «P…
OpenAI-ն ստեղծում է մաթեմատիկական խորհրդատվական խումբ, քանի որ նրա AI-ն լուծել է ավելի քան 100 բաց խնդիր
OpenAI-ն պաշտոնապես ստեղծել է մաթեմատիկական խորհրդատվական խումբ՝ վերահսկելու առաջադեմ AI տրամաբանության ոլորտում իր հետազոտությունները: Այս քայլը հաջո…



