Ինչպես է 8-բիթանոց քվանտացումը LLM-ը փոքրացնում մինչև քառորդ չափի, և ինչու մեկ արտասովոր քաշը կարող է լուռ փչացնել այն

Այս հոդվածը ներկայացնում է 8-բիթանոց (INT8) քվանտացման սկզբնական ուղեցույցը՝ տեխնիկա, որն օգտագործվում է մեծ լեզվական մոդելների (LLM) հիշողության ծավալը կրճատելու համար: Քաշերը բարձր ճշգրտության լողացող կետի ձևաչափերից 8-բիթանոց ամբողջ թվերի վերածելով՝ մոդելները կարող են փոքրանալ մինչև իրենց սկզբնական չափի մեկ քառորդը՝ զգալիորեն բարելավելով աշխատանքի արագությունը: Հեղինակը շեշտում է կարևոր խնդիր՝ արտասովոր քաշերը (outliers), որոնք կարող են աղավաղել քվանտացման մասշտաբը և նվազեցնել ճշգրտությունը: Հոդվածում բացատրվում է, թե ինչպես կարելի է մեղմել այս սխալները «կտրման» (clipping) և բլոկային քվանտացման միջոցով, որտեղ քաշերը բաժանվում են ավելի փոքր խմբերի: Ինտերակտիվ գործիքների օգնությամբ այս նյութը գործնական ուղեցույց է ծառայում մշակողների համար՝ հասկանալու մոդելի չափի, հաշվարկային ծախսերի և կատարողականության միջև առկա փոխզիջումները ժամանակակից AI համակարգերում:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Արհեստական բանականությունը ստեղծում է «մարդկային հավելավճար» մարդկանց կողմից ստեղծված արվեստի համար
Քանի որ գեներատիվ արհեստական բանականության գործիքները դառնում են ավելի հմուտ պատկերներ, տեքստեր և երաժշտություն ստեղծելու հարցում, ձևավորվում է նոր տն…
Ես սարսափելի խաղեր ստեղծեցի Google-ի AI Playground-ի միջոցով
Google-ի արհեստական բանականությամբ աշխատող խաղերի մշակման գործիքների վերջին ուսումնասիրությունը բացահայտում է գեներատիվ տեխնոլոգիաների ընթացիկ սահմանա…
Չիրականացված նախագծեր. արդյո՞ք LLM-ները մեռած առաջարկները ընդունում են որպես իրական ստանդարտներ
Նոր հետազոտությունը ուսումնասիրում է, թե արդյոք լեզվական մեծ մոդելները (LLM) սխալմամբ ընդունում են մերժված կամ չիրականացված տեխնիկական առաջարկները՝ ին…


