Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

VRAM-ը տեղային LLM-ների համար. ինչո՞ւ է հիշողության թողունակությունը որոշում վայրկյանում գեներացվող թոքենների քանակը

Dev.to
Advertisement468 × 90
VRAM-ը տեղային LLM-ների համար. ինչո՞ւ է հիշողության թողունակությունը որոշում վայրկյանում գեներացվող թոքենների քանակը

Տեղային լեզվական մոդելների (LLM) արդյունավետ աշխատանքի համար միայն VRAM-ի ծավալը բավարար չէ. հիշողության թողունակությունը կատարողականությունը որոշող հիմնական գործոնն է: Քանի որ LLM-ները յուրաքանչյուր թոքեն գեներացնելիս պետք է կարդան իրենց ամբողջական կշիռները հիշողությունից, թողունակության սահմանափակումները հաճախ որոշում են ինֆերենցիայի արագությունը: Երբ մոդելները գերազանցում են VRAM-ի ծավալը և PCIe-ի միջոցով տեղափոխվում համակարգային օպերատիվ հիշողություն, արագությունը նվազում է մինչև 20 անգամ: Հեղինակը շեշտում է, որ տեղային ինֆերենցիայի համար սարքավորումներ ընտրելիս պետք է առաջնահերթություն տալ հիշողության բարձր թողունակությանը, այլ ոչ թե հաշվարկային հզորությանը: Օգտագործված RTX 3090-ը՝ 24GB VRAM-ով, ներկայացվում է որպես ծախսարդյունավետ լուծում 32B մոդելների համար: Հոդվածը նաև ուղեցույց է տրամադրում VRAM-ի կարիքները գնահատելու համար՝ հաշվի առնելով մոդելի չափը և KV քեշի պահանջները՝ նախազգուշացնելով, որ մոդելը VRAM-ում «գրեթե տեղավորելը» հանգեցնում է կատարողականի կտրուկ անկման:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Հետազոտողները պարզել են, որ AI-որոնման դարաշրջանում մեջբերումների և բովանդակության որակի գնահատման հանրահայտ SEO գործիքները կողմնակալություն են ցուցաբ…

Habr

Սան Ֆրանցիսկոյում կայացած DevDay 2026 համաժողովում OpenAI-ը ներկայացրեց ավելի քան քսան նոր ապրանք և թարմացում: Գլխավոր նորությունը «Dots»-ն է՝ ինքնավա…

Habr

Անձնական արհեստական բանականության ոլորտը հիմնարար փոփոխությունների է ենթարկվում՝ պարզ չաթ-բոտերից անցնելով դեպի ինքնավար գործակալներ, որոնք ունակ են պ…

Dev.to
Advertisement970 × 250