Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ի՞նչ է LLM-ի ինֆերենսում նախնական լրացման (prefill) և վերծանման (decode) տարանջատումը

Dev.to
Advertisement468 × 90
Ի՞նչ է LLM-ի ինֆերենսում նախնական լրացման (prefill) և վերծանման (decode) տարանջատումը

LLM-ի ինֆերենսը բաղկացած է երկու հիմնական փուլից՝ նախնական լրացում (prefill), որը կախված է հաշվողական հզորությունից և որոշում է առաջին թոքենի ստացման ժամանակը (TTFT), և վերծանում (decode), որը կախված է հիշողության թողունակությունից և որոշում է թոքենների միջև ընկած ուշացումը (ITL): Ավանդաբար, այս փուլերը կատարվում են նույն GPU-ների վրա, ինչը հանգեցնում է ռեսուրսների մրցակցության և ուշացումների: Հոդվածը քննարկում է տարանջատված սպասարկման (disaggregated serving) հայեցակարգը, որտեղ prefill և decode գործընթացները տեղափոխվում են առանձին GPU-ների խմբեր: Այս մոտեցումը թույլ է տալիս օպտիմալացնել յուրաքանչյուր փուլը առանձին՝ բարելավելով արտադրողականությունը բարձր ծանրաբեռնվածության դեպքում: Թեև այս ճարտարապետությունը պահանջում է KV քեշի արդյունավետ փոխանցում, այն դարձել է արդյունաբերական ստանդարտ: Հոդվածում նշվում է, թե ինչպես են DigitalOcean-ի նման ծառայությունները օգտագործում այս մեթոդը՝ ապահովելու սպասարկման որակի խիստ պահանջները (SLO):

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Անհատական AI գործակալները նախատեսված են առօրյա գործերը հեշտացնելու համար, ինչպիսիք են գնումները, չվերթների ամրագրումը և այլ ծառայություններից օգտվելը:…

TechCrunch

OpenAI-ի ChatGPT-ն հայտնվել է հեղինակային իրավունքի խախտման նոր սկանդալի կենտրոնում։ Պարզվել է, որ չաթ-բոտը ստեղծում է New Yorker ամսագրի ոճով ծաղրանկ…

Mashable
Advertisement970 × 250