Ի՞նչ է LLM-ի ինֆերենսում նախնական լրացման (prefill) և վերծանման (decode) տարանջատումը

LLM-ի ինֆերենսը բաղկացած է երկու հիմնական փուլից՝ նախնական լրացում (prefill), որը կախված է հաշվողական հզորությունից և որոշում է առաջին թոքենի ստացման ժամանակը (TTFT), և վերծանում (decode), որը կախված է հիշողության թողունակությունից և որոշում է թոքենների միջև ընկած ուշացումը (ITL): Ավանդաբար, այս փուլերը կատարվում են նույն GPU-ների վրա, ինչը հանգեցնում է ռեսուրսների մրցակցության և ուշացումների: Հոդվածը քննարկում է տարանջատված սպասարկման (disaggregated serving) հայեցակարգը, որտեղ prefill և decode գործընթացները տեղափոխվում են առանձին GPU-ների խմբեր: Այս մոտեցումը թույլ է տալիս օպտիմալացնել յուրաքանչյուր փուլը առանձին՝ բարելավելով արտադրողականությունը բարձր ծանրաբեռնվածության դեպքում: Թեև այս ճարտարապետությունը պահանջում է KV քեշի արդյունավետ փոխանցում, այն դարձել է արդյունաբերական ստանդարտ: Հոդվածում նշվում է, թե ինչպես են DigitalOcean-ի նման ծառայությունները օգտագործում այս մեթոդը՝ ապահովելու սպասարկման որակի խիստ պահանջները (SLO):
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
AI գործակալների հաջորդ խոչընդոտը՝ կայքերի մուտքի ապահովումը
Անհատական AI գործակալները նախատեսված են առօրյա գործերը հեշտացնելու համար, ինչպիսիք են գնումները, չվերթների ամրագրումը և այլ ծառայություններից օգտվելը:…
Mistral-ի նոր «Le Chonk» AI մոդելը մեծ է, բաց և նախատեսված գործակալների համար
Mistral AI-ն ներկայացրել է իր վերջին՝ Mistral Large 4 լեզվական մոդելը, որը ներքին անվանումով հայտնի է որպես «Le Chonk»: Այս նոր մոդելը նախատեսված է որ…
ChatGPT-ն ստեղծում է New Yorker-ի կեղծ ծաղրանկարներ՝ նկարիչների ստորագրություններով
OpenAI-ի ChatGPT-ն հայտնվել է հեղինակային իրավունքի խախտման նոր սկանդալի կենտրոնում։ Պարզվել է, որ չաթ-բոտը ստեղծում է New Yorker ամսագրի ոճով ծաղրանկ…



