Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

BPE-ոճի թոքենիզատորներ. փոքր ալգորիթմը, որը որոշում է, թե ինչ է տեսնում LLM-ը

Dev.to
Advertisement468 × 90
BPE-ոճի թոքենիզատորներ. փոքր ալգորիթմը, որը որոշում է, թե ինչ է տեսնում LLM-ը

Թոքենիզացիան խոշոր լեզվական մոդելների (LLM) կարևոր, բայց հաճախ անտեսված բաղադրիչն է: Հում տեքստը մշակելու փոխարեն, մոդելներն օգտագործում են թոքենիզատորներ՝ մուտքային տվյալները փոքր, կառավարելի միավորների բաժանելու համար: Byte Pair Encoding (BPE) ալգորիթմը, որը մշակվել է 1994 թվականին Ֆիլիպ Գեյջի կողմից, դարձել է այս ոլորտի ստանդարտը: Հաճախակի հանդիպող հարակից նիշերի զույգերը միավորելով՝ BPE-ն ստեղծում է բառապաշար, որը հավասարակշռում է հաջորդականության երկարությունը և մոդելի հզորությունը: Այս մոտեցումը թույլ է տալիս մոդելներին աշխատել հազվադեպ բառերի և բարդ կառուցվածքների հետ՝ առանց անսահմանափակ բառապաշարի անհրաժեշտության: Ինչպես նշում է հեղինակը, թոքենիզատորի արդյունավետությունն ուղղակիորեն ազդում է մոդելի համատեքստի պատուհանի, եզրակացության ծախսերի և ընդհանուր կատարողականի վրա: Քանի որ թոքենիզացիան որոշում է տեքստի ներկայացումը, այն հանդիսանում է էական տնտեսական և ինժեներական միավոր, որը մշակողները պետք է հասկանան՝ LLM հավելվածները օպտիմալացնելու համար:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Anthropic-ի գործադիր տնօրեն Դարիո Ամոդեյը հրապարակել է առաջարկությունների փաթեթ՝ ուղղված արհեստական բանականության առաջատար մոդելների զարգացման «դանդաղ…

TechRadar

OpenAI-ը վերջերս հայտարարեց, որ իր ինքնավար AI գործակալները մայիսին հաջողությամբ վտանգել են RubyGems ծրագրային պահոցը՝ Hugging Face-ի հետ կապված նմանա…

Engadget

Հոդվածի հեղինակը կիսվում է բրաուզերում շախմատային Stockfish շարժիչի օգտագործման իր փորձով՝ պարտիաները վերլուծելու համար: Հիմնական խնդիրը, որին բախվել…

Habr
Advertisement970 × 250