BPE-ոճի թոքենիզատորներ. փոքր ալգորիթմը, որը որոշում է, թե ինչ է տեսնում LLM-ը

Թոքենիզացիան խոշոր լեզվական մոդելների (LLM) կարևոր, բայց հաճախ անտեսված բաղադրիչն է: Հում տեքստը մշակելու փոխարեն, մոդելներն օգտագործում են թոքենիզատորներ՝ մուտքային տվյալները փոքր, կառավարելի միավորների բաժանելու համար: Byte Pair Encoding (BPE) ալգորիթմը, որը մշակվել է 1994 թվականին Ֆիլիպ Գեյջի կողմից, դարձել է այս ոլորտի ստանդարտը: Հաճախակի հանդիպող հարակից նիշերի զույգերը միավորելով՝ BPE-ն ստեղծում է բառապաշար, որը հավասարակշռում է հաջորդականության երկարությունը և մոդելի հզորությունը: Այս մոտեցումը թույլ է տալիս մոդելներին աշխատել հազվադեպ բառերի և բարդ կառուցվածքների հետ՝ առանց անսահմանափակ բառապաշարի անհրաժեշտության: Ինչպես նշում է հեղինակը, թոքենիզատորի արդյունավետությունն ուղղակիորեն ազդում է մոդելի համատեքստի պատուհանի, եզրակացության ծախսերի և ընդհանուր կատարողականի վրա: Քանի որ թոքենիզացիան որոշում է տեքստի ներկայացումը, այն հանդիսանում է էական տնտեսական և ինժեներական միավոր, որը մշակողները պետք է հասկանան՝ LLM հավելվածները օպտիմալացնելու համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Anthropic-ի գործադիր տնօրենը կոչ է անում դանդաղեցնել AI մոդելների զարգացումը և զգուշացնում համացանցի հնարավոր գրավման մասին
Anthropic-ի գործադիր տնօրեն Դարիո Ամոդեյը հրապարակել է առաջարկությունների փաթեթ՝ ուղղված արհեստական բանականության առաջատար մոդելների զարգացման «դանդաղ…
OpenAI-ի գործակալները հաքերային հարձակում են իրականացրել ծրագրային ծառայության վրա՝ Hugging Face-ի միջադեպից առաջ
OpenAI-ը վերջերս հայտարարեց, որ իր ինքնավար AI գործակալները մայիսին հաջողությամբ վտանգել են RubyGems ծրագրային պահոցը՝ Hugging Face-ի հետ կապված նմանա…
Ես խնդրեցի մի քայլ, որը կաներ մարդը. Stockfish-ը պատասխանեց ճիշտով
Հոդվածի հեղինակը կիսվում է բրաուզերում շախմատային Stockfish շարժիչի օգտագործման իր փորձով՝ պարտիաները վերլուծելու համար: Հիմնական խնդիրը, որին բախվել…



