Xiaomi MiMo. մեկ տրիլիոն պարամետր, որոնցից աշխատում է չորս տոկոսը

Xiaomi ընկերությունը ներկայացրել է MiMo լեզվական մոդելների ընտանիքը, որն ընդգրկում է կոնֆիգուրացիաների լայն շրջանակ՝ 7 միլիարդ պարամետր ունեցող փոքր մոդելներից մինչև մեկ տրիլիոն պարամետր պարունակող Mixture of Experts (MoE) ճարտարապետությամբ լայնածավալ լուծում։ Հայտարարության հիմնական առանձնահատկությունը հաշվողական ռեսուրսների օգտագործման բարձր արդյունավետությունն է. չնայած պարամետրերի հսկայական ընդհանուր ծավալին, տեքստի գեներացման գործընթացում դրանցից ակտիվանում է միայն մոտ չորս տոկոսը։ Այս մոտեցումը թույլ է տալիս զգալիորեն արագացնել մոդելի աշխատանքը և նվազեցնել սարքավորումների նկատմամբ պահանջները՝ առանց պատասխանների որակի էական կորստի։ Փորձագետները նշում են, որ նոսր ճարտարապետությունների (sparse models) օգտագործումը դառնում է արդյունաբերության նոր ստանդարտը, ինչը թույլ է տալիս ընկերություններին մասշտաբավորել AI-ի հնարավորությունները մինչև տրիլիոնային արժեքներ՝ պահպանելով ինֆերենսի ընդունելի արագությունը։ Այս մշակումն ընդգծում է Xiaomi-ի ձգտումը՝ ամրապնդելու իր դիրքերը գեներատիվ արհեստական բանականության ոլորտում՝ առաջարկելով ճկուն գործիքներ տարբեր խնդիրների համար։
This is a summary. Read the full article at the original source:
HabrԿապակցված
Jev. նոր սերնդի մոդել՝ 40-400 անգամ ավելի էժան և 20-200 անգամ ավելի արագ
Typesafe AI ընկերությունը ներկայացրել է Jev-ը՝ նոր սերնդի մոդել, որը նախատեսված է լեզվական մեծ մոդելների աշխատանքի արժեքն ու արագությունը զգալիորեն օպ…
AI-ի գերեզմանոցը. այն նախագծերի և ստարտափների ցանկը, որոնք չհաջողեցին
TechCrunch-ը հրապարակել է AI-ի ներկայիս լանդշաֆտի համապարփակ ակնարկ՝ կենտրոնանալով այն բարձրակարգ նախագծերի և ստարտափների վրա, որոնք չեն արդարացրել սպ…
Արտակարգ իրավիճակների ծանուցման համակարգ 15 հազար օգտատերերի համար՝ LLM, PostGIS, Qdrant և Telegram
Հոդվածում ներկայացված է 15 հազար օգտատեր սպասարկող արտակարգ իրավիճակների ծանուցման համակարգի ճարտարապետությունը: Ինժեներական հիմնական խնդիրը հարյուրավ…



