Qwen 2.5 72B և 32B մոդելները հասանելի են Cerebras-ում՝ 1500 թոքեն/վրկ արագությամբ
Cerebras Systems-ը հայտարարել է Qwen 2.5 72B և 32B մոդելների հասանելիության մասին իր ինֆերենս հարթակում: Ընկերության մասնագիտացված Wafer-Scale Engine տեխնոլոգիայի շնորհիվ այս մոդելները հասնում են մինչև 1500 թոքեն/վրկ արագության: Այս ինտեգրումը մշակողներին հնարավորություն է տալիս օգտվել ժամանակակից բաց կոդով մոդելներից՝ շրջանցելով ավանդական GPU-ների հետ կապված ուշացումները: Cerebras Inference API-ն նախատեսված է բարձր թողունակություն պահանջող հավելվածների համար, ինչպիսիք են իրական ժամանակի AI գործակալները և տվյալների լայնածավալ մշակումը: Օպտիմալացնելով սարքավորումային և ծրագրային շերտերը հատուկ տրանսֆորմերային ճարտարապետությունների համար՝ Cerebras-ը շարունակում է դիրքավորվել որպես բարձր արագությամբ այլընտրանք այն կազմակերպությունների համար, որոնք ձգտում են ընդլայնել իրենց գեներատիվ AI հնարավորությունները՝ առանց արագության կամ մոդելի բարդության հաշվին փոխզիջումների գնալու:
This is a summary. Read the full article at the original source:
Hacker News (YC)Կապակցված
Meta-ի նոր AI գործակալը ցանկանում է ավելի անձնական դառնալ ձեզ համար
Meta-ն ներկայացրել է իր վերջին նորարարությունը՝ Muse AI գործակալը, որը նախատեսված է որպես օգտատերերի համար խիստ անհատականացված օգնական հանդես գալու հա…
Ի՞նչ է կատարվում OpenAI-ի և Նավիե-Ստոքսի հավասարումների շուրջ ծագած վեճի հետ
OpenAI-ը վերջերս հայտարարել է մաթեմատիկայի ոլորտում նշանակալի առաջընթացի մասին, որը վերաբերում է Նավիե-Ստոքսի հավասարումներին, որոնք նկարագրում են հեղ…
Խոշոր լեզվական մոդելները մշակում են նոր սոցիալական կողմնակալություններ՝ ադապտիվ ուսուցման միջոցով
OpenReview-ում հրապարակված վերջին գիտական աշխատանքը ուսումնասիրում է, թե ինչպես կարող են խոշոր լեզվական մոդելները (LLM) ձեռք բերել և դրսևորել նոր սոցի…


