Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ինչպես Google-ը սովորեցրեց փոքրիկ մոդելին հասկանալ տեքստը, նկարները, տեսանյութերը և ձայնը. վերլուծում ենք EmbeddingGemma 2-ը

Habr
Advertisement468 × 90
Ինչպես Google-ը սովորեցրեց փոքրիկ մոդելին հասկանալ տեքստը, նկարները, տեսանյութերը և ձայնը. վերլուծում ենք EmbeddingGemma 2-ը

2026 թվականի հոկտեմբերի 6-ին Google DeepMind-ը ներկայացրեց EmbeddingGemma 2-ը՝ կոմպակտ մուլտիմոդալ էմբեդինգների մոդել: Այն կարողանում է տեքստը, կոդը, պատկերները, տեսանյութերը և ձայնը փոխակերպել միասնական 768-չափանի վեկտորային տարածության, ինչը հնարավորություն է տալիս իրականացնել խաչաձև որոնում, օրինակ՝ տեսանյութեր գտնել տեքստային հարցումներով: Մոդելի գլխավոր առավելությունը դրա արդյունավետությունն է. տեքստային տարբերակը զբաղեցնում է մոտ 191 ՄԲ օպերատիվ հիշողություն, իսկ ամբողջական մուլտիմոդալ տարբերակը՝ 567 ՄԲ: Սա թույլ է տալիս առաջադեմ որոնման գործառույթներն աշխատեցնել անմիջապես շարժական սարքերի վրա, ինչպիսին է Pixel 11 Pro-ն՝ առանց ամպային սերվերներ դիմելու: Հոդվածում մանրամասն վերլուծվում է մոդելի ճարտարապետությունը, դրա չափերի օպտիմալացման մեթոդները, ինչպես նաև գործնական խորհուրդներ են տրվում ինտեգրման և հնարավոր տեխնիկական դժվարությունների վերաբերյալ:

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Odyssey ընկերությունը ներկայացրել է Odyssey-3-ը՝ նորարարական համաշխարհային մոդել, որը նախատեսված է ռոբոտներին ֆիզիկական օրենքները տեսանյութերի վերլուծ…

Habr

Microsoft-ի գործադիր տնօրեն Սաթյա Նադելլան խիստ նախազգուշացում է հնչեցրել արհեստական բանականության առաջադեմ մոդելների անվտանգության վերաբերյալ: Վերջեր…

The Verge

Habr-ի այս հոդվածը ուսումնասիրում է նեյրոնային ցանցերի պարամետրերի պահպանման այլընտրանքային մեթոդներ։ Հսկայական կշռային մատրիցներ պահելու դասական մոտե…

Habr
Advertisement970 × 250