Ինչպես Google-ը սովորեցրեց փոքրիկ մոդելին հասկանալ տեքստը, նկարները, տեսանյութերը և ձայնը. վերլուծում ենք EmbeddingGemma 2-ը

2026 թվականի հոկտեմբերի 6-ին Google DeepMind-ը ներկայացրեց EmbeddingGemma 2-ը՝ կոմպակտ մուլտիմոդալ էմբեդինգների մոդել: Այն կարողանում է տեքստը, կոդը, պատկերները, տեսանյութերը և ձայնը փոխակերպել միասնական 768-չափանի վեկտորային տարածության, ինչը հնարավորություն է տալիս իրականացնել խաչաձև որոնում, օրինակ՝ տեսանյութեր գտնել տեքստային հարցումներով: Մոդելի գլխավոր առավելությունը դրա արդյունավետությունն է. տեքստային տարբերակը զբաղեցնում է մոտ 191 ՄԲ օպերատիվ հիշողություն, իսկ ամբողջական մուլտիմոդալ տարբերակը՝ 567 ՄԲ: Սա թույլ է տալիս առաջադեմ որոնման գործառույթներն աշխատեցնել անմիջապես շարժական սարքերի վրա, ինչպիսին է Pixel 11 Pro-ն՝ առանց ամպային սերվերներ դիմելու: Հոդվածում մանրամասն վերլուծվում է մոդելի ճարտարապետությունը, դրա չափերի օպտիմալացման մեթոդները, ինչպես նաև գործնական խորհուրդներ են տրվում ինտեգրման և հնարավոր տեխնիկական դժվարությունների վերաբերյալ:
This is a summary. Read the full article at the original source:
HabrԿապակցված
Odyssey-3. համաշխարհային մոդել, որը տեսանյութերի միջոցով ռոբոտներին սովորեցնում է ֆիզիկա
Odyssey ընկերությունը ներկայացրել է Odyssey-3-ը՝ նորարարական համաշխարհային մոդել, որը նախատեսված է ռոբոտներին ֆիզիկական օրենքները տեսանյութերի վերլուծ…
Սաթյա Նադելլան ասում է, որ մենք պետք է ենթադրենք, որ բոլոր AI մոդելները «վտանգված են»
Microsoft-ի գործադիր տնօրեն Սաթյա Նադելլան խիստ նախազգուշացում է հնչեցրել արհեստական բանականության առաջադեմ մոդելների անվտանգության վերաբերյալ: Վերջեր…
Նեյրոնային ցանց՝ ըստ բաղադրատոմսի. հաշվարկում ենք կշիռները՝ մատրիցներ պահելու փոխարեն
Habr-ի այս հոդվածը ուսումնասիրում է նեյրոնային ցանցերի պարամետրերի պահպանման այլընտրանքային մեթոդներ։ Հսկայական կշռային մատրիցներ պահելու դասական մոտե…



