Gemini 4-ը հաղթել է բենչմարկներում. ինչու է դա ավելի քիչ խոսում մոդելի որակի մասին

Google-ը ներկայացրել է Gemini 4 Argon-ը, որը, ըստ պաշտոնական տվյալների, առաջատար է 18 բենչմարկներից 12-ում: Այնուամենայնիվ, փորձագետները նշում են, որ իրավիճակը կրկնում է Gemini 3.1 Pro-ի թողարկման սցենարը, որը հետագայում իրական առաջադրանքներում զիջեց մրցակիցներին: Հոդվածում ընդգծվում է, որ սինթետիկ թեստերի արդյունքները դառնում են ավելի քիչ ներկայացուցչական՝ մեծ լեզվական մոդելների իրական հնարավորությունները գնահատելու համար: Չնայած աղյուսակներում տպավորիչ թվերին, «թղթային» արդյունավետության և գործնական կիրառման միջև եղած տարբերությունը շարունակում է մեծանալ: Հեղինակը նշում է, որ AI արդյունաբերությունը ավելի հաճախ է բախվում այն խնդրին, երբ բենչմարկները դադարում են արտացոլել նեյրոնային ցանցերի աշխատանքի իրական որակը, ինչը դրանք դարձնում է ավելի քիչ հուսալի գործիք օգտատերերի և մշակողների համար՝ իրական բիզնես խնդիրների համար մոդել ընտրելիս:
This is a summary. Read the full article at the original source:
HabrԿապակցված
Արհեստական բանականության այս փորձագետները ցանկանում են բարձր ռիսկային հետազոտություններն իրականացնել բաց ձևաչափով
Trillium Labs-ը՝ արհեստական բանականության հետազոտական նոր կազմակերպությունը, մարտահրավեր է նետում ոլորտի այն նորմին, ըստ որի բարձր ռիսկային հետազոտութ…
OpenAI-ն գործարկել է Dots-ը՝ բիզնեսին ուղղված AI գործիք
OpenAI-ն պաշտոնապես ներկայացրել է «Dots»-ը՝ նոր արտադրանք, որը դիրքավորվում է որպես Muse-ի նման ստեղծագործական AI գործիքների բիզնես-կենտրոնացված այլըն…
Հռոմի պապ Լեո XIV-ը արհեստական բանականությամբ ստեղծված արվեստի երկրպագու չէ
Հռոմի պապ Լեո XIV-ը հրապարակավ քննադատել է արհեստական բանականությամբ ստեղծված արվեստի տարածումը՝ պնդելով, որ գոյաբանական հիմնարար տարբերություն կա մար…



