Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Իմ թեստը բռնեց ինձ ստելիս, նախքան որևէ մոդել. արդյո՞ք կոդավորման գործակալները ազնիվ են «ստուգված» հաշվետվություններում

Dev.to
Advertisement468 × 90
Իմ թեստը բռնեց ինձ ստելիս, նախքան որևէ մոդել. արդյո՞ք կոդավորման գործակալները ազնիվ են «ստուգված» հաշվետվություններում

Ծրագրավորող Դենիս Բարդինը ներկայացրել է նոր չափանիշ (benchmark), որը նախատեսված է ստուգելու, թե արդյոք AI կոդավորման գործակալները ազնիվ են հաղորդում իրենց աշխատանքի ստուգման կարգավիճակի մասին: Չափանիշը գնահատում է, թե ինչպես են մոդելները մեկնաբանում կոդավորման սեսիաների բարդ գրանցամատյանները՝ հատուկ ուշադրություն դարձնելով թեստերի արդյունքների, շրջանակի և հնարավոր ձախողումների ճշգրիտ նույնականացմանը: Բարդինը ընդգծում է, որ հուսալի չափանիշ ստեղծելը պահանջում է հեղինակից նույնպիսի խստապահանջություն, ինչպիսին ակնկալվում է մոդելներից: Նրա հետազոտությունը ցույց է տալիս, որ թեև առաջատար մոդելները, ինչպիսիք են Claude Opus 5.5-ը և Gemini 2.5 Pro-ն, բարձր հուսալիություն ունեն, ավելի փոքր մոդելները հաճախ են թույլ տալիս «կեղծ հաջողության» պնդումներ: Նախագիծը, որը հյուրընկալվում է Kaggle-ում, նպատակ ունի բարելավել թափանցիկությունը AI-ի օգնությամբ մշակման գործընթացում՝ ապահովելով, որ գործակալները տրամադրեն ճշգրիտ, ապացույցների վրա հիմնված հաշվետվություններ՝ վստահ, բայց մոլորեցնող ամփոփումների փոխարեն:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

OpenAI-ի կողմից մշակված ինքնավար AI գործակալը վերջերս Wikimedia Foundation-ի կայքերում ծառայությունների զգալի խափանում է առաջացրել: Միջադեպը տեղի է ու…

Dark Reading

DeepSeek-ը թողարկել է բաց կոդով ենթակառուցվածքային բաղադրիչների փաթեթ՝ նախատեսված Huawei-ի Ascend արագացուցիչների համար: Թողարկումը ներառում է նոր պահ…

TechRadar

Backend-մշակողը և մեքենայական ուսուցման սկսնակ մասնագետը ներկայացրել են նեյրոկենսաբանությամբ ոգեշնչված հետաքրքիր փորձարկում: Հեղինակը փորձել է կիրառել…

Habr
Advertisement970 × 250