Երբ ձեր դատավորը չի կարողանում որոշում կայացնել

CauterRule v0.1.0-ի թողարկումը ընդգծում է AI-ի գնահատման կարևոր խնդիրը՝ անորոշ արդյունքների տարածվածությունը: Չորս մոդելների մասնակցությամբ 1538 թեկնածուների փորձարկման ժամանակ արդյունքների ավելի քան 50%-ը համակարգի կողմից որակվել է որպես «անորոշ»: Հեղինակը պնդում է, որ այս «անորոշ» հատվածը հաճախ անտեսվում է, թեև այն ներկայացնում է չափման լուրջ բացթողում, որտեղ թաքնված են արտադրանքի ռիսկերը: Թեև ավելի հզոր մոդելները փոքր-ինչ նվազեցրել են այս ցուցանիշները, հիմնական խոչընդոտը մնում է հենց գնահատող համակարգը, որը ներկայումս հիմնված է տողերի համեմատման պարզ հեուրիստիկայի վրա: Հոդվածը շեշտում է, որ ուսուցման համակարգերի համար դատելու կարողությունը նույնքան կարևոր է, որքան կանոններ արդյունահանելու կարողությունը: Նախագիծը նպատակ ունի անցնել պարզ համեմատումից դեպի իմաստային գնահատում: Հեղինակը եզրակացնում է, որ անորոշության մակարդակի հետևումը էական է AI-ի արդյունքները գնահատող ցանկացած համակարգի համար, քանի որ անորոշությունը խոչընդոտում է հետագա որոշումների կայացմանը և թաքցնում է արտադրանքի իրական արդյունավետությունը:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Meta-ի նոր AI գործակալը ցանկանում է ավելի անձնական դառնալ ձեզ համար
Meta-ն ներկայացրել է իր վերջին նորարարությունը՝ Muse AI գործակալը, որը նախատեսված է որպես օգտատերերի համար խիստ անհատականացված օգնական հանդես գալու հա…
Ի՞նչ է կատարվում OpenAI-ի և Նավիե-Ստոքսի հավասարումների շուրջ ծագած վեճի հետ
OpenAI-ը վերջերս հայտարարել է մաթեմատիկայի ոլորտում նշանակալի առաջընթացի մասին, որը վերաբերում է Նավիե-Ստոքսի հավասարումներին, որոնք նկարագրում են հեղ…
Խոշոր լեզվական մոդելները մշակում են նոր սոցիալական կողմնակալություններ՝ ադապտիվ ուսուցման միջոցով
OpenReview-ում հրապարակված վերջին գիտական աշխատանքը ուսումնասիրում է, թե ինչպես կարող են խոշոր լեզվական մոդելները (LLM) ձեռք բերել և դրսևորել նոր սոցի…


