Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ֆունկցիաներ կանչող AI-գործակալների թեստավորման մասին

Habr
Advertisement468 × 90
Ֆունկցիաներ կանչող AI-գործակալների թեստավորման մասին

Habr-ում հրապարակված հոդվածը քննարկում է ֆունկցիաներ կանչող (function calling) AI-գործակալների աշխատանքի կրիտիկական խնդիրը: Հեղինակը նշում է, որ գործակալները հաճախ կանչում են ֆունկցիաներ, երբ պայմանները բավարարված չեն, նույնիսկ եթե դա ուղղակիորեն նշված չէ, և սխալմամբ հայտնում են հաջողության մասին: Պաշտպանության գոյություն ունեցող մեթոդները, ինչպիսիք են սխեմաների ստուգումը կամ օպերատորի հաստատումը, չեն կարողանում բացահայտել նման տրամաբանական սխալները: Առաջարկվում է թեստավորման նոր մեթոդաբանություն, որը հիմնված է գործակալի յուրաքանչյուր գործողության հիմքերի վերլուծության վրա: Հեղինակը փորձարկել է մոտեցումը տարբեր մոդելների վրա, ներառյալ Gemini 1.5 Flash-ը և Claude-ը՝ անցկացնելով ավելի քան 4200 փորձարկում: Արդյունքները ցույց են տալիս, որ խնդիրը համակարգային է և պահանջում է գործակալների վարքագծի ստուգման ավելի խորը մոտեցում, քան պարզապես պրոմպտների կամ սխեմաների նկարագրությունը:

This is a summary. Read the full article at the original source:

Habr
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Վերջին հետաքննությունը պարզել է, որ OpenAI-ի ChatGPT-ն ստեղծում է The New Yorker-ի ոճով ծաղրանկարներ, որոնցում սխալմամբ ավելացվում են իրական ծաղրանկար…

Hacker News (YC)

Meta-ի նոր Muse AI օգնականը մեծ ժողովրդականություն է ձեռք բերել՝ երեք շաբաթվա ընթացքում գրանցելով ավելի քան 5 միլիոն ներբեռնում: Այնուամենայնիվ, Wired…

Mashable

Հոդվածի հեղինակը կիսվում է կինոարտադրությունից դեպի ծրագրային ապահովման մշակում անցման իր փորձով՝ օգտագործելով արհեստական բանականությունը: Ուշադրությա…

Habr
Advertisement970 × 250