Ֆունկցիաներ կանչող AI-գործակալների թեստավորման մասին
Habr-ում հրապարակված հոդվածը քննարկում է ֆունկցիաներ կանչող (function calling) AI-գործակալների աշխատանքի կրիտիկական խնդիրը: Հեղինակը նշում է, որ գործակալները հաճախ կանչում են ֆունկցիաներ, երբ պայմանները բավարարված չեն, նույնիսկ եթե դա ուղղակիորեն նշված չէ, և սխալմամբ հայտնում են հաջողության մասին: Պաշտպանության գոյություն ունեցող մեթոդները, ինչպիսիք են սխեմաների ստուգումը կամ օպերատորի հաստատումը, չեն կարողանում բացահայտել նման տրամաբանական սխալները: Առաջարկվում է թեստավորման նոր մեթոդաբանություն, որը հիմնված է գործակալի յուրաքանչյուր գործողության հիմքերի վերլուծության վրա: Հեղինակը փորձարկել է մոտեցումը տարբեր մոդելների վրա, ներառյալ Gemini 1.5 Flash-ը և Claude-ը՝ անցկացնելով ավելի քան 4200 փորձարկում: Արդյունքները ցույց են տալիս, որ խնդիրը համակարգային է և պահանջում է գործակալների վարքագծի ստուգման ավելի խորը մոտեցում, քան պարզապես պրոմպտների կամ սխեմաների նկարագրությունը:
This is a summary. Read the full article at the original source:
HabrԿապակցված
ChatGPT-ն իրական ծաղրանկարիչների ստորագրություններն ավելացնում է կեղծ New Yorker ծաղրանկարներին
Վերջին հետաքննությունը պարզել է, որ OpenAI-ի ChatGPT-ն ստեղծում է The New Yorker-ի ոճով ծաղրանկարներ, որոնցում սխալմամբ ավելացվում են իրական ծաղրանկար…
Meta-ի Muse-ը, ըստ հաղորդումների, թղթապանակներ է պահում ձեր բոլոր մտերիմների մասին
Meta-ի նոր Muse AI օգնականը մեծ ժողովրդականություն է ձեռք բերել՝ երեք շաբաթվա ընթացքում գրանցելով ավելի քան 5 միլիոն ներբեռնում: Այնուամենայնիվ, Wired…
ԿԻՆՈ-ի ռեժիսորից՝ ԿՈԴ-ի ռեժիսոր. ինչպես ստիպեցի արհեստական բանականությանը ինքնուրույն ստեղծել պատրաստի ծրագրեր
Հոդվածի հեղինակը կիսվում է կինոարտադրությունից դեպի ծրագրային ապահովման մշակում անցման իր փորձով՝ օգտագործելով արհեստական բանականությունը: Ուշադրությա…



