Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Գործակալն ավարտեց աշխատանքը, բայց չափորոշիչը նրան զրո գնահատեց

Dev.to
Advertisement468 × 90
Գործակալն ավարտեց աշխատանքը, բայց չափորոշիչը նրան զրո գնահատեց

Վերջերս անցկացված հետազոտությունը ցույց է տալիս AI գործակալների իրական աշխատանքի և նրանց ստացած չափորոշիչների (benchmark) գնահատականների միջև եղած անհամապատասխանությունը: Հեղինակը մշակել է 96 սինթետիկ դրվագներից բաղկացած չափորոշիչ՝ ստուգելու համար, թե ինչպես են գործակալները կառավարում բիզնես գործընթացները, ինչպիսիք են տոմսերի ստեղծումը կամ գույքագրումը, երբ առկա են խնդիրներ, օրինակ՝ հաստատումների կորուստ կամ ժամանակի սպառում: Արդյունքները ցույց են տալիս, որ թեև DeepSeek-v4-pro մոդելները հաջողությամբ կատարել են բիզնես առաջադրանքները, նրանք ստացել են զրոյական գնահատական՝ խիստ գնահատման չափանիշների պատճառով, ինչպիսիք են ձևաչափման սխալները: Հեղինակը պնդում է, որ միայն մեկ հաջողության դրոշակով գնահատումը բավարար չէ: Փոխարենը, մշակողները պետք է հետևեն բազմաթիվ չափանիշների՝ ներառյալ բիզնես էֆեկտները և թույլտվությունների համապատասխանությունը: Հետազոտությունը եզրակացնում է, որ կատարողականի և պայմանագրային համապատասխանության տարանջատումը կարևոր է հուսալի համակարգեր ստեղծելու համար՝ կանխելու համար սխալ մեկնաբանությունները, որոնք կարող են հանգեցնել վտանգավոր կրկնակի գործողությունների:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Գործակալային համակարգերի վերլուծությունը ցույց է տալիս, որ AI-ի ծախսերի մեծ մասը պայմանավորված է ոչ թե բարդ տրամաբանությամբ, այլ մոդելների անարդյունավ…

Dev.to

Այս հոդվածում հեղինակը փորձարկում է արհեստական բանականության գործիքների օգնությամբ վեբ դիզայնի ակտիվների գեներացումը: Հիմնական նպատակն է ստուգել նեյրո…

Habr
Advertisement970 × 250