Գործակալն ավարտեց աշխատանքը, բայց չափորոշիչը նրան զրո գնահատեց

Վերջերս անցկացված հետազոտությունը ցույց է տալիս AI գործակալների իրական աշխատանքի և նրանց ստացած չափորոշիչների (benchmark) գնահատականների միջև եղած անհամապատասխանությունը: Հեղինակը մշակել է 96 սինթետիկ դրվագներից բաղկացած չափորոշիչ՝ ստուգելու համար, թե ինչպես են գործակալները կառավարում բիզնես գործընթացները, ինչպիսիք են տոմսերի ստեղծումը կամ գույքագրումը, երբ առկա են խնդիրներ, օրինակ՝ հաստատումների կորուստ կամ ժամանակի սպառում: Արդյունքները ցույց են տալիս, որ թեև DeepSeek-v4-pro մոդելները հաջողությամբ կատարել են բիզնես առաջադրանքները, նրանք ստացել են զրոյական գնահատական՝ խիստ գնահատման չափանիշների պատճառով, ինչպիսիք են ձևաչափման սխալները: Հեղինակը պնդում է, որ միայն մեկ հաջողության դրոշակով գնահատումը բավարար չէ: Փոխարենը, մշակողները պետք է հետևեն բազմաթիվ չափանիշների՝ ներառյալ բիզնես էֆեկտները և թույլտվությունների համապատասխանությունը: Հետազոտությունը եզրակացնում է, որ կատարողականի և պայմանագրային համապատասխանության տարանջատումը կարևոր է հուսալի համակարգեր ստեղծելու համար՝ կանխելու համար սխալ մեկնաբանությունները, որոնք կարող են հանգեցնել վտանգավոր կրկնակի գործողությունների:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
200 գործակալ, 2,011,438 գործիքային կանչ. ո՞վ է վճարում ձեր AI-ի համար
Գործակալային համակարգերի վերլուծությունը ցույց է տալիս, որ AI-ի ծախսերի մեծ մասը պայմանավորված է ոչ թե բարդ տրամաբանությամբ, այլ մոդելների անարդյունավ…
Վեբ դիզայնի ռեֆերենսների ստեղծում արհեստական բանականության միջոցով
Այս հոդվածում հեղինակը փորձարկում է արհեստական բանականության գործիքների օգնությամբ վեբ դիզայնի ակտիվների գեներացումը: Հիմնական նպատակն է ստուգել նեյրո…
Hacker News-ում վերջերս ծավալված քննարկումը ուսումնասիրում է հաշվողական տեխնիկայի փիլիսոփայական և տեխնիկական սահմանափակումները՝ պնդելով, որ համակարգիչ…


