Jev ընդդեմ Claude. Ո՞վ է հաղթում

Վերջերս անցկացված փորձարկման ընթացքում ծրագրավորող Բեն Գրինբերգը համեմատել է կառուցվածքային որոշումների համար նախատեսված Jev մոդելի և Claude Sonnet-ի աշխատանքը իրական նախագծերի գնահատման գործընթացում։ Առաջադրանքը պահանջում էր նախագծերը գնահատել հստակ քաղաքականության համաձայն՝ ընտրելով «բավարարված», «չբավարարված» կամ «ոչ բավարար ապացույցներ» տարբերակներից մեկը։ Թեև երկու մոդելներն էլ ցուցադրել են բարձր ճշգրտություն, Jev-ը զգալի առավելություններ է ունեցել արդյունավետության և հուսալիության առումով։ Jev-ի աշխատանքի արժեքը եղել է Claude-ի ծախսերի մոտ մեկ հիսունական մասը, իսկ արագությունը՝ տասն անգամ ավելի բարձր։ Կարևոր է, որ Jev-ի վստահության գնահատականներն ավելի արդյունավետ են եղել անորոշ դեպքերը բացահայտելու համար, ինչը թույլ է տվել ավելի անվտանգ ավտոմատացում իրականացնել։ Հետազոտությունը ցույց է տալիս, որ մինչ գեներատիվ LLM-ները գերազանցում են ստեղծագործական առաջադրանքներում, Jev-ի նման մասնագիտացված մոդելներն ավելի արդյունավետ են սահմանափակ, կանոնակարգված որոշումներ կայացնելու համար։ Հեղինակը եզրակացնում է, որ AI-ի ապագան հիբրիդային մոտեցման մեջ է՝ կախված առաջադրանքի պահանջներից։
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ինչպե՞ս կարող են AI գործակալները հանգեցնել ձեռնարկությունների համար անվերահսկելի ծախսերի
Քանի որ ձեռնարկություններն ավելի ու ավելի են ինտեգրում ինքնավար AI գործակալներն իրենց աշխատանքային գործընթացներում, ի հայտ է եկել ֆինանսական լուրջ ռիս…
AI-ի անվերահսկելի վտանգները կանխելու համար անհրաժեշտ է ավելին, քան պարզապես խոսակցություններ P(doom)-ի մասին
CNET-ի հյուրընկալված սյունակում հեղինակ Ջեյմի Բարթլեթը քննարկում է առաջադեմ արհեստական բանականության հետ կապված աճող ռիսկերը: Բարթլեթը պնդում է, որ «P…
OpenAI-ն ստեղծում է մաթեմատիկական խորհրդատվական խումբ, քանի որ նրա AI-ն լուծել է ավելի քան 100 բաց խնդիր
OpenAI-ն պաշտոնապես ստեղծել է մաթեմատիկական խորհրդատվական խումբ՝ վերահսկելու առաջադեմ AI տրամաբանության ոլորտում իր հետազոտությունները: Այս քայլը հաջո…



