LLM-ները հանձնում են տվյալների գիտության թեստը, բայց տալիս են այլ խորհուրդներ. 36 չափված դատողությունների Kaggle բենչմարկ

Kaggle-ի նոր հետազոտությունը բացահայտում է զգալի տարբերություն այն բանի միջև, թե ինչպես են մեծ լեզվական մոդելները (LLM) հանդես գալիս տվյալների գիտության թեստերում և իրական խորհրդատվական առաջադրանքներում: Փորձարկելով 11 մոդելներ 36 չափված դատողությունների վրա՝ հետազոտությունը ցույց է տվել, որ թեև մոդելները ցուցաբերում են 94–100% ճշգրտություն բազմակի ընտրությամբ հարցերում, նրանց արդյունավետությունը զգալիորեն նվազում է բաց հարցերի դեպքում: Հետազոտությունը ցույց է տալիս, որ մոդելները հաճախ տալիս են ճիշտ գործնական խորհուրդներ, սակայն հաճախ հիմնվում են սխալ տրամաբանության կամ թերի մոտեցումների վրա: Հեղինակը նշում է, որ թեև մոդելները հաջողությամբ խուսափում են սովորական «թակարդներից», նրանք դժվարանում են բացատրել տվյալների գիտության որոշումների հիմքում ընկած մեխանիզմները: Այս բենչմարկը, որը ներառում է Google-ի, Anthropic-ի, OpenAI-ի և այլոց մոդելները, հուշում է, որ LLM-ները լավ են ճանաչում ստանդարտ լուծումները, սակայն մնում են անհետևողական բարդ, ոչ դասագրքային խնդիրների դեպքում հուսալի և փաստարկված խորհուրդներ տալու հարցում:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Տղամարդը դատապարտվել է 1000 բոտերի օգնությամբ արհեստական բանականության երաժշտությունից 8 միլիոն դոլար հափշտակելու համար
Հյուսիսային Կարոլինայի բնակիչ Մայքլ Սմիթը դատապարտվել է 18 ամսվա ազատազրկման՝ երաժշտական հոսքային հարթակներում խարդախության խոշոր սխեմա կազմակերպելու…
AskAnyModel-ը առաջարկում է ցմահ հասանելիություն 50+ AI մոդելների՝ 29.97 դոլարով
Նոր գովազդային առաջարկը թույլ է տալիս օգտատերերին ձեռք բերել AskAnyModel AI Pro Plan-ի ցմահ բաժանորդագրություն ընդամենը 29.97 դոլարով՝ 499 դոլար սկզբն…
Ոչ տեքստային Jev AI մոդելը ստեղծող ընկերությունը գնահատվել է 7.5 միլիարդ դոլար՝ թողարկումից ընդամենը շաբաթներ անց
TypeSafe ստարտափը, որը մշակել է նոր Jev AI մոդելը, թողարկումից ընդամենը շաբաթներ անց հասել է 7.5 միլիարդ դոլար շուկայական գնահատման։ Ի տարբերություն ա…



