Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

LLM-ները հանձնում են տվյալների գիտության թեստը, բայց տալիս են այլ խորհուրդներ. 36 չափված դատողությունների Kaggle բենչմարկ

Dev.to
Advertisement468 × 90
LLM-ները հանձնում են տվյալների գիտության թեստը, բայց տալիս են այլ խորհուրդներ. 36 չափված դատողությունների Kaggle բենչմարկ

Kaggle-ի նոր հետազոտությունը բացահայտում է զգալի տարբերություն այն բանի միջև, թե ինչպես են մեծ լեզվական մոդելները (LLM) հանդես գալիս տվյալների գիտության թեստերում և իրական խորհրդատվական առաջադրանքներում: Փորձարկելով 11 մոդելներ 36 չափված դատողությունների վրա՝ հետազոտությունը ցույց է տվել, որ թեև մոդելները ցուցաբերում են 94–100% ճշգրտություն բազմակի ընտրությամբ հարցերում, նրանց արդյունավետությունը զգալիորեն նվազում է բաց հարցերի դեպքում: Հետազոտությունը ցույց է տալիս, որ մոդելները հաճախ տալիս են ճիշտ գործնական խորհուրդներ, սակայն հաճախ հիմնվում են սխալ տրամաբանության կամ թերի մոտեցումների վրա: Հեղինակը նշում է, որ թեև մոդելները հաջողությամբ խուսափում են սովորական «թակարդներից», նրանք դժվարանում են բացատրել տվյալների գիտության որոշումների հիմքում ընկած մեխանիզմները: Այս բենչմարկը, որը ներառում է Google-ի, Anthropic-ի, OpenAI-ի և այլոց մոդելները, հուշում է, որ LLM-ները լավ են ճանաչում ստանդարտ լուծումները, սակայն մնում են անհետևողական բարդ, ոչ դասագրքային խնդիրների դեպքում հուսալի և փաստարկված խորհուրդներ տալու հարցում:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Հյուսիսային Կարոլինայի բնակիչ Մայքլ Սմիթը դատապարտվել է 18 ամսվա ազատազրկման՝ երաժշտական հոսքային հարթակներում խարդախության խոշոր սխեմա կազմակերպելու…

TechRadar

Նոր գովազդային առաջարկը թույլ է տալիս օգտատերերին ձեռք բերել AskAnyModel AI Pro Plan-ի ցմահ բաժանորդագրություն ընդամենը 29.97 դոլարով՝ 499 դոլար սկզբն…

Mashable

TypeSafe ստարտափը, որը մշակել է նոր Jev AI մոդելը, թողարկումից ընդամենը շաբաթներ անց հասել է 7.5 միլիարդ դոլար շուկայական գնահատման։ Ի տարբերություն ա…

TechCrunch
Advertisement970 × 250