8 LLM, 480 հարց, 1 Kaggle չափորոշիչ. Ո՞վ կարող է բացատրել տրաֆիկի անկումը

InsightTrack բաց կոդով վերլուծական հարթակի հիմնադիր Նիշիկանտա Ռեյը հրապարակել է համապարփակ չափորոշիչ՝ գնահատելու համար, թե ինչպես են տարբեր լեզվական մոդելները (LLM) հանդես գալիս որպես AI տվյալների վերլուծաբաններ: 480 սցենարների փորձարկումը՝ գործիքների ընտրությունից մինչև տրաֆիկի բարդ ախտորոշում, ցույց է տալիս ծախսերի և ճշգրտության միջև առկա կարևոր հակասությունները: Հետազոտությունը պարզել է, որ թեև մոդելների մեծ մասը հիանալի է կատարում գործիքների ընտրության հիմնական առաջադրանքները, դրանք զգալի դժվարություններ ունեն նրբերանգային տրամաբանության հետ: Ավելի էժան մոդելները հաճախ ցուցաբերում են վտանգավոր վարքագիծ՝ հորինելով տրաֆիկի տատանումների պատճառներ կամ իրական խնդիրները անտեսելով: Արդյունքները ցույց են տալիս, որ տվյալների ախտորոշման նման մասնագիտացված առաջադրանքների համար տրամաբանական կարողությունները էական են, և Gemini 3.7 Flash-ի նման մոդելներն առաջարկում են բարձր արդյունավետության և ծախսարդյունավետության հավասարակշռություն: Նախագիծը շեշտում է, որ մշակողները պետք է առաջնահերթություն տան կոդի վրա հիմնված տրամաբանությանը՝ միաժամանակ օգտագործելով AI-ն հիմնականում մեկնաբանման համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Բիլ Գեյթսը հայտարարել է, որ արհեստական բանականության մեջ անվտանգության երաշխիքների բացակայությունը «լիովին անպատասխանատու» է
Microsoft-ի համահիմնադիր Բիլ Գեյթսը խիստ նախազգուշացում է հնչեցրել արհեստական բանականության (ԱԲ) արագ զարգացման վերաբերյալ՝ նշելով, որ «լիովին անպատաս…
Հուշումից մինչև հարթակ. ինչպես նախագծել արտադրական մակարդակի GPT հավելված
Արտադրական մակարդակի GPT հավելվածի ստեղծումը պահանջում է պարզ հարց-պատասխան ցիկլերից անցում դեպի բաշխված աշխատանքային հոսքերի կառավարման համակարգ: Հեղ…
Միայնակ հետազոտողը՝ արհեստական բանականությամբ. ինչպես ստեղծել նորը տարբեր ոլորտներից
Հոդվածը դիտարկում է գիտական հետազոտությունների և գյուտարարության գործընթացի փոխակերպումը արհեստական բանականության դարաշրջանում: Հեղինակը վերլուծում է,…



