Ճիշտ ձևակերպված թիվը չափում չէ. 13 թերություն 7 գնահատման գործիքներում

Վերջին հետազոտությունը բացահայտում է LLM-ների և AI գործակալների գնահատման ծրագրաշարի կրիտիկական խնդիրը՝ ճիշտ տեսք ունեցող թվեր տրամադրելու հակումը, որոնք չունեն էմպիրիկ հիմնավորում: Հեղինակը վերլուծել է յոթ բաց կոդով գնահատման գործիքներ, ներառյալ MLflow-ը և DSPy-ն՝ հայտնաբերելով 13 թերություն, որտեղ գործիքները տվել են արդյունքներ, որոնք հիմնավորված չեն եղել ապացույցներով: Սխալները տատանվել են շեմային արժեքների նշանների սխալներից մինչև հնացած տվյալների հաշվետվություններ: Հեղինակը շեշտում է, որ սրանք վիճակագրական խնդիրներ չեն, այլ չափման հիմնարար ձախողումներ, երբ ծրագրակազմը տալիս է ճշգրիտ թվացող պատասխան սխալ հարցի համար: Դասակարգելով այս թերությունները՝ զեկույցը նպատակ ունի բարելավել ավտոմատացված գնահատման համակարգերի հուսալիությունը: Driftproof գործիքի հեղինակը կոչ է անում գնահատման ծրագրակազմին վերաբերվել նույն կասկածամտությամբ, ինչ ցանկացած այլ գիտական գործիքի՝ համոզվելով, որ կոդը չափում է այն, ինչ պնդում է իր արդյունքներով:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Արդյո՞ք արժե գրել AI գործակալներին անգլերենով՝ թոքեններ խնայելու համար
Հոդվածի հեղինակը փորձարկել է այն տարածված խորհուրդը, թե AI գործակալների հետ շփվելիս անգլերենի օգտագործումը զգալիորեն խնայում է թոքեններ՝ ռուսերենի համ…
Ցուցարարները դիմում են ուղղակի գործողությունների ընդդեմ AI ընկերությունների
Հակա-AI ակտիվիստների աճող շարժումը գնալով ավելի հաճախ է դիմում ուղղակի գործողությունների՝ բողոքելու արհեստական բանականության արագ զարգացման դեմ: «Pull…
Google-ը կարող է ընդլայնել Gemini «Call for Me» գործառույթը անձնական կոնտակտների համար
Google-ը նախատեսում է ընդլայնել իր «Call for Me» արհեստական բանականության վրա հիմնված գործառույթը, որը ներկայումս օգնում է օգտատերերին գործնական զանգե…

