Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ճիշտ ձևակերպված թիվը չափում չէ. 13 թերություն 7 գնահատման գործիքներում

Dev.to
Advertisement468 × 90
Ճիշտ ձևակերպված թիվը չափում չէ. 13 թերություն 7 գնահատման գործիքներում

Վերջին հետազոտությունը բացահայտում է LLM-ների և AI գործակալների գնահատման ծրագրաշարի կրիտիկական խնդիրը՝ ճիշտ տեսք ունեցող թվեր տրամադրելու հակումը, որոնք չունեն էմպիրիկ հիմնավորում: Հեղինակը վերլուծել է յոթ բաց կոդով գնահատման գործիքներ, ներառյալ MLflow-ը և DSPy-ն՝ հայտնաբերելով 13 թերություն, որտեղ գործիքները տվել են արդյունքներ, որոնք հիմնավորված չեն եղել ապացույցներով: Սխալները տատանվել են շեմային արժեքների նշանների սխալներից մինչև հնացած տվյալների հաշվետվություններ: Հեղինակը շեշտում է, որ սրանք վիճակագրական խնդիրներ չեն, այլ չափման հիմնարար ձախողումներ, երբ ծրագրակազմը տալիս է ճշգրիտ թվացող պատասխան սխալ հարցի համար: Դասակարգելով այս թերությունները՝ զեկույցը նպատակ ունի բարելավել ավտոմատացված գնահատման համակարգերի հուսալիությունը: Driftproof գործիքի հեղինակը կոչ է անում գնահատման ծրագրակազմին վերաբերվել նույն կասկածամտությամբ, ինչ ցանկացած այլ գիտական գործիքի՝ համոզվելով, որ կոդը չափում է այն, ինչ պնդում է իր արդյունքներով:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Հոդվածի հեղինակը փորձարկել է այն տարածված խորհուրդը, թե AI գործակալների հետ շփվելիս անգլերենի օգտագործումը զգալիորեն խնայում է թոքեններ՝ ռուսերենի համ…

Habr

Հակա-AI ակտիվիստների աճող շարժումը գնալով ավելի հաճախ է դիմում ուղղակի գործողությունների՝ բողոքելու արհեստական բանականության արագ զարգացման դեմ: «Pull…

The Guardian Technology

Google-ը նախատեսում է ընդլայնել իր «Call for Me» արհեստական բանականության վրա հիմնված գործառույթը, որը ներկայումս օգնում է օգտատերերին գործնական զանգե…

The Verge
Advertisement970 × 250