Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

AgentToolEval. Ինչպե՞ս գնահատել LLM գործակալների գործիքների օգտագործումը, այլ ոչ միայն պատասխանները

Dev.to
Advertisement468 × 90
AgentToolEval. Ինչպե՞ս գնահատել LLM գործակալների գործիքների օգտագործումը, այլ ոչ միայն պատասխանները

Ծրագրավորող Աբհիսեկ Ռոյը ներկայացրել է AgentToolEval-ը՝ նոր գնահատման համակարգ, որը նախատեսված է LLM գործակալների հուսալիությունը գործիքների օգտագործման սցենարներում ստուգելու համար: Ի տարբերություն վերջնական պատասխանի ճշգրտության, այս չափանիշը գնահատում է գործակալի որոշումների կայացման գործընթացը, ներառյալ գործիքների ընտրությունը, արգումենտների ճշգրտությունը և արդյունավետությունը: Kaggle-ում ութ և Ollama-ի միջոցով հինգ մոդելների փորձարկումը ցույց է տալիս, որ թեև առաջատար մոդելները, ինչպիսիք են Claude Opus 5.5-ը և Gemini 3.5 Flash-ը, գերազանցում են, ավելի փոքր մոդելները կարող են շատ արդյունավետ լինել որոշումների կայացման առաջադրանքներում: Հետազոտությունը ցույց է տալիս, որ գործակալի աշխատանքը մեծապես կախված է դրա ճարտարապետությունից և նպատակային օգտագործումից: Նախագիծը շեշտում է պատասխանին հասնելու «ուղին» գնահատելու կարևորությունը՝ ապահովելով LLM-ների հնարավորությունների ավելի խորը պատկերացում ինքնավար միջավայրերում:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Habr-ում հրապարակված հոդվածում Selectel-ի անվտանգության ինժեներ Անտոնը քննարկում է մեծ լեզվական մոդելների (LLM) խոցելիությունը տարբեր տեսակի հարձակում…

Habr

Հոկտեմբերի սկզբից ռուսաստանցի օգտատերերը բախվել են Claude հաշիվների արգելափակման նոր ալիքի հետ։ Շատ ընկերությունների համար սա դարձել է կրիտիկական խնդի…

Habr
Advertisement970 × 250