AgentToolEval. Ինչպե՞ս գնահատել LLM գործակալների գործիքների օգտագործումը, այլ ոչ միայն պատասխանները

Ծրագրավորող Աբհիսեկ Ռոյը ներկայացրել է AgentToolEval-ը՝ նոր գնահատման համակարգ, որը նախատեսված է LLM գործակալների հուսալիությունը գործիքների օգտագործման սցենարներում ստուգելու համար: Ի տարբերություն վերջնական պատասխանի ճշգրտության, այս չափանիշը գնահատում է գործակալի որոշումների կայացման գործընթացը, ներառյալ գործիքների ընտրությունը, արգումենտների ճշգրտությունը և արդյունավետությունը: Kaggle-ում ութ և Ollama-ի միջոցով հինգ մոդելների փորձարկումը ցույց է տալիս, որ թեև առաջատար մոդելները, ինչպիսիք են Claude Opus 5.5-ը և Gemini 3.5 Flash-ը, գերազանցում են, ավելի փոքր մոդելները կարող են շատ արդյունավետ լինել որոշումների կայացման առաջադրանքներում: Հետազոտությունը ցույց է տալիս, որ գործակալի աշխատանքը մեծապես կախված է դրա ճարտարապետությունից և նպատակային օգտագործումից: Նախագիծը շեշտում է պատասխանին հասնելու «ուղին» գնահատելու կարևորությունը՝ ապահովելով LLM-ների հնարավորությունների ավելի խորը պատկերացում ինքնավար միջավայրերում:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
LLM Guardrails. Ինչպես է աշխատում լեզվական մոդելների պաշտպանությունը
Habr-ում հրապարակված հոդվածում Selectel-ի անվտանգության ինժեներ Անտոնը քննարկում է մեծ լեզվական մոդելների (LLM) խոցելիությունը տարբեր տեսակի հարձակում…
Ի՞նչ անել, եթե Claude-ի հասանելիությունը կորել է, իսկ աշխատանքային գործընթացը կախված է դրանից:
Հոկտեմբերի սկզբից ռուսաստանցի օգտատերերը բախվել են Claude հաշիվների արգելափակման նոր ալիքի հետ։ Շատ ընկերությունների համար սա դարձել է կրիտիկական խնդի…
OpenAI-ն թարմացրել է ChatGPT-ն ինտերակտիվ գրաֆիկայով
OpenAI-ն ներկայացրել է «Intelligent UI»-ը՝ ChatGPT-ի նոր գործառույթը, որը թույլ է տալիս արհեստական բանականությանը ստեղծել ինտերակտիվ վիզուալ ինտերֆեյս…



