Հետ
Ծրագրավորում և բաց կոդ

Կրկնե՞լ, թե՞ չկրկնել. ահա հարցը:

Dev.to
Advertisement468 × 90
Կրկնե՞լ, թե՞ չկրկնել. ահա հարցը:

Ծրագրավորող Դանիել Բալկարեկը հրապարակել է նոր հետազոտություն, որը գնահատում է, թե ինչպես են տարբեր AI մոդելներ կառավարում API-ի կրկնակի հարցումների տրամաբանությունը: Kaggle Benchmarking Challenge-ի համար նախատեսված այս փորձարկումը ստուգում է, թե արդյոք LLM-ները կարող են ճիշտ որոշել՝ արդյոք անհրաժեշտ է կրկնել ձախողված HTTP հարցումը՝ հիմնվելով համատեքստի վրա: Փորձարկելով GPT-5.6, Gemini 3.7 և Claude Sonnet 5 մոդելները՝ հետազոտությունը ցույց է տալիս, որ թեև մոդելները լավ են հաղթահարում պարզ խնդիրները, նրանք հաճախ սխալվում են այնպիսի բարդ իրավիճակներում, որտեղ համատեքստը հակասում է ակնհայտ ազդանշաններին: Արդյունքները ընդգծում են, որ նույնիսկ առաջադեմ մոդելները կարող են համակարգային թակարդներում հայտնվել, ինչը նշանակում է, որ սխալների մշակման բարդ քաղաքականություն իրականացնելիս մարդկային վերահսկողությունը մնում է կարևոր: Ամբողջական բենչմարկը, որը ներառում է 14 տարբեր սցենարներ, հասանելի է Kaggle-ում:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Ծրագրավորում և բաց կոդ

Կապակցված

Dev.to-ում հրապարակված հոդվածում Դիմիտրիս Կ.-ն պնդում է, որ AI-ի միջոցով ծրագրավորման արագության վրա ներկայիս կենտրոնացումը մոլորեցնող է: Թեև AI գործի…

Dev.to
Advertisement970 × 250