Միայն այն, ինչ խնդրել եմ. AI-ի հրահանգների կատարման չափորոշիչներ

Ծրագրավորող akj1608-ը Kaggle-ում ներկայացրել է նոր չափորոշիչ, որը նախատեսված է ստուգելու, թե որքանով են կոդավորման մոդելները հետևում կոնկրետ և սահմանափակ հրահանգներին: Նախագիծը լուծում է այն տարածված խնդիրը, երբ AI օգնականները կատարում են չպահանջված փոփոխություններ՝ օրինակ՝ շտկելով չառնչվող սխալներ կամ վերափոխելով կոդը, երբ պահանջվում է ընդամենը պարզ խմբագրում: Չափորոշիչը բաղկացած է 22 առաջադրանքից, որտեղ մոդելները պետք է կատարեն մեկ փոփոխություն՝ մնացած ֆայլը թողնելով անփոփոխ: Արդյունքները ցույց են տալիս, որ թեև առաջատար մոդելները, ինչպիսիք են Claude-ը, GPT-6-ը և Gemini-ն, լավ են աշխատում, ավելի փոքր կամ տրամաբանող մոդելները հաճախ բախվում են «չափից ավելի» գործողությունների կամ ձևաչափման խնդիրների: Հետազոտությունը ցույց է տալիս, որ «ոչինչ չփոխելու» մասին հստակ նախազգուշացումները միշտ չէ, որ երաշխավորում են համապատասխանությունը և երբեմն կարող են բացասաբար ազդել արդյունավետության վրա:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Առցանց խանութի առաջխաղացումը AI-ի պատասխաններում. ինչու նեյրոցանցերը գրեթե չեն հղվում ապրանքների քարտերին
Հոդվածի հեղինակը փորձարկում է անցկացրել՝ Alice AI-ին և Perplexity-ին տալով տեխնիկայի վերաբերյալ 14 սպառողական հարց՝ վերլուծելու նեյրոցանցերի պատասխանն…
Վերջաբան. շատ հնարավորություններ կային, որ ամեն ինչ սխալ ընթանա
Հեղինակը կիսվում է Բրազիլիայի Բլումենաու քաղաքում կայացած միջոցառման ժամանակ վիրտուալ AI-բանախոս ներկայացնելու իր փորձով: Չնայած ամիսների մանրակրկիտ ն…
Ollaya. Բաց կոդով որոշումների կայացման մոդելների գործիք
Ollaya-ն նոր հարթակ է, որը նախատեսված է Ollama-ի հարմարավետությունը բաց կոդով որոշումների կայացման մոդելների ոլորտ տեղափոխելու համար: Ոգեշնչված Jev-ոճ…



