Ես թույլ տվեցի AI-ին պլանավորել 170 փոփոխություն. այն ամեն անգամ կատարում էր նույն 3 սխալը

Ծրագրավորող Դեբաշիշ Գոսալը փորձարկել է AI-ի վրա հիմնված պլանավորման շարժիչը 170 իրական փոփոխությունների նպատակների դեմ՝ դրա հուսալիությունը գնահատելու համար: Հետազոտությունը ցույց է տվել, որ անկախ մոդելի չափից, AI-ն հետևողականորեն ձախողվել է երեք կոնկրետ ոլորտներում՝ չստուգված կախվածություններ, անվտանգ հաջորդականության բացակայություն և հետադարձի թույլ մեխանիզմներ: Գոսալը պնդում է, որ դրանք կառուցվածքային պլանավորման ձախողումներ են, այլ ոչ թե մոդելի բանականության սահմանափակումներ, ինչը նշանակում է, որ դրանք չեն կարող լուծվել պարզապես ավելի մեծ LLM-ներ օգտագործելով: Հեղինակն առաջարկում է հիբրիդային մոտեցում՝ օգտագործելով դետերմինիստական դարպասներ և «նախապայմանների փակող»՝ նախքան կատարումը պլանները վավերացնելու համար: Կոդի վրա հիմնված այս պաշտպանիչ միջոցները ներդնելով՝ շարժիչը հաջողությամբ վերածվել է սխալների ախտորոշման գործիքից՝ դառնալով ռեգրեսիոն ամուր դարպաս: Արդյունքները ցույց են տալիս, որ բարդ բազմաքայլ առաջադրանքների համար ծրագրավորողները պետք է առաջնահերթություն տան դետերմինիստական վավերացմանը՝ միայն LLM-ի տրամաբանության վրա հույս դնելու փոխարեն:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ինչպե՞ս կարող են AI գործակալները հանգեցնել ձեռնարկությունների համար անվերահսկելի ծախսերի
Քանի որ ձեռնարկություններն ավելի ու ավելի են ինտեգրում ինքնավար AI գործակալներն իրենց աշխատանքային գործընթացներում, ի հայտ է եկել ֆինանսական լուրջ ռիս…
AI-ի անվերահսկելի վտանգները կանխելու համար անհրաժեշտ է ավելին, քան պարզապես խոսակցություններ P(doom)-ի մասին
CNET-ի հյուրընկալված սյունակում հեղինակ Ջեյմի Բարթլեթը քննարկում է առաջադեմ արհեստական բանականության հետ կապված աճող ռիսկերը: Բարթլեթը պնդում է, որ «P…
OpenAI-ն ստեղծում է մաթեմատիկական խորհրդատվական խումբ, քանի որ նրա AI-ն լուծել է ավելի քան 100 բաց խնդիր
OpenAI-ն պաշտոնապես ստեղծել է մաթեմատիկական խորհրդատվական խումբ՝ վերահսկելու առաջադեմ AI տրամաբանության ոլորտում իր հետազոտությունները: Այս քայլը հաջո…



