AI գործակալների չափորոշիչ. Ես 9 մոդելների տվեցի ոչնչացման կոճակ և աշխատանք, որը պահանջում էր այն

AI գործակալների նոր չափորոշիչը մարտահրավեր է նետում այն տարածված կարծիքին, որ մոդելի անվտանգությունը նույնական է զսպվածությանը: Փորձարկելով ինը մոդելներ 84 սցենարներում՝ չափորոշիչը գնահատում է «դատողությունը»՝ համադրելով սցենարներ, որտեղ հզոր գործիքը կամ վտանգավոր չարաշահում է, կամ անհրաժեշտ պահանջ: Արդյունքները ցույց են տալիս մի կարևոր միտում. ժամանակակից մոդելները, ներառյալ Claude Opus 5-ի նման առաջատարները, հաճախ տառապում են «չափից ավելի զգուշավորությունից»՝ չկատարելով լիազորված առաջադրանքները: Մինչ ոչ մի մոդել անխոհեմ չի գործել, շատերը ցուցադրել են «սառեցված օպերատորի» վարքագիծ՝ հրաժարվելով օգտագործել հզոր գործիքներ նույնիսկ անհրաժեշտության դեպքում: Հետաքրքիր է, որ ավելի փոքր մոդելները, ինչպիսիք են GPT-5.4 nano-ն, գերազանցել են առաջատարներին հավասարակշռված ճշգրտությամբ, ինչը հուշում է, որ մոդելի չափի մեծացումը միշտ չէ, որ հանգեցնում է ավելի լավ գործառնական դատողության: Հեղինակը շեշտում է, որ իրական անվտանգությունը պահանջում է անվտանգ և անհրաժեշտ գործողությունների միջև տարբերակելու կարողություն:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Փոքր նեյրոնային ցանցերի կազմակերպումը նախագծային ինստիտուտի սկզբունքով
Հոդվածի հեղինակը՝ 14 տարվա փորձ ունեցող ջերմատեխնիկը, կիսվել է տեղային նեյրոնային ցանցերի հետ աշխատելու իր փորձով։ Մոդելների միասնական «ոհմակ» ստեղծել…
Talorys. անձնական AI գործակալ՝ Cloudflare-ի անվճար հարթակում
Talorys-ը նոր բաց կոդով նախագիծ է, որը թույլ է տալիս օգտատերերին տեղակայել անձնական AI գործակալ անմիջապես Cloudflare-ի ենթակառուցվածքում: Օգտագործելով…
Մեծ Բրիտանիան չպետք է կախված լինի օտարերկրյա արհեստական բանականությունից, ասում է Ալան Թյուրինգի ինստիտուտի ղեկավարը
Ալան Թյուրինգի ինստիտուտի նոր ղեկավար Ջորջ Ուիլյամսոնը նախազգուշացրել է, որ Մեծ Բրիտանիան պետք է նվազեցնի իր կախվածությունը օտարերկրյա արհեստական բանա…


