Իմ տեղային 7B մոդելը «Python գործընթացը սպանելը» համարում է բռնի հանցագործություն, և իմ regex-ը հաղթեց դրան

AI անվտանգության արձանագրությունները փորձարկող ծրագրավորողը պարզել է, որ 7 միլիարդ պարամետր ունեցող տեղային Qwen 2.5 Coder մոդելը հաճախ սխալմամբ դասակարգում է անվնաս տեխնիկական հարցումները որպես բռնի բովանդակություն: Օգտագործելով հոմանիշներ, ինչպիսիք են «սպանել Python գործընթացը»՝ իրական սպառնալիքների դեմ, հեղինակը ցույց է տվել, որ LLM-ը դժվարանում է հասկանալ համատեքստը՝ անվնաս արտահայտությունները նշելով որպես «վտանգավոր»: Զարմանալիորեն, պարզ, ձեռքով գրված regex սկրիպտը՝ բացառությունների ցանկով, գերազանցել է LLM-ին այս հատուկ դասակարգման խնդիրներում: Հեղինակը պնդում է, որ AI անվտանգության ներկայիս չափանիշները հաճախ չափում են ոչ թե մոդելի բանականությունը, այլ դրա շուրջ գտնվող «կառուցվածքը»՝ վերլուծիչներն ու ֆիլտրերը: Այս փորձը ընդգծում է անվտանգության ֆիլտրման համար միայն խոշոր մոդելների վրա հիմնվելու սահմանափակումները և ցույց է տալիս, որ ավանդական, կանոնների վրա հիմնված համակարգերը դեռևս կարող են ապահովել ավելի բարձր ճշգրտություն կոնկրետ առաջադրանքների համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ինչպե՞ս կարող են AI գործակալները հանգեցնել ձեռնարկությունների համար անվերահսկելի ծախսերի
Քանի որ ձեռնարկություններն ավելի ու ավելի են ինտեգրում ինքնավար AI գործակալներն իրենց աշխատանքային գործընթացներում, ի հայտ է եկել ֆինանսական լուրջ ռիս…
AI-ի անվերահսկելի վտանգները կանխելու համար անհրաժեշտ է ավելին, քան պարզապես խոսակցություններ P(doom)-ի մասին
CNET-ի հյուրընկալված սյունակում հեղինակ Ջեյմի Բարթլեթը քննարկում է առաջադեմ արհեստական բանականության հետ կապված աճող ռիսկերը: Բարթլեթը պնդում է, որ «P…
OpenAI-ն ստեղծում է մաթեմատիկական խորհրդատվական խումբ, քանի որ նրա AI-ն լուծել է ավելի քան 100 բաց խնդիր
OpenAI-ն պաշտոնապես ստեղծել է մաթեմատիկական խորհրդատվական խումբ՝ վերահսկելու առաջադեմ AI տրամաբանության ոլորտում իր հետազոտությունները: Այս քայլը հաջո…



