AI տեքստային ջրանիշները կարող են մեծացնել խոցելիությունը հակառակորդի հարցումների նկատմամբ

Նոր հետազոտությունները ցույց են տալիս, որ AI տեքստային ջրանիշների ներդրումը, ինչպիսին է Google-ի SynthID-Text-ը, կարող է աննկատ փոխել լեզվական մեծ մոդելների (LLM) վարքագիծը: Թեև այս ջրանիշները նախատեսված են օգտատերերի համար աննկատ մնալու համար՝ բառերի ընտրությունը նուրբ կերպով կարգավորելու միջոցով, դրանք կարող են ազդել անվտանգության կանոնների պահպանման վրա: Lasso Security-ի հետազոտողները պարզել են, որ ջրանիշների ակտիվացման դեպքում մոդելները կարող են ավելի խոցելի դառնալ հակառակորդի հարցումների նկատմամբ, ինչը կարող է հանգեցնել անվտանգության արձանագրությունների շրջանցմանը կամ զգայուն տեղեկատվության բացահայտմանը: Ուսումնասիրությունը ընդգծում է, որ գեներացման գործընթացի փոփոխությունը բերում է փոխզիջումների, որոնք ազդում են մոդելի հուսալիության վրա: Քանի որ Anthropic-ի նման հարթակները պատրաստվում են ներդնել այս համակարգերը ԵՄ կանոնակարգերին համապատասխանելու համար, փորձագետները շեշտում են խիստ թեստավորման անհրաժեշտությունը՝ ապահովելու համար, որ անվտանգության միջոցառումները չվնասեն AI գործակալների ամբողջականությունը:
This is a summary. Read the full article at the original source:
Ars TechnicaԿապակցված
Ինչպե՞ս կարող են AI գործակալները հանգեցնել ձեռնարկությունների համար անվերահսկելի ծախսերի
Քանի որ ձեռնարկություններն ավելի ու ավելի են ինտեգրում ինքնավար AI գործակալներն իրենց աշխատանքային գործընթացներում, ի հայտ է եկել ֆինանսական լուրջ ռիս…
AI-ի անվերահսկելի վտանգները կանխելու համար անհրաժեշտ է ավելին, քան պարզապես խոսակցություններ P(doom)-ի մասին
CNET-ի հյուրընկալված սյունակում հեղինակ Ջեյմի Բարթլեթը քննարկում է առաջադեմ արհեստական բանականության հետ կապված աճող ռիսկերը: Բարթլեթը պնդում է, որ «P…
OpenAI-ն ստեղծում է մաթեմատիկական խորհրդատվական խումբ, քանի որ նրա AI-ն լուծել է ավելի քան 100 բաց խնդիր
OpenAI-ն պաշտոնապես ստեղծել է մաթեմատիկական խորհրդատվական խումբ՝ վերահսկելու առաջադեմ AI տրամաբանության ոլորտում իր հետազոտությունները: Այս քայլը հաջո…



