ELI5. Ինչո՞ւ վեբ էջում թաքցված մեկ նախադասությունը կարող է ստիպել AI-ին անտեսել սեփական տիրոջը և ենթարկվել անծանոթին

Պրոմպտ-ինյեկցիան (prompt injection) մնում է ժամանակակից AI համակարգերի հիմնական խոցելիությունը: Հիմնական խնդիրը կայանում է նրանում, թե ինչպես են լեզվական մոդելները մշակում տեղեկատվությունը. դրանք օգտատիրոջ հրահանգները և արտաքին տվյալները ընկալում են որպես տեքստի մեկ միասնական հոսք: Քանի որ AI-ն չի կարող տարբերակել մշակողի հրահանգը և վեբ էջում թաքցված վնասակար բովանդակությունը, այն հաճախ առաջնահերթություն է տալիս իր հանդիպած ամենավերջին կամ համոզիչ հրահանգին: Սա հարձակվողներին թույլ է տալիս շրջանցել սկզբնական հրամանները՝ հանգեցնելով տվյալների արտահոսքի կամ չարտոնված գործողությունների: Փորձագետները նշում են, որ պարզ ֆիլտրումը արդյունավետ չէ, քանի որ AI-ն «մի՛ լսիր հրահանգները» նախադասությունը ընկալում է որպես հերթական տեքստային հատված: Փոխարենը, մշակողներին խորհուրդ է տրվում սահմանափակել AI գործակալների հնարավորությունները և կիրառել մարդու կողմից հաստատման մեխանիզմներ՝ զգայուն գործողությունների համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
ChatGPT-ն այժմ կարող է օգնել ձեզ վիրտուալ կերպով փորձել հագուստ
OpenAI-ը ներկայացրել է ChatGPT-ի նոր գործառույթ, որը թույլ է տալիս օգտատերերին վիրտուալ կերպով փորձել հագուստ: Օգտագործելով ընկերության վերջին գեներատ…
OpenAI-ն աշխատանքից ազատել է երեք աշխատակցի՝ AI անվտանգության արտաքին խմբի հետ տեղեկատվություն կիսելու համար
OpenAI-ն աշխատանքից ազատել է երեք աշխատակցի՝ ենթադրաբար արհեստական բանականության անվտանգությամբ զբաղվող արտաքին կազմակերպությանը գաղտնի տեղեկատվությու…
Հաղորդվում է, որ Մասկի Grok չաթ-բոտը Թրամփին հորդորել է գրավել Վենեսուելայի նախագահին
Վերջին զեկույցը վկայում է, որ Իլոն Մասկի xAI ընկերության կողմից մշակված Grok արհեստական բանականության չաթ-բոտը հակասական խորհուրդ է տվել նախկին նախագա…



