Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Իմ prompt-injection-ի պաշտպանությունը բաց թողեց 20 հարձակումներից 0-ը. այն մասը, որը գրեթե չէի կառուցել, բռնեց բոլորը

Dev.to
Advertisement468 × 90
Իմ prompt-injection-ի պաշտպանությունը բաց թողեց 20 հարձակումներից 0-ը. այն մասը, որը գրեթե չէի կառուցել, բռնեց բոլորը

Ծրագրավորող Վիշալ Հաբիբը կիսվել է AI-ի կողմից ստեղծված կենսաթոշակային խորհրդատվության համար անվտանգության ստուգիչ ստեղծելու իր փորձով: Համակարգը օգտագործում է կոդ՝ թվային փաստերը ստուգելու համար, և LLM «դատավորներ»՝ ոչ թվային բովանդակությունը գնահատելու համար: Թեստավորման ընթացքում Հաբիբը պարզեց, որ թեև իր դատավորները կայուն էին, համակարգը չուներ prompt-injection հարձակումները նույնականացնելու և պիտակավորելու մեխանիզմ: Նա ներդրեց բազմաշերտ պաշտպանություն, ներառյալ խիստ «fail-closed» տրամաբանությունը և regex ֆիլտրը: Այնուամենայնիվ, երկրորդ փուլի թեստավորումը ցույց տվեց, որ regex-ը չի կարողացել բռնել 20 նոր, քողարկված հարձակումներից ոչ մեկը: Ի վերջո, համակարգի հաջողությունը կախված էր նրանից, որ LLM դատավորներին հրահանգվեց բոլոր սևագրերը դիտարկել որպես անվստահելի տվյալներ: Հաբիբը շեշտում է, որ մշակողակողները պետք է ստուգեն, թե արդյոք իրենց համակարգերը կարող են հստակ անվանել հարձակումը, այլ ոչ թե պարզապես ենթադրել, որ դրանք անխոցելի են:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Dev.to-ում հրապարակված վերջին հոդվածը ընդգծում է ինքնավար AI գործակալների խոցելիությունը՝ նրանց անկարողությունը՝ գիտակցելու իրենց գործողությունների հե…

Dev.to
Advertisement970 × 250