Ես փորձեցի չորս վատ գործակալների անցկացնել իմ սեփական սերտիֆիկացման դարպասով. չորսն էլ արգելափակվեցին

Ծրագրավորող Դեբաշիշ Գոսալը վերջերս փորձարկել է իր HivePlane հարթակի հուսալիությունը՝ փորձելով շրջանցել դրա անվտանգության համակարգերը՝ օգտագործելով չորս միտումնավոր վնասակար AI գործակալներ: Փորձը նպատակ ուներ մոդելավորել արտադրական իրական խափանումները, ներառյալ չհավաստագրված գործակալները, մոդելների չարտոնված փոխարինումները, հետընթաց վարքագիծը և բյուջեի չափից ավելի սպառումը: Յուրաքանչյուր գործակալ հաջողությամբ արգելափակվել է HivePlane-ի կողմից, որը ստուգում է աշխատանքային ծանրաբեռնվածությունը նախքան կատարումը: Գոսալը շեշտում է, որ անվտանգության թեստավորումը պետք է դուրս գա «երջանիկ ուղիների» սահմաններից և ներառի բացասական սցենարներ, որոնք ստուգում են գործակալի վարքագիծը, այլ ոչ թե միայն արդյունքի որակը: Նա պնդում է, որ AI-ի արդյունավետ կառավարումը պահանջում է արգելափակում այն կետում, որտեղ վնասը դառնում է չափելի: Հոդվածը կարևոր հիշեցում է, որ արտադրական միջավայրում հավանական թվացող գործակալը կարող է ամենավտանգավորը լինել՝ պահանջելով խիստ, ավտոմատացված սերտիֆիկացման գործընթացներ:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ռեկուրսիվ ինքնակատարելագործում. ի՞նչ է իրականում անում Google-ի Dream-RSI հետազոտությունը
Google-ի հետազոտողները հրապարակել են Dream-RSI աշխատությունը, որը ուսումնասիրում է արհեստական բանականության ռեկուրսիվ ինքնակատարելագործումը: Թեև որոշ…
Իմաստային էմբեդինգ, կամ ինչպես դուրս բերել իմաստը բառերից
Habr-ի հոդվածում քննարկվում է «իմաստային» էմբեդինգների հայեցակարգը, որն ընդլայնում է ժամանակակից նեյրոնային ցանցերի հնարավորությունները: Հեղինակն առաջ…
Հեղինակը ներկայացրել է LSWM ճարտարապետության թարմացված տարբերակը առաջին թողարկումից ընդամենը երկու օր անց։ Կրկնակի փորձարկումների և փորձերի ընթացքում…



