Astra-ն և Fable-ը շարունակում են օգտագործել 2025 թվականի համապատասխանության գնահատման պարզեցված մեթոդներ
LessWrong-ում հրապարակված վերջին քննարկումը վերլուծում է արհեստական բանականության (AI) համապատասխանության գնահատման ներկայիս վիճակը՝ կենտրոնանալով Astra-ի և Fable-ի կողմից կիրառվող մեթոդաբանությունների վրա։ Վերլուծությունը ցույց է տալիս, որ այս կազմակերպությունները շարունակում են հիմնվել 2025 թվականից սկիզբ առած համապատասխանության համեմատաբար պարզ և սահմանափակ չափանիշների վրա։ Հեղինակը նշում է, որ թեև այս գնահատականները հիմք են ծառայում թեստավորման համար, դրանք կարող են չարտացոլել առաջադեմ մոդելների վարքագծի բարդությունը կամ ապագա AI համակարգերի հետ կապված նուրբ ռիսկերը։ Շարունակելով կատարելագործել այս հիմնարար, սակայն սահմանափակ շրջանակները՝ հետազոտողներին հորդորում են մտածել, թե արդյոք գնահատման ներկայիս ռազմավարությունները բավարար են երկարաժամկետ անվտանգությունն ապահովելու համար։ Հոդվածը հրավիրում է համայնքի քննարկմանը՝ պարզելու, թե արդյոք այս պարզեցված մոտեցումները անհրաժեշտ քայլ են, թե հնարավոր խոչընդոտ՝ ավելի հզոր մոդելների անվտանգության ապահովման գործում։
This is a summary. Read the full article at the original source:
Hacker News (YC)Կապակցված
Ի՞նչն է թաքնված արհեստական բանականության ոլորտի վերջին կանխատեսումների հետևում
Արհեստական բանականության (ԱԲ) ոլորտը ներկայումս գտնվում է թեժ քննարկումների կենտրոնում՝ կապված այն հարցի հետ, թե արդյոք ԱԲ-ն գոյաբանական սպառնալիք է ն…
Ներդնել, թե՞ օրինականացնել. ինչու արհեստական բանականությունը չի աշխատում որպես դասական ծրագրակազմ
Հոդվածի հեղինակը վերլուծում է նեյրոնային ցանցերի լուծումները կորպորատիվ միջավայրում ներդնելու դժվարությունները՝ համեմատելով դրանք դասական ERP համակարգ…
«Չափազանց քիչ, չափազանց ուշ». քննադատները տարակուսած և կասկածամիտ են AI-ի առաջնորդների՝ զարգացումը դանդաղեցնելու կոչի նկատմամբ
Արհեստական բանականության (AI) առաջացրած գոյաբանական սպառնալիքների մասին նախազգուշացումներից հետո ոլորտի առաջատարները, այդ թվում՝ Anthropic-ի գործադիր…



