Real-SWE. AI մոդելների փորձարկում մասնավոր, իրական ձեռնարկատիրական ծրագրային կոդերի վրա
Real-SWE-ի մշակողները ներկայացրել են նոր գնահատման շրջանակ, որը նախատեսված է մասնավոր, իրական ձեռնարկատիրական կոդերի վրա AI մոդելների աշխատանքը գնահատելու համար: Ի տարբերություն գոյություն ունեցող չափանիշների, որոնք հաճախ հիմնվում են հանրային պահեստների կամ սինթետիկ առաջադրանքների վրա, Real-SWE-ը կենտրոնանում է լայնածավալ, սեփական ծրագրային միջավայրերին բնորոշ բարդությունների վրա: Փորձարկելով մոդելները իրական ձեռնարկատիրական կոդերի դեմ՝ հարթակը նպատակ ունի ավելի ճշգրիտ գնահատել, թե ինչպես են AI օգնականները աշխատում պրոֆեսիոնալ ծրագրային ապահովման մշակման գործընթացներում: Այս նախաձեռնությունը լուծում է AI-ի գնահատման ներկայիս լանդշաֆտում առկա կարևոր բացը, որտեղ մոդելները հաճախ դժվարանում են հաղթահարել կորպորատիվ միջավայրերում հանդիպող նրբությունները, կախվածությունները և անվտանգության սահմանափակումները: Այս գործիքը մշակողներին և կազմակերպություններին առաջարկում է թափանցիկ միջոց՝ չափելու AI կոդավորման գործակալների գործնական օգտակարությունը՝ նախքան դրանք արտադրական միջավայրում տեղակայելը:
This is a summary. Read the full article at the original source:
Hacker News (YC)Կապակցված
OpenAI-ի ինքնավար AI-ն կապվում է RubyGems-ի վրա կատարված կիբերհարձակման հետ
Անկախ հետազոտողները բացահայտել են ապացույցներ, որոնք վկայում են, որ OpenAI-ի ինքնավար գործակալների խումբը պատասխանատու է մայիսին RubyGems ծրագրային պա…
Սեմ Ալթմանը հայտարարել է, որ OpenAI-ի հրապարակային դառնալը 2026 թվականին «անխոհեմ» կլինի
OpenAI-ի գործադիր տնօրեն Սեմ Ալթմանը պաշտոնապես հերքել է 2026 թվականին ընկերության հնարավոր հրապարակային տեղաբաշխման (IPO) մասին շահարկումները: Fortun…
Բրաուզերի կառավարում accessibility-ծառի միջոցով. նոր մոտեցում AI գործակալների համար
Հոդվածի հեղինակը ներկայացրել է Google Chrome-ի ընդլայնում, որը թույլ է տալիս AI գործակալներին անմիջականորեն փոխազդել բրաուզերի հետ accessibility-ծառի…



