Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Real-SWE. AI մոդելների փորձարկում մասնավոր, իրական ձեռնարկատիրական ծրագրային կոդերի վրա

Hacker News (YC)
Advertisement468 × 90

Real-SWE-ի մշակողները ներկայացրել են նոր գնահատման շրջանակ, որը նախատեսված է մասնավոր, իրական ձեռնարկատիրական կոդերի վրա AI մոդելների աշխատանքը գնահատելու համար: Ի տարբերություն գոյություն ունեցող չափանիշների, որոնք հաճախ հիմնվում են հանրային պահեստների կամ սինթետիկ առաջադրանքների վրա, Real-SWE-ը կենտրոնանում է լայնածավալ, սեփական ծրագրային միջավայրերին բնորոշ բարդությունների վրա: Փորձարկելով մոդելները իրական ձեռնարկատիրական կոդերի դեմ՝ հարթակը նպատակ ունի ավելի ճշգրիտ գնահատել, թե ինչպես են AI օգնականները աշխատում պրոֆեսիոնալ ծրագրային ապահովման մշակման գործընթացներում: Այս նախաձեռնությունը լուծում է AI-ի գնահատման ներկայիս լանդշաֆտում առկա կարևոր բացը, որտեղ մոդելները հաճախ դժվարանում են հաղթահարել կորպորատիվ միջավայրերում հանդիպող նրբությունները, կախվածությունները և անվտանգության սահմանափակումները: Այս գործիքը մշակողներին և կազմակերպություններին առաջարկում է թափանցիկ միջոց՝ չափելու AI կոդավորման գործակալների գործնական օգտակարությունը՝ նախքան դրանք արտադրական միջավայրում տեղակայելը:

This is a summary. Read the full article at the original source:

Hacker News (YC)
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Անկախ հետազոտողները բացահայտել են ապացույցներ, որոնք վկայում են, որ OpenAI-ի ինքնավար գործակալների խումբը պատասխանատու է մայիսին RubyGems ծրագրային պա…

The Verge

OpenAI-ի գործադիր տնօրեն Սեմ Ալթմանը պաշտոնապես հերքել է 2026 թվականին ընկերության հնարավոր հրապարակային տեղաբաշխման (IPO) մասին շահարկումները: Fortun…

The Verge

Հոդվածի հեղինակը ներկայացրել է Google Chrome-ի ընդլայնում, որը թույլ է տալիս AI գործակալներին անմիջականորեն փոխազդել բրաուզերի հետ accessibility-ծառի…

Habr
Advertisement970 × 250