Ես վաճառում եմ հիշողության API-ներ և ստեղծում եմ չափորոշիչ. Ահա թե ինչպես եմ փորձում խուսափել կեղծիքներից

Wontopos-ի ծրագրավորող Woochan-ը ներկայացրել է նոր, թափանցիկ չափորոշիչ (benchmark), որը նախատեսված է LLM-ների հիշողության հնարավորությունները գնահատելու համար: Անդրադառնալով վաճառողների կողմից հրապարակված կատարողականի ցուցանիշների նկատմամբ համատարած թերահավատությանը՝ նախագիծը նպատակ ունի ստեղծել արդար և վերարտադրելի ստանդարտ: Չափորոշիչն օգտագործում է 1,9 միլիոն թոքենից բաղկացած հսկայական կորպուս՝ մոդելները փորձարկելով 14 ուղղություններով, ներառյալ հնացած փաստերի հայտնաբերումը, հակասությունների կարգավորումը և բազմալեզու հիշողությունը: Կողմնակալությունից խուսափելու համար նախագիծը բաց կոդով է՝ Apache 2.0 լիցենզիայով, իսկ հեղինակը սահմանել է խիստ կանոններ, ինչպիսիք են յուրաքանչյուր հարցի արդյունքների պարտադիր հրապարակումը և անկախ ստուգումը: Չափորոշիչը նաև ներկայացնում է լատենտայնության չափման նրբերանգ մոտեցում՝ առանձնացնելով ցանցային ծախսերը հաշվարկային կատարողականից: Թափանցիկությանն ու համայնքային վավերացմանը առաջնահերթություն տալով՝ հեղինակը ձգտում է ծրագրավորողներին տրամադրել հիշողության API-ները համեմատելու հուսալի միջոց՝ առանց մարքեթինգային հնարավոր կեղծիքների ազդեցության:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ես ստիպեցի AI-գրասենյակի պետին հայհոյել գործակալներին. Եվ միայն հետո հասկացա, թե ինչն էր իրականում աշխատում
Հոդվածի հեղինակը կիսվում է AI-գործակալների աշխատանքի օպտիմալացման իր անսովոր փորձով: Բախվելով այն խնդրին, որ քաղաքավարի և ջանասեր գործակալները միջին ա…
Ես ստիպեցի երկու AI-ի 30 օր շարունակ ստուգել միմյանց կոդը. մարդը սխալը գտավ 5 րոպեում
Ծրագրավորողը փորձարկել է երկու AI գործակալների օգտագործումը կոդի որակը կառավարելու համար՝ «հեղինակ» գործակալը՝ ֆունկցիաներ գրելու համար, և «թերահավատ»…
«Ո՞ւմ հետ համահունչ» հոդվածը ուսումնասիրում է արհեստական բանականության (ԱԲ) համահարթեցման բարդ և հաճախ երկիմաստ բնույթը: Հեղինակը վիճարկում է արդյունա…



