Ես ստիպեցի երկու AI-ի 30 օր շարունակ ստուգել միմյանց կոդը. մարդը սխալը գտավ 5 րոպեում

Ծրագրավորողը փորձարկել է երկու AI գործակալների օգտագործումը կոդի որակը կառավարելու համար՝ «հեղինակ» գործակալը՝ ֆունկցիաներ գրելու համար, և «թերահավատ» գործակալը՝ հակառակորդի դերում ստուգումներ կատարելու համար: 30 օրվա ընթացքում թերահավատը հաջողությամբ հայտնաբերել է 41 խնդիրներից 38-ը: Այնուամենայնիվ, համակարգը չի կարողացել բացահայտել կրիտիկական տրամաբանական սխալները, ինչպիսիք են տվյալների բազայում պահպանումից առաջ իրադարձությունները հաստատող վեբհուկը: Հեղինակը եզրակացնում է, որ թեև AI-ի կողմից իրականացվող ստուգումները արդյունավետ են սովորական առաջադրանքների համար, դրանք ունեն ընդհանուր «կույր կետեր», երբ երկու գործակալներն էլ պատկանում են նույն մոդելային ընտանիքին: Փորձը ցույց է տալիս, որ մարդկային վերահսկողությունը մնում է անհրաժեշտ, հատկապես այն ինժեներների համար, ովքեր ունեն անցյալի ձախողումների փորձ, որը AI-ն չի կարող կրկնօրինակել: Հեղինակն առաջարկում է, որ կոդի ստուգման մեջ իրական անկախության հասնելու համար անհրաժեշտ է օգտագործել տարբեր մոդելներ, հակառակորդի հարցումներ և մարդկային վերջնական ստուգում:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ես ստիպեցի AI-գրասենյակի պետին հայհոյել գործակալներին. Եվ միայն հետո հասկացա, թե ինչն էր իրականում աշխատում
Հոդվածի հեղինակը կիսվում է AI-գործակալների աշխատանքի օպտիմալացման իր անսովոր փորձով: Բախվելով այն խնդրին, որ քաղաքավարի և ջանասեր գործակալները միջին ա…
Ես վաճառում եմ հիշողության API-ներ և ստեղծում եմ չափորոշիչ. Ահա թե ինչպես եմ փորձում խուսափել կեղծիքներից
Wontopos-ի ծրագրավորող Woochan-ը ներկայացրել է նոր, թափանցիկ չափորոշիչ (benchmark), որը նախատեսված է LLM-ների հիշողության հնարավորությունները գնահատել…
«Ո՞ւմ հետ համահունչ» հոդվածը ուսումնասիրում է արհեստական բանականության (ԱԲ) համահարթեցման բարդ և հաճախ երկիմաստ բնույթը: Հեղինակը վիճարկում է արդյունա…



