Հնարավո՞ր է արդյոք սովորեցնել փոքր LLM-ին՝ առանց քաշերի ավելացման. Մաս 2. Ինչու՞ կրկնակի ուսուցումը հասավ առաստաղին
Հեղինակը շարունակում է փոքր լեզվական մոդելների հետ փորձարկումների շարքը, որոնք ուղղված են LANN-4 ճարտարապետության մշակմանը: Հիմնական գաղափարը կայանում է կոմպակտ նեյրոնային ցանցերի ուսուցման մեջ, որոնք կարող են «սովորել ողջ կյանքի ընթացքում»՝ առանց պարամետրերի քանակի ավելացման՝ օգտագործելով արտաքին հիշողություն և կանոնավոր լրացուցիչ ուսուցում: Հետազոտության ընթացքում հեղինակը բախվել է խնդրի. նույն մոդելի կրկնակի ուսուցումը նոր տվյալների վրա արդյունավետ է միայն առաջին ցիկլում, որից հետո առաջընթացը կանգ է առնում: Ուսուցման բազմակի կրկնություններից կուտակային էֆեկտի հասնել չի հաջողվել: Հեղինակը կիսվում է իր ձախողումների և հաջողությունների արդյունքներով՝ ընդգծելով, որ ընթացիկ մոդելները միայն հիպոթեզների ստուգման գործիքներ են: Այժմ հետազոտողը փնտրում է համայնքի փորձագիտական օգնությունը՝ ճարտարապետության մեջ հնարավոր տրամաբանական սխալները բացահայտելու համար՝ նախքան լայնածավալ հաշվարկային թեստեր անցկացնելը:
This is a summary. Read the full article at the original source:
HabrԿապակցված
Քանի որ արհեստական բանականությունը (ԱԲ) դառնում է համատարած, մարդկային ներդրման իրական արժեքը տեղափոխվում է պարզ արդյունքից դեպի փորձագիտական դատողութ…
Հոդվածում քննարկվում է տեքստի գեներացման համար նախատեսված լեզվական մոդելներից (LLM) դեպի որոշումներ կայացնող «System One» մոդելներ անցումը: Ի տարբերու…
Կարո՞ղ է AI արդյունաբերությունը համոզել տվյալների կենտրոնների հակառակորդներին՝ հրաժարվելով NDA-ներից:
AI ենթակառուցվածքների արագ ընդլայնումը առաջացրել է տեղական լուրջ դիմադրություն, ինչը հանգեցրել է տարբեր տարածաշրջաններում տվյալների նոր կենտրոնների կա…



