Հետ
Արհեստական բանականություն և մեքենայական ուսուցում

Ցենտերը կարևոր են. արդյո՞ք մոդելը նկատում է, երբ ֆինանսական փաստերից մեկը փոխվում է

Dev.to
Advertisement468 × 90
Ցենտերը կարևոր են. արդյո՞ք մոդելը նկատում է, երբ ֆինանսական փաստերից մեկը փոխվում է

«Cents Matter / Centavos Importam» նոր չափորոշիչը գնահատում է, թե որքանով են լեզվական մոդելները (LLM) տիրապետում ճշգրիտ ֆինանսական տրամաբանությանը: Kaggle-ի մրցույթի համար ստեղծված այս թեստը բաղկացած է բրազիլական պորտուգալերենով 40 սինթետիկ դեպքերից, որոնք կազմակերպված են 20 նվազագույն զույգերի: Յուրաքանչյուր զույգում փոխվում է միայն մեկ էական փաստ: Մոդելները պետք է առանց արտաքին գործիքների ճշգրիտ հաշվարկեն դրամական տարբերությունները: Հետազոտության ընթացքում փորձարկվել են Gemini 3.7 Flash, gpt-oss-20b և Claude Haiku 4.5 մոդելները: Արդյունքները ցույց են տվել զգալի տարբերություններ. Gemini 3.7 Flash-ը ցուցադրել է 97.5% ճշգրտություն, մինչդեռ Claude Haiku 4.5-ը՝ 47.5%: Հեղինակը նշում է, որ թեև մոդելները լավ են կատարում ընդհանուր առաջադրանքներ, դրանց տրամաբանական հետևողականությունը ֆինանսական փոփոխականների դեպքում հաճախ թերի է: Այս բաց կոդով չափորոշիչը թափանցիկ հայացք է տալիս այն բանին, թե ինչպես են տարբեր ճարտարապետություններ հաղթահարում դետերմինիստական ֆինանսական տրամաբանությունը:

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Արհեստական բանականություն և մեքենայական ուսուցում

Կապակցված

Ծրագրավորող Փերի Լինքը ներկայացրել է Phocinae-Largha-150M-v1 մոդելը՝ 144 միլիոն պարամետրով, որը նախատեսված է AI գործակալների համար կրկնվող որոշումների…

Dev.to

Ծրագրավորող Բրենդոն Թոմասը գործարկել է հավակնոտ նախագիծ՝ Adobe Creative Suite-ը փոխարինելու համար՝ ստեղծելով յոթ բաց կոդով հավելվածներ։ Օգտագործելով A…

Ars Technica

Google-ը ներկայացրել է Playground-ը՝ փորձարարական հարթակ, որը նախատեսված է գեներատիվ արհեստական բանականության միջոցով բրաուզերային խաղերի մշակումը պար…

Mashable
Advertisement970 × 250