Ես նկարագրեցի 1245 աղյուսակ LLM-ի միջոցով, և որոնման արդյունավետությունը վատթարացավ

Ծրագրավորող Աշիշ Սինհան վերլուծել է տվյալների բազայի սխեմաների համար LLM-ի միջոցով նկարագրական մետատվյալներ ստեղծելու անսպասելի բացասական հետևանքները: Թեև արհեստական բանականության կողմից ստեղծված նկարագրությունները պետք է բարելավեին որոնումը, դրանք իրականում վատթարացրել են այն: Խնդիրը պայմանավորված է երկու գործոնով՝ IDF-ի (փաստաթղթերի հակադարձ հաճախականություն) նվազմամբ, երբ տիրույթի ընդհանուր տերմինները դառնում են համատարած, և երկարության նորմալացմամբ, որը տուժում է բազմաթիվ սյունակներ ունեցող կենտրոնական աղյուսակների դեպքում: Սինհան առաջարկում է լուծում՝ դաշտերը բաժանել առանձին ինդեքսների և օգտագործել Reciprocal Rank Fusion (RRF)՝ արդյունքները միավորելու համար: Այս մոտեցումը թույլ է տալիս օգտագործել հարստացված տվյալները՝ առանց հիմնական որոնման ազդանշանները աղտոտելու, ինչը ապահովում է ավելի հուսալի մեթոդ text-to-SQL համակարգերի և փաստաթղթերի ինդեքսավորման համար:
This is a summary. Read the full article at the original source:
Dev.toԿապակցված
Ծրագրավորող Ֆելիպե Գամբետա դե Սոուզան ներկայացրել է «Open Economics» նախագիծը՝ բաց կոդով հարթակ, որը նախատեսված է Բրազիլիայի մասնատված պաշտոնական տնտե…
Իր հրապարակման մեջ Էդդի Ժաուդեն պնդում է, որ Python-ի Pandas գրադարանը, որը երկար ժամանակ համարվում էր տվյալների մշակման ոլորտի ստանդարտ, հնացել է և պ…
Manticore Search 29.9.0. Chunked auto-embeddings և mmap հասանելիություն columnar-ատրիբուտների համար
Թողարկվել է Manticore Search 29.9.0 տարբերակը, որը ներառում է մի շարք կարևոր բարելավումներ որոնողական ինդեքսների և վեկտորային որոնման համար: Հիմնական…



