Назад
Данные и аналитика

Я описал 1245 таблиц с помощью LLM, и качество поиска ухудшилось

Dev.to
Advertisement468 × 90
Я описал 1245 таблиц с помощью LLM, и качество поиска ухудшилось

Разработчик Ашиш Синха проанализировал контринтуитивный провал использования LLM для генерации описательных метаданных для схем баз данных. Хотя каталогизация таблиц с помощью ИИ призвана улучшить поиск, Синха обнаружил, что это значительно снизило его эффективность. Проблема вызвана двумя механизмами: коллапсом IDF (обратной частоты документа), когда общие термины домена становятся повсеместными, и нормализацией длины, которая штрафует центральные таблицы с большим количеством столбцов. Объединение сгенерированных описаний с именами схем приводит к потере способности системы различать релевантные объекты. Синха предлагает решение: разделение полей на отдельные индексы и использование Reciprocal Rank Fusion (RRF) для объединения результатов. Этот подход гарантирует, что обогащение данных остается полезным, не загрязняя основные поисковые сигналы, обеспечивая более надежный метод для улучшения поиска в системах text-to-SQL и аналогичных задачах индексации документов.

This is a summary. Read the full article at the original source:

Dev.to
Advertisement468 × 90
Share
Данные и аналитика

Похожие

В своей провокационной статье Эдди Жауде утверждает, что библиотека Pandas для Python, долгое время считавшаяся отраслевым стандартом для манипуляции…

Hacker News (YC)
Advertisement970 × 250