Я описал 1245 таблиц с помощью LLM, и качество поиска ухудшилось

Разработчик Ашиш Синха проанализировал контринтуитивный провал использования LLM для генерации описательных метаданных для схем баз данных. Хотя каталогизация таблиц с помощью ИИ призвана улучшить поиск, Синха обнаружил, что это значительно снизило его эффективность. Проблема вызвана двумя механизмами: коллапсом IDF (обратной частоты документа), когда общие термины домена становятся повсеместными, и нормализацией длины, которая штрафует центральные таблицы с большим количеством столбцов. Объединение сгенерированных описаний с именами схем приводит к потере способности системы различать релевантные объекты. Синха предлагает решение: разделение полей на отдельные индексы и использование Reciprocal Rank Fusion (RRF) для объединения результатов. Этот подход гарантирует, что обогащение данных остается полезным, не загрязняя основные поисковые сигналы, обеспечивая более надежный метод для улучшения поиска в системах text-to-SQL и аналогичных задачах индексации документов.
This is a summary. Read the full article at the original source:
Dev.toПохожие
Разработчик Фелипе Гамбетта де Соуза представил «Open Economics» — проект с открытым исходным кодом, предназначенный для нормализации разрозненных офи…
В своей провокационной статье Эдди Жауде утверждает, что библиотека Pandas для Python, долгое время считавшаяся отраслевым стандартом для манипуляции…
Manticore Search 29.9.0: chunked auto-embeddings и mmap-доступ к columnar-атрибутам
Вышел релиз Manticore Search 29.9.0, привносящий ряд значимых улучшений для работы с поисковыми индексами и векторным поиском. Ключевые нововведения в…



