Spec-Zone.ru › Elasticsearch 8
›Elasticsearch Guide [8.17]

Переранжирование

Многие поисковые системы построены на многоступенчатых конвейерах извлечения.

На ранних этапах используются быстрые и недорогие алгоритмы для поиска широкого набора возможных совпадений.

На последующих этапах применяются более мощные модели, часто основанные на машинном обучении, для переупорядочения документов. Этот этап называется переранжированием. Поскольку ресурсоёмкая модель применяется только к меньшему набору предварительно отфильтрованных результатов, этот подход возвращает более релевантные результаты, одновременно оптимизируя производительность поиска и вычислительные затраты.

Elasticsearch поддерживает различные методы ранжирования и переранжирования для оптимизации релевантности и производительности поиска.

Двухступенчатые конвейеры извлечения

Первичное извлечение

Поиск по полному тексту: оценка BM25

Elasticsearch ранжирует документы на основе частоты встречаемости терминов и обратной частоты документов, скорректированной на длину документа. BM25 — это по умолчанию статистический алгоритм оценки в Elasticsearch.

Поиск по векторам: оценка сходства

Поиск по векторам подразумевает преобразование данных в плотные или разреженные векторные представления для захвата семантических значений и вычисления оценок сходства для векторов запросов. Храните векторы, используя поля semantic_text для автоматического вывода и векторизации или поля dense_vector и sparse_vector, когда вам требуется больший контроль над базовой моделью встраивания. Запрашивайте векторные поля с помощью запросов semantic, knn или sparse_vector для вычисления оценок сходства. Обратитесь к семантическому поиску за дополнительной информацией.

Гибридные методы

Гибридные методы поиска комбинируют результаты из конвейеров поиска по полному тексту и по векторам. Elasticsearch позволяет комбинировать оценки лексического соответствия (BM25) и поиска по векторам с помощью алгоритма взаимного слияния рангов (RRF).

Переранжирование

При использовании следующих расширенных конвейеров переранжирования механизмы первичного извлечения эффективно генерируют набор кандидатов. Эти кандидаты направляются в переранжировщик для выполнения более ресурсоёмких задач переранжирования.

Семантическое переранжирование

Семантическое переранжирование использует модели машинного обучения для переупорядочения результатов поиска на основе семантического сходства с запросом. Модели могут быть размещены непосредственно в кластере Elasticsearch, или вы можете использовать интерфейсы вывода для вызова моделей, предоставленных сторонними сервисами. Семантическое переранжирование обеспечивает возможности семантического поиска «из коробки» для существующих индексов полнотекстового поиска.

Обучение ранжированию (LTR)

Обучение ранжированию предназначено для продвинутых пользователей. Обучение ранжированию включает обучение модели машинного обучения для построения функции ранжирования для вашего поискового опыта, которая обновляется со временем. Обучение ранжированию лучше всего подходит, когда у вас есть достаточные данные для обучения и требуется высоконастроенная настройка релевантности.

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/re-ranking-overview.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API