Spec-Zone.ru › Elasticsearch 8
›Elasticsearch Руководство [8.17] ›Анализ текста ›Справочник по токенайзерам

Токенайзер Keyword

Токенайзер keyword — это токенайзер «бездействия», который принимает любой предоставленный текст и выводит тот же самый текст как единственный термин. Его можно комбинировать с фильтрами токенов для нормализации вывода, например, для приведения адресов электронной почты к нижнему регистру.

Пример вывода

resp = client.indices.analyze(
    tokenizer="keyword",
    text="New York",
)
print(resp)
response = client.indices.analyze(
  body: {
    tokenizer: 'keyword',
    text: 'New York'
  }
)
puts response
const response = await client.indices.analyze({
  tokenizer: "keyword",
  text: "New York",
});
console.log(response);
POST _analyze
{
  "tokenizer": "keyword",
  "text": "New York"
}

Вышеприведённое предложение должно привести к следующему термину:

[ New York ]

Комбинирование с фильтрами токенов

Вы можете комбинировать токенайзер keyword с фильтрами токенов для нормализации структурированных данных, таких как идентификаторы продуктов или адреса электронной почты.

Например, следующий запрос API анализа использует токенайзер keyword и фильтр lowercase для преобразования адреса электронной почты в нижний регистр.

resp = client.indices.analyze(
    tokenizer="keyword",
    filter=[
        "lowercase"
    ],
    text="john.SMITH@example.COM",
)
print(resp)
response = client.indices.analyze(
  body: {
    tokenizer: 'keyword',
    filter: [
      'lowercase'
    ],
    text: 'john.SMITH@example.COM'
  }
)
puts response
const response = await client.indices.analyze({
  tokenizer: "keyword",
  filter: ["lowercase"],
  text: "john.SMITH@example.COM",
});
console.log(response);
POST _analyze
{
  "tokenizer": "keyword",
  "filter": [ "lowercase" ],
  "text": "john.SMITH@example.COM"
}

Запрос генерирует следующий токен:

[ john.smith@example.com ]

Настройка

Токенайзер keyword принимает следующие параметры:

buffer_size

Количество символов, считываемых в буфер токена за один проход. По умолчанию равно 256. Буфер токена будет увеличиваться на эту величину до тех пор, пока весь текст не будет обработан. Не рекомендуется изменять это значение.

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/analysis-keyword-tokenizer.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API