Spec-Zone.ru › Elasticsearch 8
›Elasticsearch Руководство [8.17] ›Анализ текста ›Справочник токенизаторов

Токенизатор Letter

Токенизатор letter разделяет текст на термины всякий раз, когда встречается символ, который не является буквой. Он неплохо справляется с большинством европейских языков, но плохо справляется с некоторыми азиатскими языками, где слова не разделяются пробелами.

Пример вывода

resp = client.indices.analyze(
    tokenizer="letter",
    text="The 2 QUICK Brown-Foxes jumped over the lazy dog's bone.",
)
print(resp)
response = client.indices.analyze(
  body: {
    tokenizer: 'letter',
    text: "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."
  }
)
puts response
const response = await client.indices.analyze({
  tokenizer: "letter",
  text: "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone.",
});
console.log(response);
POST _analyze
{
  "tokenizer": "letter",
  "text": "The 2 QUICK Brown-Foxes jumped over the lazy dog's bone."
}

Предложение выше дало бы следующие термины:

[ The, QUICK, Brown, Foxes, jumped, over, the, lazy, dog, s, bone ]

Настройка

Токенизатор letter не настраивается.

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/analysis-letter-tokenizer.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API