Spec-Zone.ru › Elasticsearch 7
›Elasticsearch Руководство [7.17] ›Анализ текста ›Справочник токенизаторов

Токенизатор Thai

Токенизатор thai разделяет тайский текст на слова, используя алгоритм сегментации тайского языка, включённый в Java. Текст на других языках, в целом, будет обрабатываться так же, как и токенизатор standard.

Этот токенизатор может не поддерживаться всеми JRE. Известно, что он работает с Sun/Oracle и OpenJDK. Если вашему приложению нужна полная переносимость, рассмотрите использование токенизатора ICU вместо него.

Пример вывода

POST _analyze
{
  "tokenizer": "thai",
  "text": "การที่ได้ต้องแสดงว่างานดี"
}

Вышеприведённое предложение даст следующие термины:

[ การ, ที่, ได้, ต้อง, แสดง, ว่า, งาน, ดี ]

Настройка

Токенизатор thai не настраивается.

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/analysis-thai-tokenizer.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API