Токенайзер для тайского языка
Токенайзер thai разделяет тайский текст на слова, используя алгоритм сегментации тайского языка, включенный в Java. Текст на других языках в целом будет обрабатываться так же, как и токенайзер standard.
Этот токенайзер может не поддерживаться всеми JRE. Известно, что он работает с Sun/Oracle и OpenJDK. Если ваше приложение должно быть полностью переносимым, используйте токенайзер ICU вместо него.
Пример вывода
resp = client.indices.analyze(
tokenizer="thai",
text="การที่ได้ต้องแสดงว่างานดี",
)
print(resp) response = client.indices.analyze(
body: {
tokenizer: 'thai',
text: 'การที่ได้ต้องแสดงว่างานดี'
}
)
puts response const response = await client.indices.analyze({
tokenizer: "thai",
text: "การที่ได้ต้องแสดงว่างานดี",
});
console.log(response); POST _analyze
{
"tokenizer": "thai",
"text": "การที่ได้ต้องแสดงว่างานดี"
} Предложение выше даст следующие термины:
[ การ, ที่, ได้, ต้อง, แสดง, ว่า, งาน, ดี ]
Настройка
Токенайзер thai не настраивается.
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/analysis-thai-tokenizer.html