Фильтр токенов CJK width
Нормализует различия в ширине символов CJK (китайский, японский и корейский) следующим образом:
- Преобразует варианты символов ASCII с полной шириной в эквивалентные базовые латинские символы
- Преобразует варианты символов Катана с половинной шириной в эквивалентные символы Каны
Этот фильтр включён в встроенный анализатор языка Elasticsearch CJK language analyzer. Он использует фильтр Lucene CJKWidthFilter.
Этот фильтр токенов можно рассматривать как подмножество уникодовой нормализации NFKC/NFKD. Подробную информацию о поддержке полной нормализации см. в analysis-icu плагине.
Пример
GET /_analyze
{
"tokenizer" : "standard",
"filter" : ["cjk_width"],
"text" : "シーサイドライナー"
} Фильтр создаёт следующий токен:
シーサイドライナー
Добавление в анализатор
В следующем запросе создания индекса используется фильтр токенов CJK width для настройки нового пользовательского анализатора.
PUT /cjk_width_example
{
"settings": {
"analysis": {
"analyzer": {
"standard_cjk_width": {
"tokenizer": "standard",
"filter": [ "cjk_width" ]
}
}
}
}
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/analysis-cjk-width-tokenfilter.html