Фильтр токенов Uppercase
Изменяет текст токена на верхний регистр. Например, вы можете использовать фильтр uppercase, чтобы изменить the Lazy DoG на THE LAZY DOG.
Этот фильтр использует UpperCaseFilter из Lucene.
В зависимости от языка, одна заглавная буква может соответствовать нескольким строчным буквам. Использование фильтра uppercase может привести к потере информации о строчных буквах.
Чтобы избежать этой потери, но при этом сохранить согласованный регистр букв, используйте фильтр lowercase вместо этого.
Пример
Следующий запрос API analyze API использует фильтр по умолчанию uppercase для изменения the Quick FoX JUMPs на верхний регистр:
GET _analyze
{
"tokenizer" : "standard",
"filter" : ["uppercase"],
"text" : "the Quick FoX JUMPs"
} Фильтр создаёт следующие токены:
[ THE, QUICK, FOX, JUMPS ]
Добавление в анализатор
Следующий запрос API create index API использует фильтр uppercase для настройки нового пользовательского анализатора.
PUT uppercase_example
{
"settings": {
"analysis": {
"analyzer": {
"whitespace_uppercase": {
"tokenizer": "whitespace",
"filter": [ "uppercase" ]
}
}
}
}
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/analysis-uppercase-tokenfilter.html