Фильтр токенов Lowercase
Изменяет текст токена на нижний регистр. Например, вы можете использовать фильтр lowercase для изменения THE Lazy DoG на the lazy dog.
Помимо стандартного фильтра, фильтр токенов lowercase предоставляет доступ к языкоспецифичным фильтрам нижнего регистра Lucene для греческого, ирландского и турецкого языков.
Пример
Следующий запрос API анализа analyze API использует стандартный фильтр lowercase для изменения THE Quick FoX JUMPs на нижний регистр:
resp = client.indices.analyze(
tokenizer="standard",
filter=[
"lowercase"
],
text="THE Quick FoX JUMPs",
)
print(resp) response = client.indices.analyze(
body: {
tokenizer: 'standard',
filter: [
'lowercase'
],
text: 'THE Quick FoX JUMPs'
}
)
puts response const response = await client.indices.analyze({
tokenizer: "standard",
filter: ["lowercase"],
text: "THE Quick FoX JUMPs",
});
console.log(response); GET _analyze
{
"tokenizer" : "standard",
"filter" : ["lowercase"],
"text" : "THE Quick FoX JUMPs"
} Фильтр создаёт следующие токены:
[ the, quick, fox, jumps ]
Добавление в анализатор
Следующий запрос API создания индекса создания индекса использует фильтр lowercase для настройки нового пользовательского анализатора.
resp = client.indices.create(
index="lowercase_example",
settings={
"analysis": {
"analyzer": {
"whitespace_lowercase": {
"tokenizer": "whitespace",
"filter": [
"lowercase"
]
}
}
}
},
)
print(resp) response = client.indices.create(
index: 'lowercase_example',
body: {
settings: {
analysis: {
analyzer: {
whitespace_lowercase: {
tokenizer: 'whitespace',
filter: [
'lowercase'
]
}
}
}
}
}
)
puts response const response = await client.indices.create({
index: "lowercase_example",
settings: {
analysis: {
analyzer: {
whitespace_lowercase: {
tokenizer: "whitespace",
filter: ["lowercase"],
},
},
},
},
});
console.log(response); PUT lowercase_example
{
"settings": {
"analysis": {
"analyzer": {
"whitespace_lowercase": {
"tokenizer": "whitespace",
"filter": [ "lowercase" ]
}
}
}
}
} Настраиваемые параметры
-
language -
(Необязательно, строка) Языкоспецифичный фильтр нижнего регистра токена. Допустимые значения:
-
greek - Использует GreekLowerCaseFilter Lucene
-
irish - Использует IrishLowerCaseFilter Lucene
-
turkish - Использует TurkishLowerCaseFilter Lucene
Если не указано, используется LowerCaseFilter Lucene.
-
Настройка
Для настройки фильтра lowercase дублируйте его, чтобы создать основу для нового пользовательского фильтра токенов. Вы можете изменить фильтр, используя его настраиваемые параметры.
Например, следующий запрос создаёт пользовательский фильтр lowercase для греческого языка:
resp = client.indices.create(
index="custom_lowercase_example",
settings={
"analysis": {
"analyzer": {
"greek_lowercase_example": {
"type": "custom",
"tokenizer": "standard",
"filter": [
"greek_lowercase"
]
}
},
"filter": {
"greek_lowercase": {
"type": "lowercase",
"language": "greek"
}
}
}
},
)
print(resp) response = client.indices.create(
index: 'custom_lowercase_example',
body: {
settings: {
analysis: {
analyzer: {
greek_lowercase_example: {
type: 'custom',
tokenizer: 'standard',
filter: [
'greek_lowercase'
]
}
},
filter: {
greek_lowercase: {
type: 'lowercase',
language: 'greek'
}
}
}
}
}
)
puts response const response = await client.indices.create({
index: "custom_lowercase_example",
settings: {
analysis: {
analyzer: {
greek_lowercase_example: {
type: "custom",
tokenizer: "standard",
filter: ["greek_lowercase"],
},
},
filter: {
greek_lowercase: {
type: "lowercase",
language: "greek",
},
},
},
},
});
console.log(response); PUT custom_lowercase_example
{
"settings": {
"analysis": {
"analyzer": {
"greek_lowercase_example": {
"type": "custom",
"tokenizer": "standard",
"filter": ["greek_lowercase"]
}
},
"filter": {
"greek_lowercase": {
"type": "lowercase",
"language": "greek"
}
}
}
}
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/analysis-lowercase-tokenfilter.html