Токенизатор группы символов
Токенизатор char_group разбивает текст на токены всякий раз, когда встречается символ, который находится в определённом наборе. Он в основном полезен в случаях, когда требуется простая пользовательская токенизация, и накладные расходы на использование токенизатора pattern неприемлемы.
Настройка
Токенизатор char_group принимает один параметр:
| | Список, содержащий список символов для токенизации строки. Всякий раз, когда встречается символ из этого списка, начинается новый токен. Это принимает либо отдельные символы, например, |
| | Максимальная длина токена. Если встречается токен, длина которого превышает эту длину, то он разбивается через |
Пример вывода
POST _analyze
{
"tokenizer": {
"type": "char_group",
"tokenize_on_chars": [
"whitespace",
"-",
"\n"
]
},
"text": "The QUICK brown-fox"
} возвращает
{
"tokens": [
{
"token": "The",
"start_offset": 0,
"end_offset": 3,
"type": "word",
"position": 0
},
{
"token": "QUICK",
"start_offset": 4,
"end_offset": 9,
"type": "word",
"position": 1
},
{
"token": "brown",
"start_offset": 10,
"end_offset": 15,
"type": "word",
"position": 2
},
{
"token": "fox",
"start_offset": 16,
"end_offset": 19,
"type": "word",
"position": 3
}
]
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/analysis-chargroup-tokenizer.html