Токенизатор простых шаблонов
Токенизатор simple_pattern использует регулярное выражение для захвата совпадающего текста в качестве терминов. Набор функций регулярных выражений, которые он поддерживает, ограничен по сравнению с токенизатором pattern, но токенизация, как правило, происходит быстрее.
В отличие от токенизатора pattern, этот токенизатор не поддерживает разделение входных данных по совпадению шаблона. Для разделения по совпадениям шаблонов с использованием того же ограниченного подмножества регулярных выражений см. токенизатор simple_pattern_split.
Этот токенизатор использует регулярные выражения Lucene. Для получения объяснений поддерживаемых функций и синтаксиса см. Синтаксис регулярных выражений.
По умолчанию шаблон пустая строка, что не приводит к созданию терминов. Этот токенизатор всегда должен настраиваться с использованием шаблона, отличного от пустого.
Настройка
Токенизатор simple_pattern принимает следующие параметры:
| | регулярное выражение Lucene, по умолчанию пустая строка. |
Пример настройки
В этом примере токенизатор simple_pattern настраивается для создания терминов, являющихся трехзначными числами
PUT my-index-000001
{
"settings": {
"analysis": {
"analyzer": {
"my_analyzer": {
"tokenizer": "my_tokenizer"
}
},
"tokenizer": {
"my_tokenizer": {
"type": "simple_pattern",
"pattern": "[0123456789]{3}"
}
}
}
}
}
POST my-index-000001/_analyze
{
"analyzer": "my_analyzer",
"text": "fd-786-335-514-x"
} Приведенный выше пример создает следующие термины:
[ 786, 335, 514 ]
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/analysis-simplepattern-tokenizer.html