Токенайзер Simple pattern split
Токенайзер simple_pattern_split использует регулярное выражение для разделения входных данных на токены в точках совпадения шаблона. Набор функций регулярных выражений, которые он поддерживает, ограничен по сравнению с токенайзером pattern, но токенизация обычно происходит быстрее.
Этот токенайзер не создаёт токены из самих совпадений. Чтобы создать токены из совпадений, используя шаблоны в том же ограниченном подмножестве регулярных выражений, см. токенайзер simple_pattern.
Этот токенайзер использует регулярные выражения Lucene. Для объяснения поддерживаемых функций и синтаксиса см. Синтаксис регулярных выражений.
По умолчанию шаблон пустая строка, что создаёт один токен, содержащий весь вход. Этот токенайзер всегда должен быть настроен с нестандартным шаблоном.
Настройка
Токенайзер simple_pattern_split принимает следующие параметры:
| | Регулярное выражение Lucene, по умолчанию пустая строка. |
Пример конфигурации
В этом примере токенайзер simple_pattern_split настроен для разделения входного текста по символам нижнего подчёркивания.
PUT my-index-000001
{
"settings": {
"analysis": {
"analyzer": {
"my_analyzer": {
"tokenizer": "my_tokenizer"
}
},
"tokenizer": {
"my_tokenizer": {
"type": "simple_pattern_split",
"pattern": "_"
}
}
}
}
}
POST my-index-000001/_analyze
{
"analyzer": "my_analyzer",
"text": "an_underscored_phrase"
} В приведённом выше примере получаются следующие токены:
[ an, underscored, phrase ]
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/7.17/analysis-simplepatternsplit-tokenizer.html