Spec-Zone.ru › Elasticsearch 8
›Elasticsearch Руководство [8.17] ›Конвейеры ingest

Справочник по обработчикам ingest

Пайплайн поглощения состоит из последовательности процессоров, которые применяются к документам по мере их поглощения в индекс. Каждый процессор выполняет определенную задачу, например, фильтрацию, преобразование или обогащение данных.

Каждый последующий процессор зависит от выходных данных предыдущего процессора, поэтому порядок процессоров важен. Измененные документы индексируются в Elasticsearch после применения всех процессоров.

Elasticsearch включает более 40 настраиваемых процессоров. Подстраницы в этом разделе содержат справочную документацию для каждого процессора. Чтобы получить список доступных процессоров, используйте API информации о узлах.

resp = client.nodes.info(
    node_id="ingest",
    filter_path="nodes.*.ingest.processors",
)
print(resp)
response = client.nodes.info(
  node_id: 'ingest',
  filter_path: 'nodes.*.ingest.processors'
)
puts response
const response = await client.nodes.info({
  node_id: "ingest",
  filter_path: "nodes.*.ingest.processors",
});
console.log(response);
GET _nodes/ingest?filter_path=nodes.*.ingest.processors

Процессоры поглощения по категориям

Мы разбили доступные процессоры на этой странице по категориям и подытожили их функции. Это поможет вам найти подходящий процессор для вашей задачи.

  • Процессоры обогащения данных
  • Процессоры преобразования данных
  • Процессоры фильтрации данных
  • Процессоры обработки пайплайнов
  • Процессоры обработки массивов/JSON

Процессоры обогащения данных

Общие результаты

append процессор
Добавляет значение к полю.
date_index_name процессор
Направляет документы в правильный индекс, основанный на дате или метке времени в поле.
enrich процессор
Обогащает документы данными из другого индекса.

Обратитесь к Обогащение данных для подробных примеров использования enrich процессора для добавления данных из существующих индексов в входящие документы во время поглощения.

inference процессор
Использует машинное обучение для классификации и маркировки текстовых полей.

Конкретные результаты

attachment процессор
Разбирает и индексирует двоичные данные, такие как PDF и документы Word.
circle процессор
Преобразует поле местоположения в поле Geo-Point.
community_id процессор
Вычисляет идентификатор сообщества для данных о сетевом потоке.
fingerprint процессор
Вычисляет хеш содержимого документа.
geo_grid процессор
Преобразует гео-сетки определений плиток или ячеек сетки в обычные прямоугольники или многоугольники, описывающие их форму.
geoip процессор
Добавляет информацию о географическом местоположении IPv4 или IPv6 адреса из базы данных Maxmind.
ip_location процессор
Добавляет информацию о географическом местоположении IPv4 или IPv6 адреса из базы данных геолокации IP.
network_direction процессор
Вычисляет направление сети на основе исходного IP-адреса, целевого IP-адреса и списка внутренних сетей.
registered_domain процессор
Извлекает зарегистрированный домен (также известный как эффективный домен верхнего уровня или eTLD), поддомен и домен верхнего уровня из полного доменного имени (FQDN).
set_security_user процессор
Устанавливает пользовательские данные (такие как username, roles, email, full_name,metadata, api_key, realm и authentication_type) от текущего аутентифицированного пользователя в текущий документ путем предварительной обработки поглощения.
uri_parts процессор
Разбирает строку универсального идентификатора ресурса (URI) и извлекает ее компоненты как объект.
urldecode процессор
Декодирует строку URL.
user_agent процессор
Разбирает строки user-agent для извлечения информации о веб-клиентах.

Процессоры преобразования данных

Общие результаты

convert процессор
Преобразует поле в текущем поглощаемом документе в другой тип, например, преобразование строки в целое число.
dissect процессор
Извлекает структурированные поля из одного текстового поля в документе. В отличие от процессора grok, dissect не использует регулярные выражения. Это делает dissect проще и часто быстрее.
grok процессор
Извлекает структурированные поля из одного текстового поля в документе, используя диалект регулярных выражений Grok, который поддерживает многоразовые алиасированные выражения.
gsub процессор
Преобразует строковое поле, применяя регулярное выражение и замену.
redact процессор
Использует движок правил Grok для маскировки текста в входном документе, соответствующего заданным шаблонам Grok.
rename процессор
Переименовывает существующее поле.
set процессор
Устанавливает значение для поля.

Конкретные результаты

bytes процессор
Преобразует удобочитаемое значение байта в его значение в байтах (например, 1kb становится 1024).
csv процессор
Извлекает одну строку данных CSV из текстового поля.
date процессор
Извлекает и преобразует поля даты.
dot_expand процессор
Расширяет поле с точками в поле объекта.
html_strip процессор
Удаляет теги HTML из поля.
join процессор
Объединяет каждый элемент массива в одну строку, используя разделитель между каждым элементом.
kv процессор
Разбирает сообщения (или определенные поля событий), содержащие пары ключ-значение.
lowercase процессор и uppercase процессор
Преобразует строковое поле в нижний или верхний регистр.
split процессор
Разделяет поле на массив значений.
trim процессор
Обрезает пробелы из поля.

Обработчики фильтрации данных

drop обработчик
Удаляет документ без генерирования ошибок.
remove обработчик
Удаляет поля из документов.

Обработчики управления конвейером

fail обработчик
Вызывает исключение. Полезно, когда ожидается сбой конвейера и необходимо передать конкретное сообщение запрашивающему.
pipeline обработчик
Выполняет другой конвейер.
reroute обработчик
Перенаправляет документы в другой целевой индекс или поток данных.
terminate обработчик
Прерывает текущий конвейер поглощения, в результате чего дальнейшие обработчики не выполняются.

Обработчики обработки массивов/JSON

for_each обработчик
Выполняет обработчик поглощения для каждого элемента массива или объекта.
json обработчик
Преобразует строку JSON в структурированный JSON-объект.
script обработчик
Выполняет встроенный или сохранённый скрипт над входящими документами. Скрипт выполняется в контексте painless ingest.
sort обработчик
Сортирует элементы массива по возрастанию или убыванию.

Добавление дополнительных обработчиков

Вы можете установить дополнительные обработчики в качестве плагинов.

Вы должны установить все плагин-обработчики на всех узлах кластера. В противном случае Elasticsearch не сможет создать конвейеры, содержащие обработчик.

Чтобы отметить плагин как обязательный, установите plugin.mandatory в elasticsearch.yml. Узел не сможет запуститься, если обязательный плагин не установлен.

plugin.mandatory: my-ingest-plugin

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/processors.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API