Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

создание-задачи

Описание

Создает новое определение задачи.

См. также: Документация AWS API

Синтаксис

  create-job
--name <value>
[--job-mode <value>]
[--job-run-queuing-enabled | --no-job-run-queuing-enabled]
[--description <value>]
[--log-uri <value>]
--role <value>
[--execution-property <value>]
--command <value>
[--default-arguments <value>]
[--non-overridable-arguments <value>]
[--connections <value>]
[--max-retries <value>]
[--allocated-capacity <value>]
[--timeout <value>]
[--max-capacity <value>]
[--security-configuration <value>]
[--tags <value>]
[--notification-property <value>]
[--glue-version <value>]
[--number-of-workers <value>]
[--worker-type <value>]
[--code-gen-configuration-nodes <value>]
[--execution-class <value>]
[--source-control-details <value>]
[--maintenance-window <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--name (строка)

Имя, которое вы назначаете этому определению задачи. Оно должно быть уникальным в вашей учетной записи.

--job-mode (строка)

Режим, описывающий способ создания задачи. Допустимые значения:

  • SCRIPT — Задача была создана с помощью редактора сценариев Glue Studio.
  • VISUAL — Задача была создана с помощью визуального редактора Glue Studio.
  • NOTEBOOK — Задача была создана с помощью ноутбука интерактивных сессий.

Когда поле JobMode отсутствует или равно null, по умолчанию устанавливается значение SCRIPT.

Возможные значения:

  • SCRIPT
  • VISUAL
  • NOTEBOOK

--job-run-queuing-enabled | --no-job-run-queuing-enabled (логическое значение)

Указывает, включена ли очередь выполнения задач для этой задачи.

Значение true означает, что очередь выполнения задач включена для заданий. Если значение false или не задано, задания не будут рассматриваться для очереди.

Если это поле не соответствует значению, установленному в задании, то будет использовано значение из поля задания.

--description (строка)

Описание определенной задачи.

--log-uri (строка)

Это поле зарезервировано для будущего использования.

--role (строка)

Имя или Amazon Resource Name (ARN) роли IAM, связанной с этой задачей.

--execution-property (структура)

ExecutionProperty, определяющий максимальное количество одновременных запусков этой задачи.

MaxConcurrentRuns -> (целое число)

Максимальное количество одновременных запусков задачи. По умолчанию 1. При достижении этого порога возвращается ошибка. Максимальное значение, которое можно указать, ограничено лимитом службы.

Упрощенный синтаксис:

MaxConcurrentRuns=integer

Синтаксис JSON:

{
  "MaxConcurrentRuns": integer
}

--command (структура)

JobCommand, выполняющая эту задачу.

Name -> (строка)

Имя команды задачи. Для задачи Apache Spark ETL она должна быть glueetl. Для задачи Python shell она должна быть pythonshell. Для задачи Apache Spark streaming ETL она должна быть gluestreaming. Для задачи Ray она должна быть glueray.

ScriptLocation -> (строка)

Указывает путь к сценарию в Amazon Simple Storage Service (Amazon S3), который выполняет задачу.

PythonVersion -> (строка)

Версия Python, используемая для выполнения задачи Python shell. Допустимые значения 2 или 3.

Runtime -> (строка)

В задачах Ray параметр Runtime используется для указания версий Ray, Python и дополнительных библиотек, доступных в вашей среде. Это поле не используется в других типах задач. Доступные значения среды выполнения см. в Руководстве разработчика Glue в разделе Поддерживаемые среды выполнения Ray.

Упрощенный синтаксис:

Name=string,ScriptLocation=string,PythonVersion=string,Runtime=string

Синтаксис JSON:

{
  "Name": "string",
  "ScriptLocation": "string",
  "PythonVersion": "string",
  "Runtime": "string"
}

--default-arguments (массив)

Параметры по умолчанию для каждого запуска этой задачи, указанные как пары имя-значение.

Вы можете указать здесь параметры, используемые вашим собственным скриптом выполнения задачи, а также параметры, используемые самим Glue.

Аргументы задач могут регистрироваться. Не передавайте открытые секреты в качестве аргументов. Получайте секреты из подключения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в задаче.

Дополнительную информацию о том, как указать и использовать собственные аргументы задач, см. в разделе Вызов API Glue на Python в Руководстве разработчика.

Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке задач Spark, см. в разделе Специальные параметры, используемые Glue в Руководстве разработчика.

Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке задач Ray, см. в разделе Использование параметров задач в задачах Ray в Руководстве разработчика.

key -> (строка)

value -> (строка)

Упрощенный синтаксис:

KeyName1=string,KeyName2=string

Синтаксис JSON:

{"string": "string"
  ...}

--non-overridable-arguments (массив)

Аргументы для этой задачи, которые не переопределяются при указании аргументов задачи в запуске задачи, указанные как пары имя-значение.

key -> (строка)

value -> (строка)

Упрощенный синтаксис:

KeyName1=string,KeyName2=string

Синтаксис JSON:

{"string": "string"
  ...}

--connections (структура)

Подключения, используемые для этой задачи.

Connections -> (список)

Список подключений, используемых задачей.

(строка)

Упрощенный синтаксис:

Connections=string,string

Синтаксис JSON:

{
  "Connections": ["string", ...]
}

--max-retries (целое число)

Максимальное количество попыток повторного выполнения задачи в случае ее сбоя.

--allocated-capacity (целое число)

Этот параметр устарел. Используйте MaxCapacity вместо него.

Количество единиц обработки данных Glue (DPU), которые необходимо выделить для этой задачи. Вы можете выделить минимум 2 DPU; по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.

--timeout (целое число)

Таймаут задачи в минутах. Это максимальное время, которое запуск задачи может потреблять ресурсы, прежде чем будет завершен и перейдет в состояние TIMEOUT.

Значения таймаута задач должны быть меньше 7 дней или 10080 минут. В противном случае задачи выбросят исключение.

Если значение не указано, таймаут по умолчанию составляет 2880 минут.

Все существующие задачи Glue, имеющие значение таймаута больше 7 дней, будут по умолчанию установлены на 7 дней. Например, если вы задали таймаут в 20 дней для задачи пакетной обработки, он будет остановлен на 7-й день.

Для задач потоковой обработки, если вы настроили окно обслуживания, оно будет перезапущено в окне обслуживания после 7 дней.

--max-capacity (дробное число)

Для задач Glue версии 1.0 или более ранних, использующих стандартный тип рабочего процесса, количество единиц обработки данных Glue (DPU), которые могут быть выделены при выполнении этой задачи. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.

Для задач Glue версии 2.0+ вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.

Не задавайте MaxCapacity, если используете WorkerType и NumberOfWorkers.

Значение, которое можно выделить для MaxCapacity, зависит от того, выполняете ли вы задачу Python shell, задачу Apache Spark ETL или задачу Apache Spark streaming ETL:

  • Если вы указываете задачу Python shell (JobCommand.Name =”pythonshell”), вы можете выделить 0,0625 или 1 DPU. По умолчанию 0,0625 DPU.
  • Если вы указываете задачу Apache Spark ETL (JobCommand.Name =”glueetl”) или задачу Apache Spark streaming ETL (JobCommand.Name =”gluestreaming”), вы можете выделить от 2 до 100 DPU. По умолчанию 10 DPU. Этот тип задачи не может иметь дробное выделение DPU.

--security-configuration (строка)

Имя структуры SecurityConfiguration, которая должна использоваться с этой задачей.

--tags (массив)

Теги для использования с этой задачей. Вы можете использовать теги для ограничения доступа к задаче. Дополнительную информацию о тегах в Glue см. в разделе Теги Amazon Web Services в Glue в Руководстве разработчика.

key -> (строка)

value -> (строка)

Упрощенный синтаксис:

KeyName1=string,KeyName2=string

Синтаксис JSON:

{"string": "string"
  ...}

--notification-property (структура)

Указывает конфигурационные свойства уведомления о задаче.

NotifyDelayAfter -> (целое число)

После запуска запуска задачи количество минут, которые нужно подождать перед отправкой уведомления о задержке запуска задачи.

Упрощенный синтаксис:

NotifyDelayAfter=integer

Синтаксис JSON:

{
  "NotifyDelayAfter": integer
}

--glue-version (строка)

В задачах Spark, GlueVersion определяет версии Apache Spark и Python, доступные в задаче Glue. Версия Python указывает версию, поддерживаемую для задач типа Spark.

Задачи Ray должны установить GlueVersion на 4.0 или более позднюю. Однако версии Ray, Python и дополнительных библиотек, доступных в вашей задаче Ray, определяются параметром Runtime команды задачи.

Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в Руководстве разработчика Glue в разделе версия Glue.

Задачи, созданные без указания версии Glue, по умолчанию используют Glue 0.9.

--number-of-workers (целое число)

Количество рабочих процессов заданного workerType, которые выделены при выполнении задачи.

--worker-type (строка)

Тип предварительно выделенного рабочего узла, который выделяется при выполнении задания. Принимает значение G.1X, G.2X, G.4X, G.8X или G.025X для заданий Spark. Принимает значение Z.2X для заданий Ray.

  • Для типа рабочего узла G.1X каждый рабочий узел соответствует 1 DPU (4 vCPUs, 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для таких задач, как преобразования данных, объединения и запросы, чтобы обеспечить масштабируемый и экономичный способ запуска большинства заданий.
  • Для типа рабочего узла G.2X каждый рабочий узел соответствует 2 DPU (8 vCPUs, 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для таких задач, как преобразования данных, объединения и запросы, чтобы обеспечить масштабируемый и экономичный способ запуска большинства заданий.
  • Для типа рабочего узла G.4X каждый рабочий узел соответствует 4 DPU (16 vCPUs, 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для заданий, рабочие нагрузки которых содержат самые требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для заданий Spark ETL Glue версии 3.0 и выше в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm).
  • Для типа рабочего узла G.8X каждый рабочий узел соответствует 8 DPU (32 vCPUs, 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для заданий, рабочие нагрузки которых содержат самые требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для заданий Spark ETL Glue версии 3.0 и выше в тех же регионах Amazon Web Services, что и для типа рабочего узла G.4X.
  • Для типа рабочего узла G.025X каждый рабочий узел соответствует 0,25 DPU (2 vCPUs, 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для заданий потоковой обработки с низким объемом данных. Этот тип рабочего узла доступен только для заданий потоковой обработки Glue версии 3.0 и выше.
  • Для типа рабочего узла Z.2X каждый рабочий узел соответствует 2 M-DPU (8 vCPUs, 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 рабочих узлов Ray на основе автомасштабирования.

Возможные значения:

  • Standard
  • G.1X
  • G.2X
  • G.025X
  • G.4X
  • G.8X
  • Z.2X

--code-gen-configuration-nodes (карта)

Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.

ключ -> (строка)

значение -> (структура)

CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.

AthenaConnectorSource -> (структура)

Указывает соединитель к источнику данных Amazon Athena.

Имя -> (строка)

Имя источника данных.

Имя подключения -> (строка)

Имя подключения, связанного с соединителем.

Имя соединителя -> (строка)

Имя соединителя, помогающего получить доступ к хранилищу данных в Glue Studio.

Тип подключения -> (строка)

Тип подключения, например, marketplace.athena или custom.athena, обозначающий подключение к хранилищу данных Amazon Athena.

Таблица подключения -> (строка)

Имя таблицы в источнике данных.

Имя схемы -> (строка)

Имя группы журналов Cloudwatch для чтения. Например, /aws-glue/jobs/output.

OutputSchemas -> (список)

Указывает схему данных для пользовательского источника Athena.

(структура)

Указывает пользовательскую схему, когда схему невозможно определить Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

JDBCConnectorSource -> (структура)

Указывает соединитель к источнику данных JDBC.

Имя -> (строка)

Имя источника данных.

Имя подключения -> (строка)

Имя подключения, связанного с соединителем.

Имя соединителя -> (строка)

Имя соединителя, помогающего получить доступ к хранилищу данных в Glue Studio.

Тип подключения -> (строка)

Тип подключения, например, marketplace.jdbc или custom.jdbc, обозначающий подключение к хранилищу данных JDBC.

Дополнительные параметры -> (структура)

Дополнительные параметры подключения для соединителя.

Фильтр предиката -> (строка)

Дополнительная часть условия для фильтрации данных из источника. Например:

BillingCity='Mountain View'

При использовании запроса вместо имени таблицы необходимо проверить, что запрос работает с указанным filterPredicate.

Столбец раздела -> (строка)

Имя целочисленного столбца, используемого для разбиения на разделы. Этот параметр работает только при включении его с lowerBound, upperBound и numPartitions. Этот параметр работает так же, как в Spark SQL JDBC reader.

Нижняя граница -> (длинное целое число)

Минимальное значение partitionColumn, используемое для определения шага разбиения на разделы.

Верхняя граница -> (длинное целое число)

Максимальное значение partitionColumn, используемое для определения шага разбиения на разделы.

Число разделов -> (длинное целое число)

Количество разделов. Это значение вместе с lowerBound (включительно) и upperBound (исключительно) образуют шаги разбиения на разделы для сгенерированных WHERE выражений предложения, которые используются для разделения partitionColumn.

Ключи отметки выполнения задания -> (список)

Имя ключей отметки выполнения задания, по которым необходимо выполнить сортировку.

(строка)

Порядок сортировки ключей отметки выполнения задания -> (строка)

Указывает порядок сортировки по возрастанию или убыванию.

Отображение типов данных -> (карта)

Пользовательское отображение типов данных, создающее отображение от типа данных JDBC к типу данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} отображает поля данных типа JDBC FLOAT в тип Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение зависит от используемого драйвера. Обратитесь к документации к своему JDBC драйверу, чтобы понять, как драйвер выполняет преобразования.

ключ -> (строка)

значение -> (строка)

Таблица подключения -> (строка)

Имя таблицы в источнике данных.

Запрос -> (строка)

Таблица или SQL-запрос для получения данных. Вы можете указать либо ConnectionTable, либо query, но не оба.

OutputSchemas -> (список)

Указывает схему данных для пользовательского JDBC источника.

(структура)

Указывает пользовательскую схему, когда схему невозможно определить Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorSource -> (структура)

Указывает соединитель к источнику данных Apache Spark.

Имя -> (строка)

Имя источника данных.

Имя подключения -> (строка)

Имя подключения, связанного с соединителем.

Имя соединителя -> (строка)

Имя соединителя, помогающего получить доступ к хранилищу данных в Glue Studio.

Тип подключения -> (строка)

Тип подключения, например, marketplace.spark или custom.spark, обозначающий подключение к хранилищу данных Apache Spark.

Дополнительные параметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Указывает схему данных для пользовательского источника Spark.

(структура)

Указывает пользовательскую схему, когда схему невозможно определить Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogSource -> (структура)

Указывает хранилище данных в Glue Data Catalog.

Имя -> (строка)

Имя хранилища данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

RedshiftSource -> (структура)

Указывает хранилище данных Amazon Redshift.

Имя -> (строка)

Имя хранилища данных Amazon Redshift.

База данных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

S3CatalogSource -> (структура)

Указывает хранилище данных Amazon S3 в Glue Data Catalog.

Имя -> (строка)

Имя хранилища данных.

База данных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

Предикат разбиения -> (строка)

Разделы, удовлетворяющие этому предикату, удаляются. Файлы в рамках периода хранения в этих разделах не удаляются. Установлено в "" – по умолчанию пусто.

Дополнительные параметры -> (структура)

Указывает дополнительные параметры подключения.

Ограниченный размер -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

Ограниченное количество файлов -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

S3CsvSource -> (структура)

Указывает хранилище данных со значениями, разделёнными запятыми (CSV), хранящееся в Amazon S3.

Name -> (строка)

Имя хранилища данных.

Paths -> (список)

Список путей к файлам Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает, как сжаты данные. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Exclusions -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера кластера. Если входных файлов меньше 50 000, необходимо установить "groupFiles" в "inPartition", чтобы это имело эффект.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, если вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку, если файлов более 50 000, установите этот параметр в "none".

Recurse -> (булево)

Если установлено в true, рекурсивно считывает файлы во всех подкаталогах по указанным путям.

MaxBand -> (целое число)

Этот параметр управляет продолжительностью (в миллисекундах), по истечении которой перечень файлов S3, скорее всего, будет согласован. Файлы с отметками времени модификации, попадающими в последние maxBand миллисекунд, отслеживаются особенно при использовании JobBookmarks для учёта неявной согласованности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию — 900000 миллисекунд, или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр указывает максимальное количество файлов, сохраняемых за последние maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

Separator -> (строка)

Указывает разделитель. По умолчанию это запятая: «,» но можно указать любой другой символ.

Escaper -> (строка)

Указывает символ для экранирования. Этот параметр используется только при чтении файлов CSV. Значение по умолчанию — none. Если включено, символ, следующий сразу после него, используется как есть, за исключением небольшого набора известных экранированных символов (\n, \r, \t и \0).

QuoteChar -> (строка)

Указывает символ для кавычек. По умолчанию это двойная кавычка: '"'. Установите это в -1, чтобы полностью отключить кавычки.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит экранированный символ новой строки. Этот параметр необходимо установить в True, если запись занимает несколько строк. Значение по умолчанию — False, что позволяет более агрессивно разбивать файлы во время разбора.

WithHeader -> (булево)

Булево значение, указывающее, считать ли первую строку заголовком. Значение по умолчанию — False.

WriteHeader -> (булево)

Булево значение, указывающее, нужно ли записать заголовок в выходные данные. Значение по умолчанию — True.

SkipFirst -> (булево)

Булево значение, указывающее, пропустить ли первую строку данных. Значение по умолчанию — False.

OptimizePerformance -> (булево)

Булево значение, указывающее, использовать ли усовершенствованный SIMD-читатель CSV вместе с столбцовыми форматами памяти Apache Arrow. Доступно только в версии Glue 3.0.

OutputSchemas -> (список)

Указывает схему данных для источника S3 CSV.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ExcelSource -> (структура)

Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.

Name -> (строка)

Имя источника данных S3 Excel.

Paths -> (список)

Пути S3, где расположены файлы Excel.

(строка)

CompressionType -> (строка)

Формат сжатия, используемый для файлов Excel.

Exclusions -> (список)

Шаблоны для исключения конкретных файлов или путей из обработки.

(строка)

GroupSize -> (строка)

Определяет размер групп файлов для пакетной обработки.

GroupFiles -> (строка)

Указывает, как файлы должны быть сгруппированы для обработки.

Recurse -> (булево)

Указывает, нужно ли рекурсивно обрабатывать подкаталоги.

MaxBand -> (целое число)

Максимальное количество используемых полос обработки.

MaxFilesInBand -> (целое число)

Максимальное количество файлов для обработки в каждой полосе.

AdditionalOptions -> (структура)

Дополнительные параметры конфигурации для прямой обработки источника S3.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

NumberRows -> (длинное целое)

Количество строк для обработки из каждого файла Excel.

SkipFooter -> (целое число)

Количество строк для пропуска в конце каждого файла Excel.

OutputSchemas -> (список)

Схемы AWS Glue, которые необходимо применить к обработанным данным.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3JsonSource -> (структура)

Указывает хранилище данных JSON, хранящееся в Amazon S3.

Name -> (строка)

Имя хранилища данных.

Paths -> (список)

Список путей к файлам Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает, как сжаты данные. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Exclusions -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера кластера. Если входных файлов меньше 50 000, необходимо установить "groupFiles" в "inPartition", чтобы это имело эффект.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, если вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку, если файлов более 50 000, установите этот параметр в "none".

Recurse -> (булево)

Если установлено в true, рекурсивно считывает файлы во всех подкаталогах по указанным путям.

MaxBand -> (целое число)

Этот параметр управляет продолжительностью (в миллисекундах), по истечении которой перечень файлов S3, скорее всего, будет согласован. Файлы с отметками времени модификации, попадающими в последние maxBand миллисекунд, отслеживаются особенно при использовании JobBookmarks для учёта неявной согласованности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию — 900000 миллисекунд, или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр указывает максимальное количество файлов, сохраняемых за последние maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

JsonPath -> (строка)

Строка JsonPath, определяющая данные JSON.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит экранированный символ новой строки. Этот параметр необходимо установить в True, если запись занимает несколько строк. Значение по умолчанию — False, что позволяет более агрессивно разбивать файлы во время разбора.

OutputSchemas -> (список)

Указывает схему данных для источника S3 JSON.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ParquetSource -> (структура)

Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ТипСжатия -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

РазмерГруппы -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда имеется менее 50 000 входных файлов, "groupFiles" должно быть установлено в "inPartition" для того, чтобы это стало эффективным.

ФайлыГруппы -> (строка)

Группировка файлов включена по умолчанию, когда вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку при наличии более 50 000 файлов, установите этот параметр в "none".

Рекурсивно -> (булево)

Если установлено в значение «true», рекурсивно считывает файлы во всех подкаталогах по указанным путям.

МаксПолоса -> (целое число)

Этот параметр управляет временем в миллисекундах, после которого перечисление s3, скорее всего, будет согласованным. Файлы с отметками времени последней модификации, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учета несинхронности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию значение составляет 900000 миллисекунд или 15 минут.

МаксФайловВПолосе -> (целое число)

Этот параметр задаёт максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

ДополнительныеПараметры -> (структура)

Указывает дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (длинное целое)

Устанавливает верхнюю границу целевого количества файлов, которые будут обработаны.

ВключитьОбразецПути -> (булево)

Устанавливает параметр для включения образца пути.

ОбразецПути -> (строка)

Если включено, указывает образец пути.

СхемыВывода -> (список)

Указывает схему данных для источника S3 Parquet.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ИсточникКаталогаОтношений -> (структура)

Указывает хранилище данных реляционного каталога в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

ИсточникКаталогаDynamoDB -> (структура)

Указывает хранилище данных DynamoDBC в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

JDBCConnectorTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

ВходныеДанные -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения, связанного с соединителем.

ТаблицаПодключения -> (строка)

Имя таблицы в целевом объекте данных.

ИмяСоединителя -> (строка)

Имя соединителя, который будет использоваться.

ТипПодключения -> (строка)

Тип подключения, такой как marketplace.jdbc или custom.jdbc, обозначающий подключение к целевому объекту JDBC.

ДополнительныеПараметры -> (массив)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для целевого объекта JDBC.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorTarget -> (структура)

Указывает целевой объект, использующий соединитель Apache Spark.

Имя -> (строка)

Имя целевого объекта данных.

ВходныеДанные -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения для соединителя Apache Spark.

ИмяСоединителя -> (строка)

Имя соединителя Apache Spark.

ТипПодключения -> (строка)

Тип подключения, например, marketplace.spark или custom.spark, обозначающий подключение к хранилищу данных Apache Spark.

ДополнительныеПараметры -> (массив)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для пользовательской Spark-цели.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogTarget -> (структура)

Указывает целевой объект, использующий таблицу каталога данных Glue.

Имя -> (строка)

Имя вашего целевого объекта данных.

ВходныеДанные -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

КлючиРазделения -> (список)

Ключи разделения, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.

(список)

(строка)

БазаДанных -> (строка)

База данных, содержащая таблицу, которую вы хотите использовать в качестве целевого объекта. Эта база данных должна уже существовать в каталоге.

Таблица -> (строка)

Таблица, определяющая схему ваших выходных данных. Эта таблица должна уже существовать в каталоге.

RedshiftTarget -> (структура)

Указывает целевой объект, использующий Amazon Redshift.

Имя -> (строка)

Имя целевого объекта данных.

ВходныеДанные -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

БазаДанных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где временные данные могут быть размещены при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

UpsertRedshiftOptions -> (структура)

Набор параметров для настройки операции upsert при записи в целевой объект Redshift.

РасположениеТаблицы -> (строка)

Физическое расположение таблицы Redshift.

ИмяПодключения -> (строка)

Имя подключения для записи в Redshift.

КлючиUpsert -> (список)

Ключи, используемые для определения того, следует ли выполнить обновление или вставку.

(строка)

S3CatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.

Имя -> (строка)

Имя целевого объекта данных.

ВходныеДанные -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

КлючиРазделения -> (список)

Указывает собственное разделение, используя последовательность ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

БазаДанных -> (строка)

Имя базы данных для записи.

ПолитикаИзмененияСхемы -> (структура)

Политика, которая определяет поведение обновления для извлекателя.

ВключитьОбновлениеКаталога -> (булево)

Нужно ли использовать указанное поведение обновления, когда извлекатель находит изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления при обнаружении извлекателем изменённой схемы.

S3GlueParquetTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

ВходныеДанные -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

КлючиРазделения -> (список)

Указывает собственное разделение, используя последовательность ключей.

(список)

(строка)

Путь -> (строка)

Один путь Amazon S3 для записи.

Сжатие -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

КоличествоЦелевыхРазделов -> (строка)

Указывает количество целевых разделов для файлов Parquet при записи в Amazon S3 с использованием AWS Glue.

ПолитикаИзмененияСхемы -> (структура)

Политика, которая определяет поведение обновления для извлекателя.

ВключитьОбновлениеКаталога -> (булево)

Нужно ли использовать указанное поведение обновления, когда извлекатель находит изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления при обнаружении извлекателем изменённой схемы.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3HyperDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.

Name -> (строка)

Уникальный идентификатор узла HyperDirect целевого узла.

Inputs -> (список)

Определяет источник входных данных для целевого узла HyperDirect.

(строка)

PartitionKeys -> (список)

Определяет стратегию разбиения выходных данных.

(список)

(строка)

Path -> (строка)

Расположение в S3, куда будут записаны выходные данные.

Compression -> (строка)

Тип сжатия, применяемый к выходным данным.

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы во время операций записи.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении измененной схемы.

Table -> (строка)

Таблица в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

База данных, к которой применяется политика изменения схемы.

S3DirectTarget -> (структура)

Указывает целевой объект данных, записывающий данные в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

PartitionKeys -> (список)

Определяет нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Path -> (строка)

Один путь в Amazon S3 для записи.

Compression -> (строка)

Указывает способ сжатия данных. Обычно это не нужно, если у данных есть стандартное расширение файла. Возможные значения — "gzip" и "bzip").

NumberTargetPartitions -> (строка)

Указывает количество целевых разбиений при записи данных непосредственно в Amazon S3.

Format -> (строка)

Указывает формат выходных данных для целевого объекта.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для обработчика.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении измененной схемы.

Table -> (строка)

Таблица в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

База данных, к которой применяется политика изменения схемы.

S3IcebergDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.

Name -> (строка)

Указывает уникальный идентификатор узла Iceberg в вашей цепочке обработки данных.

Inputs -> (список)

Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.

(строка)

PartitionKeys -> (список)

Определяет столбцы, используемые для разбиения данных таблицы Iceberg в S3.

(список)

(строка)

Path -> (строка)

Определяет расположение в S3, где будут храниться данные таблицы Iceberg.

Format -> (строка)

Указывает формат файла, используемый для хранения данных таблицы Iceberg (например, Parquet, ORC).

AdditionalOptions -> (карта)

Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении измененной схемы.

Table -> (строка)

Таблица в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

База данных, к которой применяется политика изменения схемы.

Compression -> (строка)

Указывает кодек сжатия, используемый для файлов таблицы Iceberg в S3.

NumberTargetPartitions -> (строка)

Устанавливает количество целевых разбиений для распределения файлов таблицы Iceberg по S3.

ApplyMapping -> (структура)

Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте данных. Можно переименовать ключи, изменить типы данных для ключей и выбрать, какие ключи нужно удалить из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Mapping -> (список)

Указывает отображение ключей свойств данных в источнике данных на ключи свойств данных в целевом объекте данных.

(структура)

Указывает отображение ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, как должно называться столбец. Может быть таким же, как FromPath.

FromPath -> (список)

Таблица или столбец, который нужно изменить.

(строка)

FromType -> (строка)

Тип данных, который нужно изменить.

ToType -> (строка)

Тип данных, на который нужно изменить.

Dropped -> (булево)

Если true, то столбец удаляется.

Children -> (список)

Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, но также и одного из её дочерних элементов, вы можете заполнить эту структуру данных. Она также Mapping , но её FromPath будет родительским FromPath плюс FromPath из этой структуры.

Предположим, у вас есть структура:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

Вы можете указать Mapping, который выглядит так:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

(структура)

Указывает отображение ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, как должно называться столбец. Может быть таким же, как FromPath.

FromPath -> (список)

Таблица или столбец, который нужно изменить.

(строка)

FromType -> (строка)

Тип данных, который нужно изменить.

ToType -> (строка)

Тип данных, на который нужно изменить.

Dropped -> (булево)

Если true, то столбец удаляется.

SelectFields -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите сохранить.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Paths -> (список)

JSON-путь к переменной в структуре данных.

(список)

(строка)

DropFields -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите удалить.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Paths -> (список)

JSON-путь к переменной в структуре данных.

(список)

(строка)

RenameField -> (структура)

Указывает преобразование, которое переименовывает один ключ свойства данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

SourcePath -> (список)

JSON-путь к переменной в структуре данных для исходных данных.

(строка)

TargetPath -> (список)

JSON-путь к переменной в структуре данных для целевых данных.

(строка)

Spigot -> (структура)

Указывает преобразование, которое записывает образцы данных в ведро Amazon S3.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Path -> (строка)

Путь в Amazon S3, куда преобразование запишет подмножество записей из набора данных в файл JSON в ведре Amazon S3.

Topk -> (целое)

Указывает количество записей, которые нужно записать, начиная с начала набора данных.

Prob -> (двойное)

Вероятность (десятичное значение с максимальным значением 1) выбора любой заданной записи. Значение 1 указывает, что каждая строка, считанная из набора данных, должна быть включена в выходной образец.

Join -> (структура)

Указывает преобразование, которое объединяет два набора данных в один набор данных с помощью сравнительного выражения по указанным ключам свойств данных. Можно использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

JoinType -> (строка)

Указывает тип объединения, выполняемого над наборами данных.

Columns -> (список)

Список двух столбцов, которые будут объединены.

(структура)

Указывает столбец, который будет объединен.

From -> (строка)

Столбец, который будет объединен.

Keys -> (список)

Ключ столбца, который будет объединен.

(список)

(строка)

SplitFields -> (структура)

Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames . Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных, и один с оставшимися ключами свойств данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Paths -> (список)

JSON-путь к переменной в структуре данных.

(список)

(строка)

SelectFromCollection -> (структура)

Указывает преобразование, которое выбирает один DynamicFrame из набора DynamicFrames. Выход — выбранный DynamicFrame.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Index -> (целое)

Индекс DynamicFrame для выбора.

FillMissingValues -> (структура)

Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определённым методом импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определённые по их именам узлов.

(строка)

ПутьИмпутации -> (строка)

JSON-путь к переменной в структуре данных набора данных, который подлежит импутации.

ПутьЗаполнения -> (строка)

JSON-путь к переменной в структуре данных набора данных, который подлежит заполнению.

Фильтр -> (структура)

Указывает преобразование, которое разделяет набор данных на два, основываясь на условии фильтрации.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определённые по их именам узлов.

(строка)

ЛогическийОператор -> (строка)

Оператор, используемый для фильтрации строк путём сравнения значения ключа со значением.

Фильтры -> (список)

Указывает выражение фильтра.

(структура)

Указывает выражение фильтра.

Операция -> (строка)

Тип операции, выполняемой в выражении.

Отрицание -> (булево)

Указывает, требуется ли отрицание выражения.

Значения -> (список)

Список значений фильтра.

(структура)

Представляет отдельную запись в списке значений для FilterExpression.

Тип -> (строка)

Тип значения фильтра.

Значение -> (список)

Значение, которое должно быть связано.

(строка)

ПользовательскийКод -> (структура)

Указывает преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Результатом является набор DynamicFrames.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определённые по их именам узлов.

(строка)

Код -> (строка)

Пользовательский код, используемый для преобразования данных.

ИмяКласса -> (строка)

Имя, определённое для класса узла пользовательского кода.

СхемыВывода -> (список)

Указывает схему данных для преобразования пользовательского кода.

(структура)

Указывает определяемую пользователем схему, когда схема не может быть определена Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkSQL -> (структура)

Указывает преобразование, где вы вводите SQL-запрос, используя синтаксис Spark SQL, для преобразования данных. Результатом является единственный DynamicFrame.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определённые по их именам узлов. Вы можете связать имя таблицы с каждым узлом ввода для использования в SQL-запросе. Выбранное имя должно соответствовать ограничениям именования Spark SQL.

(строка)

SqlQuery -> (строка)

SQL-запрос, который должен использовать синтаксис Spark SQL и возвращать один набор данных.

SqlAliases -> (список)

Список псевдонимов. Псевдоним позволяет указать, какое имя использовать в SQL для данного ввода. Например, у вас есть источник данных с именем «MyDataSource». Если вы указываете From как MyDataSource, и Alias как SqlName, то в вашем SQL можно сделать:

select * from SqlName

и это получит данные из MyDataSource.

(структура)

Представляет отдельную запись в списке значений для SqlAliases.

От -> (строка)

Таблица или столбец в таблице.

Псевдоним -> (строка)

Временное имя, присвоенное таблице или столбцу в таблице.

СхемыВывода -> (список)

Указывает схему данных для преобразования SparkSQL.

(структура)

Указывает определяемую пользователем схему, когда схема не может быть определена Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

DirectKinesisSource -> (структура)

Указывает прямой источник данных Amazon Kinesis.

Имя -> (строка)

Имя источника данных.

РазмерОкна -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

ОпределитьСхему -> (булево)

Автоматически ли определяется схема из входящих данных.

ПараметрыПотока -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

АдресСЕРВЕР -> (строка)

Адрес конечной точки Kinesis.

ИмяПотока -> (строка)

Имя потока данных Kinesis.

Классификация -> (строка)

Необязательная классификация.

Разделитель -> (строка)

Указывает символ разделителя.

НачальнаяПозиция -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest", "trim_horizon", "earliest" или строка метки времени в формате UTC в формате yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию — "latest".

Примечание. Использование значения, являющегося строкой метки времени в формате UTC, для «начальнойПозиции», поддерживается только для версии Glue 4.0 и выше.

МаксимальноеВремяОбработкиВМс -> (длинное целое)

Максимальное время, затрачиваемое исполнителем задач на чтение записей для текущей партии из потока данных Kinesis, заданное в миллисекундах (мс). Несколько GetRecords вызовов API могут быть выполнены в течение этого времени. Значение по умолчанию — 1000.

МаксимальноеКоличествоЗаписейНаРаздел -> (длинное целое)

Максимальное количество записей для извлечения на разбиение в потоке данных Kinesis за микропакет. Примечание: клиент может превысить этот лимит, если задача потоковой обработки уже прочитала дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратен MaxRecordPerRead. Значение по умолчанию — 100000.

МаксимальноеКоличествоЗаписейЗаЧтение -> (длинное целое)

Максимальное количество записей для извлечения из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию — 10000.

ДобавитьВремяПростояМеждуЧтениями -> (булево)

Добавляет задержку времени между двумя последовательными операциями getRecords. Значение по умолчанию — "False". Этот параметр настраивается только для версии Glue 2.0 и выше.

ВремяПростояМеждуЧтениямиВМс -> (длинное целое)

Минимальная задержка времени между двумя последовательными операциями getRecords, заданная в мс. Значение по умолчанию — 1000. Этот параметр настраивается только для версии Glue 2.0 и выше.

ИнтервалОписанияРазделов -> (длинное целое)

Минимальный интервал времени между двумя вызовами API ListShards для вашего скрипта, чтобы рассмотреть возможность перераспределения. Значение по умолчанию — 1s.

КоличествоПовторов -> (целое число)

Максимальное количество повторов для запросов API Kinesis Data Streams. Значение по умолчанию — 3.

ИнтервалПовтораВМс -> (длинное целое)

Период охлаждения (указанный в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию — 1000.

МаксимальныйИнтервалПовтораВМс -> (длинное целое)

Максимальный период охлаждения (указанный в мс) между двумя повторами вызова API Kinesis Data Streams. Значение по умолчанию — 10000.

ИзбегатьПустыхПакет -> (булево)

Избегает создания пустой задачи микропакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед запуском пакетной обработки. Значение по умолчанию — "False".

ArnПотока -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

ArnРоли -> (строка)

Amazon Resource Name (ARN) роли для принятия с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для операций описания или чтения записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется вместе с "awsSTSSessionName".

ИмяСеансаРоли -> (строка)

Идентификатор сеанса принятия роли с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется вместе с "awsSTSRoleARN".

ДобавитьМеткаВремениЗаписи -> (строка)

Когда этот параметр установлен в ‘true’, выходные данные данных будут содержать дополнительный столбец с именем «__src_timestamp», который указывает время получения соответствующей записи потоком. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

ВыводитьМетрикиЗадержкиПотребителя -> (строка)

Когда этот параметр установлен в ‘true’, для каждой партии он будет отображать метрики задержки между старейшей записью, полученной потоком, и временем её прихода в Glue в CloudWatch. Имя метрики — “glue.driver.streaming.maxConsumerLagInMs”. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

НачальнаяМеткаВремени -> (метка времени)

Метка времени записи в потоке данных Kinesis для начала чтения данных. Возможные значения — строка метки времени в формате UTC шаблона yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

ПараметрыПредварительногоПросмотраДанных -> (структура)

Дополнительные параметры для предварительного просмотра данных.

ВремяОпроса -> (длинное целое)

Время опроса в миллисекундах.

ПределОпросаЗаписей -> (длинное целое)

Предел количества опрошенных записей.

DirectKafkaSource -> (структура)

Указывает хранилище данных Apache Kafka.

Name -> (строка)

Имя хранилища данных.

StreamingOptions -> (структура)

Указывает параметры потоковой передачи.

BootstrapServers -> (строка)

Список адресов серверов загрузки, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения — "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя подключения.

TopicName -> (строка)

Имя темы, указанное в Apache Kafka. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретный TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярного выражения, определяющая список тем для подписки. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделительный символ.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения — "earliest" или "latest". Значение по умолчанию — "latest".

EndingOffsets -> (строка)

Конечная точка, когда пакетный запрос завершается. Возможные значения — либо "latest", либо строка JSON, которая указывает конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (длинное целое)

Таймаут в миллисекундах для получения данных из Kafka в исполнителях задач Spark. Значение по умолчанию — 512.

NumRetries -> (целое число)

Количество попыток повторной попытки перед отказом в получении смещений Kafka. Значение по умолчанию — 3.

RetryIntervalMs -> (длинное целое)

Время в миллисекундах ожидания перед повторной попыткой получения смещений Kafka. Значение по умолчанию — 10.

MaxOffsetsPerTrigger -> (длинное целое)

Лимитирующая скорость на максимальное количество смещений, обрабатываемых за интервал триггера. Указанное общее количество смещений пропорционально разделяется между topicPartitions разных объёмов. Значение по умолчанию — null, что означает, что потребитель считывает все смещения до известного последнего смещения.

MinPartitions -> (целое число)

Желаемое минимальное количество разделов для чтения из Kafka. Значение по умолчанию — null, что означает, что количество партиций Spark равно количеству партиций Kafka.

IncludeHeaders -> (логическое)

Включать ли заголовки Kafka. При значении «true» выходные данные данных будут содержать дополнительный столбец под названием «glue_streaming_kafka_headers» с типом Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в Glue версии 3.0 и выше.

AddRecordTimestamp -> (строка)

При значении «true» выходные данные данных будут содержать дополнительный столбец под названием «__src_timestamp», который указывает время, когда соответствующий записной получил тему. Значение по умолчанию — «false». Этот параметр поддерживается в Glue версии 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При значении «true» для каждой партии будут выводиться метрики для периода между старейшим полученным сообщением темы и временем его прибытия в Glue в CloudWatch. Название метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — «false». Этот параметр поддерживается в Glue версии 4.0 и выше.

StartingTimestamp -> (маркер времени)

Маркер времени записи в теме Kafka, с которой начать чтение данных. Возможные значения — строка маркер времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).

Должен быть установлен только один из StartingTimestamp или StartingOffsets.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (логическое)

Автоматически определять схему из поступающих данных.

DataPreviewOptions -> (структура)

Указывает параметры, связанные с предварительным просмотром данных для просмотра образца ваших данных.

PollingTime -> (длинное целое)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое)

Лимит количества опрошенных записей.

CatalogKinesisSource -> (структура)

Указывает источник данных Kinesis в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (логическое)

Автоматически определять схему из поступающих данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL конечной точки Kinesis.

StreamName -> (строка)

Имя потока данных Kinesis.

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделительный символ.

StartingPosition -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest", "trim_horizon", "earliest" или строка маркер времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию — "latest".

Примечание: Использование значения, являющегося строкой маркер времени в формате UTC для «startingPosition», поддерживается только для Glue версии 4.0 и выше.

MaxFetchTimeInMs -> (длинное целое)

Максимальное время, потраченное исполнителем задачи для чтения записей текущей партии из потока данных Kinesis, указанное в миллисекундах (мс). Несколько GetRecords вызовов API могут быть выполнены в течение этого времени. Значение по умолчанию — 1000.

MaxFetchRecordsPerShard -> (длинное целое)

Максимальное количество записей для извлечения на каждый раздел в потоке данных Kinesis за микропакет. Примечание: клиент может превысить этот лимит, если задача потоковой передачи уже прочитала дополнительные записи из Kinesis (в одном и том же вызове get-records). Если MaxFetchRecordsPerShard должна быть строгой, то она должна быть кратной MaxRecordPerRead. Значение по умолчанию — 100000.

MaxRecordPerRead -> (длинное целое)

Максимальное количество записей для извлечения из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию — 10000.

AddIdleTimeBetweenReads -> (логическое)

Добавляет временную задержку между двумя последовательными операциями getRecords. Значение по умолчанию — "False". Этот параметр настраивается только для Glue версии 2.0 и выше.

IdleTimeBetweenReadsInMs -> (длинное целое)

Минимальная временная задержка между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию — 1000. Этот параметр настраивается только для Glue версии 2.0 и выше.

DescribeShardInterval -> (длинное целое)

Минимальный интервал времени между двумя вызовами API ListShards для вашего скрипта, чтобы рассмотреть возможность решардинга. Значение по умолчанию — 1s.

NumRetries -> (целое число)

Максимальное количество повторных попыток для запросов API Kinesis Data Streams. Значение по умолчанию — 3.

RetryIntervalMs -> (длинное целое)

Период охлаждения (указанный в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию — 1000.

MaxRetryIntervalMs -> (длинное целое)

Максимальный период охлаждения (указанный в мс) между двумя повторными попытками вызова API Kinesis Data Streams. Значение по умолчанию — 10000.

AvoidEmptyBatches -> (логическое)

Избегает создания пустых партий задач, проверяя наличие непрочитанных данных в потоке данных Kinesis перед началом партии. Значение по умолчанию — "False".

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли для предположения с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для описания или чтения записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется вместе с "awsSTSSessionName".

RoleSessionName -> (строка)

Идентификатор сеанса, предполагающего роль с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется вместе с "awsSTSRoleARN".

AddRecordTimestamp -> (строка)

При значении «true» выходные данные данных будут содержать дополнительный столбец под названием «__src_timestamp», который указывает время, когда соответствующая запись получила поток. Значение по умолчанию — «false». Этот параметр поддерживается в Glue версии 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При значении «true» для каждой партии будут выводиться метрики для периода между старейшей полученной записью потока и временем её прибытия в Glue в CloudWatch. Название метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — «false». Этот параметр поддерживается в Glue версии 4.0 и выше.

StartingTimestamp -> (маркер времени)

Маркер времени записи в потоке данных Kinesis, с которой начать чтение данных. Возможные значения — строка маркер времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

PollingTime -> (длинное целое)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое)

Лимит количества опрошенных записей.

CatalogKafkaSource -> (структура)

Указывает хранилище данных Apache Kafka в каталоге данных.

Name -> (строка)

Имя хранилища данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (логическое значение)

Автоматически определять схему из входящих данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Указывает параметры потоковой обработки.

BootstrapServers -> (строка)

Список адресов серверов Bootstrap, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения — "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя соединения.

TopicName -> (строка)

Имя темы, как указано в Apache Kafka. Вы должны указать как минимум один из "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретный TopicPartitions для потребления. Вы должны указать как минимум один из "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярного выражения, которая идентифицирует список тем для подписки. Вы должны указать как минимум один из "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения — "earliest" или "latest". Значение по умолчанию — "latest".

EndingOffsets -> (строка)

Конечная точка, когда запрос пакетной обработки завершается. Возможные значения — либо "latest", либо строка JSON, которая указывает конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (длинное целое число)

Таймаут в миллисекундах для получения данных из Kafka в исполнителях задач Spark. Значение по умолчанию — 512.

NumRetries -> (целое число)

Количество попыток повторного получения офсетов Kafka перед отказом. Значение по умолчанию — 3.

RetryIntervalMs -> (длинное целое число)

Время в миллисекундах ожидания перед повторной попыткой получения офсетов Kafka. Значение по умолчанию — 10.

MaxOffsetsPerTrigger -> (длинное целое число)

Предельная скорость максимального количества офсетов, обрабатываемых за интервал срабатывания. Указанное общее количество офсетов пропорционально распределяется по topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель читает все офсеты до последнего известного.

MinPartitions -> (целое число)

Желаемое минимальное количество партиций для чтения из Kafka. Значение по умолчанию — null, что означает, что количество партиций Spark равно количеству партиций Kafka.

IncludeHeaders -> (логическое значение)

Включать ли заголовки Kafka. При значении “true” вывод данных будет содержать дополнительный столбец с именем “glue_streaming_kafka_headers” типа Array[Struct(key: String, value: String)]. Значение по умолчанию — “false”. Этот параметр доступен только в версии Glue 3.0 и выше.

AddRecordTimestamp -> (строка)

При значении ‘true’ вывод данных будет содержать дополнительный столбец с именем “__src_timestamp”, который указывает время получения соответствующего сообщения темой. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При значении ‘true’, для каждого пакета, он будет отображать метрики продолжительности между самым старым сообщением, полученным темой, и временем его прибытия в Glue в CloudWatch. Имя метрики — “glue.driver.streaming.maxConsumerLagInMs”. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (временная метка)

Временная метка сообщения в теме Kafka, с которой начинается чтение данных. Возможные значения — строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

Только один из StartingTimestamp или StartingOffsets должен быть установлен.

DataPreviewOptions -> (структура)

Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.

PollingTime -> (длинное целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое число)

Предел количества опрошенных сообщений.

DropNullFields -> (структура)

Указывает преобразование, которое удаляет столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, которые являются “null”, целые числа -1 или другие заполнитель, такие как нули, автоматически не распознаются как null.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Данные входов, идентифицированные по их именам узлов.

(строка)

NullCheckBoxList -> (структура)

Структура, которая представляет, распознаются ли определенные значения как нулевые значения для удаления.

IsEmpty -> (логическое значение)

Указывает, что пустая строка рассматривается как нулевое значение.

IsNullString -> (логическое значение)

Указывает, что значение, записывающее слово ‘null’, рассматривается как нулевое значение.

IsNegOne -> (логическое значение)

Указывает, что целое число -1 рассматривается как нулевое значение.

NullTextList -> (список)

Структура, которая указывает список NullValueField-структур, представляющих пользовательское нулевое значение, такое как ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.

Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение заполнителя нуля и тип данных совпадают с данными.

(структура)

Представляет пользовательское нулевое значение, такое как ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.

Value -> (строка)

Значение заполнителя null.

Datatype -> (структура)

Тип данных значения.

Id -> (строка)

Тип данных значения.

Label -> (строка)

Метка, присвоенная типу данных.

Merge -> (структура)

Указывает преобразование, которое объединяет DynamicFrame с эталонным DynamicFrame на основе указанных первичных ключей для идентификации записей. Дубликаты записей (записи с одинаковыми первичными ключами) не удаляются.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Данные входов, идентифицированные по их именам узлов.

(строка)

Source -> (строка)

Источник DynamicFrame, который будет объединен с эталонным DynamicFrame.

PrimaryKeys -> (список)

Список полей первичного ключа для сопоставления записей из исходной и эталонной динамических фреймов.

(список)

(строка)

Union -> (структура)

Указывает преобразование, которое объединяет строки из двух или более наборов данных в один результат.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узлов ID в преобразование.

(строка)

UnionType -> (строка)

Указывает тип преобразования Union.

Укажите ALL, чтобы объединить все строки из источников данных в результирующий DynamicFrame. Результирующее объединение не удаляет дублирующие строки.

Укажите DISTINCT, чтобы удалить дублирующие строки в результирующем DynamicFrame.

PIIDetection -> (структура)

Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узлов ID в преобразование.

(строка)

PiiType -> (строка)

Указывает тип преобразования PIIDetection.

EntityTypesToDetect -> (список)

Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.

Типы сущностей PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE

(строка)

OutputColumnName -> (строка)

Указывает имя выходного столбца, который будет содержать любой тип сущности, обнаруженный в этой строке.

SampleFraction -> (двойное число)

Указывает долю данных для выборки при сканировании на сущности PII.

ThresholdFraction -> (двойное число)

Указывает долю данных, которая должна быть соблюдена для того, чтобы столбец был идентифицирован как данные PII.

MaskValue -> (строка)

Указывает значение, которое заменит обнаруженную сущность.

Aggregate -> (структура)

Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по указанной функции.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Указывает поля и строки, которые будут использоваться в качестве входов для преобразования агрегирования.

(строка)

Groups -> (список)

Указывает поля для группировки.

(список)

(строка)

Aggs -> (список)

Указывает агрегирующие функции, которые будут выполняться для указанных полей.

(структура)

Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании агрегирования.

Column -> (список)

Указывает столбец в наборе данных, к которому будет применена функция агрегирования.

(строка)

AggFunc -> (строка)

Указывает функцию агрегирования, которая должна быть применена.

Возможные функции агрегирования включают: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

DropDuplicates -> (структура)

Указывает преобразование, которое удаляет строки с повторяющимися данными из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Данные входов, идентифицированные по их именам узлов.

(строка)

Columns -> (список)

Имя столбцов для объединения или удаления при повторении.

(список)

(строка)

GovernedCatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в управляемый каталог.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными данными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных, в которую нужно записать.

Database -> (строка)

Имя базы данных, в которую нужно записать.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для управляемого каталога.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда программа-робот обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение при обновлении, когда программа-робот находит изменённую схему.

GovernedCatalogSource -> (структура)

Указывает источник данных в управляемом каталоге данных.

Name -> (строка)

Имя хранилища данных.

Database -> (строка)

База данных для чтения.

Table -> (строка)

Таблица базы данных для чтения.

PartitionPredicate -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разбиениях не удаляются. Установлено в "" – по умолчанию пусто.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

MicrosoftSQLServerCatalogSource -> (структура)

Указывает источник данных Microsoft SQL Server в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MySQLCatalogSource -> (структура)

Указывает источник данных MySQL в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

OracleSQLCatalogSource -> (структура)

Указывает источник данных Oracle в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

PostgreSQLCatalogSource -> (структура)

Указывает источник данных PostgresSQL в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MicrosoftSQLServerCatalogTarget -> (структура)

Указывает целевой объект, использующий Microsoft SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными данными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

MySQLCatalogTarget -> (структура)

Указывает целевой объект, использующий MySQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными данными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

OracleSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Oracle SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными данными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

PostgreSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Postgres SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными данными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

DynamicTransform -> (структура)

Указывает пользовательский визуальный трансформирование, созданный пользователем.

Name -> (строка)

Указывает имя динамического преобразования.

TransformName -> (строка)

Указывает имя динамического преобразования, как оно отображается в визуальном редакторе Glue Studio.

Inputs -> (список)

Указывает входные данные для динамического преобразования, которые требуются.

(строка)

Parameters -> (список)

Указывает параметры динамического преобразования.

(структура)

Указывает параметры в файле конфигурации динамического преобразования.

Name -> (строка)

Указывает имя параметра в файле конфигурации динамического преобразования.

Type -> (строка)

Указывает тип параметра в файле конфигурации динамического преобразования.

ValidationRule -> (строка)

Указывает правило проверки в файле конфигурации динамического преобразования.

ValidationMessage -> (строка)

Указывает сообщение проверки в файле конфигурации динамического преобразования.

Value -> (список)

Указывает значение параметра в файле конфигурации динамического преобразования.

(строка)

ListType -> (строка)

Указывает тип списка параметра в файле конфигурации динамического преобразования.

IsOptional -> (булево)

Указывает, является ли параметр необязательным или нет в файле конфигурации динамического преобразования.

FunctionName -> (строка)

Указывает имя функции динамического преобразования.

Path -> (строка)

Указывает путь к исходным файлам и файлам конфигурации динамического преобразования.

Version -> (строка)

Это поле не используется и будет устаревшим в будущих выпусках.

OutputSchemas -> (список)

Указывает схему данных для динамического преобразования.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

EvaluateDataQuality -> (структура)

Указывает критерии оценки качества ваших данных.

Name -> (строка)

Имя оценки качества данных.

Inputs -> (список)

Входы вашей оценки качества данных.

(строка)

Ruleset -> (строка)

Набор правил для оценки качества данных.

Output -> (строка)

Вывод вашей оценки качества данных.

PublishingOptions -> (структура)

Параметры для настройки публикации ваших результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

StopJobOnFailureOptions -> (структура)

Параметры для настройки остановки задачи в случае неудачи оценки качества данных.

StopJobOnFailureTiming -> (строка)

Когда остановить задачу в случае неудачи оценки качества данных. Доступные варианты: Immediate или AfterDataLoad.

S3CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiSource -> (структура)

Указывает источник данных Hudi, хранящийся в Amazon S3.

Name -> (строка)

Имя источника Hudi.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalHudiOptions -> (словарь)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Указывает дополнительные параметры для коннектора.

BoundedSize -> (длинное целое число)

Устанавливает максимальный размер нацеливаемого набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое число)

Устанавливает максимальное количество файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения пути выборки.

SamplePath -> (строка)

Если включено, указывает путь выборки.

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiCatalogTarget -> (структура)

Указывает целевой объект для записи в источник данных Hudi в Glue Data Catalog.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (словарь)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для извлекателя.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда извлекатель находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда извлекатель находит изменённую схему.

S3HudiDirectTarget -> (структура)

Указывает целевой объект для записи в источник данных Hudi в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Path -> (строка)

Путь Amazon S3 вашего источника данных Hudi для записи.

Compression -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip").

NumberTargetPartitions -> (строка)

Указывает количество целевых разбиений для распределения файлов набора данных Hudi по Amazon S3.

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Format -> (строка)

Указывает формат выходных данных для целевого объекта.

AdditionalOptions -> (словарь)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для извлекателя.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда извлекатель находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда извлекатель находит изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

DirectJDBCSource -> (структура)

Указывает прямое подключение JDBC-источника.

Name -> (строка)

Имя подключения JDBC-источника.

Database -> (строка)

База данных подключения JDBC-источника.

Table -> (строка)

Таблица подключения JDBC-источника.

ConnectionName -> (строка)

Имя соединения JDBC-источника.

ConnectionType -> (строка)

Тип соединения JDBC-источника.

RedshiftTmpDir -> (строка)

Временная директория JDBC-источника Redshift.

S3CatalogDeltaSource -> (структура)

Указывает источник данных Delta Lake, зарегистрированный в Glue Data Catalog. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (словарь)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Delta Lake.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogDeltaSource -> (структура)

Указывает источник данных Delta Lake, зарегистрированный в Glue Data Catalog.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (словарь)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Delta Lake.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaSource -> (структура)

Указывает источник данных Delta Lake, хранящийся в Amazon S3.

Name -> (строка)

Имя источника Delta Lake.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalDeltaOptions -> (словарь)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Указывает дополнительные параметры для коннектора.

BoundedSize -> (длинное целое число)

Устанавливает максимальный размер нацеливаемого набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое число)

Устанавливает максимальное количество файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения пути выборки.

SamplePath -> (строка)

Если включено, указывает путь выборки.

OutputSchemas -> (список)

Указывает схему данных для источника Delta Lake.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaCatalogTarget -> (структура)

Указывает целевой объект для записи в источник данных Delta Lake в Glue Data Catalog.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (словарь)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для извлекателя.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда извлекатель находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда извлекатель находит изменённую схему.

S3DeltaDirectTarget -> (структура)

Указывает целевой объект, который записывает данные в источник Delta Lake в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Путь -> (строка)

Путь Amazon S3 для вашего источника данных Delta Lake, в который нужно записать данные.

Сжатие -> (строка)

Указывает способ сжатия данных. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

ЧислоЦелевыхРазбиений -> (строка)

Указывает количество целевых разбиений для распределения файлов набора данных Delta Lake по Amazon S3.

Формат -> (строка)

Указывает формат выходных данных для целевого объекта.

ДополнительныеПараметры -> (карта)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

ПолитикаИзмененияСхемы -> (структура)

Политика, определяющая поведение обновления для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда ползунок обнаруживает измененную схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда ползунок обнаруживает измененную схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

AmazonRedshiftSource -> (структура)

Указывает целевой объект, который записывает данные в источник данных в Amazon Redshift.

Имя -> (строка)

Имя источника Amazon Redshift.

Данные -> (структура)

Указывает данные узла источника Amazon Reshift.

ТипДоступа -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

ТипИсточника -> (строка)

Тип источника, чтобы указать, является ли определенная таблица источником или пользовательским запросом.

Подключение -> (структура)

Подключение Glue к кластеру Redshift.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

БазаДанныхКаталога -> (структура)

Имя базы данных каталога данных Glue при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ТаблицаКаталога -> (структура)

Имя таблицы каталога данных Glue при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

СхемаRedshiftКаталога -> (строка)

Имя схемы Redshift при работе с каталогом данных.

ТаблицаRedshiftКаталога -> (строка)

Таблица базы данных для чтения.

ВременнаяДиректория -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

РольIam -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Роль IAM по умолчанию — роль в задаче, если она не указана.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ДополнительныеПараметры -> (список)

Дополнительные значения при подключении к кластеру Redshift.

(структура)

Указывает дополнительное значение при подключении к кластеру Redshift.

Ключ -> (строка)

Ключ для дополнительного параметра подключения.

Значение -> (строка)

Значение для дополнительного параметра подключения.

ПримерЗапроса -> (строка)

SQL, используемый для извлечения данных из источника Redshift, когда тип источника — ‘запрос’.

ДействиеДо -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

ДействиеПосле -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Действие -> (строка)

Указывает способ записи в кластер Redshift.

ПрефиксТаблицы -> (строка)

Указывает префикс к таблице.

Upsert -> (булево)

Действие, применяемое к Redshift-пунктам назначения при выполнении APPEND.

ДействиеMerge -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-пункте назначения.

MergeWhenMatched -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-пункте назначения, когда существующая запись соответствует новой записи.

MergeWhenNotMatched -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-пункте назначения, когда существующая запись не соответствует новой записи.

ОператорMerge -> (строка)

SQL, используемый в пользовательском merge для обработки совпадающих записей.

ПодключениеПолзунка -> (строка)

Указывает имя подключения, связанное с таблицей каталога.

СхемаТаблицы -> (список)

Массив выходных схем для данного узла.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ТаблицаЭтапирования -> (строка)

Имя временной таблицы этапирования, используемой при MERGE или APPEND с upsert.

ВыбранныеСтолбцы -> (список)

Список имен столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

AmazonRedshiftTarget -> (структура)

Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.

Name -> (строка)

Имя целевого объекта Amazon Redshift.

Data -> (структура)

Указывает данные узла целевого объекта Amazon Redshift.

AccessType -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

SourceType -> (строка)

Тип источника для указания, является ли определенная таблица источником или это пользовательский запрос.

Connection -> (структура)

Подключение Glue к кластеру Redshift.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Table -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogDatabase -> (структура)

Имя базы данных каталога данных Glue при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogTable -> (структура)

Имя таблицы каталога данных Glue при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogRedshiftSchema -> (строка)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (строка)

Таблица базы данных для чтения.

TempDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

IamRole -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. При оставлении пустым, роль IAM по умолчанию будет ролью задания.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdvancedOptions -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Key -> (строка)

Ключ дополнительного параметра подключения.

Value -> (строка)

Значение дополнительного параметра подключения.

SampleQuery -> (строка)

SQL, используемый для извлечения данных из источника Redshift, когда SourceType равен ‘query’.

PreAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

PostAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Action -> (строка)

Указывает способ записи в кластер Redshift.

TablePrefix -> (строка)

Указывает префикс к таблице.

Upsert -> (булево)

Действие, используемое в Redshift-целях при выполнении APPEND.

MergeAction -> (строка)

Действие, используемое для определения, как будет обрабатываться MERGE в целевом Redshift при выполнении upsert.

MergeWhenMatched -> (строка)

Действие, используемое для определения, как будет обрабатываться MERGE в целевом Redshift при совпадении существующей записи с новой записью.

MergeWhenNotMatched -> (строка)

Действие, используемое для определения, как будет обрабатываться MERGE в целевом Redshift, когда существующая запись не соответствует новой записи.

MergeClause -> (строка)

SQL, используемый в пользовательском MERGE для обработки совпадающих записей.

CrawlerConnection -> (строка)

Указывает имя подключения, связанное с таблицей каталога.

TableSchema -> (список)

Массив выходных схем для данного узла.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

StagingTable -> (строка)

Имя временной таблицы подготовки, используемой при MERGE или APPEND с upsert.

SelectedColumns -> (список)

Список имен столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

EvaluateDataQualityMultiFrame -> (структура)

Указывает критерии оценки качества данных. Позволяет использовать несколько входных данных и возвращает набор динамических кадров.

Name -> (строка)

Имя оценки качества данных.

Inputs -> (список)

Входы для оценки качества данных. Первый вход в этом списке — основной источник данных.

(строка)

AdditionalDataSources -> (карта)

Псевдонимы всех источников данных, кроме основного.

key -> (строка)

value -> (строка)

Ruleset -> (строка)

Набор правил для оценки качества данных.

PublishingOptions -> (структура)

Параметры настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

AdditionalOptions -> (карта)

Параметры для настройки поведения преобразования во время выполнения.

key -> (строка)

value -> (строка)

StopJobOnFailureOptions -> (структура)

Параметры для настройки того, как задание будет остановлено, если оценка качества данных завершится неудачно.

StopJobOnFailureTiming -> (строка)

Когда останавливать задание, если оценка качества данных завершится неудачно. Варианты: Immediate или AfterDataLoad.

Recipe -> (структура)

Указывает узел рецепта Glue DataBrew.

Name -> (строка)

Имя узла Glue Studio.

Inputs -> (список)

Узлы, являющиеся входами для узла рецепта, определенные по идентификатору.

(строка)

RecipeReference -> (структура)

Ссылка на рецепт DataBrew, используемый узлом.

RecipeArn -> (строка)

ARN рецепта DataBrew.

RecipeVersion -> (строка)

Версия Recipe рецепта DataBrew.

RecipeSteps -> (список)

Шаги преобразования, используемые в узле рецепта.

(структура)

Шаг рецепта, используемый в узле подготовки данных рецепта Glue Studio.

Action -> (структура)

Действие преобразования шага рецепта.

Operation -> (строка)

Операция действия рецепта.

Parameters -> (карта)

Параметры действия рецепта.

key -> (строка)

value -> (строка)

ConditionExpressions -> (список)

Условные выражения для шага рецепта.

(структура)

Условное выражение, определенное в узле подготовки данных рецепта Glue Studio.

Condition -> (строка)

Условие условного выражения.

Value -> (строка)

Значение условного выражения.

TargetColumn -> (строка)

Целевой столбец условных выражений.

SnowflakeSource -> (структура)

Указывает источник данных Snowflake.

Name -> (строка)

Имя источника данных Snowflake.

Data -> (структура)

Настройка источника данных Snowflake.

SourceType -> (строка)

Определяет, как задаются извлечённые данные. Допустимые значения: "table" , "query" .

Connection -> (структура)

Указывает подключение Glue Data Catalog к узлу Snowflake.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (строка)

Указывает схему базы данных Snowflake для использования узлом.

Table -> (строка)

Указывает таблицу Snowflake для использования узлом.

Database -> (строка)

Указывает базу данных Snowflake для использования узлом.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdditionalOptions -> (карта)

Указывает дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны в другом месте в этом узле, они будут иметь приоритет.

key -> (строка)

value -> (строка)

SampleQuery -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

PreAction -> (строка)

Строка SQL, выполняемая перед тем, как коннектор Snowflake выполнит свои стандартные действия.

PostAction -> (строка)

Строка SQL, выполняемая после того, как коннектор Snowflake выполнит свои стандартные действия.

Action -> (строка)

Указывает действие, которое нужно выполнить при записи в таблицу с уже существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Action равен append . Указывает поведение разрешения, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

MergeAction -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .

MergeWhenMatched -> (строка)

Указывает, как разрешить записи, соответствующие существующим данным при слиянии. Допустимые значения: update , delete .

MergeWhenNotMatched -> (строка)

Указывает, как обработать записи, которые не соответствуют существующим данным при слиянии. Допустимые значения: insert , none .

MergeClause -> (строка)

SQL-запрос, определяющий пользовательское поведение слияния.

StagingTable -> (строка)

Имя временной таблицы, используемой при выполнении действий merge или upsert append. Данные записываются в эту таблицу, затем перемещаются в таблицу table с помощью сгенерированного postaction.

SelectedColumns -> (список)

Указывает столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description. Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AutoPushdown -> (булево)

Указывает, включена ли автоматическая протаскивание запросов. Если протаскивание включено, то при выполнении запроса на Spark, если часть запроса может быть "протащена" на сервер Snowflake, она протаскивается. Это повышает производительность некоторых запросов.

TableSchema -> (список)

Вручную определяет целевую схему для узла. Список структур с ключами value , label и description. Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

OutputSchemas -> (список)

Указывает пользовательские схемы для выходных данных.

(структура)

Указывает пользовательскую схему, когда схема не может быть определена Glue.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SnowflakeTarget -> (структура)

Указывает целевой объект для записи в источник данных Snowflake.

Name -> (строка)

Имя целевого объекта Snowflake.

Data -> (структура)

Указывает данные целевого узла Snowflake.

SourceType -> (строка)

Определяет, как задаются извлечённые данные. Допустимые значения: "table" , "query" .

Connection -> (структура)

Указывает подключение Glue Data Catalog к узлу Snowflake.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (строка)

Указывает схему базы данных Snowflake для использования узлом.

Table -> (строка)

Указывает таблицу Snowflake для использования узлом.

Database -> (строка)

Указывает базу данных Snowflake для использования узлом.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdditionalOptions -> (карта)

Указывает дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны в другом месте в этом узле, они будут иметь приоритет.

key -> (строка)

value -> (строка)

SampleQuery -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

PreAction -> (строка)

Строка SQL, выполняемая перед тем, как коннектор Snowflake выполнит свои стандартные действия.

PostAction -> (строка)

Строка SQL, выполняемая после того, как коннектор Snowflake выполнит свои стандартные действия.

Action -> (строка)

Указывает действие, которое нужно выполнить при записи в таблицу с уже существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Action равен append . Указывает поведение разрешения, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

MergeAction -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .

MergeWhenMatched -> (строка)

Указывает, как разрешить записи, соответствующие существующим данным при слиянии. Допустимые значения: update , delete .

MergeWhenNotMatched -> (строка)

Указывает, как обработать записи, которые не соответствуют существующим данным при слиянии. Допустимые значения: insert , none .

MergeClause -> (строка)

SQL-запрос, определяющий пользовательское поведение слияния.

StagingTable -> (строка)

Имя временной таблицы, используемой при выполнении действий merge или upsert append. Данные записываются в эту таблицу, затем перемещаются в таблицу table с помощью сгенерированного postaction.

SelectedColumns -> (список)

Указывает столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description. Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AutoPushdown -> (булево)

Указывает, включена ли автоматическая протаскивание запросов. Если протаскивание включено, то при выполнении запроса на Spark, если часть запроса может быть "протащена" на сервер Snowflake, она протаскивается. Это повышает производительность некоторых запросов.

TableSchema -> (список)

Вручную определяет целевую схему для узла. Список структур с ключами value , label и description. Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, которые являются входами в целевой объект данных.

(строка)

ConnectorDataSource -> (структура)

Указывает на источник, сгенерированный со стандартными параметрами подключения.

Name -> (string)

Имя этого узла источника.

ConnectionType -> (string)

connectionType, предоставленные библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (map)

Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе Параметры подключения в документации Glue.

key -> (string)

value -> (string)

OutputSchemas -> (list)

Указывает схему данных для этого источника.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (list)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (string)

Имя столбца в схеме Glue Studio.

Type -> (string)

Тип Hive для этого столбца в схеме Glue Studio.

ConnectorDataTarget -> (structure)

Указывает целевой объект, сгенерированный со стандартными параметрами подключения.

Name -> (string)

Имя этого узла целевого объекта.

ConnectionType -> (string)

connectionType, предоставленные библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (map)

Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе Параметры подключения в документации Glue.

key -> (string)

value -> (string)

Inputs -> (list)

Узлы, являющиеся входами в целевой объект данных.

(string)

JSON Синтаксис:

{"string": {
      "AthenaConnectorSource": {
        "Name": "string",
        "ConnectionName": "string",
        "ConnectorName": "string",
        "ConnectionType": "string",
        "ConnectionTable": "string",
        "SchemaName": "string",
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "JDBCConnectorSource": {
        "Name": "string",
        "ConnectionName": "string",
        "ConnectorName": "string",
        "ConnectionType": "string",
        "AdditionalOptions": {
          "FilterPredicate": "string",
          "PartitionColumn": "string",
          "LowerBound": long,
          "UpperBound": long,
          "NumPartitions": long,
          "JobBookmarkKeys": ["string", ...],
          "JobBookmarkKeysSortOrder": "string",
          "DataTypeMapping": {"ARRAY"|"BIGINT"|"BINARY"|"BIT"|"BLOB"|"BOOLEAN"|"CHAR"|"CLOB"|"DATALINK"|"DATE"|"DECIMAL"|"DISTINCT"|"DOUBLE"|"FLOAT"|"INTEGER"|"JAVA_OBJECT"|"LONGNVARCHAR"|"LONGVARBINARY"|"LONGVARCHAR"|"NCHAR"|"NCLOB"|"NULL"|"NUMERIC"|"NVARCHAR"|"OTHER"|"REAL"|"REF"|"REF_CURSOR"|"ROWID"|"SMALLINT"|"SQLXML"|"STRUCT"|"TIME"|"TIME_WITH_TIMEZONE"|"TIMESTAMP"|"TIMESTAMP_WITH_TIMEZONE"|"TINYINT"|"VARBINARY"|"VARCHAR": "DATE"|"STRING"|"TIMESTAMP"|"INT"|"FLOAT"|"LONG"|"BIGDECIMAL"|"BYTE"|"SHORT"|"DOUBLE"
            ...}
        },
        "ConnectionTable": "string",
        "Query": "string",
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "SparkConnectorSource": {
        "Name": "string",
        "ConnectionName": "string",
        "ConnectorName": "string",
        "ConnectionType": "string",
        "AdditionalOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "CatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "RedshiftSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "RedshiftTmpDir": "string",
        "TmpDirIAMRole": "string"
      },
      "S3CatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "PartitionPredicate": "string",
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long
        }
      },
      "S3CsvSource": {
        "Name": "string",
        "Paths": ["string", ...],
        "CompressionType": "gzip"|"bzip2",
        "Exclusions": ["string", ...],
        "GroupSize": "string",
        "GroupFiles": "string",
        "Recurse": true|false,
        "MaxBand": integer,
        "MaxFilesInBand": integer,
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long,
          "EnableSamplePath": true|false,
          "SamplePath": "string"
        },
        "Separator": "comma"|"ctrla"|"pipe"|"semicolon"|"tab",
        "Escaper": "string",
        "QuoteChar": "quote"|"quillemet"|"single_quote"|"disabled",
        "Multiline": true|false,
        "WithHeader": true|false,
        "WriteHeader": true|false,
        "SkipFirst": true|false,
        "OptimizePerformance": true|false,
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3ExcelSource": {
        "Name": "string",
        "Paths": ["string", ...],
        "CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
        "Exclusions": ["string", ...],
        "GroupSize": "string",
        "GroupFiles": "string",
        "Recurse": true|false,
        "MaxBand": integer,
        "MaxFilesInBand": integer,
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long,
          "EnableSamplePath": true|false,
          "SamplePath": "string"
        },
        "NumberRows": long,
        "SkipFooter": integer,
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3JsonSource": {
        "Name": "string",
        "Paths": ["string", ...],
        "CompressionType": "gzip"|"bzip2",
        "Exclusions": ["string", ...],
        "GroupSize": "string",
        "GroupFiles": "string",
        "Recurse": true|false,
        "MaxBand": integer,
        "MaxFilesInBand": integer,
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long,
          "EnableSamplePath": true|false,
          "SamplePath": "string"
        },
        "JsonPath": "string",
        "Multiline": true|false,
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3ParquetSource": {
        "Name": "string",
        "Paths": ["string", ...],
        "CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
        "Exclusions": ["string", ...],
        "GroupSize": "string",
        "GroupFiles": "string",
        "Recurse": true|false,
        "MaxBand": integer,
        "MaxFilesInBand": integer,
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long,
          "EnableSamplePath": true|false,
          "SamplePath": "string"
        },
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "RelationalCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "DynamoDBCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "JDBCConnectorTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "ConnectionName": "string",
        "ConnectionTable": "string",
        "ConnectorName": "string",
        "ConnectionType": "string",
        "AdditionalOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "SparkConnectorTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "ConnectionName": "string",
        "ConnectorName": "string",
        "ConnectionType": "string",
        "AdditionalOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "CatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Database": "string",
        "Table": "string"
      },
      "RedshiftTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Database": "string",
        "Table": "string",
        "RedshiftTmpDir": "string",
        "TmpDirIAMRole": "string",
        "UpsertRedshiftOptions": {
          "TableLocation": "string",
          "ConnectionName": "string",
          "UpsertKeys": ["string", ...]
        }
      },
      "S3CatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Table": "string",
        "Database": "string",
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
        }
      },
      "S3GlueParquetTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Path": "string",
        "Compression": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
        "NumberTargetPartitions": "string",
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
          "Table": "string",
          "Database": "string"
        }
      },
      "S3HyperDirectTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Path": "string",
        "Compression": "uncompressed",
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
          "Table": "string",
          "Database": "string"
        }
      },
      "S3DirectTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Path": "string",
        "Compression": "string",
        "NumberTargetPartitions": "string",
        "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
          "Table": "string",
          "Database": "string"
        }
      },
      "S3IcebergDirectTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Path": "string",
        "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
        "AdditionalOptions": {"string": "string"
          ...},
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
          "Table": "string",
          "Database": "string"
        },
        "Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
        "NumberTargetPartitions": "string"
      },
      "ApplyMapping": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Mapping": [
          {
            "ToKey": "string",
            "FromPath": ["string", ...],
            "FromType": "string",
            "ToType": "string",
            "Dropped": true|false,
            "Children": [
              {
                "ToKey": "string",
                "FromPath": ["string", ...],
                "FromType": "string",
                "ToType": "string",
                "Dropped": true|false,
                "Children":
              }
              ...
            ]
          }
          ...
        ]
      },
      "SelectFields": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Paths": [
          ["string", ...]
          ...
        ]
      },
      "DropFields": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Paths": [
          ["string", ...]
          ...
        ]
      },
      "RenameField": {
        "Name": "string",
        "Inputs": ["string", ...],
        "SourcePath": ["string", ...],
        "TargetPath": ["string", ...]
      },
      "Spigot": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Path": "string",
        "Topk": integer,
        "Prob": double
      },
      "Join": {
        "Name": "string",
        "Inputs": ["string", ...],
        "JoinType": "equijoin"|"left"|"right"|"outer"|"leftsemi"|"leftanti",
        "Columns": [
          {
            "From": "string",
            "Keys": [
              ["string", ...]
              ...
            ]
          }
          ...
        ]
      },
      "SplitFields": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Paths": [
          ["string", ...]
          ...
        ]
      },
      "SelectFromCollection": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Index": integer
      },
      "FillMissingValues": {
        "Name": "string",
        "Inputs": ["string", ...],
        "ImputedPath": "string",
        "FilledPath": "string"
      },
      "Filter": {
        "Name": "string",
        "Inputs": ["string", ...],
        "LogicalOperator": "AND"|"OR",
        "Filters": [
          {
            "Operation": "EQ"|"LT"|"GT"|"LTE"|"GTE"|"REGEX"|"ISNULL",
            "Negated": true|false,
            "Values": [
              {
                "Type": "COLUMNEXTRACTED"|"CONSTANT",
                "Value": ["string", ...]
              }
              ...
            ]
          }
          ...
        ]
      },
      "CustomCode": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Code": "string",
        "ClassName": "string",
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "SparkSQL": {
        "Name": "string",
        "Inputs": ["string", ...],
        "SqlQuery": "string",
        "SqlAliases": [
          {
            "From": "string",
            "Alias": "string"
          }
          ...
        ],
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "DirectKinesisSource": {
        "Name": "string",
        "WindowSize": integer,
        "DetectSchema": true|false,
        "StreamingOptions": {
          "EndpointUrl": "string",
          "StreamName": "string",
          "Classification": "string",
          "Delimiter": "string",
          "StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
          "MaxFetchTimeInMs": long,
          "MaxFetchRecordsPerShard": long,
          "MaxRecordPerRead": long,
          "AddIdleTimeBetweenReads": true|false,
          "IdleTimeBetweenReadsInMs": long,
          "DescribeShardInterval": long,
          "NumRetries": integer,
          "RetryIntervalMs": long,
          "MaxRetryIntervalMs": long,
          "AvoidEmptyBatches": true|false,
          "StreamArn": "string",
          "RoleArn": "string",
          "RoleSessionName": "string",
          "AddRecordTimestamp": "string",
          "EmitConsumerLagMetrics": "string",
          "StartingTimestamp": timestamp
        },
        "DataPreviewOptions": {
          "PollingTime": long,
          "RecordPollingLimit": long
        }
      },
      "DirectKafkaSource": {
        "Name": "string",
        "StreamingOptions": {
          "BootstrapServers": "string",
          "SecurityProtocol": "string",
          "ConnectionName": "string",
          "TopicName": "string",
          "Assign": "string",
          "SubscribePattern": "string",
          "Classification": "string",
          "Delimiter": "string",
          "StartingOffsets": "string",
          "EndingOffsets": "string",
          "PollTimeoutMs": long,
          "NumRetries": integer,
          "RetryIntervalMs": long,
          "MaxOffsetsPerTrigger": long,
          "MinPartitions": integer,
          "IncludeHeaders": true|false,
          "AddRecordTimestamp": "string",
          "EmitConsumerLagMetrics": "string",
          "StartingTimestamp": timestamp
        },
        "WindowSize": integer,
        "DetectSchema": true|false,
        "DataPreviewOptions": {
          "PollingTime": long,
          "RecordPollingLimit": long
        }
      },
      "CatalogKinesisSource": {
        "Name": "string",
        "WindowSize": integer,
        "DetectSchema": true|false,
        "Table": "string",
        "Database": "string",
        "StreamingOptions": {
          "EndpointUrl": "string",
          "StreamName": "string",
          "Classification": "string",
          "Delimiter": "string",
          "StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
          "MaxFetchTimeInMs": long,
          "MaxFetchRecordsPerShard": long,
          "MaxRecordPerRead": long,
          "AddIdleTimeBetweenReads": true|false,
          "IdleTimeBetweenReadsInMs": long,
          "DescribeShardInterval": long,
          "NumRetries": integer,
          "RetryIntervalMs": long,
          "MaxRetryIntervalMs": long,
          "AvoidEmptyBatches": true|false,
          "StreamArn": "string",
          "RoleArn": "string",
          "RoleSessionName": "string",
          "AddRecordTimestamp": "string",
          "EmitConsumerLagMetrics": "string",
          "StartingTimestamp": timestamp
        },
        "DataPreviewOptions": {
          "PollingTime": long,
          "RecordPollingLimit": long
        }
      },
      "CatalogKafkaSource": {
        "Name": "string",
        "WindowSize": integer,
        "DetectSchema": true|false,
        "Table": "string",
        "Database": "string",
        "StreamingOptions": {
          "BootstrapServers": "string",
          "SecurityProtocol": "string",
          "ConnectionName": "string",
          "TopicName": "string",
          "Assign": "string",
          "SubscribePattern": "string",
          "Classification": "string",
          "Delimiter": "string",
          "StartingOffsets": "string",
          "EndingOffsets": "string",
          "PollTimeoutMs": long,
          "NumRetries": integer,
          "RetryIntervalMs": long,
          "MaxOffsetsPerTrigger": long,
          "MinPartitions": integer,
          "IncludeHeaders": true|false,
          "AddRecordTimestamp": "string",
          "EmitConsumerLagMetrics": "string",
          "StartingTimestamp": timestamp
        },
        "DataPreviewOptions": {
          "PollingTime": long,
          "RecordPollingLimit": long
        }
      },
      "DropNullFields": {
        "Name": "string",
        "Inputs": ["string", ...],
        "NullCheckBoxList": {
          "IsEmpty": true|false,
          "IsNullString": true|false,
          "IsNegOne": true|false
        },
        "NullTextList": [
          {
            "Value": "string",
            "Datatype": {
              "Id": "string",
              "Label": "string"
            }
          }
          ...
        ]
      },
      "Merge": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Source": "string",
        "PrimaryKeys": [
          ["string", ...]
          ...
        ]
      },
      "Union": {
        "Name": "string",
        "Inputs": ["string", ...],
        "UnionType": "ALL"|"DISTINCT"
      },
      "PIIDetection": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PiiType": "RowAudit"|"RowMasking"|"ColumnAudit"|"ColumnMasking",
        "EntityTypesToDetect": ["string", ...],
        "OutputColumnName": "string",
        "SampleFraction": double,
        "ThresholdFraction": double,
        "MaskValue": "string"
      },
      "Aggregate": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Groups": [
          ["string", ...]
          ...
        ],
        "Aggs": [
          {
            "Column": ["string", ...],
            "AggFunc": "avg"|"countDistinct"|"count"|"first"|"last"|"kurtosis"|"max"|"min"|"skewness"|"stddev_samp"|"stddev_pop"|"sum"|"sumDistinct"|"var_samp"|"var_pop"
          }
          ...
        ]
      },
      "DropDuplicates": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Columns": [
          ["string", ...]
          ...
        ]
      },
      "GovernedCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Table": "string",
        "Database": "string",
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
        }
      },
      "GovernedCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "PartitionPredicate": "string",
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long
        }
      },
      "MicrosoftSQLServerCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "MySQLCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "OracleSQLCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "PostgreSQLCatalogSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string"
      },
      "MicrosoftSQLServerCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Database": "string",
        "Table": "string"
      },
      "MySQLCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Database": "string",
        "Table": "string"
      },
      "OracleSQLCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Database": "string",
        "Table": "string"
      },
      "PostgreSQLCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Database": "string",
        "Table": "string"
      },
      "DynamicTransform": {
        "Name": "string",
        "TransformName": "string",
        "Inputs": ["string", ...],
        "Parameters": [
          {
            "Name": "string",
            "Type": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
            "ValidationRule": "string",
            "ValidationMessage": "string",
            "Value": ["string", ...],
            "ListType": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
            "IsOptional": true|false
          }
          ...
        ],
        "FunctionName": "string",
        "Path": "string",
        "Version": "string",
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "EvaluateDataQuality": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Ruleset": "string",
        "Output": "PrimaryInput"|"EvaluationResults",
        "PublishingOptions": {
          "EvaluationContext": "string",
          "ResultsS3Prefix": "string",
          "CloudWatchMetricsEnabled": true|false,
          "ResultsPublishingEnabled": true|false
        },
        "StopJobOnFailureOptions": {
          "StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
        }
      },
      "S3CatalogHudiSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "AdditionalHudiOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "CatalogHudiSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "AdditionalHudiOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3HudiSource": {
        "Name": "string",
        "Paths": ["string", ...],
        "AdditionalHudiOptions": {"string": "string"
          ...},
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long,
          "EnableSamplePath": true|false,
          "SamplePath": "string"
        },
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3HudiCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Table": "string",
        "Database": "string",
        "AdditionalOptions": {"string": "string"
          ...},
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
        }
      },
      "S3HudiDirectTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "Path": "string",
        "Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
        "NumberTargetPartitions": "string",
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
        "AdditionalOptions": {"string": "string"
          ...},
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
          "Table": "string",
          "Database": "string"
        }
      },
      "DirectJDBCSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "ConnectionName": "string",
        "ConnectionType": "sqlserver"|"mysql"|"oracle"|"postgresql"|"redshift",
        "RedshiftTmpDir": "string"
      },
      "S3CatalogDeltaSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "AdditionalDeltaOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "CatalogDeltaSource": {
        "Name": "string",
        "Database": "string",
        "Table": "string",
        "AdditionalDeltaOptions": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3DeltaSource": {
        "Name": "string",
        "Paths": ["string", ...],
        "AdditionalDeltaOptions": {"string": "string"
          ...},
        "AdditionalOptions": {
          "BoundedSize": long,
          "BoundedFiles": long,
          "EnableSamplePath": true|false,
          "SamplePath": "string"
        },
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "S3DeltaCatalogTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Table": "string",
        "Database": "string",
        "AdditionalOptions": {"string": "string"
          ...},
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
        }
      },
      "S3DeltaDirectTarget": {
        "Name": "string",
        "Inputs": ["string", ...],
        "PartitionKeys": [
          ["string", ...]
          ...
        ],
        "Path": "string",
        "Compression": "uncompressed"|"snappy",
        "NumberTargetPartitions": "string",
        "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
        "AdditionalOptions": {"string": "string"
          ...},
        "SchemaChangePolicy": {
          "EnableUpdateCatalog": true|false,
          "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
          "Table": "string",
          "Database": "string"
        }
      },
      "AmazonRedshiftSource": {
        "Name": "string",
        "Data": {
          "AccessType": "string",
          "SourceType": "string",
          "Connection": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "Schema": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "Table": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "CatalogDatabase": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "CatalogTable": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "CatalogRedshiftSchema": "string",
          "CatalogRedshiftTable": "string",
          "TempDir": "string",
          "IamRole": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "AdvancedOptions": [
            {
              "Key": "string",
              "Value": "string"
            }
            ...
          ],
          "SampleQuery": "string",
          "PreAction": "string",
          "PostAction": "string",
          "Action": "string",
          "TablePrefix": "string",
          "Upsert": true|false,
          "MergeAction": "string",
          "MergeWhenMatched": "string",
          "MergeWhenNotMatched": "string",
          "MergeClause": "string",
          "CrawlerConnection": "string",
          "TableSchema": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ],
          "StagingTable": "string",
          "SelectedColumns": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ]
        }
      },
      "AmazonRedshiftTarget": {
        "Name": "string",
        "Data": {
          "AccessType": "string",
          "SourceType": "string",
          "Connection": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "Schema": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "Table": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "CatalogDatabase": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "CatalogTable": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "CatalogRedshiftSchema": "string",
          "CatalogRedshiftTable": "string",
          "TempDir": "string",
          "IamRole": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "AdvancedOptions": [
            {
              "Key": "string",
              "Value": "string"
            }
            ...
          ],
          "SampleQuery": "string",
          "PreAction": "string",
          "PostAction": "string",
          "Action": "string",
          "TablePrefix": "string",
          "Upsert": true|false,
          "MergeAction": "string",
          "MergeWhenMatched": "string",
          "MergeWhenNotMatched": "string",
          "MergeClause": "string",
          "CrawlerConnection": "string",
          "TableSchema": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ],
          "StagingTable": "string",
          "SelectedColumns": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ]
        },
        "Inputs": ["string", ...]
      },
      "EvaluateDataQualityMultiFrame": {
        "Name": "string",
        "Inputs": ["string", ...],
        "AdditionalDataSources": {"string": "string"
          ...},
        "Ruleset": "string",
        "PublishingOptions": {
          "EvaluationContext": "string",
          "ResultsS3Prefix": "string",
          "CloudWatchMetricsEnabled": true|false,
          "ResultsPublishingEnabled": true|false
        },
        "AdditionalOptions": {"performanceTuning.caching"|"observations.scope": "string"
          ...},
        "StopJobOnFailureOptions": {
          "StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
        }
      },
      "Recipe": {
        "Name": "string",
        "Inputs": ["string", ...],
        "RecipeReference": {
          "RecipeArn": "string",
          "RecipeVersion": "string"
        },
        "RecipeSteps": [
          {
            "Action": {
              "Operation": "string",
              "Parameters": {"string": "string"
                ...}
            },
            "ConditionExpressions": [
              {
                "Condition": "string",
                "Value": "string",
                "TargetColumn": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "SnowflakeSource": {
        "Name": "string",
        "Data": {
          "SourceType": "string",
          "Connection": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "Schema": "string",
          "Table": "string",
          "Database": "string",
          "TempDir": "string",
          "IamRole": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "AdditionalOptions": {"string": "string"
            ...},
          "SampleQuery": "string",
          "PreAction": "string",
          "PostAction": "string",
          "Action": "string",
          "Upsert": true|false,
          "MergeAction": "string",
          "MergeWhenMatched": "string",
          "MergeWhenNotMatched": "string",
          "MergeClause": "string",
          "StagingTable": "string",
          "SelectedColumns": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ],
          "AutoPushdown": true|false,
          "TableSchema": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ]
        },
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "SnowflakeTarget": {
        "Name": "string",
        "Data": {
          "SourceType": "string",
          "Connection": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "Schema": "string",
          "Table": "string",
          "Database": "string",
          "TempDir": "string",
          "IamRole": {
            "Value": "string",
            "Label": "string",
            "Description": "string"
          },
          "AdditionalOptions": {"string": "string"
            ...},
          "SampleQuery": "string",
          "PreAction": "string",
          "PostAction": "string",
          "Action": "string",
          "Upsert": true|false,
          "MergeAction": "string",
          "MergeWhenMatched": "string",
          "MergeWhenNotMatched": "string",
          "MergeClause": "string",
          "StagingTable": "string",
          "SelectedColumns": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ],
          "AutoPushdown": true|false,
          "TableSchema": [
            {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            }
            ...
          ]
        },
        "Inputs": ["string", ...]
      },
      "ConnectorDataSource": {
        "Name": "string",
        "ConnectionType": "string",
        "Data": {"string": "string"
          ...},
        "OutputSchemas": [
          {
            "Columns": [
              {
                "Name": "string",
                "Type": "string"
              }
              ...
            ]
          }
          ...
        ]
      },
      "ConnectorDataTarget": {
        "Name": "string",
        "ConnectionType": "string",
        "Data": {"string": "string"
          ...},
        "Inputs": ["string", ...]
      }
    }
  ...}

--execution-class (string)

Указывает, выполняется ли задача со стандартным или гибким классом выполнения. Стандартный класс выполнения идеально подходит для задач с жесткими временными ограничениями, требующих быстрого запуска задачи и выделенных ресурсов.

Гибкий класс выполнения подходит для задач, не требующих строгого времени выполнения, начало и окончание которых могут изменяться.

Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass на FLEX. Гибкий класс выполнения доступен для задач Spark.

Возможные значения:

  • FLEX
  • STANDARD

--source-control-details (структура)

Подробности для конфигурации управления версиями источника для задачи, позволяющие синхронизировать артефакты задачи с удаленным репозиторием или из него.

Provider -> (string)

Поставщик удаленного репозитория.

Repository -> (string)

Имя удаленного репозитория, содержащего артефакты задачи.

Owner -> (string)

Владелец удаленного репозитория, содержащего артефакты задачи.

Branch -> (string)

Необязательная ветвь в удаленном репозитории.

Folder -> (string)

Необязательная папка в удаленном репозитории.

LastCommitId -> (string)

Последний идентификатор коммита для коммита в удаленном репозитории.

AuthStrategy -> (string)

Тип аутентификации, которая может быть токеном аутентификации, хранящимся в Amazon Web Services Secrets Manager, или персональным токеном доступа.

AuthToken -> (string)

Значение токена авторизации.

Сокращенный синтаксис:

Provider=string,Repository=string,Owner=string,Branch=string,Folder=string,LastCommitId=string,AuthStrategy=string,AuthToken=string

JSON Синтаксис:

{
  "Provider": "GITHUB"|"GITLAB"|"BITBUCKET"|"AWS_CODE_COMMIT",
  "Repository": "string",
  "Owner": "string",
  "Branch": "string",
  "Folder": "string",
  "LastCommitId": "string",
  "AuthStrategy": "PERSONAL_ACCESS_TOKEN"|"AWS_SECRETS_MANAGER",
  "AuthToken": "string"
}

--maintenance-window (строка)

Это поле указывает день недели и час для окна обслуживания для потоковых задач. Glue периодически выполняет задачи обслуживания. В эти окна обслуживания Glue потребуется перезапустить ваши потоковые задачи.

Glue перезапустит задачу в течение 3 часов с момента указанного окна обслуживания. Например, если вы настроите окно обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.

--cli-input-json | --cli-input-yaml (string) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределяют значения, предоставленные в JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет взята буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение или значение input, выводит JSON-образец входных данных, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, оно выведет пример входных данных YAML, который можно использовать с --cli-input-yaml. При предоставлении значения output оно валидирует входные данные команды и возвращает пример выходных данных JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (boolean)

Включить отладочную запись журнала.

--endpoint-url (string)

Переопределить URL по умолчанию команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверяет SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (boolean)

Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования выходных данных команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использовать определенный профиль из файла учетных данных.

--region (string)

Регион для использования. Переопределяет параметры конфигурации/среды.

--version (string)

Отобразить версию этого инструмента.

--color (string)

Включить/выключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (string)

Файл сертификата CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (string)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла непосредственно, независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить выгрузку страниц CLI для вывода.

--cli-auto-prompt (boolean)

Автоматически запросить параметры ввода CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматическое запросы параметров ввода CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительные сведения см. в руководстве по началу работы с AWS CLI в Руководстве пользователя AWS CLI.

Если не указано иное, во всех примерах используются правила кавычек Unix-подобных систем. Эти примеры необходимо адаптировать к правилам кавычек вашей оболочки. См. раздел Использование кавычек со строками в Руководстве пользователя AWS CLI.

Чтобы создать задачу преобразования данных

Следующий create-job пример создает потоковую задачу, которая выполняет скрипт, хранящийся в S3.

aws glue create-job \
    --name my-testing-job \
    --role AWSGlueServiceRoleDefault \
    --command '{ \
        "Name": "gluestreaming", \
        "ScriptLocation": "s3://amzn-s3-demo-bucket/folder/" \
    }' \
    --region us-east-1 \
    --output json \
    --default-arguments '{ \
        "--job-language":"scala", \
        "--class":"GlueApp" \
    }' \
    --profile my-profile \
    --endpoint https://glue.us-east-1.amazonaws.com

Содержание test_script.scala:

importcom.amazonaws.services.glue.ChoiceOption
importcom.amazonaws.services.glue.GlueContext
importcom.amazonaws.services.glue.MappingSpec
importcom.amazonaws.services.glue.ResolveSpec
importcom.amazonaws.services.glue.errors.CallSite
importcom.amazonaws.services.glue.util.GlueArgParser
importcom.amazonaws.services.glue.util.Job
importcom.amazonaws.services.glue.util.JsonOptions
importorg.apache.spark.SparkContext
importscala.collection.JavaConverters._

object GlueApp {
    defmain(sysArgs: Array[String]) {
        val spark: SparkContext = new SparkContext()
        val glueContext: GlueContext = new GlueContext(spark)
        // @params: [JOB_NAME]
        val args = GlueArgParser.getResolvedOptions(sysArgs, Seq("JOB_NAME").toArray)
        Job.init(args("JOB_NAME"), glueContext, args.asJava)
        // @type: DataSource
        // @args: [database = "tempdb", table_name = "s3-source", transformation_ctx = "datasource0"]
        // @return: datasource0
        // @inputs: []
        val datasource0 = glueContext.getCatalogSource(database = "tempdb", tableName = "s3-source", redshiftTmpDir = "", transformationContext = "datasource0").getDynamicFrame()
        // @type: ApplyMapping
        // @args: [mapping = [("sensorid", "int", "sensorid", "int"), ("currenttemperature", "int", "currenttemperature", "int"), ("status", "string", "status", "string")], transformation_ctx = "applymapping1"]
        // @return: applymapping1
        // @inputs: [frame = datasource0]
        val applymapping1 = datasource0.applyMapping(mappings = Seq(("sensorid", "int", "sensorid", "int"), ("currenttemperature", "int", "currenttemperature", "int"), ("status", "string", "status", "string")), caseSensitive = false, transformationContext = "applymapping1")
        // @type: SelectFields
        // @args: [paths = ["sensorid", "currenttemperature", "status"], transformation_ctx = "selectfields2"]
        // @return: selectfields2
        // @inputs: [frame = applymapping1]
        val selectfields2 = applymapping1.selectFields(paths = Seq("sensorid", "currenttemperature", "status"), transformationContext = "selectfields2")
        // @type: ResolveChoice
        // @args: [choice = "MATCH_CATALOG", database = "tempdb", table_name = "my-s3-sink", transformation_ctx = "resolvechoice3"]
        // @return: resolvechoice3
        // @inputs: [frame = selectfields2]
        val resolvechoice3 = selectfields2.resolveChoice(choiceOption = Some(ChoiceOption("MATCH_CATALOG")), database = Some("tempdb"), tableName = Some("my-s3-sink"), transformationContext = "resolvechoice3")
        // @type: DataSink
        // @args: [database = "tempdb", table_name = "my-s3-sink", transformation_ctx = "datasink4"]
        // @return: datasink4
        // @inputs: [frame = resolvechoice3]
        val datasink4 = glueContext.getCatalogSink(database = "tempdb", tableName = "my-s3-sink", redshiftTmpDir = "", transformationContext = "datasink4").writeDynamicFrame(resolvechoice3)
        Job.commit()
    }
}

Вывод:

{
    "Name": "my-testing-job"
}

Дополнительную информацию см. в разделе Создание задач в AWS Glue в Руководстве разработчика AWS Glue.

Вывод

Name -> (string)

Уникальное имя, которое было предоставлено для этого определения задачи.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API