Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

обновить-задание

Описание

Обновляет существующее определение задания. Предыдущее определение задания полностью перезаписывается этой информацией.

См. также: Документацию API AWS

Синтаксис

  update-job
--job-name <value>
--job-update <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--job-name (строка)

Имя определения задания для обновления.

--job-update (структура)

Указывает значения, с помощью которых обновляется определение задания. Неуказанные параметры удаляются или сбрасываются до значений по умолчанию.

JobMode -> (строка)

Режим, описывающий способ создания задания. Допустимые значения:

  • SCRIPT - Задание создано с помощью редактора сценариев Glue Studio.
  • VISUAL - Задание создано с помощью визуального редактора Glue Studio.
  • NOTEBOOK - Задание создано с помощью блокнота интерактивных сеансов.

Если поле JobMode отсутствует или равно null, то SCRIPT используется в качестве значения по умолчанию.

JobRunQueuingEnabled -> (логическое)

Указывает, включено ли очередирование запусков заданий для запусков заданий этого задания.

Значение true означает, что очередирование запусков заданий включено для запусков заданий. Если false или не задано, запуски заданий не будут рассматриваться для очередирования.

Если это поле не совпадает со значением, установленным в запуске задания, то используется значение из поля запуска задания.

Description -> (строка)

Описание заданного задания.

LogUri -> (строка)

Это поле зарезервировано для будущего использования.

Role -> (строка)

Имя или Amazon Resource Name (ARN) роли IAM, связанной с этим заданием (требуется).

ExecutionProperty -> (структура)

Структура, определяющая максимальное количество одновременных запусков, разрешенных для этого задания.

MaxConcurrentRuns -> (целое число)

Максимальное количество одновременных запусков, разрешенных для задания. По умолчанию 1. При достижении этого порога возвращается ошибка. Максимальное значение, которое вы можете указать, контролируется пределом службы.

Command -> (структура)

Команда, выполняющая это задание (требуется).

Name -> (строка)

Имя команды задания. Для задания ETL Apache Spark это должно быть glueetl. Для задания Python shell - это должно быть pythonshell. Для задания ETL Apache Spark Streaming - это должно быть gluestreaming. Для задания Ray - это должно быть glueray.

ScriptLocation -> (строка)

Указывает путь Amazon Simple Storage Service (Amazon S3) к сценарию, который выполняет задание.

PythonVersion -> (строка)

Версия Python, используемая для выполнения задания Python shell. Допустимые значения 2 или 3.

Runtime -> (строка)

В заданиях Ray параметр Runtime используется для указания версий Ray, Python и дополнительных библиотек, доступных в вашей среде. Это поле не используется в других типах заданий. Доступные значения среды выполнения см. в Руководстве разработчика Glue.

DefaultArguments -> (отображение)

Значения аргументов по умолчанию для каждого запуска этого задания, заданные в виде пар имя-значение.

Вы можете указать здесь аргументы, которые использует ваш собственный сценарий выполнения задания, а также аргументы, которые использует сам Glue.

Аргументы задания могут регистрироваться. Не передавайте открытые секреты в качестве аргументов. Получайте секреты из соединения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите сохранить их в рамках задания.

Дополнительную информацию о том, как указать и использовать собственные аргументы задания, см. в разделе Вызов API Glue на Python в руководстве разработчика.

Дополнительную информацию об аргументах, которые можно предоставить в этом поле при настройке заданий Spark, см. в разделе Специальные параметры, используемые Glue, в руководстве разработчика.

Дополнительную информацию об аргументах, которые можно предоставить в этом поле при настройке заданий Ray, см. в разделе Использование параметров задания в заданиях Ray в руководстве разработчика.

key -> (строка)

value -> (строка)

NonOverridableArguments -> (отображение)

Аргументы для этого задания, которые не перезаписываются при предоставлении аргументов задания в запуске задания, заданные в виде пар имя-значение.

key -> (строка)

value -> (строка)

Connections -> (структура)

Соединения, используемые для этого задания.

Connections -> (список)

Список соединений, используемых заданием.

(строка)

MaxRetries -> (целое число)

Максимальное количество попыток повторного выполнения этого задания при сбоях.

AllocatedCapacity -> (целое число)

Это поле устарело. Используйте MaxCapacity вместо него.

Количество единиц обработки данных Glue (DPU), выделяемых для этого задания. Вы можете выделить минимум 2 DPU; значение по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 vCPU вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.

Timeout -> (целое число)

Тайм-аут задания в минутах. Это максимальное время, которое запуск задания может потреблять ресурсы, прежде чем он завершится и перейдет в состояние TIMEOUT.

Значения тайм-аута задания должны быть меньше 7 дней или 10080 минут. В противном случае задания генерируют исключение.

Если значение не указано, тайм-аут по умолчанию составляет 2880 минут.

Любые существующие задания Glue, у которых значение тайм-аута было больше 7 дней, будут сбрасываться до 7 дней. Например, если вы указали тайм-аут в 20 дней для задания пакетной обработки, оно будет остановлено на 7-й день.

Для заданий потоковой обработки, если вы настроили окно обслуживания, оно будет перезапущено во время окна обслуживания по истечении 7 дней.

MaxCapacity -> (двойное)

Для заданий Glue версии 1.0 или более ранних версий, использующих стандартный тип рабочего процесса, количество единиц обработки данных Glue (DPU), которые могут быть выделены при запуске этого задания. DPU — это относительная мера вычислительной мощности, состоящая из 4 vCPU вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.

Для заданий Glue версии 2.0 и выше вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.

Не устанавливайте MaxCapacity, если используете WorkerType и NumberOfWorkers.

Значение, которое может быть выделено для MaxCapacity, зависит от того, выполняете ли вы задание Python shell, задание Apache Spark ETL или задание Apache Spark streaming ETL:

  • Если вы указываете задание Python shell (JobCommand.Name =”pythonshell”), вы можете выделить 0,0625 или 1 DPU. Значение по умолчанию 0,0625 DPU.
  • Если вы указываете задание Apache Spark ETL (JobCommand.Name =”glueetl”) или задание Apache Spark streaming ETL (JobCommand.Name =”gluestreaming”), вы можете выделить от 2 до 100 DPU. Значение по умолчанию 10 DPU. Для этого типа задания не допускается выделение дробных DPU.

WorkerType -> (строка)

Тип предопределенного рабочего процесса, выделенного при запуске задания. Принимает значение G.1X, G.2X, G.4X, G.8X или G.025X для заданий Spark. Принимает значение Z.2X для заданий Ray.

  • Для типа рабочего процесса G.1X каждый рабочий соответствует 1 DPU (4 vCPU, 16 ГБ памяти) с диском 94 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономичный способ выполнения большинства заданий.
  • Для типа рабочего процесса G.2X каждый рабочий соответствует 2 DPU (8 vCPU, 32 ГБ памяти) с диском 138 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономичный способ выполнения большинства заданий.
  • Для типа рабочего процесса G.4X каждый рабочий соответствует 4 DPU (16 vCPU, 64 ГБ памяти) с диском 256 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для заданий, рабочие нагрузки которых содержат наиболее требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего процесса доступен только для заданий Apache Spark ETL Glue версии 3.0 и более поздних версий в следующих регионах Amazon Web Services: US East (Огайо), US East (Северная Вирджиния), US West (Орегон), Asia Pacific (Сингапур), Asia Pacific (Сидней), Asia Pacific (Токио), Canada (Центр), Europe (Франкфурт), Europe (Ирландия) и Europe (Стокгольм).
  • Для типа рабочего процесса G.8X каждый рабочий соответствует 8 DPU (32 vCPU, 128 ГБ памяти) с диском 512 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для заданий, рабочие нагрузки которых содержат наиболее требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего процесса доступен только для заданий Apache Spark ETL Glue версии 3.0 и более поздних версий в тех же регионах Amazon Web Services, что и для типа рабочего процесса G.4X.
  • Для типа рабочего процесса G.025X каждый рабочий соответствует 0,25 DPU (2 vCPU, 4 ГБ памяти) с диском 84 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для заданий потоковой обработки с низким объемом данных. Этот тип рабочего процесса доступен только для заданий потоковой обработки Glue версии 3.0 и более поздних версий.
  • Для типа рабочего процесса Z.2X каждый рабочий соответствует 2 M-DPU (8vCPU, 64 ГБ памяти) с диском 128 ГБ и обеспечивает до 8 рабочих процессов Ray на основе автоматического масштабирования.

NumberOfWorkers -> (целое число)

Количество рабочих процессов определенного workerType, выделяемых при запуске задания.

SecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, используемой с этим заданием.

NotificationProperty -> (структура)

Указывает конфигурационные параметры уведомления о задании.

NotifyDelayAfter -> (целое число)

Количество минут ожидания отправки уведомления о задержке запуска задания после начала выполнения задания.

GlueVersion -> (строка)

В заданиях Spark параметр GlueVersion определяет версии Apache Spark и Python, доступные в задании Glue. Версия Python указывает версию, поддерживаемую для заданий типа Spark.

Задания Ray должны установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительные библиотеки, доступные в вашем задании Ray, определяются параметром Runtime команды задания.

Дополнительную информацию об доступных версиях Glue и соответствующих версиях Spark и Python см. в руководстве разработчика.

Задания, созданные без указания версии Glue, используют Glue 0.9 по умолчанию.

CodeGenConfigurationNodes -> (отображение)

Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.

ключ -> (строка)

значение -> (структура)

CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.

AthenaConnectorSource -> (структура)

Указывает соединение с источником данных Amazon Athena.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, например, marketplace.athena или custom.athena, обозначающий соединение с хранилищем данных Amazon Athena.

ТаблицаСоединения -> (строка)

Имя таблицы в источнике данных.

ИмяСхемы -> (строка)

Имя группы журналов Cloudwatch для чтения. Например, /aws-glue/jobs/output.

СхемыВывода -> (список)

Указывает схему данных для пользовательского источника Athena.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

JDBCConnectorSource -> (структура)

Указывает соединение с источником данных JDBC.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, например, marketplace.jdbc или custom.jdbc, обозначающий соединение с хранилищем данных JDBC.

ДополнительныеПараметры -> (структура)

Дополнительные параметры соединения для соединителя.

ФильтрПредска -> (строка)

Дополнительное условие для фильтрации данных из источника. Например:

BillingCity='Mountain View'

При использовании запроса вместо имени таблицы необходимо убедиться, что запрос работает с указанным filterPredicate.

СтолбецРазделения -> (строка)

Имя целочисленного столбца, используемого для разбиения. Этот параметр работает только при включении его с lowerBound, upperBound и numPartitions. Этот параметр работает так же, как и в Spark SQL JDBC reader.

НижняяГраница -> (целое число)

Минимальное значение partitionColumn, используемое для определения шага разбиения.

ВерхняяГраница -> (целое число)

Максимальное значение partitionColumn, используемое для определения шага разбиения.

КоличествоРазделений -> (целое число)

Количество разделов. Это значение вместе с lowerBound (включительно) и upperBound (исключительно) формируют шаги разбиения для выражений сгенерированных WHERE-клаузами, используемыми для разделения partitionColumn.

КлючиОтметкиРаботы -> (список)

Имя ключей отметки работы, по которым необходимо отсортировать.

(строка)

ПорядокСортировкиКлючейОтметкиРаботы -> (строка)

Указывает порядок сортировки — возрастающий или убывающий.

СопоставлениеТиповДанных -> (карта)

Пользовательское сопоставление типов данных, создающее соответствие между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} сопоставляет поля данных типа JDBC FLOAT с типом Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания Glue записи. Объект ResultSet реализуется каждым драйвером, поэтому поведение зависит от используемого драйвера. Обратитесь к документации вашего JDBC драйвера, чтобы понять, как драйвер выполняет преобразования.

ключ -> (строка)

значение -> (строка)

ТаблицаСоединения -> (строка)

Имя таблицы в источнике данных.

Запрос -> (строка)

Таблица или SQL запрос для получения данных. Вы можете указать либо ConnectionTable, либо query, но не оба.

СхемыВывода -> (список)

Указывает схему данных для пользовательского JDBC источника.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorSource -> (структура)

Указывает соединение с источником данных Apache Spark.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, например, marketplace.spark или custom.spark, обозначающий соединение с хранилищем данных Apache Spark.

ДополнительныеПараметры -> (карта)

Дополнительные параметры соединения для соединителя.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для пользовательского источника Spark.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogSource -> (структура)

Указывает хранилище данных в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

RedshiftSource -> (структура)

Указывает хранилище данных Amazon Redshift.

Имя -> (строка)

Имя хранилища данных Amazon Redshift.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

S3CatalogSource -> (структура)

Указывает хранилище данных Amazon S3 в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

ПредикатРазбиения -> (строка)

Разделы, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разделах не удаляются. Установлено в "" — по умолчанию пусто.

ДополнительныеПараметры -> (структура)

Указывает дополнительные параметры соединения.

ОграниченныйРазмер -> (целое число)

Устанавливает максимальный размер набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (целое число)

Устанавливает максимальное количество файлов, которые будут обработаны.

S3CsvSource -> (структура)

Указывает хранилище данных в формате CSV (значения, разделённые запятыми), хранящееся в Amazon S3.

Name -> (строка)

Имя хранилища данных.

Paths -> (список)

Список путей к файлам Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает способ сжатия данных. Обычно это не нужно, если у данных есть стандартное расширение файла. Возможные значения: "gzip" и "bzip".

Exclusions -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда количество входных файлов меньше 50 000, необходимо установить "groupFiles" на значение "inPartition", чтобы это подействовало.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, если входной набор содержит более 50 000 файлов. Чтобы включить группировку с меньшим количеством файлов (менее 50 000), установите этот параметр в значение «inPartition». Чтобы отключить группировку при наличии более 50 000 файлов, установите этот параметр в значение "none".

Recurse -> (булево)

Если установлено в значение true, то происходит рекурсивный поиск файлов во всех подкаталогах по указанным путям.

MaxBand -> (целое число)

Этот параметр контролирует время в миллисекундах, после которого список содержимого s3, скорее всего, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учёта возможной несинхронности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию значение равно 900000 миллисекунд или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр указывает максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только при следующем запуске задачи.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (целое число с длинной точностью)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число с длинной точностью)

Устанавливает верхнюю границу целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образцовый путь.

Separator -> (строка)

Указывает разделитель. По умолчанию это запятая: «,» , но можно указать любой другой символ.

Escaper -> (строка)

Указывает символ для экранирования. Этот параметр используется только при чтении файлов CSV. Значение по умолчанию - none. Если включено, символ, который следует сразу за ним, используется как есть, за исключением небольшого набора известных экранирований (\n, \r, \t и \0).

QuoteChar -> (строка)

Указывает символ для кавычек. По умолчанию двойная кавычка: '"'. Установите значение в -1, чтобы полностью отключить кавычки.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ новой строки в кавычках. Необходимо установить этот параметр в значение True, если какая-либо запись занимает несколько строк. Значение по умолчанию - False, что позволяет более активно разбивать файлы при разборе.

WithHeader -> (булево)

Булево значение, указывающее, следует ли рассматривать первую строку как заголовок. Значение по умолчанию - False.

WriteHeader -> (булево)

Булево значение, указывающее, следует ли записать заголовок в выходные данные. Значение по умолчанию - True.

SkipFirst -> (булево)

Булево значение, указывающее, следует ли пропустить первую строку данных. Значение по умолчанию - False.

OptimizePerformance -> (булево)

Булево значение, указывающее, использовать ли расширенный CSV-читатель SIMD вместе с столбцовыми форматами памяти на основе Apache Arrow. Доступно только в версии Glue 3.0.

OutputSchemas -> (список)

Указывает схему данных для источника S3 CSV.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ExcelSource -> (структура)

Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.

Name -> (строка)

Имя источника данных Excel в S3.

Paths -> (список)

Пути в S3, где расположены файлы Excel.

(строка)

CompressionType -> (строка)

Формат сжатия, используемый для файлов Excel.

Exclusions -> (список)

Шаблоны для исключения определённых файлов или путей из обработки.

(строка)

GroupSize -> (строка)

Определяет размер групп файлов для пакетной обработки.

GroupFiles -> (строка)

Указывает, как файлы должны быть сгруппированы для обработки.

Recurse -> (булево)

Указывает, нужно ли рекурсивно обрабатывать подкаталоги.

MaxBand -> (целое число)

Максимальное количество полос обработки.

MaxFilesInBand -> (целое число)

Максимальное количество файлов для обработки в каждой полосе.

AdditionalOptions -> (структура)

Дополнительные параметры конфигурации для обработки прямых источников S3.

BoundedSize -> (целое число с длинной точностью)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число с длинной точностью)

Устанавливает верхнюю границу целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образцовый путь.

NumberRows -> (целое число с длинной точностью)

Количество строк для обработки из каждого файла Excel.

SkipFooter -> (целое число)

Количество строк, которые нужно пропустить в конце каждого файла Excel.

OutputSchemas -> (список)

Схемы AWS Glue, применяемые к обработанным данным.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3JsonSource -> (структура)

Указывает хранилище данных в формате JSON, хранящееся в Amazon S3.

Name -> (строка)

Имя хранилища данных.

Paths -> (список)

Список путей к файлам Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает способ сжатия данных. Обычно это не нужно, если у данных есть стандартное расширение файла. Возможные значения: "gzip" и "bzip".

Exclusions -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда количество входных файлов меньше 50 000, необходимо установить "groupFiles" на значение "inPartition", чтобы это подействовало.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, если входной набор содержит более 50 000 файлов. Чтобы включить группировку с меньшим количеством файлов (менее 50 000), установите этот параметр в значение «inPartition». Чтобы отключить группировку при наличии более 50 000 файлов, установите этот параметр в значение "none".

Recurse -> (булево)

Если установлено в значение true, то происходит рекурсивный поиск файлов во всех подкаталогах по указанным путям.

MaxBand -> (целое число)

Этот параметр контролирует время в миллисекундах, после которого список содержимого s3, скорее всего, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учёта возможной несинхронности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию значение равно 900000 миллисекунд или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр указывает максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только при следующем запуске задачи.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (целое число с длинной точностью)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число с длинной точностью)

Устанавливает верхнюю границу целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образцовый путь.

JsonPath -> (строка)

Строка JsonPath, определяющая данные JSON.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ новой строки в кавычках. Необходимо установить этот параметр в значение True, если какая-либо запись занимает несколько строк. Значение по умолчанию - False, что позволяет более активно разбивать файлы при разборе.

OutputSchemas -> (список)

Указывает схему данных для источника S3 JSON.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ParquetSource -> (структура)

Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ТипСжатия -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

РазмерГруппы -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера кластера. Если количество входных файлов меньше 50 000, необходимо установить "groupFiles" в "inPartition", чтобы это имело эффект.

ФайлыВГруппе -> (строка)

Группировка файлов включена по умолчанию, если входные данные содержат более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку при более чем 50 000 файлах, установите этот параметр в "none".

Рекурсия -> (булево)

Если установлено в значение true, файлы во всех подкаталогах по указанным путям читаются рекурсивно.

МаксимальнаяПолоса -> (целое число)

Этот параметр контролирует длительность в миллисекундах, после которой перечисление s3, скорее всего, будет согласованным. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учета неявной согласованности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию составляет 900000 миллисекунд или 15 минут.

МаксимальноеКоличествоФайловВПолосе -> (целое число)

Этот параметр задает максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

ДополнительныеПараметры -> (структура)

Указывает дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, которые будут обработаны.

ОграниченноеКоличествоФайлов -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

ВключитьОбразецПути -> (булево)

Устанавливает параметр для включения образца пути.

ОбразецПути -> (строка)

Если включено, указывает образец пути.

СхемыВывода -> (список)

Указывает схему данных для источника S3 Parquet.

(структура)

Указывает схему, определённую пользователем, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

RelationalCatalogSource -> (структура)

Указывает хранилище данных реляционной базы данных в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

DynamoDBCatalogSource -> (структура)

Указывает хранилище данных DynamoDBC в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

JDBCConnectorTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбчатом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения, связанного с коннектором.

ТаблицаПодключения -> (строка)

Имя таблицы в целевом объекте данных.

ИмяКоннектора -> (строка)

Имя коннектора, который будет использоваться.

ТипПодключения -> (строка)

Тип подключения, например marketplace.jdbc или custom.jdbc, обозначающий подключение к целевому объекту данных JDBC.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для целевого объекта JDBC.

(структура)

Указывает схему, определённую пользователем, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorTarget -> (структура)

Указывает целевой объект, использующий коннектор Apache Spark.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения для коннектора Apache Spark.

ИмяКоннектора -> (строка)

Имя коннектора Apache Spark.

ТипПодключения -> (строка)

Тип подключения, например marketplace.spark или custom.spark, обозначающий подключение к хранилищу данных Apache Spark.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для пользовательского целевого объекта Spark.

(структура)

Указывает схему, определённую пользователем, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogTarget -> (структура)

Указывает целевой объект, использующий таблицу каталога данных Glue.

Имя -> (строка)

Имя вашего целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Ключи разбиения, используемые для распределения данных по нескольким разделам или фрагментам на основе определённого ключа или набора ключей.

(список)

(строка)

БазаДанных -> (строка)

База данных, содержащая таблицу, которую вы хотите использовать в качестве целевого объекта. Эта база данных должна уже существовать в каталоге данных.

Таблица -> (строка)

Таблица, определяющая схему ваших выходных данных. Эта таблица должна уже существовать в каталоге данных.

RedshiftTarget -> (структура)

Указывает целевой объект, использующий Amazon Redshift.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

БазаДанных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

IAM-роль с разрешениями.

UpsertRedshiftOptions -> (структура)

Набор параметров для настройки операции upsert при записи в целевой объект Redshift.

РасположениеТаблицы -> (строка)

Физическое расположение таблицы Redshift.

ИмяПодключения -> (строка)

Имя подключения для записи в Redshift.

КлючиUpsert -> (список)

Ключи, используемые для определения того, нужно ли выполнить обновление или вставку.

(строка)

S3CatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

БазаДанных -> (строка)

Имя базы данных для записи.

ПолитикаИзмененийСхемы -> (структура)

Политика, которая определяет поведение при обновлении для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение при обновлении, когда ползунок обнаруживает изменённую схему.

ПоведениеПриОбновлении -> (строка)

Поведение при обновлении, когда ползунок обнаруживает изменённую схему.

S3GlueParquetTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбчатом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Путь -> (строка)

Единственный путь Amazon S3 для записи.

Сжатие -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

КоличествоЦелевыхРазделов -> (строка)

Указывает количество целевых разделов для файлов Parquet при записи в Amazon S3 с помощью AWS Glue.

ПолитикаИзмененийСхемы -> (структура)

Политика, которая определяет поведение при обновлении для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение при обновлении, когда ползунок обнаруживает изменённую схему.

ПоведениеПриОбновлении -> (строка)

Поведение при обновлении, когда ползунок обнаруживает изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3HyperDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.

Name -> (строка)

Уникальный идентификатор узла HyperDirect назначения.

Inputs -> (список)

Указывает источник входных данных для узла HyperDirect назначения.

(строка)

PartitionKeys -> (список)

Определяет стратегию разбиения выходных данных.

(список)

(строка)

Path -> (строка)

Расположение в S3, куда будут записаны выходные данные.

Compression -> (строка)

Тип сжатия, применяемый к выходным данным.

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы во время операций записи.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении измененной схемы обработчиком.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3DirectTarget -> (структура)

Определяет целевой объект данных для записи в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с использованием последовательности ключей.

(список)

(строка)

Path -> (строка)

Единственный путь Amazon S3 для записи.

Compression -> (строка)

Указывает способ сжатия данных. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip".

NumberTargetPartitions -> (строка)

Указывает количество целевых разбиений при непосредственной записи данных в Amazon S3.

Format -> (строка)

Указывает формат выходных данных для целевого объекта.

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для обработчика.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении измененной схемы обработчиком.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3IcebergDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.

Name -> (строка)

Указывает уникальный идентификатор узла Iceberg в вашей цепочке обработки данных.

Inputs -> (список)

Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.

(строка)

PartitionKeys -> (список)

Указывает столбцы, используемые для разбиения данных таблицы Iceberg в S3.

(список)

(строка)

Path -> (строка)

Определяет расположение в S3, где будут храниться данные таблицы Iceberg.

Format -> (строка)

Указывает формат файлов данных таблицы Iceberg (например, Parquet, ORC).

AdditionalOptions -> (карта)

Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении измененной схемы обработчиком.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

Compression -> (строка)

Указывает кодек сжатия, используемый для файлов таблицы Iceberg в S3.

NumberTargetPartitions -> (строка)

Устанавливает количество целевых разбиений для распределения файлов таблицы Iceberg по S3.

ApplyMapping -> (структура)

Определяет преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте. Вы можете переименовывать ключи, изменять типы данных для ключей и выбирать ключи для удаления из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

Mapping -> (список)

Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте.

(структура)

Определяет сопоставление ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, как должно называться поле. Может быть таким же, как FromPath.

FromPath -> (список)

Таблица или столбец, подлежащие модификации.

(строка)

FromType -> (строка)

Тип данных, подлежащих модификации.

ToType -> (строка)

Тип данных, в который необходимо изменить данные.

Dropped -> (булево)

Если true, то столбец удаляется.

Children -> (список)

Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, а также один из её дочерних элементов, вы можете заполнить эту структуру данных. Это также Mapping, но её FromPath будет родительским FromPath плюс FromPath из этой структуры.

Для части children, предположим, у вас есть структура:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

Вы можете указать Mapping, которая выглядит следующим образом:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

(структура)

Определяет сопоставление ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, как должно называться поле. Может быть таким же, как FromPath.

FromPath -> (список)

Таблица или столбец, подлежащие модификации.

(строка)

FromType -> (строка)

Тип данных, подлежащих модификации.

ToType -> (строка)

Тип данных, в который необходимо изменить данные.

Dropped -> (булево)

Если true, то столбец удаляется.

SelectFields -> (структура)

Определяет преобразование, которое выбирает ключи свойств данных, которые нужно сохранить.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

Paths -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

DropFields -> (структура)

Определяет преобразование, которое выбирает ключи свойств данных, которые нужно удалить.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

Paths -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

RenameField -> (структура)

Определяет преобразование, которое переименовывает один ключ свойства данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

SourcePath -> (список)

Путь JSON к переменной в структуре данных для исходных данных.

(строка)

TargetPath -> (список)

Путь JSON к переменной в структуре данных для целевых данных.

(строка)

Spigot -> (структура)

Определяет преобразование, которое записывает образцы данных в хранилище Amazon S3.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

Path -> (строка)

Путь в Amazon S3, куда преобразование запишет подмножество записей из набора данных в файл JSON в хранилище Amazon S3.

Topk -> (целое число)

Указывает количество записей для записи, начиная с начала набора данных.

Prob -> (двойное число)

Вероятность (десятичное значение с максимальным значением 1) выбора любой заданной записи. Значение 1 означает, что каждая строка, считанная из набора данных, должна быть включена в выходной образец.

Join -> (структура)

Определяет преобразование, которое объединяет два набора данных в один набор данных с использованием сравнения по указанным ключам свойств данных. Вы можете использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

JoinType -> (строка)

Указывает тип объединения, который будет выполнен для наборов данных.

Columns -> (список)

Список двух столбцов, которые нужно объединить.

(структура)

Определяет столбец, который будет объединён.

From -> (строка)

Столбец для объединения.

Keys -> (список)

Ключ столбца для объединения.

(список)

(строка)

SplitFields -> (структура)

Определяет преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных, и один с оставшимися ключами свойств данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

Paths -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

SelectFromCollection -> (структура)

Определяет преобразование, которое выбирает один DynamicFrame из набора DynamicFrames. Выходной результат - выбранный DynamicFrame.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по именам узлов.

(строка)

Index -> (целое число)

Индекс для выбора DynamicFrame.

FillMissingValues -> (структура)

Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определенным методом импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

ImputedPath -> (строка)

Путь JSON к переменной в структуре данных набора данных, который импутируется.

FilledPath -> (строка)

Путь JSON к переменной в структуре данных набора данных, который заполняется.

Фильтр -> (структура)

Указывает преобразование, которое разделяет набор данных на два, основываясь на условии фильтрации.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

ЛогическийОператор -> (строка)

Оператор, используемый для фильтрации строк путем сравнения значения ключа со значением, указанным в условии.

Фильтры -> (список)

Указывает выражение фильтра.

(структура)

Указывает выражение фильтра.

Операция -> (строка)

Тип операции, выполняемой в выражении.

Отрицание -> (булево)

Необходимо ли отрицать выражение.

Значения -> (список)

Список значений фильтра.

(структура)

Представляет одну запись в списке значений для FilterExpression .

Тип -> (строка)

Тип значения фильтра.

Значение -> (список)

Значение, которое нужно ассоциировать.

(строка)

CustomCode -> (структура)

Указывает преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Результатом является коллекция DynamicFrames.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Код -> (строка)

Пользовательский код, используемый для выполнения преобразования данных.

ИмяКласса -> (строка)

Имя, определенное для класса узла пользовательского кода.

СхемыВывода -> (список)

Указывает схему данных для преобразования пользовательского кода.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkSQL -> (структура)

Указывает преобразование, где вы вводите SQL-запрос, используя синтаксис Spark SQL, для преобразования данных. Результатом является один DynamicFrame .

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов. Вы можете связать имя таблицы с каждым входным узлом для использования в SQL-запросе. Выбранное имя должно соответствовать ограничениям именования Spark SQL.

(строка)

SqlQuery -> (строка)

SQL-запрос, который должен использовать синтаксис Spark SQL и возвращать один набор данных.

SqlAliases -> (список)

Список псевдонимов. Псевдоним позволяет указать имя, которое следует использовать в SQL для заданного ввода. Например, у вас есть источник данных под названием «MyDataSource». Если вы укажете From как MyDataSource, и Alias как SqlName, то в вашем SQL вы можете сделать:

select * from SqlName

и это получит данные из MyDataSource.

(структура)

Представляет одну запись в списке значений для SqlAliases .

От -> (строка)

Таблица или столбец в таблице.

Псевдоним -> (строка)

Временное имя, присвоенное таблице или столбцу в таблице.

СхемыВывода -> (список)

Указывает схему данных для преобразования SparkSQL.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

DirectKinesisSource -> (структура)

Указывает прямой источник данных Amazon Kinesis.

Имя -> (строка)

Имя источника данных.

РазмерОкна -> (целое число)

Время, которое нужно потратить на обработку каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из поступающих данных.

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL конечной точки Kinesis.

ИмяПотока -> (строка)

Имя потока данных Kinesis.

Классификация -> (строка)

Необязательная классификация.

Разделитель -> (строка)

Указывает разделительный символ.

НачальнаяПозиция -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения: "latest" , "trim_horizon" , "earliest" или строка метки времени в формате UTC в шаблоне yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию: "latest" .

Примечание: Использование значения, которое является строкой метки времени в формате UTC, для «начальнойПозиции», поддерживается только для версии Glue 4.0 и выше.

МаксимальноеВремяОбработкиВМс -> (длинное целое число)

Максимальное время, которое узел выполнения тратит на чтение записей для текущего пакета из потока данных Kinesis, указанное в миллисекундах (мс). В течение этого времени может быть выполнено несколько вызовов API GetRecords . Значение по умолчанию: 1000 .

МаксимальноеЧислоЗаписейНаРаздел -> (длинное целое число)

Максимальное количество записей, извлекаемых на разбиение в потоке данных Kinesis за один микропакет. Примечание: клиент может превысить этот предел, если задача потокового выполнения уже прочитала дополнительные записи из Kinesis (в одном вызове get-records). Если MaxFetchRecordsPerShard требует строгости, оно должно быть кратно MaxRecordPerRead . Значение по умолчанию: 100000 .

МаксимальноеЧислоЗаписейНаЧтение -> (длинное целое число)

Максимальное количество записей, получаемых из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию: 10000 .

ДобавитьВремяПростояМеждуЧтениями -> (булево)

Добавляет задержку между двумя последовательными операциями getRecords. Значение по умолчанию: "False" . Этот параметр настраивается только для версии Glue 2.0 и выше.

ВремяПростояМеждуЧтениямиВМс -> (длинное целое число)

Минимальная задержка между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию: 1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.

ИнтервалОписанияРазделов -> (длинное целое число)

Минимальный интервал времени между двумя вызовами API ListShards для вашей программы, чтобы рассмотреть возможность решардинга. Значение по умолчанию: 1s .

КоличествоПовторов -> (целое число)

Максимальное количество повторов для запросов API Kinesis Data Streams. Значение по умолчанию: 3 .

ИнтервалПовтораВМс -> (длинное целое число)

Период охлаждения (указанный в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию: 1000 .

МаксимальныйИнтервалПовтораВМс -> (длинное целое число)

Максимальный период охлаждения (указанный в мс) между двумя повторными попытками вызова API Kinesis Data Streams. Значение по умолчанию: 10000 .

ИзбегатьПустыхПакет -> (булево)

Избегает создания пустого микропакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед запуском пакета. Значение по умолчанию: "False" .

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли, которая предполагается использовать с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения на операции describe или read record для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется вместе с "awsSTSSessionName" .

RoleSessionName -> (строка)

Идентификатор сессии, предполагающей роль с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется вместе с "awsSTSRoleARN" .

ДобавитьМеткаВремениЗаписи -> (строка)

Если этот параметр установлен в ‘true’, данные вывода будут содержать дополнительный столбец с именем “__src_timestamp”, который указывает время получения соответствующей записи потоком. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

Если этот параметр установлен в ‘true’, для каждого пакета будет генерироваться метрика длительности между самой старой записью, полученной потоком, и временем ее прихода в Glue в CloudWatch. Имя метрики: “glue.driver.streaming.maxConsumerLagInMs”. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

НачальнаяМеткаВремени -> (метка времени)

Метка времени записи в потоке данных Kinesis для начала чтения данных. Возможные значения: строка метки времени в формате UTC в шаблоне yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: “2023-04-04T08:00:00+08:00”).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

ВремяОпроса -> (длинное целое число)

Время опроса в миллисекундах.

ПределОпросаЗаписей -> (длинное целое число)

Предел количества опрошенных записей.

DirectKafkaSource -> (структура)

Определяет хранилище данных Apache Kafka.

Name -> (строка)

Имя хранилища данных.

StreamingOptions -> (структура)

Определяет параметры потоковой передачи.

BootstrapServers -> (строка)

Список URL-адресов серверов начальной загрузки, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения - "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя соединения.

TopicName -> (строка)

Имя темы, указанное в Apache Kafka. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретная TopicPartitions для потребления. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярного выражения, определяющая список тем для подписки. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Определяет разделитель.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения - "earliest" или "latest". Значение по умолчанию - "latest".

EndingOffsets -> (строка)

Конечная точка при завершении запроса пакетной обработки. Возможные значения — "latest" или строка JSON, определяющая конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (целое число)

Таймаут в миллисекундах для опроса данных из Kafka в исполнителях задач Spark. Значение по умолчанию - 512.

NumRetries -> (целое число)

Количество попыток повторной обработки перед отказом в получении смещений Kafka. Значение по умолчанию - 3.

RetryIntervalMs -> (целое число)

Время ожидания в миллисекундах перед повторной попыткой получить смещения Kafka. Значение по умолчанию - 10.

MaxOffsetsPerTrigger -> (целое число)

Предельная скорость обработки максимального количества смещений за один интервал срабатывания. Указанное общее количество смещений пропорционально разделяется между topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель считывает все смещения до известного последнего смещения.

MinPartitions -> (целое число)

Желаемое минимальное количество партиций для чтения из Kafka. Значение по умолчанию — null, что означает, что количество партиций Spark равно количеству партиций Kafka.

IncludeHeaders -> (логическое)

Включать ли заголовки Kafka. При значении «true» выходные данные будут содержать дополнительный столбец с именем «glue_streaming_kafka_headers» и типом Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и выше.

AddRecordTimestamp -> (строка)

При значении ‘true’ выходные данные будут содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующего сообщения темой. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При значении ‘true’ для каждой группы будет отображаться метрика продолжительности между самым старым сообщением, полученным темой, и временем его прибытия в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (метка времени)

Метка времени сообщения в теме Kafka, с которой начинать чтение данных. Возможные значения — строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).

Только один из параметров StartingTimestamp или StartingOffsets должен быть задан.

WindowSize -> (целое число)

Время, которое нужно потратить на обработку каждого микропакета.

DetectSchema -> (логическое)

Автоматически определять схему из входящих данных.

DataPreviewOptions -> (структура)

Определяет параметры, связанные с предварительным просмотром данных для просмотра выборки данных.

PollingTime -> (целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (целое число)

Предел количества опрошенных записей.

CatalogKinesisSource -> (структура)

Определяет источник данных Kinesis в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

WindowSize -> (целое число)

Время, которое нужно потратить на обработку каждого микропакета.

DetectSchema -> (логическое)

Автоматически определять схему из входящих данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL-адрес конечной точки Kinesis.

StreamName -> (строка)

Имя потока данных Kinesis.

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingPosition -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения - "latest", "trim_horizon", "earliest" или строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию - "latest".

Примечание: Использование значения, являющегося строкой метки времени в формате UTC для «startingPosition», поддерживается только в версии Glue 4.0 и выше.

MaxFetchTimeInMs -> (целое число)

Максимальное время, затрачиваемое исполнителем задачи на чтение записей для текущего пакета из потока данных Kinesis, указанное в миллисекундах (мс). За это время могут быть выполнены несколько GetRecords вызовов API. Значение по умолчанию — 1000.

MaxFetchRecordsPerShard -> (целое число)

Максимальное количество записей для получения на разрез в потоке данных Kinesis за микропакет. Примечание: клиент может превысить этот лимит, если рабочая задача потоковой передачи уже прочла дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard необходимо строго соблюдать, то оно должно быть кратно MaxRecordPerRead. Значение по умолчанию — 100000.

MaxRecordPerRead -> (целое число)

Максимальное количество записей, извлекаемых из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию — 10000.

AddIdleTimeBetweenReads -> (логическое)

Добавляет временную задержку между двумя последовательными операциями getRecords. Значение по умолчанию — "False". Этот параметр настраивается только для версии Glue 2.0 и выше.

IdleTimeBetweenReadsInMs -> (целое число)

Минимальная временная задержка между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию — 1000. Этот параметр настраивается только для версии Glue 2.0 и выше.

DescribeShardInterval -> (целое число)

Минимальный интервал времени между двумя вызовами ListShards API для вашего скрипта, чтобы рассмотреть возможность перераспределения. Значение по умолчанию — 1s.

NumRetries -> (целое число)

Максимальное число попыток повторной обработки для запросов к API потоков данных Kinesis. Значение по умолчанию — 3.

RetryIntervalMs -> (целое число)

Время ожидания (указанное в мс) перед повторной попыткой вызова API потоков данных Kinesis. Значение по умолчанию — 1000.

MaxRetryIntervalMs -> (целое число)

Максимальное время ожидания (указанное в мс) между двумя попытками повторной обработки вызова API потоков данных Kinesis. Значение по умолчанию — 10000.

AvoidEmptyBatches -> (логическое)

Избегает создания пустой работы микропакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед началом пакета. Значение по умолчанию — "False".

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли для принятия AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения на операции описания или чтения записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSSessionName".

RoleSessionName -> (строка)

Идентификатор сеанса принятия роли с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSRoleARN".

AddRecordTimestamp -> (строка)

При значении ‘true’ выходные данные будут содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующего сообщения потоком. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При значении ‘true’ для каждой группы будет отображаться метрика продолжительности между самым старым сообщением, полученным потоком, и временем его прибытия в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (метка времени)

Метка времени сообщения в потоке данных Kinesis, с которой начинать чтение данных. Возможные значения — строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

PollingTime -> (целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (целое число)

Предел количества опрошенных записей.

CatalogKafkaSource -> (структура)

Указывает хранилище данных Apache Kafka в каталоге данных.

Name -> (строка)

Имя хранилища данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из входящих данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Указывает параметры потоковой передачи.

BootstrapServers -> (строка)

Список адресов серверов Bootstrap, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения — "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя подключения.

TopicName -> (строка)

Имя темы, как указано в Apache Kafka. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретный TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярных выражений, определяющая список тем для подписки. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения — "earliest" или "latest". Значение по умолчанию — "latest".

EndingOffsets -> (строка)

Конечная точка, когда запрос на пакет завершен. Возможные значения — либо "latest", либо строка JSON, определяющая конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (длинное целое число)

Тайм-аут в миллисекундах для опроса данных из Kafka в исполнителях задач Spark. Значение по умолчанию — 512.

NumRetries -> (целое число)

Количество попыток повтора перед отказом при получении смещений Kafka. Значение по умолчанию — 3.

RetryIntervalMs -> (длинное целое число)

Время в миллисекундах ожидания повторной попытки получения смещений Kafka. Значение по умолчанию — 10.

MaxOffsetsPerTrigger -> (длинное целое число)

Предел скорости максимального количества смещений, обрабатываемых за интервал срабатывания. Указанное общее количество смещений пропорционально разделено на topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель читает все смещения до известного последнего смещения.

MinPartitions -> (целое число)

Желаемое минимальное количество партиций для чтения из Kafka. Значение по умолчанию — null, что означает, что количество партиций spark равно количеству партиций Kafka.

IncludeHeaders -> (булево)

Включать заголовки Kafka. При установке параметра в «true» вывод данных будет содержать дополнительный столбец с именем «glue_streaming_kafka_headers» и типом Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и более поздних.

AddRecordTimestamp -> (строка)

При установке этого параметра в ‘true’, вывод данных будет содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующего сообщения темой. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 или более поздних.

EmitConsumerLagMetrics -> (строка)

При установке этого параметра в ‘true’, для каждого пакета будут выводиться метрики для периода между самым старым сообщением, полученным темой, и временем его прибытия в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 или более поздних.

StartingTimestamp -> (метка времени)

Метка времени сообщения в теме Kafka для начала чтения данных. Возможные значения — строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).

Должен быть установлен только один из StartingTimestamp или StartingOffsets.

DataPreviewOptions -> (структура)

Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.

PollingTime -> (длинное целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое число)

Предел числа опрошенных сообщений.

DropNullFields -> (структура)

Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, которые являются «null», целые числа -1 или другие заполнитель, такие как нули, не распознаются автоматически как нулевые.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, определенные по их именам узлов.

(строка)

NullCheckBoxList -> (структура)

Структура, представляющая, распознаются ли определенные значения как нулевые значения для удаления.

IsEmpty -> (булево)

Указывает, что пустая строка рассматривается как нулевое значение.

IsNullString -> (булево)

Указывает, что значение, представляющее слово «null», рассматривается как нулевое значение.

IsNegOne -> (булево)

Указывает, что целое число -1 рассматривается как нулевое значение.

NullTextList -> (список)

Структура, определяющая список структур NullValueField, представляющих пользовательское нулевое значение, например, ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.

Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение заполнителя нулевого значения и тип данных совпадают с данными.

(структура)

Представляет пользовательское нулевое значение, например, ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.

Value -> (строка)

Значение заполнителя нулевого значения.

Datatype -> (структура)

Тип данных значения.

Id -> (строка)

Тип данных значения.

Label -> (строка)

Метка, назначенная типу данных.

Merge -> (структура)

Указывает преобразование, которое объединяет DynamicFrame со стекингом DynamicFrame на основе указанных первичных ключей для идентификации записей. Повторные записи (записи с одинаковыми первичными ключами) не удаляются.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, определенные по их именам узлов.

(строка)

Source -> (строка)

Источник DynamicFrame, который будет объединен со стекингом DynamicFrame.

PrimaryKeys -> (список)

Список полей первичных ключей для сопоставления записей из исходного и стекингового динамических кадров.

(список)

(строка)

Union -> (структура)

Указывает преобразование, которое объединяет строки из двух или более наборов данных в один результат.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узла ID для преобразования.

(строка)

UnionType -> (строка)

Указывает тип преобразования Union.

Укажите ALL, чтобы объединить все строки из источников данных в результирующий DynamicFrame. Результирующий union не удаляет дублируемые строки.

Укажите DISTINCT, чтобы удалить дублируемые строки в результирующем DynamicFrame.

PIIDetection -> (структура)

Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узла ID для преобразования.

(строка)

PiiType -> (строка)

Указывает тип преобразования PIIDetection.

EntityTypesToDetect -> (список)

Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.

Сущности типа PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE

(строка)

OutputColumnName -> (строка)

Указывает имя выходного столбца, который будет содержать любой тип сущности, обнаруженный в этой строке.

SampleFraction -> (двойное число)

Указывает долю данных для выборки при сканировании сущностей PII.

ThresholdFraction -> (двойное число)

Указывает долю данных, которая должна быть достигнута для того, чтобы столбец был идентифицирован как данные PII.

MaskValue -> (строка)

Указывает значение, которое заменит обнаруженную сущность.

Aggregate -> (структура)

Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по заданной функции.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Указывает поля и строки, используемые в качестве входов для преобразования агрегирования.

(строка)

Groups -> (список)

Указывает поля для группировки.

(список)

(строка)

Aggs -> (список)

Указывает функции агрегирования, которые будут выполняться над указанными полями.

(структура)

Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании агрегирования.

Column -> (список)

Указывает столбец в наборе данных, к которому будет применена функция агрегирования.

(строка)

AggFunc -> (строка)

Указывает функцию агрегирования для применения.

Возможные функции агрегирования: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

DropDuplicates -> (структура)

Указывает преобразование, удаляющее строки с повторяющимися данными из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, определенные по их именам узлов.

(строка)

Columns -> (список)

Имя столбцов, которые будут объединены или удалены при повторении.

(список)

(строка)

GovernedCatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в управляемый каталог.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

База данных -> (строка)

Имя базы данных для записи.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для управляемого каталога.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда обходчик обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда обходчик обнаруживает изменённую схему.

GovernedCatalogSource -> (структура)

Указывает источник данных в управляемом каталоге данных.

Имя -> (строка)

Имя хранилища данных.

База данных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

PartitionPredicate -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в рамках периода хранения в этих разбиениях не удаляются. Устанавливается в "" – по умолчанию пусто.

Дополнительные параметры -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обрабатываться.

BoundedFiles -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обрабатываться.

MicrosoftSQLServerCatalogSource -> (структура)

Указывает источник данных Microsoft SQL Server в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

MySQLCatalogSource -> (структура)

Указывает источник данных MySQL в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

OracleSQLCatalogSource -> (структура)

Указывает источник данных Oracle в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

PostgreSQLCatalogSource -> (структура)

Указывает источник данных PostgresSQL в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

MicrosoftSQLServerCatalogTarget -> (структура)

Указывает целевой объект, использующий Microsoft SQL.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

База данных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

MySQLCatalogTarget -> (структура)

Указывает целевой объект, использующий MySQL.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

База данных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

OracleSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Oracle SQL.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

База данных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

PostgreSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Postgres SQL.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

База данных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

DynamicTransform -> (структура)

Указывает пользовательскую визуальную трансформацию, созданную пользователем.

Имя -> (строка)

Указывает имя динамической трансформации.

ИмяТрансформации -> (строка)

Указывает имя динамической трансформации, как оно отображается в визуальном редакторе Glue Studio.

Входы -> (список)

Указывает входные данные для динамической трансформации, которые требуются.

(строка)

Параметры -> (список)

Указывает параметры динамической трансформации.

(структура)

Указывает параметры в файле конфигурации динамической трансформации.

Имя -> (строка)

Указывает имя параметра в файле конфигурации динамической трансформации.

Тип -> (строка)

Указывает тип параметра в файле конфигурации динамической трансформации.

ПравилоПроверки -> (строка)

Указывает правило проверки в файле конфигурации динамической трансформации.

СообщениеОПроверке -> (строка)

Указывает сообщение о проверке в файле конфигурации динамической трансформации.

Значение -> (список)

Указывает значение параметра в файле конфигурации динамической трансформации.

(строка)

ТипСписка -> (строка)

Указывает тип списка параметра в файле конфигурации динамической трансформации.

Необязательно -> (булево)

Указывает, является ли параметр необязательным или нет в файле конфигурации динамической трансформации.

ИмяФункции -> (строка)

Указывает имя функции динамической трансформации.

Путь -> (строка)

Указывает путь к исходным файлам динамической трансформации и файлам конфигурации.

Версия -> (строка)

Это поле не используется и будет устаревшим в будущих версиях.

OutputSchemas -> (список)

Указывает схему данных для динамической трансформации.

(структура)

Указывает пользовательскую схему, когда схема не может быть определена Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

EvaluateDataQuality -> (структура)

Указывает критерии оценки качества данных.

Имя -> (строка)

Имя оценки качества данных.

Входы -> (список)

Входы вашей оценки качества данных.

(строка)

НаборПравил -> (строка)

Набор правил для оценки качества данных.

Вывод -> (строка)

Вывод вашей оценки качества данных.

PublishingOptions -> (структура)

Параметры для настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов качества данных.

StopJobOnFailureOptions -> (структура)

Параметры для настройки остановки задания при сбое оценки качества данных.

StopJobOnFailureTiming -> (строка)

Когда остановить задание, если оценка качества данных завершилась неудачно. Варианты: Сразу или ПослеЗагрузкиДанных.

S3CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Имя -> (строка)

Имя источника данных Hudi.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

Дополнительные параметры Hudi -> (карта)

Указывает дополнительные параметры подключения.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает пользовательскую схему, когда схема не может быть определена Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.

Имя -> (строка)

Имя источника данных Hudi.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

Дополнительные параметры Hudi -> (карта)

Указывает дополнительные параметры подключения.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает пользовательскую схему, когда схема не может быть определена Glue.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiSource -> (структура)

Определяет источник данных Hudi, хранящийся в Amazon S3.

Имя -> (строка)

Имя источника Hudi.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ДополнительныеОпцииHudi -> (отображение)

Указывает дополнительные параметры подключения.

ключ -> (строка)

значение -> (строка)

ДополнительныеОпции -> (структура)

Указывает дополнительные параметры для коннектора.

ОграниченныйРазмер -> (длинное целое)

Устанавливает максимальный размер целевого набора данных в байтах, который будет обработан.

ОграниченноеЧислоФайлов -> (длинное целое)

Устанавливает максимальное число целевых файлов, которые будут обработаны.

ВключитьОбразецПути -> (булево)

Устанавливает опцию для включения образца пути.

ПутьОбразца -> (строка)

Если включено, указывает путь образца.

СхемыВывода -> (список)

Определяет схему данных для источника Hudi.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiКаталогЦель -> (структура)

Определяет цель, которая записывает в источник данных Hudi в каталоге данных Glue.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

КлючиРазбиения -> (список)

Указывает нативное разбиение, используя последовательность ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

БазаДанных -> (строка)

Имя базы данных для записи.

ДополнительныеОпции -> (отображение)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

ПолитикаИзмененийСхемы -> (структура)

Политика, которая определяет поведение обновления для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда ползунок обнаруживает изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда ползунок обнаруживает изменённую схему.

S3HudiПрямаяЦель -> (структура)

Определяет цель, которая записывает в источник данных Hudi в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

Путь -> (строка)

Путь Amazon S3 вашего источника данных Hudi для записи.

Сжатие -> (строка)

Указывает, как сжимаются данные. Обычно это не требуется, если у данных есть стандартное расширение файла. Возможные значения — "gzip" и "bzip").

ЧислоЦелевыхРазделов -> (строка)

Указывает число целевых разделов для распределения файлов набора данных Hudi по Amazon S3.

КлючиРазбиения -> (список)

Указывает нативное разбиение, используя последовательность ключей.

(список)

(строка)

Формат -> (строка)

Указывает формат выходных данных для цели.

ДополнительныеОпции -> (отображение)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

ПолитикаИзмененийСхемы -> (структура)

Политика, которая определяет поведение обновления для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда ползунок обнаруживает изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда ползунок обнаруживает изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

DirectJDBCИсточник -> (структура)

Определяет подключение прямого JDBC источника.

Имя -> (строка)

Имя подключения JDBC источника.

БазаДанных -> (строка)

База данных подключения JDBC источника.

Таблица -> (строка)

Таблица подключения JDBC источника.

ИмяПодключения -> (строка)

Имя подключения JDBC источника.

ТипПодключения -> (строка)

Тип подключения JDBC источника.

RedshiftTmpDir -> (строка)

Папка временных файлов источника JDBC Redshift.

S3КаталогDeltaИсточник -> (структура)

Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Имя -> (строка)

Имя источника данных Delta Lake.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

ДополнительныеDeltaОпции -> (отображение)

Указывает дополнительные параметры подключения.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

КаталогDeltaИсточник -> (структура)

Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue.

Имя -> (строка)

Имя источника данных Delta Lake.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

ДополнительныеDeltaОпции -> (отображение)

Указывает дополнительные параметры подключения.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaИсточник -> (структура)

Определяет источник данных Delta Lake, хранящийся в Amazon S3.

Имя -> (строка)

Имя источника Delta Lake.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ДополнительныеDeltaОпции -> (отображение)

Указывает дополнительные параметры подключения.

ключ -> (строка)

значение -> (строка)

ДополнительныеОпции -> (структура)

Указывает дополнительные параметры для коннектора.

ОграниченныйРазмер -> (длинное целое)

Устанавливает максимальный размер целевого набора данных в байтах, который будет обработан.

ОграниченноеЧислоФайлов -> (длинное целое)

Устанавливает максимальное число целевых файлов, которые будут обработаны.

ВключитьОбразецПути -> (булево)

Устанавливает опцию для включения образца пути.

ПутьОбразца -> (строка)

Если включено, указывает путь образца.

СхемыВывода -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3КаталогDeltaЦель -> (структура)

Определяет цель, которая записывает в источник данных Delta Lake в каталоге данных Glue.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами в целевой объект данных.

(строка)

КлючиРазбиения -> (список)

Указывает нативное разбиение, используя последовательность ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

БазаДанных -> (строка)

Имя базы данных для записи.

ДополнительныеОпции -> (отображение)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

ПолитикаИзмененийСхемы -> (структура)

Политика, которая определяет поведение обновления для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда ползунок обнаруживает изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда ползунок обнаруживает изменённую схему.

S3DeltaПрямаяЦель -> (структура)

Определяет целевой объект, который записывает данные в источник Delta Lake в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативную партицию, используя последовательность ключей.

(список)

(строка)

Путь -> (строка)

Путь Amazon S3 для вашего источника данных Delta Lake, в который необходимо записать данные.

Сжатие -> (строка)

Определяет способ сжатия данных. Как правило, это не требуется, если данные имеют стандартное расширение файла. Возможные значения: "gzip" и "bzip".

Количество целевых партиций -> (строка)

Указывает количество целевых партиций для распределения файлов набора данных Delta Lake по Amazon S3.

Формат -> (строка)

Определяет формат выходных данных для целевого объекта.

Дополнительные параметры -> (карта)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

Политика изменений схемы -> (структура)

Политика, определяющая поведение обновления для сканера.

Включить обновление каталога -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает измененную схему.

Поведение при обновлении -> (строка)

Поведение при обновлении, когда сканер обнаруживает измененную схему.

Таблица -> (строка)

Указывает таблицу в базе данных, на которую распространяется политика изменения схемы.

База данных -> (строка)

Указывает базу данных, на которую распространяется политика изменения схемы.

AmazonRedshiftSource -> (структура)

Определяет целевой объект, который записывает данные в источник данных в Amazon Redshift.

Имя -> (строка)

Имя источника Amazon Redshift.

Данные -> (структура)

Указывает данные узла источника Amazon Reshift.

Тип доступа -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

Тип источника -> (строка)

Тип источника, определяющий, является ли источником конкретная таблица или пользовательский запрос.

Подключение -> (структура)

Подключение Glue к кластеру Redshift.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

База данных каталога -> (структура)

Имя базы данных каталога данных Glue при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица каталога -> (структура)

Имя таблицы каталога данных Glue при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема Redshift каталога -> (строка)

Имя схемы Redshift при работе с каталогом данных.

Таблица Redshift каталога -> (строка)

Таблица базы данных для чтения.

Временная папка -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

Роль IAM -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Если поле пустое, роль IAM по умолчанию берется из роли в задании.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Дополнительные параметры -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Ключ -> (строка)

Ключ дополнительного параметра подключения.

Значение -> (строка)

Значение дополнительного параметра подключения.

Пример запроса -> (строка)

SQL, используемый для получения данных из источников Redshift, когда тип источника — ‘запрос’.

Действие до -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Действие после -> (строка)

SQL, используемый после MERGE или APPEND с upsert.

Действие -> (строка)

Определяет, как будет происходить запись в кластер Redshift.

Префикс таблицы -> (строка)

Указывает префикс таблицы.

Upsert -> (булево)

Действие, выполняемое над Redshift-целями при использовании APPEND.

Действие Merge -> (строка)

Действие, определяющее, как будет обрабатываться MERGE в Redshift-целях.

MergeWhenMatched -> (строка)

Действие, определяющее, как будет обрабатываться MERGE в Redshift-целях, когда существует совпадающая запись.

MergeWhenNotMatched -> (строка)

Действие, определяющее, как будет обрабатываться MERGE в Redshift-целях, когда существующей записи нет в новой записи.

Оператор Merge -> (строка)

SQL, используемый в пользовательском merge для работы с совпадающими записями.

Подключение сканера -> (строка)

Указывает имя подключения, связанного с таблицей каталога.

Схема таблицы -> (список)

Массив схем вывода для заданного узла.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица предварительной обработки -> (строка)

Имя временной таблицы предварительной обработки, используемой при MERGE или APPEND с upsert.

Выбранные столбцы -> (список)

Список имен столбцов, используемых для определения совпадения записей при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

AmazonRedshiftTarget -> (структура)

Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.

Name -> (строка)

Имя целевого объекта Amazon Redshift.

Data -> (структура)

Указывает данные узла целевого объекта Amazon Redshift.

AccessType -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

SourceType -> (строка)

Тип источника, чтобы указать, является ли источником определенная таблица или пользовательский запрос.

Connection -> (структура)

Подключение Glue к кластеру Redshift.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Table -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogDatabase -> (структура)

Имя базы данных Glue Data Catalog при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogTable -> (структура)

Имя таблицы Glue Data Catalog при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogRedshiftSchema -> (строка)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (строка)

Таблица базы данных для чтения.

TempDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

IamRole -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Если поле пустое, роль IAM будет по умолчанию роли задачи.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdvancedOptions -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Key -> (строка)

Ключ дополнительного параметра подключения.

Value -> (строка)

Значение дополнительного параметра подключения.

SampleQuery -> (строка)

SQL, используемый для извлечения данных из источника Redshift, когда SourceType равен ‘query’.

PreAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

PostAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Action -> (строка)

Указывает, как будет происходить запись в кластер Redshift.

TablePrefix -> (строка)

Указывает префикс к таблице.

Upsert -> (булево)

Действие, используемое для Redshift приемников при APPEND.

MergeAction -> (строка)

Действие, используемое для определения обработки MERGE в приемнике Redshift.

MergeWhenMatched -> (строка)

Действие, используемое для определения обработки MERGE в приемнике Redshift при совпадении существующей записи с новой.

MergeWhenNotMatched -> (строка)

Действие, используемое для определения обработки MERGE в приемнике Redshift при отсутствии совпадения существующей записи с новой.

MergeClause -> (строка)

SQL, используемый в пользовательском MERGE для обработки сопоставляемых записей.

CrawlerConnection -> (строка)

Указывает имя подключения, связанного с используемой таблицей каталога.

TableSchema -> (список)

Массив схем вывода для данного узла.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

StagingTable -> (строка)

Имя временной таблицы хранения, используемой при MERGE или APPEND с upsert.

SelectedColumns -> (список)

Список имен столбцов, используемых для определения сопоставляемой записи при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

EvaluateDataQualityMultiFrame -> (структура)

Указывает критерии оценки качества данных. Позволяет использовать несколько входных данных и возвращает набор динамических фреймов.

Name -> (строка)

Название оценки качества данных.

Inputs -> (список)

Входы вашей оценки качества данных. Первый вход в этом списке — основной источник данных.

(строка)

AdditionalDataSources -> (отображение)

Псевдонимы всех источников данных, кроме основного.

ключ -> (строка)

значение -> (строка)

Ruleset -> (строка)

Набор правил для оценки качества данных.

PublishingOptions -> (структура)

Параметры настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

AdditionalOptions -> (отображение)

Параметры настройки поведения преобразования во время выполнения.

ключ -> (строка)

значение -> (строка)

StopJobOnFailureOptions -> (структура)

Параметры настройки поведения задачи при сбое оценки качества данных.

StopJobOnFailureTiming -> (строка)

Время остановки задачи при сбое оценки качества данных. Доступные варианты: Немедленно или ПослеЗагрузкиДанных.

Recipe -> (структура)

Указывает узел рецепта Glue DataBrew.

Name -> (строка)

Имя узла Glue Studio.

Inputs -> (список)

Узлы, являющиеся входными для узла рецепта, определенные по идентификатору.

(строка)

RecipeReference -> (структура)

Ссылка на рецепт DataBrew, используемый узлом.

RecipeArn -> (строка)

ARN рецепта DataBrew.

RecipeVersion -> (строка)

Версия рецепта DataBrew.

RecipeSteps -> (список)

Шаги преобразования, используемые в узле рецепта.

(структура)

Шаг рецепта, используемый в узле подготовки данных рецепта Glue Studio.

Action -> (структура)

Действие преобразования шага рецепта.

Operation -> (строка)

Операция действия рецепта.

Parameters -> (отображение)

Параметры действия рецепта.

ключ -> (строка)

значение -> (строка)

ConditionExpressions -> (список)

Условные выражения для шага рецепта.

(структура)

Условное выражение, определенное в узле подготовки данных рецепта Glue Studio.

Condition -> (строка)

Условие условного выражения.

Value -> (строка)

Значение условного выражения.

TargetColumn -> (строка)

Целевой столбец условных выражений.

SnowflakeSource -> (структура)

Определяет источник данных Snowflake.

Name -> (строка)

Имя источника данных Snowflake.

Data -> (структура)

Настройка источника данных Snowflake.

SourceType -> (строка)

Определяет способ указания извлечённых данных. Допустимые значения: "table" , "query" .

Connection -> (структура)

Определяет подключение к каталогу данных Glue для Snowflake-точке.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (строка)

Указывает схему базы данных Snowflake, которую должен использовать узел.

Table -> (строка)

Указывает таблицу Snowflake, которую должен использовать узел.

Database -> (строка)

Указывает базу данных Snowflake, которую должен использовать узел.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdditionalOptions -> (отображение)

Определяет дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны где-то ещё в этом узле, эти параметры имеют приоритет.

key -> (строка)

value -> (строка)

SampleQuery -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

PreAction -> (строка)

Строка SQL, выполняемая перед тем, как коннектор Snowflake выполнит свои стандартные действия.

PostAction -> (строка)

Строка SQL, выполняемая после того, как коннектор Snowflake выполнит свои стандартные действия.

Action -> (строка)

Определяет действие, которое должно быть выполнено при записи в таблицу с уже существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Action равно append . Определяет поведение при разрешении, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

MergeAction -> (строка)

Определяет действие слияния. Допустимые значения: simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .

MergeWhenMatched -> (строка)

Определяет, как разрешить записи, совпадающие с существующими данными при слиянии. Допустимые значения: update , delete .

MergeWhenNotMatched -> (строка)

Определяет, как обработать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

MergeClause -> (строка)

SQL-выражение, определяющее пользовательское поведение слияния.

StagingTable -> (строка)

Имя временной таблицы, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table сгенерированным действием postaction.

SelectedColumns -> (список)

Определяет столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upserts. Список структур с ключами value , label и description . Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AutoPushdown -> (булево)

Указывает, включена ли автоматическая передача запросов вниз. Если передача запросов вниз включена, при запуске запроса в Spark, если часть запроса может быть "передана вниз" на сервер Snowflake, она передаётся вниз. Это повышает производительность некоторых запросов.

TableSchema -> (список)

Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

OutputSchemas -> (список)

Определяет схемы, определённые пользователем, для выходных данных.

(структура)

Определяет схему, определённую пользователем, когда схему нельзя определить с помощью Glue.

Columns -> (список)

Определяет определения столбцов, составляющих схему Glue.

(структура)

Определяет отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SnowflakeTarget -> (структура)

Определяет целевой объект, который записывает данные в источник Snowflake.

Name -> (строка)

Имя целевого объекта Snowflake.

Data -> (структура)

Определяет данные целевого узла Snowflake.

SourceType -> (строка)

Определяет способ указания извлечённых данных. Допустимые значения: "table" , "query" .

Connection -> (структура)

Определяет подключение к каталогу данных Glue для Snowflake-точке.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (строка)

Указывает схему базы данных Snowflake, которую должен использовать узел.

Table -> (строка)

Указывает таблицу Snowflake, которую должен использовать узел.

Database -> (строка)

Указывает базу данных Snowflake, которую должен использовать узел.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdditionalOptions -> (отображение)

Определяет дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны где-то ещё в этом узле, эти параметры имеют приоритет.

key -> (строка)

value -> (строка)

SampleQuery -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

PreAction -> (строка)

Строка SQL, выполняемая перед тем, как коннектор Snowflake выполнит свои стандартные действия.

PostAction -> (строка)

Строка SQL, выполняемая после того, как коннектор Snowflake выполнит свои стандартные действия.

Action -> (строка)

Определяет действие, которое должно быть выполнено при записи в таблицу с уже существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Action равно append . Определяет поведение при разрешении, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

MergeAction -> (строка)

Определяет действие слияния. Допустимые значения: simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .

MergeWhenMatched -> (строка)

Определяет, как разрешить записи, совпадающие с существующими данными при слиянии. Допустимые значения: update , delete .

MergeWhenNotMatched -> (строка)

Определяет, как обработать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

MergeClause -> (строка)

SQL-выражение, определяющее пользовательское поведение слияния.

StagingTable -> (строка)

Имя временной таблицы, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table сгенерированным действием postaction.

SelectedColumns -> (список)

Определяет столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upserts. Список структур с ключами value , label и description . Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AutoPushdown -> (булево)

Указывает, включена ли автоматическая передача запросов вниз. Если передача запросов вниз включена, при запуске запроса в Spark, если часть запроса может быть "передана вниз" на сервер Snowflake, она передаётся вниз. Это повышает производительность некоторых запросов.

TableSchema -> (список)

Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ConnectorDataSource -> (структура)

Указывает на источник, сгенерированный со стандартными параметрами подключения.

Имя -> (строка)

Имя этого узла источника.

Тип подключения -> (строка)

connectionType, предоставленный библиотеке Glue. Этот тип узла поддерживает следующие типы подключения:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Данные -> (словарь)

Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации по Glue.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Определяет схему данных для этого источника.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ConnectorDataTarget -> (структура)

Указывает на целевой объект, сгенерированный со стандартными параметрами подключения.

Имя -> (строка)

Имя этого узла целевого объекта.

Тип подключения -> (строка)

connectionType, предоставленный библиотеке Glue. Этот тип узла поддерживает следующие типы подключения:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Данные -> (словарь)

Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации по Glue.

ключ -> (строка)

значение -> (строка)

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

ExecutionClass -> (строка)

Указывает, выполняется ли работа со стандартным или гибким классом выполнения. Стандартный класс выполнения идеально подходит для задач с временными ограничениями, требующих быстрого запуска работы и выделенных ресурсов.

Гибкий класс выполнения подходит для работ, не зависящих от времени, время начала и завершения которых может изменяться.

Только работы с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для работ Spark.

SourceControlDetails -> (структура)

Подробная информация о конфигурации системы контроля версий для работы, позволяющая синхронизировать артефакты работы с удаленным хранилищем или из него.

Поставщик -> (строка)

Поставщик удаленного хранилища.

Хранилище -> (строка)

Имя удаленного хранилища, содержащего артефакты работы.

Владелец -> (строка)

Владелец удаленного хранилища, содержащего артефакты работы.

Ветка -> (строка)

Необязательная ветка в удаленном хранилище.

Папка -> (строка)

Необязательная папка в удаленном хранилище.

Последний идентификатор коммита -> (строка)

Последний идентификатор коммита для коммита в удаленном хранилище.

Стратегия аутентификации -> (строка)

Тип аутентификации, который может быть токеном аутентификации, хранящимся в Amazon Web Services Secrets Manager, или личным токеном доступа.

Токен аутентификации -> (строка)

Значение токена авторизации.

MaintenanceWindow -> (строка)

Это поле указывает день недели и час для окна обслуживания для потоковых работ. Glue периодически выполняет задачи обслуживания. Во время этих окон обслуживания Glue потребуется перезапустить ваши потоковые работы.

Glue перезапустит работу в течение 3 часов от указанного окна обслуживания. Например, если вы настроили окно обслуживания на понедельник в 10:00 по Гринвичу, ваши работы будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.

JSON Синтаксис:

{
  "JobMode": "SCRIPT"|"VISUAL"|"NOTEBOOK",
  "JobRunQueuingEnabled": true|false,
  "Description": "string",
  "LogUri": "string",
  "Role": "string",
  "ExecutionProperty": {
    "MaxConcurrentRuns": integer
  },
  "Command": {
    "Name": "string",
    "ScriptLocation": "string",
    "PythonVersion": "string",
    "Runtime": "string"
  },
  "DefaultArguments": {"string": "string"
    ...},
  "NonOverridableArguments": {"string": "string"
    ...},
  "Connections": {
    "Connections": ["string", ...]
  },
  "MaxRetries": integer,
  "AllocatedCapacity": integer,
  "Timeout": integer,
  "MaxCapacity": double,
  "WorkerType": "Standard"|"G.1X"|"G.2X"|"G.025X"|"G.4X"|"G.8X"|"Z.2X",
  "NumberOfWorkers": integer,
  "SecurityConfiguration": "string",
  "NotificationProperty": {
    "NotifyDelayAfter": integer
  },
  "GlueVersion": "string",
  "CodeGenConfigurationNodes": {"string": {
        "AthenaConnectorSource": {
          "Name": "string",
          "ConnectionName": "string",
          "ConnectorName": "string",
          "ConnectionType": "string",
          "ConnectionTable": "string",
          "SchemaName": "string",
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "JDBCConnectorSource": {
          "Name": "string",
          "ConnectionName": "string",
          "ConnectorName": "string",
          "ConnectionType": "string",
          "AdditionalOptions": {
            "FilterPredicate": "string",
            "PartitionColumn": "string",
            "LowerBound": long,
            "UpperBound": long,
            "NumPartitions": long,
            "JobBookmarkKeys": ["string", ...],
            "JobBookmarkKeysSortOrder": "string",
            "DataTypeMapping": {"ARRAY"|"BIGINT"|"BINARY"|"BIT"|"BLOB"|"BOOLEAN"|"CHAR"|"CLOB"|"DATALINK"|"DATE"|"DECIMAL"|"DISTINCT"|"DOUBLE"|"FLOAT"|"INTEGER"|"JAVA_OBJECT"|"LONGNVARCHAR"|"LONGVARBINARY"|"LONGVARCHAR"|"NCHAR"|"NCLOB"|"NULL"|"NUMERIC"|"NVARCHAR"|"OTHER"|"REAL"|"REF"|"REF_CURSOR"|"ROWID"|"SMALLINT"|"SQLXML"|"STRUCT"|"TIME"|"TIME_WITH_TIMEZONE"|"TIMESTAMP"|"TIMESTAMP_WITH_TIMEZONE"|"TINYINT"|"VARBINARY"|"VARCHAR": "DATE"|"STRING"|"TIMESTAMP"|"INT"|"FLOAT"|"LONG"|"BIGDECIMAL"|"BYTE"|"SHORT"|"DOUBLE"
              ...}
          },
          "ConnectionTable": "string",
          "Query": "string",
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "SparkConnectorSource": {
          "Name": "string",
          "ConnectionName": "string",
          "ConnectorName": "string",
          "ConnectionType": "string",
          "AdditionalOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "CatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "RedshiftSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "RedshiftTmpDir": "string",
          "TmpDirIAMRole": "string"
        },
        "S3CatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "PartitionPredicate": "string",
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long
          }
        },
        "S3CsvSource": {
          "Name": "string",
          "Paths": ["string", ...],
          "CompressionType": "gzip"|"bzip2",
          "Exclusions": ["string", ...],
          "GroupSize": "string",
          "GroupFiles": "string",
          "Recurse": true|false,
          "MaxBand": integer,
          "MaxFilesInBand": integer,
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long,
            "EnableSamplePath": true|false,
            "SamplePath": "string"
          },
          "Separator": "comma"|"ctrla"|"pipe"|"semicolon"|"tab",
          "Escaper": "string",
          "QuoteChar": "quote"|"quillemet"|"single_quote"|"disabled",
          "Multiline": true|false,
          "WithHeader": true|false,
          "WriteHeader": true|false,
          "SkipFirst": true|false,
          "OptimizePerformance": true|false,
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3ExcelSource": {
          "Name": "string",
          "Paths": ["string", ...],
          "CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
          "Exclusions": ["string", ...],
          "GroupSize": "string",
          "GroupFiles": "string",
          "Recurse": true|false,
          "MaxBand": integer,
          "MaxFilesInBand": integer,
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long,
            "EnableSamplePath": true|false,
            "SamplePath": "string"
          },
          "NumberRows": long,
          "SkipFooter": integer,
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3JsonSource": {
          "Name": "string",
          "Paths": ["string", ...],
          "CompressionType": "gzip"|"bzip2",
          "Exclusions": ["string", ...],
          "GroupSize": "string",
          "GroupFiles": "string",
          "Recurse": true|false,
          "MaxBand": integer,
          "MaxFilesInBand": integer,
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long,
            "EnableSamplePath": true|false,
            "SamplePath": "string"
          },
          "JsonPath": "string",
          "Multiline": true|false,
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3ParquetSource": {
          "Name": "string",
          "Paths": ["string", ...],
          "CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
          "Exclusions": ["string", ...],
          "GroupSize": "string",
          "GroupFiles": "string",
          "Recurse": true|false,
          "MaxBand": integer,
          "MaxFilesInBand": integer,
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long,
            "EnableSamplePath": true|false,
            "SamplePath": "string"
          },
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "RelationalCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "DynamoDBCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "JDBCConnectorTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "ConnectionName": "string",
          "ConnectionTable": "string",
          "ConnectorName": "string",
          "ConnectionType": "string",
          "AdditionalOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "SparkConnectorTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "ConnectionName": "string",
          "ConnectorName": "string",
          "ConnectionType": "string",
          "AdditionalOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "CatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Database": "string",
          "Table": "string"
        },
        "RedshiftTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Database": "string",
          "Table": "string",
          "RedshiftTmpDir": "string",
          "TmpDirIAMRole": "string",
          "UpsertRedshiftOptions": {
            "TableLocation": "string",
            "ConnectionName": "string",
            "UpsertKeys": ["string", ...]
          }
        },
        "S3CatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Table": "string",
          "Database": "string",
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
          }
        },
        "S3GlueParquetTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Path": "string",
          "Compression": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
          "NumberTargetPartitions": "string",
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
            "Table": "string",
            "Database": "string"
          }
        },
        "S3HyperDirectTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Path": "string",
          "Compression": "uncompressed",
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
            "Table": "string",
            "Database": "string"
          }
        },
        "S3DirectTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Path": "string",
          "Compression": "string",
          "NumberTargetPartitions": "string",
          "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
            "Table": "string",
            "Database": "string"
          }
        },
        "S3IcebergDirectTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Path": "string",
          "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
          "AdditionalOptions": {"string": "string"
            ...},
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
            "Table": "string",
            "Database": "string"
          },
          "Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
          "NumberTargetPartitions": "string"
        },
        "ApplyMapping": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Mapping": [
            {
              "ToKey": "string",
              "FromPath": ["string", ...],
              "FromType": "string",
              "ToType": "string",
              "Dropped": true|false,
              "Children": [
                {
                  "ToKey": "string",
                  "FromPath": ["string", ...],
                  "FromType": "string",
                  "ToType": "string",
                  "Dropped": true|false,
                  "Children":
                }
                ...
              ]
            }
            ...
          ]
        },
        "SelectFields": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Paths": [
            ["string", ...]
            ...
          ]
        },
        "DropFields": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Paths": [
            ["string", ...]
            ...
          ]
        },
        "RenameField": {
          "Name": "string",
          "Inputs": ["string", ...],
          "SourcePath": ["string", ...],
          "TargetPath": ["string", ...]
        },
        "Spigot": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Path": "string",
          "Topk": integer,
          "Prob": double
        },
        "Join": {
          "Name": "string",
          "Inputs": ["string", ...],
          "JoinType": "equijoin"|"left"|"right"|"outer"|"leftsemi"|"leftanti",
          "Columns": [
            {
              "From": "string",
              "Keys": [
                ["string", ...]
                ...
              ]
            }
            ...
          ]
        },
        "SplitFields": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Paths": [
            ["string", ...]
            ...
          ]
        },
        "SelectFromCollection": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Index": integer
        },
        "FillMissingValues": {
          "Name": "string",
          "Inputs": ["string", ...],
          "ImputedPath": "string",
          "FilledPath": "string"
        },
        "Filter": {
          "Name": "string",
          "Inputs": ["string", ...],
          "LogicalOperator": "AND"|"OR",
          "Filters": [
            {
              "Operation": "EQ"|"LT"|"GT"|"LTE"|"GTE"|"REGEX"|"ISNULL",
              "Negated": true|false,
              "Values": [
                {
                  "Type": "COLUMNEXTRACTED"|"CONSTANT",
                  "Value": ["string", ...]
                }
                ...
              ]
            }
            ...
          ]
        },
        "CustomCode": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Code": "string",
          "ClassName": "string",
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "SparkSQL": {
          "Name": "string",
          "Inputs": ["string", ...],
          "SqlQuery": "string",
          "SqlAliases": [
            {
              "From": "string",
              "Alias": "string"
            }
            ...
          ],
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "DirectKinesisSource": {
          "Name": "string",
          "WindowSize": integer,
          "DetectSchema": true|false,
          "StreamingOptions": {
            "EndpointUrl": "string",
            "StreamName": "string",
            "Classification": "string",
            "Delimiter": "string",
            "StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
            "MaxFetchTimeInMs": long,
            "MaxFetchRecordsPerShard": long,
            "MaxRecordPerRead": long,
            "AddIdleTimeBetweenReads": true|false,
            "IdleTimeBetweenReadsInMs": long,
            "DescribeShardInterval": long,
            "NumRetries": integer,
            "RetryIntervalMs": long,
            "MaxRetryIntervalMs": long,
            "AvoidEmptyBatches": true|false,
            "StreamArn": "string",
            "RoleArn": "string",
            "RoleSessionName": "string",
            "AddRecordTimestamp": "string",
            "EmitConsumerLagMetrics": "string",
            "StartingTimestamp": timestamp
          },
          "DataPreviewOptions": {
            "PollingTime": long,
            "RecordPollingLimit": long
          }
        },
        "DirectKafkaSource": {
          "Name": "string",
          "StreamingOptions": {
            "BootstrapServers": "string",
            "SecurityProtocol": "string",
            "ConnectionName": "string",
            "TopicName": "string",
            "Assign": "string",
            "SubscribePattern": "string",
            "Classification": "string",
            "Delimiter": "string",
            "StartingOffsets": "string",
            "EndingOffsets": "string",
            "PollTimeoutMs": long,
            "NumRetries": integer,
            "RetryIntervalMs": long,
            "MaxOffsetsPerTrigger": long,
            "MinPartitions": integer,
            "IncludeHeaders": true|false,
            "AddRecordTimestamp": "string",
            "EmitConsumerLagMetrics": "string",
            "StartingTimestamp": timestamp
          },
          "WindowSize": integer,
          "DetectSchema": true|false,
          "DataPreviewOptions": {
            "PollingTime": long,
            "RecordPollingLimit": long
          }
        },
        "CatalogKinesisSource": {
          "Name": "string",
          "WindowSize": integer,
          "DetectSchema": true|false,
          "Table": "string",
          "Database": "string",
          "StreamingOptions": {
            "EndpointUrl": "string",
            "StreamName": "string",
            "Classification": "string",
            "Delimiter": "string",
            "StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
            "MaxFetchTimeInMs": long,
            "MaxFetchRecordsPerShard": long,
            "MaxRecordPerRead": long,
            "AddIdleTimeBetweenReads": true|false,
            "IdleTimeBetweenReadsInMs": long,
            "DescribeShardInterval": long,
            "NumRetries": integer,
            "RetryIntervalMs": long,
            "MaxRetryIntervalMs": long,
            "AvoidEmptyBatches": true|false,
            "StreamArn": "string",
            "RoleArn": "string",
            "RoleSessionName": "string",
            "AddRecordTimestamp": "string",
            "EmitConsumerLagMetrics": "string",
            "StartingTimestamp": timestamp
          },
          "DataPreviewOptions": {
            "PollingTime": long,
            "RecordPollingLimit": long
          }
        },
        "CatalogKafkaSource": {
          "Name": "string",
          "WindowSize": integer,
          "DetectSchema": true|false,
          "Table": "string",
          "Database": "string",
          "StreamingOptions": {
            "BootstrapServers": "string",
            "SecurityProtocol": "string",
            "ConnectionName": "string",
            "TopicName": "string",
            "Assign": "string",
            "SubscribePattern": "string",
            "Classification": "string",
            "Delimiter": "string",
            "StartingOffsets": "string",
            "EndingOffsets": "string",
            "PollTimeoutMs": long,
            "NumRetries": integer,
            "RetryIntervalMs": long,
            "MaxOffsetsPerTrigger": long,
            "MinPartitions": integer,
            "IncludeHeaders": true|false,
            "AddRecordTimestamp": "string",
            "EmitConsumerLagMetrics": "string",
            "StartingTimestamp": timestamp
          },
          "DataPreviewOptions": {
            "PollingTime": long,
            "RecordPollingLimit": long
          }
        },
        "DropNullFields": {
          "Name": "string",
          "Inputs": ["string", ...],
          "NullCheckBoxList": {
            "IsEmpty": true|false,
            "IsNullString": true|false,
            "IsNegOne": true|false
          },
          "NullTextList": [
            {
              "Value": "string",
              "Datatype": {
                "Id": "string",
                "Label": "string"
              }
            }
            ...
          ]
        },
        "Merge": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Source": "string",
          "PrimaryKeys": [
            ["string", ...]
            ...
          ]
        },
        "Union": {
          "Name": "string",
          "Inputs": ["string", ...],
          "UnionType": "ALL"|"DISTINCT"
        },
        "PIIDetection": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PiiType": "RowAudit"|"RowMasking"|"ColumnAudit"|"ColumnMasking",
          "EntityTypesToDetect": ["string", ...],
          "OutputColumnName": "string",
          "SampleFraction": double,
          "ThresholdFraction": double,
          "MaskValue": "string"
        },
        "Aggregate": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Groups": [
            ["string", ...]
            ...
          ],
          "Aggs": [
            {
              "Column": ["string", ...],
              "AggFunc": "avg"|"countDistinct"|"count"|"first"|"last"|"kurtosis"|"max"|"min"|"skewness"|"stddev_samp"|"stddev_pop"|"sum"|"sumDistinct"|"var_samp"|"var_pop"
            }
            ...
          ]
        },
        "DropDuplicates": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Columns": [
            ["string", ...]
            ...
          ]
        },
        "GovernedCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Table": "string",
          "Database": "string",
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
          }
        },
        "GovernedCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "PartitionPredicate": "string",
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long
          }
        },
        "MicrosoftSQLServerCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "MySQLCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "OracleSQLCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "PostgreSQLCatalogSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string"
        },
        "MicrosoftSQLServerCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Database": "string",
          "Table": "string"
        },
        "MySQLCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Database": "string",
          "Table": "string"
        },
        "OracleSQLCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Database": "string",
          "Table": "string"
        },
        "PostgreSQLCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Database": "string",
          "Table": "string"
        },
        "DynamicTransform": {
          "Name": "string",
          "TransformName": "string",
          "Inputs": ["string", ...],
          "Parameters": [
            {
              "Name": "string",
              "Type": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
              "ValidationRule": "string",
              "ValidationMessage": "string",
              "Value": ["string", ...],
              "ListType": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
              "IsOptional": true|false
            }
            ...
          ],
          "FunctionName": "string",
          "Path": "string",
          "Version": "string",
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "EvaluateDataQuality": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Ruleset": "string",
          "Output": "PrimaryInput"|"EvaluationResults",
          "PublishingOptions": {
            "EvaluationContext": "string",
            "ResultsS3Prefix": "string",
            "CloudWatchMetricsEnabled": true|false,
            "ResultsPublishingEnabled": true|false
          },
          "StopJobOnFailureOptions": {
            "StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
          }
        },
        "S3CatalogHudiSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "AdditionalHudiOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "CatalogHudiSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "AdditionalHudiOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3HudiSource": {
          "Name": "string",
          "Paths": ["string", ...],
          "AdditionalHudiOptions": {"string": "string"
            ...},
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long,
            "EnableSamplePath": true|false,
            "SamplePath": "string"
          },
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3HudiCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Table": "string",
          "Database": "string",
          "AdditionalOptions": {"string": "string"
            ...},
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
          }
        },
        "S3HudiDirectTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "Path": "string",
          "Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
          "NumberTargetPartitions": "string",
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
          "AdditionalOptions": {"string": "string"
            ...},
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
            "Table": "string",
            "Database": "string"
          }
        },
        "DirectJDBCSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "ConnectionName": "string",
          "ConnectionType": "sqlserver"|"mysql"|"oracle"|"postgresql"|"redshift",
          "RedshiftTmpDir": "string"
        },
        "S3CatalogDeltaSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "AdditionalDeltaOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "CatalogDeltaSource": {
          "Name": "string",
          "Database": "string",
          "Table": "string",
          "AdditionalDeltaOptions": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3DeltaSource": {
          "Name": "string",
          "Paths": ["string", ...],
          "AdditionalDeltaOptions": {"string": "string"
            ...},
          "AdditionalOptions": {
            "BoundedSize": long,
            "BoundedFiles": long,
            "EnableSamplePath": true|false,
            "SamplePath": "string"
          },
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "S3DeltaCatalogTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Table": "string",
          "Database": "string",
          "AdditionalOptions": {"string": "string"
            ...},
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
          }
        },
        "S3DeltaDirectTarget": {
          "Name": "string",
          "Inputs": ["string", ...],
          "PartitionKeys": [
            ["string", ...]
            ...
          ],
          "Path": "string",
          "Compression": "uncompressed"|"snappy",
          "NumberTargetPartitions": "string",
          "Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
          "AdditionalOptions": {"string": "string"
            ...},
          "SchemaChangePolicy": {
            "EnableUpdateCatalog": true|false,
            "UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
            "Table": "string",
            "Database": "string"
          }
        },
        "AmazonRedshiftSource": {
          "Name": "string",
          "Data": {
            "AccessType": "string",
            "SourceType": "string",
            "Connection": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "Schema": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "Table": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "CatalogDatabase": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "CatalogTable": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "CatalogRedshiftSchema": "string",
            "CatalogRedshiftTable": "string",
            "TempDir": "string",
            "IamRole": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "AdvancedOptions": [
              {
                "Key": "string",
                "Value": "string"
              }
              ...
            ],
            "SampleQuery": "string",
            "PreAction": "string",
            "PostAction": "string",
            "Action": "string",
            "TablePrefix": "string",
            "Upsert": true|false,
            "MergeAction": "string",
            "MergeWhenMatched": "string",
            "MergeWhenNotMatched": "string",
            "MergeClause": "string",
            "CrawlerConnection": "string",
            "TableSchema": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ],
            "StagingTable": "string",
            "SelectedColumns": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ]
          }
        },
        "AmazonRedshiftTarget": {
          "Name": "string",
          "Data": {
            "AccessType": "string",
            "SourceType": "string",
            "Connection": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "Schema": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "Table": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "CatalogDatabase": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "CatalogTable": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "CatalogRedshiftSchema": "string",
            "CatalogRedshiftTable": "string",
            "TempDir": "string",
            "IamRole": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "AdvancedOptions": [
              {
                "Key": "string",
                "Value": "string"
              }
              ...
            ],
            "SampleQuery": "string",
            "PreAction": "string",
            "PostAction": "string",
            "Action": "string",
            "TablePrefix": "string",
            "Upsert": true|false,
            "MergeAction": "string",
            "MergeWhenMatched": "string",
            "MergeWhenNotMatched": "string",
            "MergeClause": "string",
            "CrawlerConnection": "string",
            "TableSchema": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ],
            "StagingTable": "string",
            "SelectedColumns": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ]
          },
          "Inputs": ["string", ...]
        },
        "EvaluateDataQualityMultiFrame": {
          "Name": "string",
          "Inputs": ["string", ...],
          "AdditionalDataSources": {"string": "string"
            ...},
          "Ruleset": "string",
          "PublishingOptions": {
            "EvaluationContext": "string",
            "ResultsS3Prefix": "string",
            "CloudWatchMetricsEnabled": true|false,
            "ResultsPublishingEnabled": true|false
          },
          "AdditionalOptions": {"performanceTuning.caching"|"observations.scope": "string"
            ...},
          "StopJobOnFailureOptions": {
            "StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
          }
        },
        "Recipe": {
          "Name": "string",
          "Inputs": ["string", ...],
          "RecipeReference": {
            "RecipeArn": "string",
            "RecipeVersion": "string"
          },
          "RecipeSteps": [
            {
              "Action": {
                "Operation": "string",
                "Parameters": {"string": "string"
                  ...}
              },
              "ConditionExpressions": [
                {
                  "Condition": "string",
                  "Value": "string",
                  "TargetColumn": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "SnowflakeSource": {
          "Name": "string",
          "Data": {
            "SourceType": "string",
            "Connection": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "Schema": "string",
            "Table": "string",
            "Database": "string",
            "TempDir": "string",
            "IamRole": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "AdditionalOptions": {"string": "string"
              ...},
            "SampleQuery": "string",
            "PreAction": "string",
            "PostAction": "string",
            "Action": "string",
            "Upsert": true|false,
            "MergeAction": "string",
            "MergeWhenMatched": "string",
            "MergeWhenNotMatched": "string",
            "MergeClause": "string",
            "StagingTable": "string",
            "SelectedColumns": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ],
            "AutoPushdown": true|false,
            "TableSchema": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ]
          },
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "SnowflakeTarget": {
          "Name": "string",
          "Data": {
            "SourceType": "string",
            "Connection": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "Schema": "string",
            "Table": "string",
            "Database": "string",
            "TempDir": "string",
            "IamRole": {
              "Value": "string",
              "Label": "string",
              "Description": "string"
            },
            "AdditionalOptions": {"string": "string"
              ...},
            "SampleQuery": "string",
            "PreAction": "string",
            "PostAction": "string",
            "Action": "string",
            "Upsert": true|false,
            "MergeAction": "string",
            "MergeWhenMatched": "string",
            "MergeWhenNotMatched": "string",
            "MergeClause": "string",
            "StagingTable": "string",
            "SelectedColumns": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ],
            "AutoPushdown": true|false,
            "TableSchema": [
              {
                "Value": "string",
                "Label": "string",
                "Description": "string"
              }
              ...
            ]
          },
          "Inputs": ["string", ...]
        },
        "ConnectorDataSource": {
          "Name": "string",
          "ConnectionType": "string",
          "Data": {"string": "string"
            ...},
          "OutputSchemas": [
            {
              "Columns": [
                {
                  "Name": "string",
                  "Type": "string"
                }
                ...
              ]
            }
            ...
          ]
        },
        "ConnectorDataTarget": {
          "Name": "string",
          "ConnectionType": "string",
          "Data": {"string": "string"
            ...},
          "Inputs": ["string", ...]
        }
      }
    ...},
  "ExecutionClass": "FLEX"|"STANDARD",
  "SourceControlDetails": {
    "Provider": "GITHUB"|"GITLAB"|"BITBUCKET"|"AWS_CODE_COMMIT",
    "Repository": "string",
    "Owner": "string",
    "Branch": "string",
    "Folder": "string",
    "LastCommitId": "string",
    "AuthStrategy": "PERSONAL_ACCESS_TOKEN"|"AWS_SECRETS_MANAGER",
    "AuthToken": "string"
  },
  "MaintenanceWindow": "string"
}

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределяют значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью предоставленного JSON-значения, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод, не отправляя запрос API. При отсутствии значения или значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании yaml-input он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логический)

Включить отладовую запись в журнал.

--endpoint-url (строка)

Переопределить значение URL по умолчанию команды указанным URL.

--no-verify-ssl (логический)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (логический)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команд.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использование определенного профиля из файла учетных данных.

--region (строка)

Используемый регион. Переопределяет параметры конфигурации/окружения.

--version (строка)

Отображение версии этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • вкл
  • выкл
  • авто

--no-sign-request (логический)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/окружения.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде строки, закодированной в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла непосредственно независимо от настроек cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логический)

Отключение пейджера CLI для вывода.

--cli-auto-prompt (логический)

Автоматически запрашивать параметры входных данных CLI.

--no-cli-auto-prompt (логический)

Отключение автоматического запроса параметров входных данных CLI.

Вывод

JobName -> (строка)

Возвращает имя обновленной дефиниции работы.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API