создание-задачи
Описание
Создает новое определение задачи.
См. также: Документация AWS API
Синтаксис
create-job
--name <value>
[--job-mode <value>]
[--job-run-queuing-enabled | --no-job-run-queuing-enabled]
[--description <value>]
[--log-uri <value>]
--role <value>
[--execution-property <value>]
--command <value>
[--default-arguments <value>]
[--non-overridable-arguments <value>]
[--connections <value>]
[--max-retries <value>]
[--allocated-capacity <value>]
[--timeout <value>]
[--max-capacity <value>]
[--security-configuration <value>]
[--tags <value>]
[--notification-property <value>]
[--glue-version <value>]
[--number-of-workers <value>]
[--worker-type <value>]
[--code-gen-configuration-nodes <value>]
[--execution-class <value>]
[--source-control-details <value>]
[--maintenance-window <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--name (строка)
--job-mode (строка)
Режим, описывающий способ создания задачи. Допустимые значения:
-
SCRIPT— Задача была создана с помощью редактора сценариев Glue Studio. -
VISUAL— Задача была создана с помощью визуального редактора Glue Studio. -
NOTEBOOK— Задача была создана с помощью ноутбука интерактивных сессий.
Когда поле JobMode отсутствует или равно null, по умолчанию устанавливается значение SCRIPT.
Возможные значения:
SCRIPTVISUALNOTEBOOK
--job-run-queuing-enabled | --no-job-run-queuing-enabled (логическое значение)
Указывает, включена ли очередь выполнения задач для этой задачи.
Значение true означает, что очередь выполнения задач включена для заданий. Если значение false или не задано, задания не будут рассматриваться для очереди.
Если это поле не соответствует значению, установленному в задании, то будет использовано значение из поля задания.
--description (строка)
--log-uri (строка)
--role (строка)
--execution-property (структура)
ExecutionProperty, определяющий максимальное количество одновременных запусков этой задачи.
MaxConcurrentRuns -> (целое число)
Упрощенный синтаксис:
MaxConcurrentRuns=integer
Синтаксис JSON:
{
"MaxConcurrentRuns": integer
}
--command (структура)
JobCommand, выполняющая эту задачу.
Name -> (строка)
glueetl. Для задачи Python shell она должна быть pythonshell. Для задачи Apache Spark streaming ETL она должна быть gluestreaming. Для задачи Ray она должна быть glueray.ScriptLocation -> (строка)
PythonVersion -> (строка)
Runtime -> (строка)
Упрощенный синтаксис:
Name=string,ScriptLocation=string,PythonVersion=string,Runtime=string
Синтаксис JSON:
{
"Name": "string",
"ScriptLocation": "string",
"PythonVersion": "string",
"Runtime": "string"
}
--default-arguments (массив)
Параметры по умолчанию для каждого запуска этой задачи, указанные как пары имя-значение.
Вы можете указать здесь параметры, используемые вашим собственным скриптом выполнения задачи, а также параметры, используемые самим Glue.
Аргументы задач могут регистрироваться. Не передавайте открытые секреты в качестве аргументов. Получайте секреты из подключения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в задаче.
Дополнительную информацию о том, как указать и использовать собственные аргументы задач, см. в разделе Вызов API Glue на Python в Руководстве разработчика.
Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке задач Spark, см. в разделе Специальные параметры, используемые Glue в Руководстве разработчика.
Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке задач Ray, см. в разделе Использование параметров задач в задачах Ray в Руководстве разработчика.
key -> (строка)
value -> (строка)
Упрощенный синтаксис:
KeyName1=string,KeyName2=string
Синтаксис JSON:
{"string": "string"
...}
--non-overridable-arguments (массив)
Аргументы для этой задачи, которые не переопределяются при указании аргументов задачи в запуске задачи, указанные как пары имя-значение.
key -> (строка)
value -> (строка)
Упрощенный синтаксис:
KeyName1=string,KeyName2=string
Синтаксис JSON:
{"string": "string"
...}
--connections (структура)
Подключения, используемые для этой задачи.
Connections -> (список)
Список подключений, используемых задачей.
(строка)
Упрощенный синтаксис:
Connections=string,string
Синтаксис JSON:
{
"Connections": ["string", ...]
}
--max-retries (целое число)
--allocated-capacity (целое число)
Этот параметр устарел. Используйте MaxCapacity вместо него.
Количество единиц обработки данных Glue (DPU), которые необходимо выделить для этой задачи. Вы можете выделить минимум 2 DPU; по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.
--timeout (целое число)
Таймаут задачи в минутах. Это максимальное время, которое запуск задачи может потреблять ресурсы, прежде чем будет завершен и перейдет в состояние TIMEOUT.
Значения таймаута задач должны быть меньше 7 дней или 10080 минут. В противном случае задачи выбросят исключение.
Если значение не указано, таймаут по умолчанию составляет 2880 минут.
Все существующие задачи Glue, имеющие значение таймаута больше 7 дней, будут по умолчанию установлены на 7 дней. Например, если вы задали таймаут в 20 дней для задачи пакетной обработки, он будет остановлен на 7-й день.
Для задач потоковой обработки, если вы настроили окно обслуживания, оно будет перезапущено в окне обслуживания после 7 дней.
--max-capacity (дробное число)
Для задач Glue версии 1.0 или более ранних, использующих стандартный тип рабочего процесса, количество единиц обработки данных Glue (DPU), которые могут быть выделены при выполнении этой задачи. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.
Для задач Glue версии 2.0+ вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.
Не задавайте MaxCapacity, если используете WorkerType и NumberOfWorkers.
Значение, которое можно выделить для MaxCapacity, зависит от того, выполняете ли вы задачу Python shell, задачу Apache Spark ETL или задачу Apache Spark streaming ETL:
- Если вы указываете задачу Python shell (
JobCommand.Name=”pythonshell”), вы можете выделить 0,0625 или 1 DPU. По умолчанию 0,0625 DPU. - Если вы указываете задачу Apache Spark ETL (
JobCommand.Name=”glueetl”) или задачу Apache Spark streaming ETL (JobCommand.Name=”gluestreaming”), вы можете выделить от 2 до 100 DPU. По умолчанию 10 DPU. Этот тип задачи не может иметь дробное выделение DPU.
--security-configuration (строка)
SecurityConfiguration, которая должна использоваться с этой задачей.--tags (массив)
Теги для использования с этой задачей. Вы можете использовать теги для ограничения доступа к задаче. Дополнительную информацию о тегах в Glue см. в разделе Теги Amazon Web Services в Glue в Руководстве разработчика.
key -> (строка)
value -> (строка)
Упрощенный синтаксис:
KeyName1=string,KeyName2=string
Синтаксис JSON:
{"string": "string"
...}
--notification-property (структура)
Указывает конфигурационные свойства уведомления о задаче.
NotifyDelayAfter -> (целое число)
Упрощенный синтаксис:
NotifyDelayAfter=integer
Синтаксис JSON:
{
"NotifyDelayAfter": integer
}
--glue-version (строка)
В задачах Spark, GlueVersion определяет версии Apache Spark и Python, доступные в задаче Glue. Версия Python указывает версию, поддерживаемую для задач типа Spark.
Задачи Ray должны установить GlueVersion на 4.0 или более позднюю. Однако версии Ray, Python и дополнительных библиотек, доступных в вашей задаче Ray, определяются параметром Runtime команды задачи.
Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в Руководстве разработчика Glue в разделе версия Glue.
Задачи, созданные без указания версии Glue, по умолчанию используют Glue 0.9.
--number-of-workers (целое число)
workerType, которые выделены при выполнении задачи.--worker-type (строка)
Тип предварительно выделенного рабочего узла, который выделяется при выполнении задания. Принимает значение G.1X, G.2X, G.4X, G.8X или G.025X для заданий Spark. Принимает значение Z.2X для заданий Ray.
- Для типа рабочего узла
G.1Xкаждый рабочий узел соответствует 1 DPU (4 vCPUs, 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для таких задач, как преобразования данных, объединения и запросы, чтобы обеспечить масштабируемый и экономичный способ запуска большинства заданий. - Для типа рабочего узла
G.2Xкаждый рабочий узел соответствует 2 DPU (8 vCPUs, 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для таких задач, как преобразования данных, объединения и запросы, чтобы обеспечить масштабируемый и экономичный способ запуска большинства заданий. - Для типа рабочего узла
G.4Xкаждый рабочий узел соответствует 4 DPU (16 vCPUs, 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для заданий, рабочие нагрузки которых содержат самые требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для заданий Spark ETL Glue версии 3.0 и выше в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm). - Для типа рабочего узла
G.8Xкаждый рабочий узел соответствует 8 DPU (32 vCPUs, 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для заданий, рабочие нагрузки которых содержат самые требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для заданий Spark ETL Glue версии 3.0 и выше в тех же регионах Amazon Web Services, что и для типа рабочего узлаG.4X. - Для типа рабочего узла
G.025Xкаждый рабочий узел соответствует 0,25 DPU (2 vCPUs, 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполнителя на рабочий узел. Рекомендуется использовать этот тип рабочего узла для заданий потоковой обработки с низким объемом данных. Этот тип рабочего узла доступен только для заданий потоковой обработки Glue версии 3.0 и выше. - Для типа рабочего узла
Z.2Xкаждый рабочий узел соответствует 2 M-DPU (8 vCPUs, 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 рабочих узлов Ray на основе автомасштабирования.
Возможные значения:
StandardG.1XG.2XG.025XG.4XG.8XZ.2X
--code-gen-configuration-nodes (карта)
Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.
ключ -> (строка)
значение -> (структура)
CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.AthenaConnectorSource -> (структура)
Указывает соединитель к источнику данных Amazon Athena.
Имя -> (строка)
Имя подключения -> (строка)
Имя соединителя -> (строка)
Тип подключения -> (строка)
Таблица подключения -> (строка)
Имя схемы -> (строка)
/aws-glue/jobs/output.OutputSchemas -> (список)
Указывает схему данных для пользовательского источника Athena.
(структура)
Указывает пользовательскую схему, когда схему невозможно определить Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
JDBCConnectorSource -> (структура)
Указывает соединитель к источнику данных JDBC.
Имя -> (строка)
Имя подключения -> (строка)
Имя соединителя -> (строка)
Тип подключения -> (строка)
Дополнительные параметры -> (структура)
Дополнительные параметры подключения для соединителя.
Фильтр предиката -> (строка)
Дополнительная часть условия для фильтрации данных из источника. Например:
BillingCity='Mountain View'При использовании запроса вместо имени таблицы необходимо проверить, что запрос работает с указанным filterPredicate.
Столбец раздела -> (строка)
lowerBound, upperBound и numPartitions. Этот параметр работает так же, как в Spark SQL JDBC reader.Нижняя граница -> (длинное целое число)
partitionColumn, используемое для определения шага разбиения на разделы.Верхняя граница -> (длинное целое число)
partitionColumn, используемое для определения шага разбиения на разделы.Число разделов -> (длинное целое число)
lowerBound (включительно) и upperBound (исключительно) образуют шаги разбиения на разделы для сгенерированных WHERE выражений предложения, которые используются для разделения partitionColumn.Ключи отметки выполнения задания -> (список)
Имя ключей отметки выполнения задания, по которым необходимо выполнить сортировку.
(строка)
Порядок сортировки ключей отметки выполнения задания -> (строка)
Отображение типов данных -> (карта)
Пользовательское отображение типов данных, создающее отображение от типа данных JDBC к типу данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} отображает поля данных типа JDBC FLOAT в тип Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение зависит от используемого драйвера. Обратитесь к документации к своему JDBC драйверу, чтобы понять, как драйвер выполняет преобразования.
ключ -> (строка)
значение -> (строка)
Таблица подключения -> (строка)
Запрос -> (строка)
ConnectionTable, либо query, но не оба.OutputSchemas -> (список)
Указывает схему данных для пользовательского JDBC источника.
(структура)
Указывает пользовательскую схему, когда схему невозможно определить Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorSource -> (структура)
Указывает соединитель к источнику данных Apache Spark.
Имя -> (строка)
Имя подключения -> (строка)
Имя соединителя -> (строка)
Тип подключения -> (строка)
Дополнительные параметры -> (карта)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Указывает схему данных для пользовательского источника Spark.
(структура)
Указывает пользовательскую схему, когда схему невозможно определить Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogSource -> (структура)
Указывает хранилище данных в Glue Data Catalog.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
RedshiftSource -> (структура)
Указывает хранилище данных Amazon Redshift.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
S3CatalogSource -> (структура)
Указывает хранилище данных Amazon S3 в Glue Data Catalog.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
Предикат разбиения -> (строка)
"" – по умолчанию пусто.Дополнительные параметры -> (структура)
Указывает дополнительные параметры подключения.
Ограниченный размер -> (длинное целое число)
Ограниченное количество файлов -> (длинное целое число)
S3CsvSource -> (структура)
Указывает хранилище данных со значениями, разделёнными запятыми (CSV), хранящееся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей к файлам Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip").Exclusions -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" в "inPartition", чтобы это имело эффект.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (длинное целое)
BoundedFiles -> (длинное целое)
EnableSamplePath -> (булево)
SamplePath -> (строка)
Separator -> (строка)
Escaper -> (строка)
none. Если включено, символ, следующий сразу после него, используется как есть, за исключением небольшого набора известных экранированных символов (\n, \r, \t и \0).QuoteChar -> (строка)
'"'. Установите это в -1, чтобы полностью отключить кавычки.Multiline -> (булево)
False, что позволяет более агрессивно разбивать файлы во время разбора.WithHeader -> (булево)
False.WriteHeader -> (булево)
True.SkipFirst -> (булево)
False.OptimizePerformance -> (булево)
OutputSchemas -> (список)
Указывает схему данных для источника S3 CSV.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3ExcelSource -> (структура)
Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.
Name -> (строка)
Paths -> (список)
Пути S3, где расположены файлы Excel.
(строка)
CompressionType -> (строка)
Exclusions -> (список)
Шаблоны для исключения конкретных файлов или путей из обработки.
(строка)
GroupSize -> (строка)
GroupFiles -> (строка)
Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Дополнительные параметры конфигурации для прямой обработки источника S3.
BoundedSize -> (длинное целое)
BoundedFiles -> (длинное целое)
EnableSamplePath -> (булево)
SamplePath -> (строка)
NumberRows -> (длинное целое)
SkipFooter -> (целое число)
OutputSchemas -> (список)
Схемы AWS Glue, которые необходимо применить к обработанным данным.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3JsonSource -> (структура)
Указывает хранилище данных JSON, хранящееся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей к файлам Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip").Exclusions -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" в "inPartition", чтобы это имело эффект.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (длинное целое)
BoundedFiles -> (длинное целое)
EnableSamplePath -> (булево)
SamplePath -> (строка)
JsonPath -> (строка)
Multiline -> (булево)
False, что позволяет более агрессивно разбивать файлы во время разбора.OutputSchemas -> (список)
Указывает схему данных для источника S3 JSON.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3ParquetSource -> (структура)
Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ТипСжатия -> (строка)
"gzip" и "bzip").Исключения -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
РазмерГруппы -> (строка)
"groupFiles" должно быть установлено в "inPartition" для того, чтобы это стало эффективным.ФайлыГруппы -> (строка)
"none".Рекурсивно -> (булево)
МаксПолоса -> (целое число)
МаксФайловВПолосе -> (целое число)
ДополнительныеПараметры -> (структура)
Указывает дополнительные параметры подключения.
ОграниченныйРазмер -> (длинное целое)
ОграниченноеКоличествоФайлов -> (длинное целое)
ВключитьОбразецПути -> (булево)
ОбразецПути -> (строка)
СхемыВывода -> (список)
Указывает схему данных для источника S3 Parquet.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
ИсточникКаталогаОтношений -> (структура)
Указывает хранилище данных реляционного каталога в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ИсточникКаталогаDynamoDB -> (структура)
Указывает хранилище данных DynamoDBC в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
JDBCConnectorTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.
Имя -> (строка)
ВходныеДанные -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
ИмяПодключения -> (строка)
ТаблицаПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (массив)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для целевого объекта JDBC.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorTarget -> (структура)
Указывает целевой объект, использующий соединитель Apache Spark.
Имя -> (строка)
ВходныеДанные -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
ИмяПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (массив)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для пользовательской Spark-цели.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogTarget -> (структура)
Указывает целевой объект, использующий таблицу каталога данных Glue.
Имя -> (строка)
ВходныеДанные -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
КлючиРазделения -> (список)
Ключи разделения, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.
(список)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTarget -> (структура)
Указывает целевой объект, использующий Amazon Redshift.
Имя -> (строка)
ВходныеДанные -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
UpsertRedshiftOptions -> (структура)
Набор параметров для настройки операции upsert при записи в целевой объект Redshift.
РасположениеТаблицы -> (строка)
ИмяПодключения -> (строка)
КлючиUpsert -> (список)
Ключи, используемые для определения того, следует ли выполнить обновление или вставку.
(строка)
S3CatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.
Имя -> (строка)
ВходныеДанные -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
КлючиРазделения -> (список)
Указывает собственное разделение, используя последовательность ключей.
(список)
Таблица -> (строка)
БазаДанных -> (строка)
ПолитикаИзмененияСхемы -> (структура)
Политика, которая определяет поведение обновления для извлекателя.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
S3GlueParquetTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.
Имя -> (строка)
ВходныеДанные -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
КлючиРазделения -> (список)
Указывает собственное разделение, используя последовательность ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").КоличествоЦелевыхРазделов -> (строка)
ПолитикаИзмененияСхемы -> (структура)
Политика, которая определяет поведение обновления для извлекателя.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
Таблица -> (строка)
БазаДанных -> (строка)
S3HyperDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.
Name -> (строка)
Inputs -> (список)
Определяет источник входных данных для целевого узла HyperDirect.
(строка)
PartitionKeys -> (список)
Определяет стратегию разбиения выходных данных.
(список)
Path -> (строка)
Compression -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы во время операций записи.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
S3DirectTarget -> (структура)
Указывает целевой объект данных, записывающий данные в Amazon S3.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
PartitionKeys -> (список)
Определяет нативное разбиение с помощью последовательности ключей.
(список)
Path -> (строка)
Compression -> (строка)
"gzip" и "bzip").NumberTargetPartitions -> (строка)
Format -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для обработчика.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
S3IcebergDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.
Name -> (строка)
Inputs -> (список)
Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.
(строка)
PartitionKeys -> (список)
Определяет столбцы, используемые для разбиения данных таблицы Iceberg в S3.
(список)
Path -> (строка)
Format -> (строка)
AdditionalOptions -> (карта)
Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
Compression -> (строка)
NumberTargetPartitions -> (строка)
ApplyMapping -> (структура)
Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте данных. Можно переименовать ключи, изменить типы данных для ключей и выбрать, какие ключи нужно удалить из набора данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Mapping -> (список)
Указывает отображение ключей свойств данных в источнике данных на ключи свойств данных в целевом объекте данных.
(структура)
Указывает отображение ключей свойств данных.
ToKey -> (строка)
FromPath.FromPath -> (список)
Таблица или столбец, который нужно изменить.
(строка)
FromType -> (строка)
ToType -> (строка)
Dropped -> (булево)
Children -> (список)
Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, но также и одного из её дочерних элементов, вы можете заполнить эту структуру данных. Она также Mapping , но её FromPath будет родительским FromPath плюс FromPath из этой структуры.
Предположим, у вас есть структура:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }Вы можете указать Mapping, который выглядит так:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }(структура)
Указывает отображение ключей свойств данных.
ToKey -> (строка)
FromPath.FromPath -> (список)
Таблица или столбец, который нужно изменить.
(строка)
FromType -> (строка)
ToType -> (строка)
Dropped -> (булево)
SelectFields -> (структура)
Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите сохранить.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Paths -> (список)
JSON-путь к переменной в структуре данных.
(список)
DropFields -> (структура)
Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите удалить.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Paths -> (список)
JSON-путь к переменной в структуре данных.
(список)
RenameField -> (структура)
Указывает преобразование, которое переименовывает один ключ свойства данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
SourcePath -> (список)
JSON-путь к переменной в структуре данных для исходных данных.
(строка)
TargetPath -> (список)
JSON-путь к переменной в структуре данных для целевых данных.
(строка)
Spigot -> (структура)
Указывает преобразование, которое записывает образцы данных в ведро Amazon S3.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Path -> (строка)
Topk -> (целое)
Prob -> (двойное)
Join -> (структура)
Указывает преобразование, которое объединяет два набора данных в один набор данных с помощью сравнительного выражения по указанным ключам свойств данных. Можно использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
JoinType -> (строка)
Columns -> (список)
Список двух столбцов, которые будут объединены.
(структура)
Указывает столбец, который будет объединен.
From -> (строка)
Keys -> (список)
Ключ столбца, который будет объединен.
(список)
SplitFields -> (структура)
Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames . Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных, и один с оставшимися ключами свойств данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Paths -> (список)
JSON-путь к переменной в структуре данных.
(список)
SelectFromCollection -> (структура)
Указывает преобразование, которое выбирает один DynamicFrame из набора DynamicFrames. Выход — выбранный DynamicFrame.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Index -> (целое)
FillMissingValues -> (структура)
Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определённым методом импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.
Имя -> (строка)
Входы -> (список)
Входы данных, определённые по их именам узлов.
(строка)
ПутьИмпутации -> (строка)
ПутьЗаполнения -> (строка)
Фильтр -> (структура)
Указывает преобразование, которое разделяет набор данных на два, основываясь на условии фильтрации.
Имя -> (строка)
Входы -> (список)
Входы данных, определённые по их именам узлов.
(строка)
ЛогическийОператор -> (строка)
Фильтры -> (список)
Указывает выражение фильтра.
(структура)
Указывает выражение фильтра.
Операция -> (строка)
Отрицание -> (булево)
Значения -> (список)
Список значений фильтра.
(структура)
Представляет отдельную запись в списке значений для FilterExpression.
Тип -> (строка)
Значение -> (список)
Значение, которое должно быть связано.
(строка)
ПользовательскийКод -> (структура)
Указывает преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Результатом является набор DynamicFrames.
Имя -> (строка)
Входы -> (список)
Входы данных, определённые по их именам узлов.
(строка)
Код -> (строка)
ИмяКласса -> (строка)
СхемыВывода -> (список)
Указывает схему данных для преобразования пользовательского кода.
(структура)
Указывает определяемую пользователем схему, когда схема не может быть определена Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает отдельный столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkSQL -> (структура)
Указывает преобразование, где вы вводите SQL-запрос, используя синтаксис Spark SQL, для преобразования данных. Результатом является единственный DynamicFrame.
Имя -> (строка)
Входы -> (список)
Входы данных, определённые по их именам узлов. Вы можете связать имя таблицы с каждым узлом ввода для использования в SQL-запросе. Выбранное имя должно соответствовать ограничениям именования Spark SQL.
(строка)
SqlQuery -> (строка)
SqlAliases -> (список)
Список псевдонимов. Псевдоним позволяет указать, какое имя использовать в SQL для данного ввода. Например, у вас есть источник данных с именем «MyDataSource». Если вы указываете From как MyDataSource, и Alias как SqlName, то в вашем SQL можно сделать:
select * from SqlNameи это получит данные из MyDataSource.
(структура)
Представляет отдельную запись в списке значений для SqlAliases.
От -> (строка)
Псевдоним -> (строка)
СхемыВывода -> (список)
Указывает схему данных для преобразования SparkSQL.
(структура)
Указывает определяемую пользователем схему, когда схема не может быть определена Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает отдельный столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
DirectKinesisSource -> (структура)
Указывает прямой источник данных Amazon Kinesis.
Имя -> (строка)
РазмерОкна -> (целое число)
ОпределитьСхему -> (булево)
ПараметрыПотока -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
АдресСЕРВЕР -> (строка)
ИмяПотока -> (строка)
Классификация -> (строка)
Разделитель -> (строка)
НачальнаяПозиция -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest", "trim_horizon", "earliest" или строка метки времени в формате UTC в формате yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию — "latest".
Примечание. Использование значения, являющегося строкой метки времени в формате UTC, для «начальнойПозиции», поддерживается только для версии Glue 4.0 и выше.
МаксимальноеВремяОбработкиВМс -> (длинное целое)
GetRecords вызовов API могут быть выполнены в течение этого времени. Значение по умолчанию — 1000.МаксимальноеКоличествоЗаписейНаРаздел -> (длинное целое)
MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратен MaxRecordPerRead. Значение по умолчанию — 100000.МаксимальноеКоличествоЗаписейЗаЧтение -> (длинное целое)
10000.ДобавитьВремяПростояМеждуЧтениями -> (булево)
"False". Этот параметр настраивается только для версии Glue 2.0 и выше.ВремяПростояМеждуЧтениямиВМс -> (длинное целое)
1000. Этот параметр настраивается только для версии Glue 2.0 и выше.ИнтервалОписанияРазделов -> (длинное целое)
1s.КоличествоПовторов -> (целое число)
3.ИнтервалПовтораВМс -> (длинное целое)
1000.МаксимальныйИнтервалПовтораВМс -> (длинное целое)
10000.ИзбегатьПустыхПакет -> (булево)
"False".ArnПотока -> (строка)
ArnРоли -> (строка)
"awsSTSSessionName".ИмяСеансаРоли -> (строка)
"awsSTSRoleARN".ДобавитьМеткаВремениЗаписи -> (строка)
ВыводитьМетрикиЗадержкиПотребителя -> (строка)
НачальнаяМеткаВремени -> (метка времени)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).ПараметрыПредварительногоПросмотраДанных -> (структура)
Дополнительные параметры для предварительного просмотра данных.
ВремяОпроса -> (длинное целое)
ПределОпросаЗаписей -> (длинное целое)
DirectKafkaSource -> (структура)
Указывает хранилище данных Apache Kafka.
Name -> (строка)
StreamingOptions -> (структура)
Указывает параметры потоковой передачи.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT".ConnectionName -> (строка)
TopicName -> (строка)
"topicName", "assign" или "subscribePattern".Assign -> (строка)
TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".SubscribePattern -> (строка)
"topicName", "assign" или "subscribePattern".Classification -> (строка)
Delimiter -> (строка)
StartingOffsets -> (строка)
"earliest" или "latest". Значение по умолчанию — "latest".EndingOffsets -> (строка)
"latest", либо строка JSON, которая указывает конечную позицию для каждого TopicPartition.PollTimeoutMs -> (длинное целое)
512.NumRetries -> (целое число)
3.RetryIntervalMs -> (длинное целое)
10.MaxOffsetsPerTrigger -> (длинное целое)
topicPartitions разных объёмов. Значение по умолчанию — null, что означает, что потребитель считывает все смещения до известного последнего смещения.MinPartitions -> (целое число)
IncludeHeaders -> (логическое)
Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в Glue версии 3.0 и выше.AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (маркер времени)
Маркер времени записи в теме Kafka, с которой начать чтение данных. Возможные значения — строка маркер времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).
Должен быть установлен только один из StartingTimestamp или StartingOffsets.
WindowSize -> (целое число)
DetectSchema -> (логическое)
DataPreviewOptions -> (структура)
Указывает параметры, связанные с предварительным просмотром данных для просмотра образца ваших данных.
PollingTime -> (длинное целое)
RecordPollingLimit -> (длинное целое)
CatalogKinesisSource -> (структура)
Указывает источник данных Kinesis в каталоге данных Glue.
Name -> (строка)
WindowSize -> (целое число)
DetectSchema -> (логическое)
Table -> (строка)
Database -> (строка)
StreamingOptions -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
EndpointUrl -> (строка)
StreamName -> (строка)
Classification -> (строка)
Delimiter -> (строка)
StartingPosition -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest", "trim_horizon", "earliest" или строка маркер времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию — "latest".
Примечание: Использование значения, являющегося строкой маркер времени в формате UTC для «startingPosition», поддерживается только для Glue версии 4.0 и выше.
MaxFetchTimeInMs -> (длинное целое)
GetRecords вызовов API могут быть выполнены в течение этого времени. Значение по умолчанию — 1000.MaxFetchRecordsPerShard -> (длинное целое)
MaxFetchRecordsPerShard должна быть строгой, то она должна быть кратной MaxRecordPerRead. Значение по умолчанию — 100000.MaxRecordPerRead -> (длинное целое)
10000.AddIdleTimeBetweenReads -> (логическое)
"False". Этот параметр настраивается только для Glue версии 2.0 и выше.IdleTimeBetweenReadsInMs -> (длинное целое)
1000. Этот параметр настраивается только для Glue версии 2.0 и выше.DescribeShardInterval -> (длинное целое)
1s.NumRetries -> (целое число)
3.RetryIntervalMs -> (длинное целое)
1000.MaxRetryIntervalMs -> (длинное целое)
10000.AvoidEmptyBatches -> (логическое)
"False".StreamArn -> (строка)
RoleArn -> (строка)
"awsSTSSessionName".RoleSessionName -> (строка)
"awsSTSRoleARN".AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (маркер времени)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).DataPreviewOptions -> (структура)
Дополнительные параметры для предварительного просмотра данных.
PollingTime -> (длинное целое)
RecordPollingLimit -> (длинное целое)
CatalogKafkaSource -> (структура)
Указывает хранилище данных Apache Kafka в каталоге данных.
Name -> (строка)
WindowSize -> (целое число)
DetectSchema -> (логическое значение)
Table -> (строка)
Database -> (строка)
StreamingOptions -> (структура)
Указывает параметры потоковой обработки.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT".ConnectionName -> (строка)
TopicName -> (строка)
"topicName", "assign" или "subscribePattern".Assign -> (строка)
TopicPartitions для потребления. Вы должны указать как минимум один из "topicName", "assign" или "subscribePattern".SubscribePattern -> (строка)
"topicName", "assign" или "subscribePattern".Classification -> (строка)
Delimiter -> (строка)
StartingOffsets -> (строка)
"earliest" или "latest". Значение по умолчанию — "latest".EndingOffsets -> (строка)
"latest", либо строка JSON, которая указывает конечную позицию для каждого TopicPartition.PollTimeoutMs -> (длинное целое число)
512.NumRetries -> (целое число)
3.RetryIntervalMs -> (длинное целое число)
10.MaxOffsetsPerTrigger -> (длинное целое число)
topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель читает все офсеты до последнего известного.MinPartitions -> (целое число)
IncludeHeaders -> (логическое значение)
Array[Struct(key: String, value: String)]. Значение по умолчанию — “false”. Этот параметр доступен только в версии Glue 3.0 и выше.AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (временная метка)
Временная метка сообщения в теме Kafka, с которой начинается чтение данных. Возможные значения — строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).
Только один из StartingTimestamp или StartingOffsets должен быть установлен.
DataPreviewOptions -> (структура)
Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.
PollingTime -> (длинное целое число)
RecordPollingLimit -> (длинное целое число)
DropNullFields -> (структура)
Указывает преобразование, которое удаляет столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, которые являются “null”, целые числа -1 или другие заполнитель, такие как нули, автоматически не распознаются как null.
Name -> (строка)
Inputs -> (список)
Данные входов, идентифицированные по их именам узлов.
(строка)
NullCheckBoxList -> (структура)
Структура, которая представляет, распознаются ли определенные значения как нулевые значения для удаления.
IsEmpty -> (логическое значение)
IsNullString -> (логическое значение)
IsNegOne -> (логическое значение)
NullTextList -> (список)
Структура, которая указывает список NullValueField-структур, представляющих пользовательское нулевое значение, такое как ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.
Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение заполнителя нуля и тип данных совпадают с данными.
(структура)
Представляет пользовательское нулевое значение, такое как ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.
Value -> (строка)
Datatype -> (структура)
Тип данных значения.
Id -> (строка)
Label -> (строка)
Merge -> (структура)
Указывает преобразование, которое объединяет DynamicFrame с эталонным DynamicFrame на основе указанных первичных ключей для идентификации записей. Дубликаты записей (записи с одинаковыми первичными ключами) не удаляются.
Name -> (строка)
Inputs -> (список)
Данные входов, идентифицированные по их именам узлов.
(строка)
Source -> (строка)
DynamicFrame, который будет объединен с эталонным DynamicFrame.PrimaryKeys -> (список)
Список полей первичного ключа для сопоставления записей из исходной и эталонной динамических фреймов.
(список)
Union -> (структура)
Указывает преобразование, которое объединяет строки из двух или более наборов данных в один результат.
Name -> (строка)
Inputs -> (список)
Входы узлов ID в преобразование.
(строка)
UnionType -> (строка)
Указывает тип преобразования Union.
Укажите ALL, чтобы объединить все строки из источников данных в результирующий DynamicFrame. Результирующее объединение не удаляет дублирующие строки.
Укажите DISTINCT, чтобы удалить дублирующие строки в результирующем DynamicFrame.
PIIDetection -> (структура)
Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.
Name -> (строка)
Inputs -> (список)
Входы узлов ID в преобразование.
(строка)
PiiType -> (строка)
EntityTypesToDetect -> (список)
Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.
Типы сущностей PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE
(строка)
OutputColumnName -> (строка)
SampleFraction -> (двойное число)
ThresholdFraction -> (двойное число)
MaskValue -> (строка)
Aggregate -> (структура)
Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по указанной функции.
Name -> (строка)
Inputs -> (список)
Указывает поля и строки, которые будут использоваться в качестве входов для преобразования агрегирования.
(строка)
Groups -> (список)
Указывает поля для группировки.
(список)
Aggs -> (список)
Указывает агрегирующие функции, которые будут выполняться для указанных полей.
(структура)
Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании агрегирования.
Column -> (список)
Указывает столбец в наборе данных, к которому будет применена функция агрегирования.
(строка)
AggFunc -> (строка)
Указывает функцию агрегирования, которая должна быть применена.
Возможные функции агрегирования включают: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop
DropDuplicates -> (структура)
Указывает преобразование, которое удаляет строки с повторяющимися данными из набора данных.
Name -> (строка)
Inputs -> (список)
Данные входов, идентифицированные по их именам узлов.
(строка)
Columns -> (список)
Имя столбцов для объединения или удаления при повторении.
(список)
GovernedCatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в управляемый каталог.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными данными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает собственное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для управляемого каталога.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
GovernedCatalogSource -> (структура)
Указывает источник данных в управляемом каталоге данных.
Name -> (строка)
Database -> (строка)
Table -> (строка)
PartitionPredicate -> (строка)
"" – по умолчанию пусто.AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (целое)
BoundedFiles -> (целое)
MicrosoftSQLServerCatalogSource -> (структура)
Указывает источник данных Microsoft SQL Server в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
MySQLCatalogSource -> (структура)
Указывает источник данных MySQL в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
OracleSQLCatalogSource -> (структура)
Указывает источник данных Oracle в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
PostgreSQLCatalogSource -> (структура)
Указывает источник данных PostgresSQL в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
MicrosoftSQLServerCatalogTarget -> (структура)
Указывает целевой объект, использующий Microsoft SQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными данными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
MySQLCatalogTarget -> (структура)
Указывает целевой объект, использующий MySQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными данными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
OracleSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Oracle SQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными данными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
PostgreSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Postgres SQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными данными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
DynamicTransform -> (структура)
Указывает пользовательский визуальный трансформирование, созданный пользователем.
Name -> (строка)
TransformName -> (строка)
Inputs -> (список)
Указывает входные данные для динамического преобразования, которые требуются.
(строка)
Parameters -> (список)
Указывает параметры динамического преобразования.
(структура)
Указывает параметры в файле конфигурации динамического преобразования.
Name -> (строка)
Type -> (строка)
ValidationRule -> (строка)
ValidationMessage -> (строка)
Value -> (список)
Указывает значение параметра в файле конфигурации динамического преобразования.
(строка)
ListType -> (строка)
IsOptional -> (булево)
FunctionName -> (строка)
Path -> (строка)
Version -> (строка)
OutputSchemas -> (список)
Указывает схему данных для динамического преобразования.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, которые составляют схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
EvaluateDataQuality -> (структура)
Указывает критерии оценки качества ваших данных.
Name -> (строка)
Inputs -> (список)
Входы вашей оценки качества данных.
(строка)
Ruleset -> (строка)
Output -> (строка)
PublishingOptions -> (структура)
Параметры для настройки публикации ваших результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
StopJobOnFailureOptions -> (структура)
Параметры для настройки остановки задачи в случае неудачи оценки качества данных.
StopJobOnFailureTiming -> (строка)
S3CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalHudiOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, которые составляют схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalHudiOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, которые составляют схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3HudiSource -> (структура)
Указывает источник данных Hudi, хранящийся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
AdditionalHudiOptions -> (словарь)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
AdditionalOptions -> (структура)
Указывает дополнительные параметры для коннектора.
BoundedSize -> (длинное целое число)
BoundedFiles -> (длинное целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3HudiCatalogTarget -> (структура)
Указывает целевой объект для записи в источник данных Hudi в Glue Data Catalog.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает собственное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
AdditionalOptions -> (словарь)
Указывает дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для извлекателя.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
S3HudiDirectTarget -> (структура)
Указывает целевой объект для записи в источник данных Hudi в Amazon S3.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
Path -> (строка)
Compression -> (строка)
"gzip" и "bzip").NumberTargetPartitions -> (строка)
PartitionKeys -> (список)
Указывает собственное разбиение с помощью последовательности ключей.
(список)
Format -> (строка)
AdditionalOptions -> (словарь)
Указывает дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для извлекателя.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
DirectJDBCSource -> (структура)
Указывает прямое подключение JDBC-источника.
Name -> (строка)
Database -> (строка)
Table -> (строка)
ConnectionName -> (строка)
ConnectionType -> (строка)
RedshiftTmpDir -> (строка)
S3CatalogDeltaSource -> (структура)
Указывает источник данных Delta Lake, зарегистрированный в Glue Data Catalog. Источник данных должен храниться в Amazon S3.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalDeltaOptions -> (словарь)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Delta Lake.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
CatalogDeltaSource -> (структура)
Указывает источник данных Delta Lake, зарегистрированный в Glue Data Catalog.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalDeltaOptions -> (словарь)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Delta Lake.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3DeltaSource -> (структура)
Указывает источник данных Delta Lake, хранящийся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
AdditionalDeltaOptions -> (словарь)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
AdditionalOptions -> (структура)
Указывает дополнительные параметры для коннектора.
BoundedSize -> (длинное целое число)
BoundedFiles -> (длинное целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Delta Lake.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3DeltaCatalogTarget -> (структура)
Указывает целевой объект для записи в источник данных Delta Lake в Glue Data Catalog.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает собственное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
AdditionalOptions -> (словарь)
Указывает дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для извлекателя.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
S3DeltaDirectTarget -> (структура)
Указывает целевой объект, который записывает данные в источник Delta Lake в Amazon S3.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами для целевого объекта данных.
(строка)
КлючиРазбиения -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").ЧислоЦелевыхРазбиений -> (строка)
Формат -> (строка)
ДополнительныеПараметры -> (карта)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
ПолитикаИзмененияСхемы -> (структура)
Политика, определяющая поведение обновления для ползунка.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
Таблица -> (строка)
База данных -> (строка)
AmazonRedshiftSource -> (структура)
Указывает целевой объект, который записывает данные в источник данных в Amazon Redshift.
Имя -> (строка)
Данные -> (структура)
Указывает данные узла источника Amazon Reshift.
ТипДоступа -> (строка)
ТипИсточника -> (строка)
Подключение -> (структура)
Подключение Glue к кластеру Redshift.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
БазаДанныхКаталога -> (структура)
Имя базы данных каталога данных Glue при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
ТаблицаКаталога -> (структура)
Имя таблицы каталога данных Glue при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
СхемаRedshiftКаталога -> (строка)
ТаблицаRedshiftКаталога -> (строка)
ВременнаяДиректория -> (строка)
РольIam -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. Роль IAM по умолчанию — роль в задаче, если она не указана.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
ДополнительныеПараметры -> (список)
Дополнительные значения при подключении к кластеру Redshift.
(структура)
Указывает дополнительное значение при подключении к кластеру Redshift.
Ключ -> (строка)
Значение -> (строка)
ПримерЗапроса -> (строка)
ДействиеДо -> (строка)
ДействиеПосле -> (строка)
Действие -> (строка)
ПрефиксТаблицы -> (строка)
Upsert -> (булево)
ДействиеMerge -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
ОператорMerge -> (строка)
ПодключениеПолзунка -> (строка)
СхемаТаблицы -> (список)
Массив выходных схем для данного узла.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
ТаблицаЭтапирования -> (строка)
ВыбранныеСтолбцы -> (список)
Список имен столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
AmazonRedshiftTarget -> (структура)
Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.
Name -> (строка)
Data -> (структура)
Указывает данные узла целевого объекта Amazon Redshift.
AccessType -> (строка)
SourceType -> (строка)
Connection -> (структура)
Подключение Glue к кластеру Redshift.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Table -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogDatabase -> (структура)
Имя базы данных каталога данных Glue при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogTable -> (структура)
Имя таблицы каталога данных Glue при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogRedshiftSchema -> (строка)
CatalogRedshiftTable -> (строка)
TempDir -> (строка)
IamRole -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. При оставлении пустым, роль IAM по умолчанию будет ролью задания.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdvancedOptions -> (список)
Необязательные значения при подключении к кластеру Redshift.
(структура)
Указывает необязательное значение при подключении к кластеру Redshift.
Key -> (строка)
Value -> (строка)
SampleQuery -> (строка)
PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
TablePrefix -> (строка)
Upsert -> (булево)
MergeAction -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
MergeClause -> (строка)
CrawlerConnection -> (строка)
TableSchema -> (список)
Массив выходных схем для данного узла.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
StagingTable -> (строка)
SelectedColumns -> (список)
Список имен столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
EvaluateDataQualityMultiFrame -> (структура)
Указывает критерии оценки качества данных. Позволяет использовать несколько входных данных и возвращает набор динамических кадров.
Name -> (строка)
Inputs -> (список)
Входы для оценки качества данных. Первый вход в этом списке — основной источник данных.
(строка)
AdditionalDataSources -> (карта)
Псевдонимы всех источников данных, кроме основного.
key -> (строка)
value -> (строка)
Ruleset -> (строка)
PublishingOptions -> (структура)
Параметры настройки публикации результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
AdditionalOptions -> (карта)
Параметры для настройки поведения преобразования во время выполнения.
key -> (строка)
value -> (строка)
StopJobOnFailureOptions -> (структура)
Параметры для настройки того, как задание будет остановлено, если оценка качества данных завершится неудачно.
StopJobOnFailureTiming -> (строка)
Recipe -> (структура)
Указывает узел рецепта Glue DataBrew.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входами для узла рецепта, определенные по идентификатору.
(строка)
RecipeReference -> (структура)
Ссылка на рецепт DataBrew, используемый узлом.
RecipeArn -> (строка)
RecipeVersion -> (строка)
RecipeSteps -> (список)
Шаги преобразования, используемые в узле рецепта.
(структура)
Шаг рецепта, используемый в узле подготовки данных рецепта Glue Studio.
Action -> (структура)
Действие преобразования шага рецепта.
Operation -> (строка)
Parameters -> (карта)
Параметры действия рецепта.
key -> (строка)
value -> (строка)
ConditionExpressions -> (список)
Условные выражения для шага рецепта.
(структура)
Условное выражение, определенное в узле подготовки данных рецепта Glue Studio.
Condition -> (строка)
Value -> (строка)
TargetColumn -> (строка)
SnowflakeSource -> (структура)
Указывает источник данных Snowflake.
Name -> (строка)
Data -> (структура)
Настройка источника данных Snowflake.
SourceType -> (строка)
"table" , "query" .Connection -> (структура)
Указывает подключение Glue Data Catalog к узлу Snowflake.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (строка)
Table -> (строка)
Database -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdditionalOptions -> (карта)
Указывает дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны в другом месте в этом узле, они будут иметь приоритет.
key -> (строка)
value -> (строка)
SampleQuery -> (строка)
query .PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Указывает поведение разрешения, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.MergeAction -> (строка)
simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .MergeWhenMatched -> (строка)
update , delete .MergeWhenNotMatched -> (строка)
insert , none .MergeClause -> (строка)
StagingTable -> (строка)
merge или upsert append. Данные записываются в эту таблицу, затем перемещаются в таблицу table с помощью сгенерированного postaction.SelectedColumns -> (список)
Указывает столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description. Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AutoPushdown -> (булево)
TableSchema -> (список)
Вручную определяет целевую схему для узла. Список структур с ключами value , label и description. Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
OutputSchemas -> (список)
Указывает пользовательские схемы для выходных данных.
(структура)
Указывает пользовательскую схему, когда схема не может быть определена Glue.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
SnowflakeTarget -> (структура)
Указывает целевой объект для записи в источник данных Snowflake.
Name -> (строка)
Data -> (структура)
Указывает данные целевого узла Snowflake.
SourceType -> (строка)
"table" , "query" .Connection -> (структура)
Указывает подключение Glue Data Catalog к узлу Snowflake.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (строка)
Table -> (строка)
Database -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdditionalOptions -> (карта)
Указывает дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны в другом месте в этом узле, они будут иметь приоритет.
key -> (строка)
value -> (строка)
SampleQuery -> (строка)
query .PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Указывает поведение разрешения, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.MergeAction -> (строка)
simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .MergeWhenMatched -> (строка)
update , delete .MergeWhenNotMatched -> (строка)
insert , none .MergeClause -> (строка)
StagingTable -> (строка)
merge или upsert append. Данные записываются в эту таблицу, затем перемещаются в таблицу table с помощью сгенерированного postaction.SelectedColumns -> (список)
Указывает столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description. Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AutoPushdown -> (булево)
TableSchema -> (список)
Вручную определяет целевую схему для узла. Список структур с ключами value , label и description. Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, которые являются входами в целевой объект данных.
(строка)
ConnectorDataSource -> (структура)
Указывает на источник, сгенерированный со стандартными параметрами подключения.
Name -> (string)
ConnectionType -> (string)
connectionType, предоставленные библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Data -> (map)
Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе Параметры подключения в документации Glue.
key -> (string)
value -> (string)
OutputSchemas -> (list)
Указывает схему данных для этого источника.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (list)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (string)
Type -> (string)
ConnectorDataTarget -> (structure)
Указывает целевой объект, сгенерированный со стандартными параметрами подключения.
Name -> (string)
ConnectionType -> (string)
connectionType, предоставленные библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Data -> (map)
Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе Параметры подключения в документации Glue.
key -> (string)
value -> (string)
Inputs -> (list)
Узлы, являющиеся входами в целевой объект данных.
(string)
JSON Синтаксис:
{"string": {
"AthenaConnectorSource": {
"Name": "string",
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"ConnectionTable": "string",
"SchemaName": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"JDBCConnectorSource": {
"Name": "string",
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {
"FilterPredicate": "string",
"PartitionColumn": "string",
"LowerBound": long,
"UpperBound": long,
"NumPartitions": long,
"JobBookmarkKeys": ["string", ...],
"JobBookmarkKeysSortOrder": "string",
"DataTypeMapping": {"ARRAY"|"BIGINT"|"BINARY"|"BIT"|"BLOB"|"BOOLEAN"|"CHAR"|"CLOB"|"DATALINK"|"DATE"|"DECIMAL"|"DISTINCT"|"DOUBLE"|"FLOAT"|"INTEGER"|"JAVA_OBJECT"|"LONGNVARCHAR"|"LONGVARBINARY"|"LONGVARCHAR"|"NCHAR"|"NCLOB"|"NULL"|"NUMERIC"|"NVARCHAR"|"OTHER"|"REAL"|"REF"|"REF_CURSOR"|"ROWID"|"SMALLINT"|"SQLXML"|"STRUCT"|"TIME"|"TIME_WITH_TIMEZONE"|"TIMESTAMP"|"TIMESTAMP_WITH_TIMEZONE"|"TINYINT"|"VARBINARY"|"VARCHAR": "DATE"|"STRING"|"TIMESTAMP"|"INT"|"FLOAT"|"LONG"|"BIGDECIMAL"|"BYTE"|"SHORT"|"DOUBLE"
...}
},
"ConnectionTable": "string",
"Query": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SparkConnectorSource": {
"Name": "string",
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"RedshiftSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"RedshiftTmpDir": "string",
"TmpDirIAMRole": "string"
},
"S3CatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"PartitionPredicate": "string",
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long
}
},
"S3CsvSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "gzip"|"bzip2",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"Separator": "comma"|"ctrla"|"pipe"|"semicolon"|"tab",
"Escaper": "string",
"QuoteChar": "quote"|"quillemet"|"single_quote"|"disabled",
"Multiline": true|false,
"WithHeader": true|false,
"WriteHeader": true|false,
"SkipFirst": true|false,
"OptimizePerformance": true|false,
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3ExcelSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"NumberRows": long,
"SkipFooter": integer,
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3JsonSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "gzip"|"bzip2",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"JsonPath": "string",
"Multiline": true|false,
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3ParquetSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"RelationalCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"DynamoDBCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"JDBCConnectorTarget": {
"Name": "string",
"Inputs": ["string", ...],
"ConnectionName": "string",
"ConnectionTable": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SparkConnectorTarget": {
"Name": "string",
"Inputs": ["string", ...],
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Database": "string",
"Table": "string"
},
"RedshiftTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string",
"RedshiftTmpDir": "string",
"TmpDirIAMRole": "string",
"UpsertRedshiftOptions": {
"TableLocation": "string",
"ConnectionName": "string",
"UpsertKeys": ["string", ...]
}
},
"S3CatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"S3GlueParquetTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
"NumberTargetPartitions": "string",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"S3HyperDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "uncompressed",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"S3DirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "string",
"NumberTargetPartitions": "string",
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"S3IcebergDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
},
"Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
"NumberTargetPartitions": "string"
},
"ApplyMapping": {
"Name": "string",
"Inputs": ["string", ...],
"Mapping": [
{
"ToKey": "string",
"FromPath": ["string", ...],
"FromType": "string",
"ToType": "string",
"Dropped": true|false,
"Children": [
{
"ToKey": "string",
"FromPath": ["string", ...],
"FromType": "string",
"ToType": "string",
"Dropped": true|false,
"Children":
}
...
]
}
...
]
},
"SelectFields": {
"Name": "string",
"Inputs": ["string", ...],
"Paths": [
["string", ...]
...
]
},
"DropFields": {
"Name": "string",
"Inputs": ["string", ...],
"Paths": [
["string", ...]
...
]
},
"RenameField": {
"Name": "string",
"Inputs": ["string", ...],
"SourcePath": ["string", ...],
"TargetPath": ["string", ...]
},
"Spigot": {
"Name": "string",
"Inputs": ["string", ...],
"Path": "string",
"Topk": integer,
"Prob": double
},
"Join": {
"Name": "string",
"Inputs": ["string", ...],
"JoinType": "equijoin"|"left"|"right"|"outer"|"leftsemi"|"leftanti",
"Columns": [
{
"From": "string",
"Keys": [
["string", ...]
...
]
}
...
]
},
"SplitFields": {
"Name": "string",
"Inputs": ["string", ...],
"Paths": [
["string", ...]
...
]
},
"SelectFromCollection": {
"Name": "string",
"Inputs": ["string", ...],
"Index": integer
},
"FillMissingValues": {
"Name": "string",
"Inputs": ["string", ...],
"ImputedPath": "string",
"FilledPath": "string"
},
"Filter": {
"Name": "string",
"Inputs": ["string", ...],
"LogicalOperator": "AND"|"OR",
"Filters": [
{
"Operation": "EQ"|"LT"|"GT"|"LTE"|"GTE"|"REGEX"|"ISNULL",
"Negated": true|false,
"Values": [
{
"Type": "COLUMNEXTRACTED"|"CONSTANT",
"Value": ["string", ...]
}
...
]
}
...
]
},
"CustomCode": {
"Name": "string",
"Inputs": ["string", ...],
"Code": "string",
"ClassName": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SparkSQL": {
"Name": "string",
"Inputs": ["string", ...],
"SqlQuery": "string",
"SqlAliases": [
{
"From": "string",
"Alias": "string"
}
...
],
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"DirectKinesisSource": {
"Name": "string",
"WindowSize": integer,
"DetectSchema": true|false,
"StreamingOptions": {
"EndpointUrl": "string",
"StreamName": "string",
"Classification": "string",
"Delimiter": "string",
"StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
"MaxFetchTimeInMs": long,
"MaxFetchRecordsPerShard": long,
"MaxRecordPerRead": long,
"AddIdleTimeBetweenReads": true|false,
"IdleTimeBetweenReadsInMs": long,
"DescribeShardInterval": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxRetryIntervalMs": long,
"AvoidEmptyBatches": true|false,
"StreamArn": "string",
"RoleArn": "string",
"RoleSessionName": "string",
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"DirectKafkaSource": {
"Name": "string",
"StreamingOptions": {
"BootstrapServers": "string",
"SecurityProtocol": "string",
"ConnectionName": "string",
"TopicName": "string",
"Assign": "string",
"SubscribePattern": "string",
"Classification": "string",
"Delimiter": "string",
"StartingOffsets": "string",
"EndingOffsets": "string",
"PollTimeoutMs": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxOffsetsPerTrigger": long,
"MinPartitions": integer,
"IncludeHeaders": true|false,
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"WindowSize": integer,
"DetectSchema": true|false,
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"CatalogKinesisSource": {
"Name": "string",
"WindowSize": integer,
"DetectSchema": true|false,
"Table": "string",
"Database": "string",
"StreamingOptions": {
"EndpointUrl": "string",
"StreamName": "string",
"Classification": "string",
"Delimiter": "string",
"StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
"MaxFetchTimeInMs": long,
"MaxFetchRecordsPerShard": long,
"MaxRecordPerRead": long,
"AddIdleTimeBetweenReads": true|false,
"IdleTimeBetweenReadsInMs": long,
"DescribeShardInterval": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxRetryIntervalMs": long,
"AvoidEmptyBatches": true|false,
"StreamArn": "string",
"RoleArn": "string",
"RoleSessionName": "string",
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"CatalogKafkaSource": {
"Name": "string",
"WindowSize": integer,
"DetectSchema": true|false,
"Table": "string",
"Database": "string",
"StreamingOptions": {
"BootstrapServers": "string",
"SecurityProtocol": "string",
"ConnectionName": "string",
"TopicName": "string",
"Assign": "string",
"SubscribePattern": "string",
"Classification": "string",
"Delimiter": "string",
"StartingOffsets": "string",
"EndingOffsets": "string",
"PollTimeoutMs": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxOffsetsPerTrigger": long,
"MinPartitions": integer,
"IncludeHeaders": true|false,
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"DropNullFields": {
"Name": "string",
"Inputs": ["string", ...],
"NullCheckBoxList": {
"IsEmpty": true|false,
"IsNullString": true|false,
"IsNegOne": true|false
},
"NullTextList": [
{
"Value": "string",
"Datatype": {
"Id": "string",
"Label": "string"
}
}
...
]
},
"Merge": {
"Name": "string",
"Inputs": ["string", ...],
"Source": "string",
"PrimaryKeys": [
["string", ...]
...
]
},
"Union": {
"Name": "string",
"Inputs": ["string", ...],
"UnionType": "ALL"|"DISTINCT"
},
"PIIDetection": {
"Name": "string",
"Inputs": ["string", ...],
"PiiType": "RowAudit"|"RowMasking"|"ColumnAudit"|"ColumnMasking",
"EntityTypesToDetect": ["string", ...],
"OutputColumnName": "string",
"SampleFraction": double,
"ThresholdFraction": double,
"MaskValue": "string"
},
"Aggregate": {
"Name": "string",
"Inputs": ["string", ...],
"Groups": [
["string", ...]
...
],
"Aggs": [
{
"Column": ["string", ...],
"AggFunc": "avg"|"countDistinct"|"count"|"first"|"last"|"kurtosis"|"max"|"min"|"skewness"|"stddev_samp"|"stddev_pop"|"sum"|"sumDistinct"|"var_samp"|"var_pop"
}
...
]
},
"DropDuplicates": {
"Name": "string",
"Inputs": ["string", ...],
"Columns": [
["string", ...]
...
]
},
"GovernedCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"GovernedCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"PartitionPredicate": "string",
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long
}
},
"MicrosoftSQLServerCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"MySQLCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"OracleSQLCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"PostgreSQLCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"MicrosoftSQLServerCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"MySQLCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"OracleSQLCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"PostgreSQLCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"DynamicTransform": {
"Name": "string",
"TransformName": "string",
"Inputs": ["string", ...],
"Parameters": [
{
"Name": "string",
"Type": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
"ValidationRule": "string",
"ValidationMessage": "string",
"Value": ["string", ...],
"ListType": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
"IsOptional": true|false
}
...
],
"FunctionName": "string",
"Path": "string",
"Version": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"EvaluateDataQuality": {
"Name": "string",
"Inputs": ["string", ...],
"Ruleset": "string",
"Output": "PrimaryInput"|"EvaluationResults",
"PublishingOptions": {
"EvaluationContext": "string",
"ResultsS3Prefix": "string",
"CloudWatchMetricsEnabled": true|false,
"ResultsPublishingEnabled": true|false
},
"StopJobOnFailureOptions": {
"StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
}
},
"S3CatalogHudiSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalHudiOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogHudiSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalHudiOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3HudiSource": {
"Name": "string",
"Paths": ["string", ...],
"AdditionalHudiOptions": {"string": "string"
...},
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3HudiCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"S3HudiDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Path": "string",
"Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
"NumberTargetPartitions": "string",
"PartitionKeys": [
["string", ...]
...
],
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"DirectJDBCSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"ConnectionName": "string",
"ConnectionType": "sqlserver"|"mysql"|"oracle"|"postgresql"|"redshift",
"RedshiftTmpDir": "string"
},
"S3CatalogDeltaSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalDeltaOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogDeltaSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalDeltaOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3DeltaSource": {
"Name": "string",
"Paths": ["string", ...],
"AdditionalDeltaOptions": {"string": "string"
...},
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3DeltaCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"S3DeltaDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "uncompressed"|"snappy",
"NumberTargetPartitions": "string",
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"AmazonRedshiftSource": {
"Name": "string",
"Data": {
"AccessType": "string",
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Table": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogDatabase": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogTable": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogRedshiftSchema": "string",
"CatalogRedshiftTable": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdvancedOptions": [
{
"Key": "string",
"Value": "string"
}
...
],
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"TablePrefix": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"CrawlerConnection": "string",
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
}
},
"AmazonRedshiftTarget": {
"Name": "string",
"Data": {
"AccessType": "string",
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Table": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogDatabase": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogTable": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogRedshiftSchema": "string",
"CatalogRedshiftTable": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdvancedOptions": [
{
"Key": "string",
"Value": "string"
}
...
],
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"TablePrefix": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"CrawlerConnection": "string",
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
},
"Inputs": ["string", ...]
},
"EvaluateDataQualityMultiFrame": {
"Name": "string",
"Inputs": ["string", ...],
"AdditionalDataSources": {"string": "string"
...},
"Ruleset": "string",
"PublishingOptions": {
"EvaluationContext": "string",
"ResultsS3Prefix": "string",
"CloudWatchMetricsEnabled": true|false,
"ResultsPublishingEnabled": true|false
},
"AdditionalOptions": {"performanceTuning.caching"|"observations.scope": "string"
...},
"StopJobOnFailureOptions": {
"StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
}
},
"Recipe": {
"Name": "string",
"Inputs": ["string", ...],
"RecipeReference": {
"RecipeArn": "string",
"RecipeVersion": "string"
},
"RecipeSteps": [
{
"Action": {
"Operation": "string",
"Parameters": {"string": "string"
...}
},
"ConditionExpressions": [
{
"Condition": "string",
"Value": "string",
"TargetColumn": "string"
}
...
]
}
...
]
},
"SnowflakeSource": {
"Name": "string",
"Data": {
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": "string",
"Table": "string",
"Database": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdditionalOptions": {"string": "string"
...},
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"AutoPushdown": true|false,
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SnowflakeTarget": {
"Name": "string",
"Data": {
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": "string",
"Table": "string",
"Database": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdditionalOptions": {"string": "string"
...},
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"AutoPushdown": true|false,
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
},
"Inputs": ["string", ...]
},
"ConnectorDataSource": {
"Name": "string",
"ConnectionType": "string",
"Data": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"ConnectorDataTarget": {
"Name": "string",
"ConnectionType": "string",
"Data": {"string": "string"
...},
"Inputs": ["string", ...]
}
}
...}
--execution-class (string)
Указывает, выполняется ли задача со стандартным или гибким классом выполнения. Стандартный класс выполнения идеально подходит для задач с жесткими временными ограничениями, требующих быстрого запуска задачи и выделенных ресурсов.
Гибкий класс выполнения подходит для задач, не требующих строгого времени выполнения, начало и окончание которых могут изменяться.
Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass на FLEX. Гибкий класс выполнения доступен для задач Spark.
Возможные значения:
FLEXSTANDARD
--source-control-details (структура)
Подробности для конфигурации управления версиями источника для задачи, позволяющие синхронизировать артефакты задачи с удаленным репозиторием или из него.
Provider -> (string)
Repository -> (string)
Owner -> (string)
Branch -> (string)
Folder -> (string)
LastCommitId -> (string)
AuthStrategy -> (string)
AuthToken -> (string)
Сокращенный синтаксис:
Provider=string,Repository=string,Owner=string,Branch=string,Folder=string,LastCommitId=string,AuthStrategy=string,AuthToken=string
JSON Синтаксис:
{
"Provider": "GITHUB"|"GITLAB"|"BITBUCKET"|"AWS_CODE_COMMIT",
"Repository": "string",
"Owner": "string",
"Branch": "string",
"Folder": "string",
"LastCommitId": "string",
"AuthStrategy": "PERSONAL_ACCESS_TOKEN"|"AWS_SECRETS_MANAGER",
"AuthToken": "string"
}
--maintenance-window (строка)
Это поле указывает день недели и час для окна обслуживания для потоковых задач. Glue периодически выполняет задачи обслуживания. В эти окна обслуживания Glue потребуется перезапустить ваши потоковые задачи.
Glue перезапустит задачу в течение 3 часов с момента указанного окна обслуживания. Например, если вы настроите окно обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.
--cli-input-json | --cli-input-yaml (string) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределяют значения, предоставленные в JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет взята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение или значение input, выводит JSON-образец входных данных, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, оно выведет пример входных данных YAML, который можно использовать с --cli-input-yaml. При предоставлении значения output оно валидирует входные данные команды и возвращает пример выходных данных JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (boolean)
Включить отладочную запись журнала.
--endpoint-url (string)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (boolean)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверяет SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (boolean)
Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (string)
Стиль форматирования выходных данных команды.
- json
- text
- table
- yaml
- yaml-stream
--query (string)
Запрос JMESPath для фильтрации данных ответа.
--profile (string)
Использовать определенный профиль из файла учетных данных.
--region (string)
Регион для использования. Переопределяет параметры конфигурации/среды.
--version (string)
Отобразить версию этого инструмента.
--color (string)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (boolean)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (string)
Файл сертификата CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (string)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла непосредственно, независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (boolean)
Отключить выгрузку страниц CLI для вывода.
--cli-auto-prompt (boolean)
Автоматически запросить параметры ввода CLI.
--no-cli-auto-prompt (boolean)
Отключить автоматическое запросы параметров ввода CLI.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительные сведения см. в руководстве по началу работы с AWS CLI в Руководстве пользователя AWS CLI.
Если не указано иное, во всех примерах используются правила кавычек Unix-подобных систем. Эти примеры необходимо адаптировать к правилам кавычек вашей оболочки. См. раздел Использование кавычек со строками в Руководстве пользователя AWS CLI.
Чтобы создать задачу преобразования данных
Следующий create-job пример создает потоковую задачу, которая выполняет скрипт, хранящийся в S3.
aws glue create-job \
--name my-testing-job \
--role AWSGlueServiceRoleDefault \
--command '{ \
"Name": "gluestreaming", \
"ScriptLocation": "s3://amzn-s3-demo-bucket/folder/" \
}' \
--region us-east-1 \
--output json \
--default-arguments '{ \
"--job-language":"scala", \
"--class":"GlueApp" \
}' \
--profile my-profile \
--endpoint https://glue.us-east-1.amazonaws.com
Содержание test_script.scala:
importcom.amazonaws.services.glue.ChoiceOption
importcom.amazonaws.services.glue.GlueContext
importcom.amazonaws.services.glue.MappingSpec
importcom.amazonaws.services.glue.ResolveSpec
importcom.amazonaws.services.glue.errors.CallSite
importcom.amazonaws.services.glue.util.GlueArgParser
importcom.amazonaws.services.glue.util.Job
importcom.amazonaws.services.glue.util.JsonOptions
importorg.apache.spark.SparkContext
importscala.collection.JavaConverters._
object GlueApp {
defmain(sysArgs: Array[String]) {
val spark: SparkContext = new SparkContext()
val glueContext: GlueContext = new GlueContext(spark)
// @params: [JOB_NAME]
val args = GlueArgParser.getResolvedOptions(sysArgs, Seq("JOB_NAME").toArray)
Job.init(args("JOB_NAME"), glueContext, args.asJava)
// @type: DataSource
// @args: [database = "tempdb", table_name = "s3-source", transformation_ctx = "datasource0"]
// @return: datasource0
// @inputs: []
val datasource0 = glueContext.getCatalogSource(database = "tempdb", tableName = "s3-source", redshiftTmpDir = "", transformationContext = "datasource0").getDynamicFrame()
// @type: ApplyMapping
// @args: [mapping = [("sensorid", "int", "sensorid", "int"), ("currenttemperature", "int", "currenttemperature", "int"), ("status", "string", "status", "string")], transformation_ctx = "applymapping1"]
// @return: applymapping1
// @inputs: [frame = datasource0]
val applymapping1 = datasource0.applyMapping(mappings = Seq(("sensorid", "int", "sensorid", "int"), ("currenttemperature", "int", "currenttemperature", "int"), ("status", "string", "status", "string")), caseSensitive = false, transformationContext = "applymapping1")
// @type: SelectFields
// @args: [paths = ["sensorid", "currenttemperature", "status"], transformation_ctx = "selectfields2"]
// @return: selectfields2
// @inputs: [frame = applymapping1]
val selectfields2 = applymapping1.selectFields(paths = Seq("sensorid", "currenttemperature", "status"), transformationContext = "selectfields2")
// @type: ResolveChoice
// @args: [choice = "MATCH_CATALOG", database = "tempdb", table_name = "my-s3-sink", transformation_ctx = "resolvechoice3"]
// @return: resolvechoice3
// @inputs: [frame = selectfields2]
val resolvechoice3 = selectfields2.resolveChoice(choiceOption = Some(ChoiceOption("MATCH_CATALOG")), database = Some("tempdb"), tableName = Some("my-s3-sink"), transformationContext = "resolvechoice3")
// @type: DataSink
// @args: [database = "tempdb", table_name = "my-s3-sink", transformation_ctx = "datasink4"]
// @return: datasink4
// @inputs: [frame = resolvechoice3]
val datasink4 = glueContext.getCatalogSink(database = "tempdb", tableName = "my-s3-sink", redshiftTmpDir = "", transformationContext = "datasink4").writeDynamicFrame(resolvechoice3)
Job.commit()
}
}
Вывод:
{
"Name": "my-testing-job"
}
Дополнительную информацию см. в разделе Создание задач в AWS Glue в Руководстве разработчика AWS Glue.
Вывод
Name -> (string)
© Copyright 2025, Amazon Web Services. Created using Sphinx.