обновить-задание
Описание
Обновляет существующее определение задания. Предыдущее определение задания полностью перезаписывается этой информацией.
См. также: Документацию API AWS
Синтаксис
update-job
--job-name <value>
--job-update <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--job-name (строка)
--job-update (структура)
Указывает значения, с помощью которых обновляется определение задания. Неуказанные параметры удаляются или сбрасываются до значений по умолчанию.
JobMode -> (строка)
Режим, описывающий способ создания задания. Допустимые значения:
-
SCRIPT- Задание создано с помощью редактора сценариев Glue Studio. -
VISUAL- Задание создано с помощью визуального редактора Glue Studio. -
NOTEBOOK- Задание создано с помощью блокнота интерактивных сеансов.
Если поле JobMode отсутствует или равно null, то SCRIPT используется в качестве значения по умолчанию.
JobRunQueuingEnabled -> (логическое)
Указывает, включено ли очередирование запусков заданий для запусков заданий этого задания.
Значение true означает, что очередирование запусков заданий включено для запусков заданий. Если false или не задано, запуски заданий не будут рассматриваться для очередирования.
Если это поле не совпадает со значением, установленным в запуске задания, то используется значение из поля запуска задания.
Description -> (строка)
LogUri -> (строка)
Role -> (строка)
ExecutionProperty -> (структура)
Структура, определяющая максимальное количество одновременных запусков, разрешенных для этого задания.
MaxConcurrentRuns -> (целое число)
Command -> (структура)
Команда, выполняющая это задание (требуется).
Name -> (строка)
glueetl. Для задания Python shell - это должно быть pythonshell. Для задания ETL Apache Spark Streaming - это должно быть gluestreaming. Для задания Ray - это должно быть glueray.ScriptLocation -> (строка)
PythonVersion -> (строка)
Runtime -> (строка)
DefaultArguments -> (отображение)
Значения аргументов по умолчанию для каждого запуска этого задания, заданные в виде пар имя-значение.
Вы можете указать здесь аргументы, которые использует ваш собственный сценарий выполнения задания, а также аргументы, которые использует сам Glue.
Аргументы задания могут регистрироваться. Не передавайте открытые секреты в качестве аргументов. Получайте секреты из соединения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите сохранить их в рамках задания.
Дополнительную информацию о том, как указать и использовать собственные аргументы задания, см. в разделе Вызов API Glue на Python в руководстве разработчика.
Дополнительную информацию об аргументах, которые можно предоставить в этом поле при настройке заданий Spark, см. в разделе Специальные параметры, используемые Glue, в руководстве разработчика.
Дополнительную информацию об аргументах, которые можно предоставить в этом поле при настройке заданий Ray, см. в разделе Использование параметров задания в заданиях Ray в руководстве разработчика.
key -> (строка)
value -> (строка)
NonOverridableArguments -> (отображение)
Аргументы для этого задания, которые не перезаписываются при предоставлении аргументов задания в запуске задания, заданные в виде пар имя-значение.
key -> (строка)
value -> (строка)
Connections -> (структура)
Соединения, используемые для этого задания.
Connections -> (список)
Список соединений, используемых заданием.
(строка)
MaxRetries -> (целое число)
AllocatedCapacity -> (целое число)
Это поле устарело. Используйте MaxCapacity вместо него.
Количество единиц обработки данных Glue (DPU), выделяемых для этого задания. Вы можете выделить минимум 2 DPU; значение по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 vCPU вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.
Timeout -> (целое число)
Тайм-аут задания в минутах. Это максимальное время, которое запуск задания может потреблять ресурсы, прежде чем он завершится и перейдет в состояние TIMEOUT.
Значения тайм-аута задания должны быть меньше 7 дней или 10080 минут. В противном случае задания генерируют исключение.
Если значение не указано, тайм-аут по умолчанию составляет 2880 минут.
Любые существующие задания Glue, у которых значение тайм-аута было больше 7 дней, будут сбрасываться до 7 дней. Например, если вы указали тайм-аут в 20 дней для задания пакетной обработки, оно будет остановлено на 7-й день.
Для заданий потоковой обработки, если вы настроили окно обслуживания, оно будет перезапущено во время окна обслуживания по истечении 7 дней.
MaxCapacity -> (двойное)
Для заданий Glue версии 1.0 или более ранних версий, использующих стандартный тип рабочего процесса, количество единиц обработки данных Glue (DPU), которые могут быть выделены при запуске этого задания. DPU — это относительная мера вычислительной мощности, состоящая из 4 vCPU вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.
Для заданий Glue версии 2.0 и выше вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.
Не устанавливайте MaxCapacity, если используете WorkerType и NumberOfWorkers.
Значение, которое может быть выделено для MaxCapacity, зависит от того, выполняете ли вы задание Python shell, задание Apache Spark ETL или задание Apache Spark streaming ETL:
- Если вы указываете задание Python shell (
JobCommand.Name=”pythonshell”), вы можете выделить 0,0625 или 1 DPU. Значение по умолчанию 0,0625 DPU. - Если вы указываете задание Apache Spark ETL (
JobCommand.Name=”glueetl”) или задание Apache Spark streaming ETL (JobCommand.Name=”gluestreaming”), вы можете выделить от 2 до 100 DPU. Значение по умолчанию 10 DPU. Для этого типа задания не допускается выделение дробных DPU.
WorkerType -> (строка)
Тип предопределенного рабочего процесса, выделенного при запуске задания. Принимает значение G.1X, G.2X, G.4X, G.8X или G.025X для заданий Spark. Принимает значение Z.2X для заданий Ray.
- Для типа рабочего процесса
G.1Xкаждый рабочий соответствует 1 DPU (4 vCPU, 16 ГБ памяти) с диском 94 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономичный способ выполнения большинства заданий. - Для типа рабочего процесса
G.2Xкаждый рабочий соответствует 2 DPU (8 vCPU, 32 ГБ памяти) с диском 138 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономичный способ выполнения большинства заданий. - Для типа рабочего процесса
G.4Xкаждый рабочий соответствует 4 DPU (16 vCPU, 64 ГБ памяти) с диском 256 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для заданий, рабочие нагрузки которых содержат наиболее требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего процесса доступен только для заданий Apache Spark ETL Glue версии 3.0 и более поздних версий в следующих регионах Amazon Web Services: US East (Огайо), US East (Северная Вирджиния), US West (Орегон), Asia Pacific (Сингапур), Asia Pacific (Сидней), Asia Pacific (Токио), Canada (Центр), Europe (Франкфурт), Europe (Ирландия) и Europe (Стокгольм). - Для типа рабочего процесса
G.8Xкаждый рабочий соответствует 8 DPU (32 vCPU, 128 ГБ памяти) с диском 512 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для заданий, рабочие нагрузки которых содержат наиболее требовательные преобразования, агрегации, объединения и запросы. Этот тип рабочего процесса доступен только для заданий Apache Spark ETL Glue версии 3.0 и более поздних версий в тех же регионах Amazon Web Services, что и для типа рабочего процессаG.4X. - Для типа рабочего процесса
G.025Xкаждый рабочий соответствует 0,25 DPU (2 vCPU, 4 ГБ памяти) с диском 84 ГБ и обеспечивает 1 исполнитель на рабочий процесс. Мы рекомендуем этот тип рабочего процесса для заданий потоковой обработки с низким объемом данных. Этот тип рабочего процесса доступен только для заданий потоковой обработки Glue версии 3.0 и более поздних версий. - Для типа рабочего процесса
Z.2Xкаждый рабочий соответствует 2 M-DPU (8vCPU, 64 ГБ памяти) с диском 128 ГБ и обеспечивает до 8 рабочих процессов Ray на основе автоматического масштабирования.
NumberOfWorkers -> (целое число)
workerType, выделяемых при запуске задания.SecurityConfiguration -> (строка)
SecurityConfiguration, используемой с этим заданием.NotificationProperty -> (структура)
Указывает конфигурационные параметры уведомления о задании.
NotifyDelayAfter -> (целое число)
GlueVersion -> (строка)
В заданиях Spark параметр GlueVersion определяет версии Apache Spark и Python, доступные в задании Glue. Версия Python указывает версию, поддерживаемую для заданий типа Spark.
Задания Ray должны установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительные библиотеки, доступные в вашем задании Ray, определяются параметром Runtime команды задания.
Дополнительную информацию об доступных версиях Glue и соответствующих версиях Spark и Python см. в руководстве разработчика.
Задания, созданные без указания версии Glue, используют Glue 0.9 по умолчанию.
CodeGenConfigurationNodes -> (отображение)
Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.
ключ -> (строка)
значение -> (структура)
CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.AthenaConnectorSource -> (структура)
Указывает соединение с источником данных Amazon Athena.
Имя -> (строка)
ИмяСоединения -> (строка)
ИмяСоединителя -> (строка)
ТипСоединения -> (строка)
ТаблицаСоединения -> (строка)
ИмяСхемы -> (строка)
/aws-glue/jobs/output.СхемыВывода -> (список)
Указывает схему данных для пользовательского источника Athena.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
JDBCConnectorSource -> (структура)
Указывает соединение с источником данных JDBC.
Имя -> (строка)
ИмяСоединения -> (строка)
ИмяСоединителя -> (строка)
ТипСоединения -> (строка)
ДополнительныеПараметры -> (структура)
Дополнительные параметры соединения для соединителя.
ФильтрПредска -> (строка)
Дополнительное условие для фильтрации данных из источника. Например:
BillingCity='Mountain View'При использовании запроса вместо имени таблицы необходимо убедиться, что запрос работает с указанным filterPredicate.
СтолбецРазделения -> (строка)
lowerBound, upperBound и numPartitions. Этот параметр работает так же, как и в Spark SQL JDBC reader.НижняяГраница -> (целое число)
partitionColumn, используемое для определения шага разбиения.ВерхняяГраница -> (целое число)
partitionColumn, используемое для определения шага разбиения.КоличествоРазделений -> (целое число)
lowerBound (включительно) и upperBound (исключительно) формируют шаги разбиения для выражений сгенерированных WHERE-клаузами, используемыми для разделения partitionColumn.КлючиОтметкиРаботы -> (список)
Имя ключей отметки работы, по которым необходимо отсортировать.
(строка)
ПорядокСортировкиКлючейОтметкиРаботы -> (строка)
СопоставлениеТиповДанных -> (карта)
Пользовательское сопоставление типов данных, создающее соответствие между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} сопоставляет поля данных типа JDBC FLOAT с типом Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания Glue записи. Объект ResultSet реализуется каждым драйвером, поэтому поведение зависит от используемого драйвера. Обратитесь к документации вашего JDBC драйвера, чтобы понять, как драйвер выполняет преобразования.
ключ -> (строка)
значение -> (строка)
ТаблицаСоединения -> (строка)
Запрос -> (строка)
ConnectionTable, либо query, но не оба.СхемыВывода -> (список)
Указывает схему данных для пользовательского JDBC источника.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorSource -> (структура)
Указывает соединение с источником данных Apache Spark.
Имя -> (строка)
ИмяСоединения -> (строка)
ИмяСоединителя -> (строка)
ТипСоединения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры соединения для соединителя.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для пользовательского источника Spark.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogSource -> (структура)
Указывает хранилище данных в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftSource -> (структура)
Указывает хранилище данных Amazon Redshift.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
S3CatalogSource -> (структура)
Указывает хранилище данных Amazon S3 в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ПредикатРазбиения -> (строка)
"" — по умолчанию пусто.ДополнительныеПараметры -> (структура)
Указывает дополнительные параметры соединения.
ОграниченныйРазмер -> (целое число)
ОграниченноеКоличествоФайлов -> (целое число)
S3CsvSource -> (структура)
Указывает хранилище данных в формате CSV (значения, разделённые запятыми), хранящееся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей к файлам Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip".Exclusions -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" на значение "inPartition", чтобы это подействовало.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (целое число с длинной точностью)
BoundedFiles -> (целое число с длинной точностью)
EnableSamplePath -> (булево)
SamplePath -> (строка)
Separator -> (строка)
Escaper -> (строка)
none. Если включено, символ, который следует сразу за ним, используется как есть, за исключением небольшого набора известных экранирований (\n, \r, \t и \0).QuoteChar -> (строка)
'"'. Установите значение в -1, чтобы полностью отключить кавычки.Multiline -> (булево)
False, что позволяет более активно разбивать файлы при разборе.WithHeader -> (булево)
False.WriteHeader -> (булево)
True.SkipFirst -> (булево)
False.OptimizePerformance -> (булево)
OutputSchemas -> (список)
Указывает схему данных для источника S3 CSV.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3ExcelSource -> (структура)
Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.
Name -> (строка)
Paths -> (список)
Пути в S3, где расположены файлы Excel.
(строка)
CompressionType -> (строка)
Exclusions -> (список)
Шаблоны для исключения определённых файлов или путей из обработки.
(строка)
GroupSize -> (строка)
GroupFiles -> (строка)
Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Дополнительные параметры конфигурации для обработки прямых источников S3.
BoundedSize -> (целое число с длинной точностью)
BoundedFiles -> (целое число с длинной точностью)
EnableSamplePath -> (булево)
SamplePath -> (строка)
NumberRows -> (целое число с длинной точностью)
SkipFooter -> (целое число)
OutputSchemas -> (список)
Схемы AWS Glue, применяемые к обработанным данным.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3JsonSource -> (структура)
Указывает хранилище данных в формате JSON, хранящееся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей к файлам Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip".Exclusions -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" на значение "inPartition", чтобы это подействовало.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (целое число с длинной точностью)
BoundedFiles -> (целое число с длинной точностью)
EnableSamplePath -> (булево)
SamplePath -> (строка)
JsonPath -> (строка)
Multiline -> (булево)
False, что позволяет более активно разбивать файлы при разборе.OutputSchemas -> (список)
Указывает схему данных для источника S3 JSON.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3ParquetSource -> (структура)
Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ТипСжатия -> (строка)
"gzip" и "bzip").Исключения -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
РазмерГруппы -> (строка)
"groupFiles" в "inPartition", чтобы это имело эффект.ФайлыВГруппе -> (строка)
"none".Рекурсия -> (булево)
МаксимальнаяПолоса -> (целое число)
МаксимальноеКоличествоФайловВПолосе -> (целое число)
ДополнительныеПараметры -> (структура)
Указывает дополнительные параметры подключения.
ОграниченныйРазмер -> (длинное целое число)
ОграниченноеКоличествоФайлов -> (длинное целое число)
ВключитьОбразецПути -> (булево)
ОбразецПути -> (строка)
СхемыВывода -> (список)
Указывает схему данных для источника S3 Parquet.
(структура)
Указывает схему, определённую пользователем, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
RelationalCatalogSource -> (структура)
Указывает хранилище данных реляционной базы данных в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
DynamoDBCatalogSource -> (структура)
Указывает хранилище данных DynamoDBC в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
JDBCConnectorTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в столбчатом хранилище Apache Parquet.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
ИмяПодключения -> (строка)
ТаблицаПодключения -> (строка)
ИмяКоннектора -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для целевого объекта JDBC.
(структура)
Указывает схему, определённую пользователем, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorTarget -> (структура)
Указывает целевой объект, использующий коннектор Apache Spark.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
ИмяПодключения -> (строка)
ИмяКоннектора -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для пользовательского целевого объекта Spark.
(структура)
Указывает схему, определённую пользователем, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogTarget -> (структура)
Указывает целевой объект, использующий таблицу каталога данных Glue.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
КлючиРазбиения -> (список)
Ключи разбиения, используемые для распределения данных по нескольким разделам или фрагментам на основе определённого ключа или набора ключей.
(список)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTarget -> (структура)
Указывает целевой объект, использующий Amazon Redshift.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
UpsertRedshiftOptions -> (структура)
Набор параметров для настройки операции upsert при записи в целевой объект Redshift.
РасположениеТаблицы -> (строка)
ИмяПодключения -> (строка)
КлючиUpsert -> (список)
Ключи, используемые для определения того, нужно ли выполнить обновление или вставку.
(строка)
S3CatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
КлючиРазбиения -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Таблица -> (строка)
БазаДанных -> (строка)
ПолитикаИзмененийСхемы -> (структура)
Политика, которая определяет поведение при обновлении для ползунка.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеПриОбновлении -> (строка)
S3GlueParquetTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в столбчатом хранилище Apache Parquet.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
КлючиРазбиения -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").КоличествоЦелевыхРазделов -> (строка)
ПолитикаИзмененийСхемы -> (структура)
Политика, которая определяет поведение при обновлении для ползунка.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеПриОбновлении -> (строка)
Таблица -> (строка)
БазаДанных -> (строка)
S3HyperDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.
Name -> (строка)
Inputs -> (список)
Указывает источник входных данных для узла HyperDirect назначения.
(строка)
PartitionKeys -> (список)
Определяет стратегию разбиения выходных данных.
(список)
Path -> (строка)
Compression -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы во время операций записи.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
S3DirectTarget -> (структура)
Определяет целевой объект данных для записи в Amazon S3.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с использованием последовательности ключей.
(список)
Path -> (строка)
Compression -> (строка)
"gzip" и "bzip".NumberTargetPartitions -> (строка)
Format -> (строка)
SchemaChangePolicy -> (структура)
Политика, определяющая поведение обновления для обработчика.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
S3IcebergDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.
Name -> (строка)
Inputs -> (список)
Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.
(строка)
PartitionKeys -> (список)
Указывает столбцы, используемые для разбиения данных таблицы Iceberg в S3.
(список)
Path -> (строка)
Format -> (строка)
AdditionalOptions -> (карта)
Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
Compression -> (строка)
NumberTargetPartitions -> (строка)
ApplyMapping -> (структура)
Определяет преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте. Вы можете переименовывать ключи, изменять типы данных для ключей и выбирать ключи для удаления из набора данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
Mapping -> (список)
Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте.
(структура)
Определяет сопоставление ключей свойств данных.
ToKey -> (строка)
FromPath.FromPath -> (список)
Таблица или столбец, подлежащие модификации.
(строка)
FromType -> (строка)
ToType -> (строка)
Dropped -> (булево)
Children -> (список)
Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, а также один из её дочерних элементов, вы можете заполнить эту структуру данных. Это также Mapping, но её FromPath будет родительским FromPath плюс FromPath из этой структуры.
Для части children, предположим, у вас есть структура:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }Вы можете указать Mapping, которая выглядит следующим образом:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }(структура)
Определяет сопоставление ключей свойств данных.
ToKey -> (строка)
FromPath.FromPath -> (список)
Таблица или столбец, подлежащие модификации.
(строка)
FromType -> (строка)
ToType -> (строка)
Dropped -> (булево)
SelectFields -> (структура)
Определяет преобразование, которое выбирает ключи свойств данных, которые нужно сохранить.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
Paths -> (список)
Путь JSON к переменной в структуре данных.
(список)
DropFields -> (структура)
Определяет преобразование, которое выбирает ключи свойств данных, которые нужно удалить.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
Paths -> (список)
Путь JSON к переменной в структуре данных.
(список)
RenameField -> (структура)
Определяет преобразование, которое переименовывает один ключ свойства данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
SourcePath -> (список)
Путь JSON к переменной в структуре данных для исходных данных.
(строка)
TargetPath -> (список)
Путь JSON к переменной в структуре данных для целевых данных.
(строка)
Spigot -> (структура)
Определяет преобразование, которое записывает образцы данных в хранилище Amazon S3.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
Path -> (строка)
Topk -> (целое число)
Prob -> (двойное число)
Join -> (структура)
Определяет преобразование, которое объединяет два набора данных в один набор данных с использованием сравнения по указанным ключам свойств данных. Вы можете использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
JoinType -> (строка)
Columns -> (список)
Список двух столбцов, которые нужно объединить.
(структура)
Определяет столбец, который будет объединён.
From -> (строка)
Keys -> (список)
Ключ столбца для объединения.
(список)
SplitFields -> (структура)
Определяет преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных, и один с оставшимися ключами свойств данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
Paths -> (список)
Путь JSON к переменной в структуре данных.
(список)
SelectFromCollection -> (структура)
Определяет преобразование, которое выбирает один DynamicFrame из набора DynamicFrames. Выходной результат - выбранный DynamicFrame.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по именам узлов.
(строка)
Index -> (целое число)
FillMissingValues -> (структура)
Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определенным методом импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
ImputedPath -> (строка)
FilledPath -> (строка)
Фильтр -> (структура)
Указывает преобразование, которое разделяет набор данных на два, основываясь на условии фильтрации.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
ЛогическийОператор -> (строка)
Фильтры -> (список)
Указывает выражение фильтра.
(структура)
Указывает выражение фильтра.
Операция -> (строка)
Отрицание -> (булево)
Значения -> (список)
Список значений фильтра.
(структура)
Представляет одну запись в списке значений для FilterExpression .
Тип -> (строка)
Значение -> (список)
Значение, которое нужно ассоциировать.
(строка)
CustomCode -> (структура)
Указывает преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Результатом является коллекция DynamicFrames.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Код -> (строка)
ИмяКласса -> (строка)
СхемыВывода -> (список)
Указывает схему данных для преобразования пользовательского кода.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkSQL -> (структура)
Указывает преобразование, где вы вводите SQL-запрос, используя синтаксис Spark SQL, для преобразования данных. Результатом является один DynamicFrame .
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов. Вы можете связать имя таблицы с каждым входным узлом для использования в SQL-запросе. Выбранное имя должно соответствовать ограничениям именования Spark SQL.
(строка)
SqlQuery -> (строка)
SqlAliases -> (список)
Список псевдонимов. Псевдоним позволяет указать имя, которое следует использовать в SQL для заданного ввода. Например, у вас есть источник данных под названием «MyDataSource». Если вы укажете From как MyDataSource, и Alias как SqlName, то в вашем SQL вы можете сделать:
select * from SqlNameи это получит данные из MyDataSource.
(структура)
Представляет одну запись в списке значений для SqlAliases .
От -> (строка)
Псевдоним -> (строка)
СхемыВывода -> (список)
Указывает схему данных для преобразования SparkSQL.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
DirectKinesisSource -> (структура)
Указывает прямой источник данных Amazon Kinesis.
Имя -> (строка)
РазмерОкна -> (целое число)
DetectSchema -> (булево)
StreamingOptions -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
EndpointUrl -> (строка)
ИмяПотока -> (строка)
Классификация -> (строка)
Разделитель -> (строка)
НачальнаяПозиция -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения: "latest" , "trim_horizon" , "earliest" или строка метки времени в формате UTC в шаблоне yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию: "latest" .
Примечание: Использование значения, которое является строкой метки времени в формате UTC, для «начальнойПозиции», поддерживается только для версии Glue 4.0 и выше.
МаксимальноеВремяОбработкиВМс -> (длинное целое число)
GetRecords . Значение по умолчанию: 1000 .МаксимальноеЧислоЗаписейНаРаздел -> (длинное целое число)
MaxFetchRecordsPerShard требует строгости, оно должно быть кратно MaxRecordPerRead . Значение по умолчанию: 100000 .МаксимальноеЧислоЗаписейНаЧтение -> (длинное целое число)
10000 .ДобавитьВремяПростояМеждуЧтениями -> (булево)
"False" . Этот параметр настраивается только для версии Glue 2.0 и выше.ВремяПростояМеждуЧтениямиВМс -> (длинное целое число)
1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.ИнтервалОписанияРазделов -> (длинное целое число)
1s .КоличествоПовторов -> (целое число)
3 .ИнтервалПовтораВМс -> (длинное целое число)
1000 .МаксимальныйИнтервалПовтораВМс -> (длинное целое число)
10000 .ИзбегатьПустыхПакет -> (булево)
"False" .StreamArn -> (строка)
RoleArn -> (строка)
"awsSTSSessionName" .RoleSessionName -> (строка)
"awsSTSRoleARN" .ДобавитьМеткаВремениЗаписи -> (строка)
EmitConsumerLagMetrics -> (строка)
НачальнаяМеткаВремени -> (метка времени)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: “2023-04-04T08:00:00+08:00”).DataPreviewOptions -> (структура)
Дополнительные параметры для предварительного просмотра данных.
ВремяОпроса -> (длинное целое число)
ПределОпросаЗаписей -> (длинное целое число)
DirectKafkaSource -> (структура)
Определяет хранилище данных Apache Kafka.
Name -> (строка)
StreamingOptions -> (структура)
Определяет параметры потоковой передачи.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT".ConnectionName -> (строка)
TopicName -> (строка)
"topicName", "assign" или "subscribePattern".Assign -> (строка)
TopicPartitions для потребления. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".SubscribePattern -> (строка)
"topicName", "assign" или "subscribePattern".Classification -> (строка)
Delimiter -> (строка)
StartingOffsets -> (строка)
"earliest" или "latest". Значение по умолчанию - "latest".EndingOffsets -> (строка)
"latest" или строка JSON, определяющая конечную позицию для каждого TopicPartition.PollTimeoutMs -> (целое число)
512.NumRetries -> (целое число)
3.RetryIntervalMs -> (целое число)
10.MaxOffsetsPerTrigger -> (целое число)
topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель считывает все смещения до известного последнего смещения.MinPartitions -> (целое число)
IncludeHeaders -> (логическое)
Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и выше.AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (метка времени)
Метка времени сообщения в теме Kafka, с которой начинать чтение данных. Возможные значения — строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).
Только один из параметров StartingTimestamp или StartingOffsets должен быть задан.
WindowSize -> (целое число)
DetectSchema -> (логическое)
DataPreviewOptions -> (структура)
Определяет параметры, связанные с предварительным просмотром данных для просмотра выборки данных.
PollingTime -> (целое число)
RecordPollingLimit -> (целое число)
CatalogKinesisSource -> (структура)
Определяет источник данных Kinesis в каталоге данных Glue.
Name -> (строка)
WindowSize -> (целое число)
DetectSchema -> (логическое)
Table -> (строка)
Database -> (строка)
StreamingOptions -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
EndpointUrl -> (строка)
StreamName -> (строка)
Classification -> (строка)
Delimiter -> (строка)
StartingPosition -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения - "latest", "trim_horizon", "earliest" или строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию - "latest".
Примечание: Использование значения, являющегося строкой метки времени в формате UTC для «startingPosition», поддерживается только в версии Glue 4.0 и выше.
MaxFetchTimeInMs -> (целое число)
GetRecords вызовов API. Значение по умолчанию — 1000.MaxFetchRecordsPerShard -> (целое число)
MaxFetchRecordsPerShard необходимо строго соблюдать, то оно должно быть кратно MaxRecordPerRead. Значение по умолчанию — 100000.MaxRecordPerRead -> (целое число)
10000.AddIdleTimeBetweenReads -> (логическое)
"False". Этот параметр настраивается только для версии Glue 2.0 и выше.IdleTimeBetweenReadsInMs -> (целое число)
1000. Этот параметр настраивается только для версии Glue 2.0 и выше.DescribeShardInterval -> (целое число)
1s.NumRetries -> (целое число)
3.RetryIntervalMs -> (целое число)
1000.MaxRetryIntervalMs -> (целое число)
10000.AvoidEmptyBatches -> (логическое)
"False".StreamArn -> (строка)
RoleArn -> (строка)
"awsSTSSessionName".RoleSessionName -> (строка)
"awsSTSRoleARN".AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (метка времени)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).DataPreviewOptions -> (структура)
Дополнительные параметры для предварительного просмотра данных.
PollingTime -> (целое число)
RecordPollingLimit -> (целое число)
CatalogKafkaSource -> (структура)
Указывает хранилище данных Apache Kafka в каталоге данных.
Name -> (строка)
WindowSize -> (целое число)
DetectSchema -> (булево)
Table -> (строка)
Database -> (строка)
StreamingOptions -> (структура)
Указывает параметры потоковой передачи.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT".ConnectionName -> (строка)
TopicName -> (строка)
"topicName", "assign" или "subscribePattern".Assign -> (строка)
TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".SubscribePattern -> (строка)
"topicName", "assign" или "subscribePattern".Classification -> (строка)
Delimiter -> (строка)
StartingOffsets -> (строка)
"earliest" или "latest". Значение по умолчанию — "latest".EndingOffsets -> (строка)
"latest", либо строка JSON, определяющая конечную позицию для каждого TopicPartition.PollTimeoutMs -> (длинное целое число)
512.NumRetries -> (целое число)
3.RetryIntervalMs -> (длинное целое число)
10.MaxOffsetsPerTrigger -> (длинное целое число)
topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель читает все смещения до известного последнего смещения.MinPartitions -> (целое число)
IncludeHeaders -> (булево)
Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и более поздних.AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (метка времени)
Метка времени сообщения в теме Kafka для начала чтения данных. Возможные значения — строка метки времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).
Должен быть установлен только один из StartingTimestamp или StartingOffsets.
DataPreviewOptions -> (структура)
Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.
PollingTime -> (длинное целое число)
RecordPollingLimit -> (длинное целое число)
DropNullFields -> (структура)
Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, которые являются «null», целые числа -1 или другие заполнитель, такие как нули, не распознаются автоматически как нулевые.
Name -> (строка)
Inputs -> (список)
Входы данных, определенные по их именам узлов.
(строка)
NullCheckBoxList -> (структура)
Структура, представляющая, распознаются ли определенные значения как нулевые значения для удаления.
IsEmpty -> (булево)
IsNullString -> (булево)
IsNegOne -> (булево)
NullTextList -> (список)
Структура, определяющая список структур NullValueField, представляющих пользовательское нулевое значение, например, ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.
Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение заполнителя нулевого значения и тип данных совпадают с данными.
(структура)
Представляет пользовательское нулевое значение, например, ноль или другое значение, используемое в качестве заполнителя нулевого значения, уникального для набора данных.
Value -> (строка)
Datatype -> (структура)
Тип данных значения.
Id -> (строка)
Label -> (строка)
Merge -> (структура)
Указывает преобразование, которое объединяет DynamicFrame со стекингом DynamicFrame на основе указанных первичных ключей для идентификации записей. Повторные записи (записи с одинаковыми первичными ключами) не удаляются.
Name -> (строка)
Inputs -> (список)
Входы данных, определенные по их именам узлов.
(строка)
Source -> (строка)
DynamicFrame, который будет объединен со стекингом DynamicFrame.PrimaryKeys -> (список)
Список полей первичных ключей для сопоставления записей из исходного и стекингового динамических кадров.
(список)
Union -> (структура)
Указывает преобразование, которое объединяет строки из двух или более наборов данных в один результат.
Name -> (строка)
Inputs -> (список)
Входы узла ID для преобразования.
(строка)
UnionType -> (строка)
Указывает тип преобразования Union.
Укажите ALL, чтобы объединить все строки из источников данных в результирующий DynamicFrame. Результирующий union не удаляет дублируемые строки.
Укажите DISTINCT, чтобы удалить дублируемые строки в результирующем DynamicFrame.
PIIDetection -> (структура)
Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.
Name -> (строка)
Inputs -> (список)
Входы узла ID для преобразования.
(строка)
PiiType -> (строка)
EntityTypesToDetect -> (список)
Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.
Сущности типа PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE
(строка)
OutputColumnName -> (строка)
SampleFraction -> (двойное число)
ThresholdFraction -> (двойное число)
MaskValue -> (строка)
Aggregate -> (структура)
Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по заданной функции.
Name -> (строка)
Inputs -> (список)
Указывает поля и строки, используемые в качестве входов для преобразования агрегирования.
(строка)
Groups -> (список)
Указывает поля для группировки.
(список)
Aggs -> (список)
Указывает функции агрегирования, которые будут выполняться над указанными полями.
(структура)
Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании агрегирования.
Column -> (список)
Указывает столбец в наборе данных, к которому будет применена функция агрегирования.
(строка)
AggFunc -> (строка)
Указывает функцию агрегирования для применения.
Возможные функции агрегирования: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop
DropDuplicates -> (структура)
Указывает преобразование, удаляющее строки с повторяющимися данными из набора данных.
Name -> (строка)
Inputs -> (список)
Входы данных, определенные по их именам узлов.
(строка)
Columns -> (список)
Имя столбцов, которые будут объединены или удалены при повторении.
(список)
GovernedCatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в управляемый каталог.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Таблица -> (строка)
База данных -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для управляемого каталога.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
GovernedCatalogSource -> (структура)
Указывает источник данных в управляемом каталоге данных.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
PartitionPredicate -> (строка)
"" – по умолчанию пусто.Дополнительные параметры -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (длинное целое число)
BoundedFiles -> (длинное целое число)
MicrosoftSQLServerCatalogSource -> (структура)
Указывает источник данных Microsoft SQL Server в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
MySQLCatalogSource -> (структура)
Указывает источник данных MySQL в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
OracleSQLCatalogSource -> (структура)
Указывает источник данных Oracle в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
PostgreSQLCatalogSource -> (структура)
Указывает источник данных PostgresSQL в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
MicrosoftSQLServerCatalogTarget -> (структура)
Указывает целевой объект, использующий Microsoft SQL.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
База данных -> (строка)
Таблица -> (строка)
MySQLCatalogTarget -> (структура)
Указывает целевой объект, использующий MySQL.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
База данных -> (строка)
Таблица -> (строка)
OracleSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Oracle SQL.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
База данных -> (строка)
Таблица -> (строка)
PostgreSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Postgres SQL.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
База данных -> (строка)
Таблица -> (строка)
DynamicTransform -> (структура)
Указывает пользовательскую визуальную трансформацию, созданную пользователем.
Имя -> (строка)
ИмяТрансформации -> (строка)
Входы -> (список)
Указывает входные данные для динамической трансформации, которые требуются.
(строка)
Параметры -> (список)
Указывает параметры динамической трансформации.
(структура)
Указывает параметры в файле конфигурации динамической трансформации.
Имя -> (строка)
Тип -> (строка)
ПравилоПроверки -> (строка)
СообщениеОПроверке -> (строка)
Значение -> (список)
Указывает значение параметра в файле конфигурации динамической трансформации.
(строка)
ТипСписка -> (строка)
Необязательно -> (булево)
ИмяФункции -> (строка)
Путь -> (строка)
Версия -> (строка)
OutputSchemas -> (список)
Указывает схему данных для динамической трансформации.
(структура)
Указывает пользовательскую схему, когда схема не может быть определена Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
EvaluateDataQuality -> (структура)
Указывает критерии оценки качества данных.
Имя -> (строка)
Входы -> (список)
Входы вашей оценки качества данных.
(строка)
НаборПравил -> (строка)
Вывод -> (строка)
PublishingOptions -> (структура)
Параметры для настройки публикации результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
StopJobOnFailureOptions -> (структура)
Параметры для настройки остановки задания при сбое оценки качества данных.
StopJobOnFailureTiming -> (строка)
S3CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
Дополнительные параметры Hudi -> (карта)
Указывает дополнительные параметры подключения.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает пользовательскую схему, когда схема не может быть определена Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
Дополнительные параметры Hudi -> (карта)
Указывает дополнительные параметры подключения.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает пользовательскую схему, когда схема не может быть определена Glue.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3HudiSource -> (структура)
Определяет источник данных Hudi, хранящийся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ДополнительныеОпцииHudi -> (отображение)
Указывает дополнительные параметры подключения.
ключ -> (строка)
значение -> (строка)
ДополнительныеОпции -> (структура)
Указывает дополнительные параметры для коннектора.
ОграниченныйРазмер -> (длинное целое)
ОграниченноеЧислоФайлов -> (длинное целое)
ВключитьОбразецПути -> (булево)
ПутьОбразца -> (строка)
СхемыВывода -> (список)
Определяет схему данных для источника Hudi.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3HudiКаталогЦель -> (структура)
Определяет цель, которая записывает в источник данных Hudi в каталоге данных Glue.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
КлючиРазбиения -> (список)
Указывает нативное разбиение, используя последовательность ключей.
(список)
Таблица -> (строка)
БазаДанных -> (строка)
ДополнительныеОпции -> (отображение)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
ПолитикаИзмененийСхемы -> (структура)
Политика, которая определяет поведение обновления для ползунка.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
S3HudiПрямаяЦель -> (структура)
Определяет цель, которая записывает в источник данных Hudi в Amazon S3.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").ЧислоЦелевыхРазделов -> (строка)
КлючиРазбиения -> (список)
Указывает нативное разбиение, используя последовательность ключей.
(список)
Формат -> (строка)
ДополнительныеОпции -> (отображение)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
ПолитикаИзмененийСхемы -> (структура)
Политика, которая определяет поведение обновления для ползунка.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
Таблица -> (строка)
БазаДанных -> (строка)
DirectJDBCИсточник -> (структура)
Определяет подключение прямого JDBC источника.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ИмяПодключения -> (строка)
ТипПодключения -> (строка)
RedshiftTmpDir -> (строка)
S3КаталогDeltaИсточник -> (структура)
Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ДополнительныеDeltaОпции -> (отображение)
Указывает дополнительные параметры подключения.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Определяет схему данных для источника Delta Lake.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
КаталогDeltaИсточник -> (структура)
Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ДополнительныеDeltaОпции -> (отображение)
Указывает дополнительные параметры подключения.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Определяет схему данных для источника Delta Lake.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3DeltaИсточник -> (структура)
Определяет источник данных Delta Lake, хранящийся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ДополнительныеDeltaОпции -> (отображение)
Указывает дополнительные параметры подключения.
ключ -> (строка)
значение -> (строка)
ДополнительныеОпции -> (структура)
Указывает дополнительные параметры для коннектора.
ОграниченныйРазмер -> (длинное целое)
ОграниченноеЧислоФайлов -> (длинное целое)
ВключитьОбразецПути -> (булево)
ПутьОбразца -> (строка)
СхемыВывода -> (список)
Определяет схему данных для источника Delta Lake.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3КаталогDeltaЦель -> (структура)
Определяет цель, которая записывает в источник данных Delta Lake в каталоге данных Glue.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами в целевой объект данных.
(строка)
КлючиРазбиения -> (список)
Указывает нативное разбиение, используя последовательность ключей.
(список)
Таблица -> (строка)
БазаДанных -> (строка)
ДополнительныеОпции -> (отображение)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
ПолитикаИзмененийСхемы -> (структура)
Политика, которая определяет поведение обновления для ползунка.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
S3DeltaПрямаяЦель -> (структура)
Определяет целевой объект, который записывает данные в источник Delta Lake в Amazon S3.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входами для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативную партицию, используя последовательность ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip".Количество целевых партиций -> (строка)
Формат -> (строка)
Дополнительные параметры -> (карта)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
Политика изменений схемы -> (структура)
Политика, определяющая поведение обновления для сканера.
Включить обновление каталога -> (булево)
Поведение при обновлении -> (строка)
Таблица -> (строка)
База данных -> (строка)
AmazonRedshiftSource -> (структура)
Определяет целевой объект, который записывает данные в источник данных в Amazon Redshift.
Имя -> (строка)
Данные -> (структура)
Указывает данные узла источника Amazon Reshift.
Тип доступа -> (строка)
Тип источника -> (строка)
Подключение -> (структура)
Подключение Glue к кластеру Redshift.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
База данных каталога -> (структура)
Имя базы данных каталога данных Glue при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица каталога -> (структура)
Имя таблицы каталога данных Glue при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема Redshift каталога -> (строка)
Таблица Redshift каталога -> (строка)
Временная папка -> (строка)
Роль IAM -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. Если поле пустое, роль IAM по умолчанию берется из роли в задании.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Дополнительные параметры -> (список)
Необязательные значения при подключении к кластеру Redshift.
(структура)
Указывает необязательное значение при подключении к кластеру Redshift.
Ключ -> (строка)
Значение -> (строка)
Пример запроса -> (строка)
Действие до -> (строка)
Действие после -> (строка)
Действие -> (строка)
Префикс таблицы -> (строка)
Upsert -> (булево)
Действие Merge -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
Оператор Merge -> (строка)
Подключение сканера -> (строка)
Схема таблицы -> (список)
Массив схем вывода для заданного узла.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица предварительной обработки -> (строка)
Выбранные столбцы -> (список)
Список имен столбцов, используемых для определения совпадения записей при MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
AmazonRedshiftTarget -> (структура)
Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.
Name -> (строка)
Data -> (структура)
Указывает данные узла целевого объекта Amazon Redshift.
AccessType -> (строка)
SourceType -> (строка)
Connection -> (структура)
Подключение Glue к кластеру Redshift.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Table -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogDatabase -> (структура)
Имя базы данных Glue Data Catalog при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogTable -> (структура)
Имя таблицы Glue Data Catalog при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogRedshiftSchema -> (строка)
CatalogRedshiftTable -> (строка)
TempDir -> (строка)
IamRole -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. Если поле пустое, роль IAM будет по умолчанию роли задачи.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdvancedOptions -> (список)
Необязательные значения при подключении к кластеру Redshift.
(структура)
Указывает необязательное значение при подключении к кластеру Redshift.
Key -> (строка)
Value -> (строка)
SampleQuery -> (строка)
PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
TablePrefix -> (строка)
Upsert -> (булево)
MergeAction -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
MergeClause -> (строка)
CrawlerConnection -> (строка)
TableSchema -> (список)
Массив схем вывода для данного узла.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
StagingTable -> (строка)
SelectedColumns -> (список)
Список имен столбцов, используемых для определения сопоставляемой записи при MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
EvaluateDataQualityMultiFrame -> (структура)
Указывает критерии оценки качества данных. Позволяет использовать несколько входных данных и возвращает набор динамических фреймов.
Name -> (строка)
Inputs -> (список)
Входы вашей оценки качества данных. Первый вход в этом списке — основной источник данных.
(строка)
AdditionalDataSources -> (отображение)
Псевдонимы всех источников данных, кроме основного.
ключ -> (строка)
значение -> (строка)
Ruleset -> (строка)
PublishingOptions -> (структура)
Параметры настройки публикации результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
AdditionalOptions -> (отображение)
Параметры настройки поведения преобразования во время выполнения.
ключ -> (строка)
значение -> (строка)
StopJobOnFailureOptions -> (структура)
Параметры настройки поведения задачи при сбое оценки качества данных.
StopJobOnFailureTiming -> (строка)
Recipe -> (структура)
Указывает узел рецепта Glue DataBrew.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для узла рецепта, определенные по идентификатору.
(строка)
RecipeReference -> (структура)
Ссылка на рецепт DataBrew, используемый узлом.
RecipeArn -> (строка)
RecipeVersion -> (строка)
RecipeSteps -> (список)
Шаги преобразования, используемые в узле рецепта.
(структура)
Шаг рецепта, используемый в узле подготовки данных рецепта Glue Studio.
Action -> (структура)
Действие преобразования шага рецепта.
Operation -> (строка)
Parameters -> (отображение)
Параметры действия рецепта.
ключ -> (строка)
значение -> (строка)
ConditionExpressions -> (список)
Условные выражения для шага рецепта.
(структура)
Условное выражение, определенное в узле подготовки данных рецепта Glue Studio.
Condition -> (строка)
Value -> (строка)
TargetColumn -> (строка)
SnowflakeSource -> (структура)
Определяет источник данных Snowflake.
Name -> (строка)
Data -> (структура)
Настройка источника данных Snowflake.
SourceType -> (строка)
"table" , "query" .Connection -> (структура)
Определяет подключение к каталогу данных Glue для Snowflake-точке.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (строка)
Table -> (строка)
Database -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdditionalOptions -> (отображение)
Определяет дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны где-то ещё в этом узле, эти параметры имеют приоритет.
key -> (строка)
value -> (строка)
SampleQuery -> (строка)
query .PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Определяет поведение при разрешении, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.MergeAction -> (строка)
simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .MergeWhenMatched -> (строка)
update , delete .MergeWhenNotMatched -> (строка)
insert , none .MergeClause -> (строка)
StagingTable -> (строка)
merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table сгенерированным действием postaction.SelectedColumns -> (список)
Определяет столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upserts. Список структур с ключами value , label и description . Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AutoPushdown -> (булево)
TableSchema -> (список)
Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
OutputSchemas -> (список)
Определяет схемы, определённые пользователем, для выходных данных.
(структура)
Определяет схему, определённую пользователем, когда схему нельзя определить с помощью Glue.
Columns -> (список)
Определяет определения столбцов, составляющих схему Glue.
(структура)
Определяет отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
SnowflakeTarget -> (структура)
Определяет целевой объект, который записывает данные в источник Snowflake.
Name -> (строка)
Data -> (структура)
Определяет данные целевого узла Snowflake.
SourceType -> (строка)
"table" , "query" .Connection -> (структура)
Определяет подключение к каталогу данных Glue для Snowflake-точке.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (строка)
Table -> (строка)
Database -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdditionalOptions -> (отображение)
Определяет дополнительные параметры, передаваемые коннектору Snowflake. Если параметры указаны где-то ещё в этом узле, эти параметры имеют приоритет.
key -> (строка)
value -> (строка)
SampleQuery -> (строка)
query .PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Определяет поведение при разрешении, когда строка уже существует. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.MergeAction -> (строка)
simple , custom . Если simple, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если custom, определяется MergeClause .MergeWhenMatched -> (строка)
update , delete .MergeWhenNotMatched -> (строка)
insert , none .MergeClause -> (строка)
StagingTable -> (строка)
merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table сгенерированным действием postaction.SelectedColumns -> (список)
Определяет столбцы, объединённые для идентификации записи при обнаружении совпадений для слияний и upserts. Список структур с ключами value , label и description . Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AutoPushdown -> (булево)
TableSchema -> (список)
Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
ConnectorDataSource -> (структура)
Указывает на источник, сгенерированный со стандартными параметрами подключения.
Имя -> (строка)
Тип подключения -> (строка)
connectionType, предоставленный библиотеке Glue. Этот тип узла поддерживает следующие типы подключения:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Данные -> (словарь)
Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации по Glue.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Определяет схему данных для этого источника.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
ConnectorDataTarget -> (структура)
Указывает на целевой объект, сгенерированный со стандартными параметрами подключения.
Имя -> (строка)
Тип подключения -> (строка)
connectionType, предоставленный библиотеке Glue. Этот тип узла поддерживает следующие типы подключения:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Данные -> (словарь)
Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации по Glue.
ключ -> (строка)
значение -> (строка)
Входы -> (список)
Узлы, являющиеся входами для целевого объекта данных.
(строка)
ExecutionClass -> (строка)
Указывает, выполняется ли работа со стандартным или гибким классом выполнения. Стандартный класс выполнения идеально подходит для задач с временными ограничениями, требующих быстрого запуска работы и выделенных ресурсов.
Гибкий класс выполнения подходит для работ, не зависящих от времени, время начала и завершения которых может изменяться.
Только работы с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для работ Spark.
SourceControlDetails -> (структура)
Подробная информация о конфигурации системы контроля версий для работы, позволяющая синхронизировать артефакты работы с удаленным хранилищем или из него.
Поставщик -> (строка)
Хранилище -> (строка)
Владелец -> (строка)
Ветка -> (строка)
Папка -> (строка)
Последний идентификатор коммита -> (строка)
Стратегия аутентификации -> (строка)
Токен аутентификации -> (строка)
MaintenanceWindow -> (строка)
Это поле указывает день недели и час для окна обслуживания для потоковых работ. Glue периодически выполняет задачи обслуживания. Во время этих окон обслуживания Glue потребуется перезапустить ваши потоковые работы.
Glue перезапустит работу в течение 3 часов от указанного окна обслуживания. Например, если вы настроили окно обслуживания на понедельник в 10:00 по Гринвичу, ваши работы будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.
JSON Синтаксис:
{
"JobMode": "SCRIPT"|"VISUAL"|"NOTEBOOK",
"JobRunQueuingEnabled": true|false,
"Description": "string",
"LogUri": "string",
"Role": "string",
"ExecutionProperty": {
"MaxConcurrentRuns": integer
},
"Command": {
"Name": "string",
"ScriptLocation": "string",
"PythonVersion": "string",
"Runtime": "string"
},
"DefaultArguments": {"string": "string"
...},
"NonOverridableArguments": {"string": "string"
...},
"Connections": {
"Connections": ["string", ...]
},
"MaxRetries": integer,
"AllocatedCapacity": integer,
"Timeout": integer,
"MaxCapacity": double,
"WorkerType": "Standard"|"G.1X"|"G.2X"|"G.025X"|"G.4X"|"G.8X"|"Z.2X",
"NumberOfWorkers": integer,
"SecurityConfiguration": "string",
"NotificationProperty": {
"NotifyDelayAfter": integer
},
"GlueVersion": "string",
"CodeGenConfigurationNodes": {"string": {
"AthenaConnectorSource": {
"Name": "string",
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"ConnectionTable": "string",
"SchemaName": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"JDBCConnectorSource": {
"Name": "string",
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {
"FilterPredicate": "string",
"PartitionColumn": "string",
"LowerBound": long,
"UpperBound": long,
"NumPartitions": long,
"JobBookmarkKeys": ["string", ...],
"JobBookmarkKeysSortOrder": "string",
"DataTypeMapping": {"ARRAY"|"BIGINT"|"BINARY"|"BIT"|"BLOB"|"BOOLEAN"|"CHAR"|"CLOB"|"DATALINK"|"DATE"|"DECIMAL"|"DISTINCT"|"DOUBLE"|"FLOAT"|"INTEGER"|"JAVA_OBJECT"|"LONGNVARCHAR"|"LONGVARBINARY"|"LONGVARCHAR"|"NCHAR"|"NCLOB"|"NULL"|"NUMERIC"|"NVARCHAR"|"OTHER"|"REAL"|"REF"|"REF_CURSOR"|"ROWID"|"SMALLINT"|"SQLXML"|"STRUCT"|"TIME"|"TIME_WITH_TIMEZONE"|"TIMESTAMP"|"TIMESTAMP_WITH_TIMEZONE"|"TINYINT"|"VARBINARY"|"VARCHAR": "DATE"|"STRING"|"TIMESTAMP"|"INT"|"FLOAT"|"LONG"|"BIGDECIMAL"|"BYTE"|"SHORT"|"DOUBLE"
...}
},
"ConnectionTable": "string",
"Query": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SparkConnectorSource": {
"Name": "string",
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"RedshiftSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"RedshiftTmpDir": "string",
"TmpDirIAMRole": "string"
},
"S3CatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"PartitionPredicate": "string",
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long
}
},
"S3CsvSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "gzip"|"bzip2",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"Separator": "comma"|"ctrla"|"pipe"|"semicolon"|"tab",
"Escaper": "string",
"QuoteChar": "quote"|"quillemet"|"single_quote"|"disabled",
"Multiline": true|false,
"WithHeader": true|false,
"WriteHeader": true|false,
"SkipFirst": true|false,
"OptimizePerformance": true|false,
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3ExcelSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"NumberRows": long,
"SkipFooter": integer,
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3JsonSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "gzip"|"bzip2",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"JsonPath": "string",
"Multiline": true|false,
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3ParquetSource": {
"Name": "string",
"Paths": ["string", ...],
"CompressionType": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
"Exclusions": ["string", ...],
"GroupSize": "string",
"GroupFiles": "string",
"Recurse": true|false,
"MaxBand": integer,
"MaxFilesInBand": integer,
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"RelationalCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"DynamoDBCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"JDBCConnectorTarget": {
"Name": "string",
"Inputs": ["string", ...],
"ConnectionName": "string",
"ConnectionTable": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SparkConnectorTarget": {
"Name": "string",
"Inputs": ["string", ...],
"ConnectionName": "string",
"ConnectorName": "string",
"ConnectionType": "string",
"AdditionalOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Database": "string",
"Table": "string"
},
"RedshiftTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string",
"RedshiftTmpDir": "string",
"TmpDirIAMRole": "string",
"UpsertRedshiftOptions": {
"TableLocation": "string",
"ConnectionName": "string",
"UpsertKeys": ["string", ...]
}
},
"S3CatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"S3GlueParquetTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "snappy"|"lzo"|"gzip"|"brotli"|"lz4"|"uncompressed"|"none",
"NumberTargetPartitions": "string",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"S3HyperDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "uncompressed",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"S3DirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "string",
"NumberTargetPartitions": "string",
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"S3IcebergDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
},
"Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
"NumberTargetPartitions": "string"
},
"ApplyMapping": {
"Name": "string",
"Inputs": ["string", ...],
"Mapping": [
{
"ToKey": "string",
"FromPath": ["string", ...],
"FromType": "string",
"ToType": "string",
"Dropped": true|false,
"Children": [
{
"ToKey": "string",
"FromPath": ["string", ...],
"FromType": "string",
"ToType": "string",
"Dropped": true|false,
"Children":
}
...
]
}
...
]
},
"SelectFields": {
"Name": "string",
"Inputs": ["string", ...],
"Paths": [
["string", ...]
...
]
},
"DropFields": {
"Name": "string",
"Inputs": ["string", ...],
"Paths": [
["string", ...]
...
]
},
"RenameField": {
"Name": "string",
"Inputs": ["string", ...],
"SourcePath": ["string", ...],
"TargetPath": ["string", ...]
},
"Spigot": {
"Name": "string",
"Inputs": ["string", ...],
"Path": "string",
"Topk": integer,
"Prob": double
},
"Join": {
"Name": "string",
"Inputs": ["string", ...],
"JoinType": "equijoin"|"left"|"right"|"outer"|"leftsemi"|"leftanti",
"Columns": [
{
"From": "string",
"Keys": [
["string", ...]
...
]
}
...
]
},
"SplitFields": {
"Name": "string",
"Inputs": ["string", ...],
"Paths": [
["string", ...]
...
]
},
"SelectFromCollection": {
"Name": "string",
"Inputs": ["string", ...],
"Index": integer
},
"FillMissingValues": {
"Name": "string",
"Inputs": ["string", ...],
"ImputedPath": "string",
"FilledPath": "string"
},
"Filter": {
"Name": "string",
"Inputs": ["string", ...],
"LogicalOperator": "AND"|"OR",
"Filters": [
{
"Operation": "EQ"|"LT"|"GT"|"LTE"|"GTE"|"REGEX"|"ISNULL",
"Negated": true|false,
"Values": [
{
"Type": "COLUMNEXTRACTED"|"CONSTANT",
"Value": ["string", ...]
}
...
]
}
...
]
},
"CustomCode": {
"Name": "string",
"Inputs": ["string", ...],
"Code": "string",
"ClassName": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SparkSQL": {
"Name": "string",
"Inputs": ["string", ...],
"SqlQuery": "string",
"SqlAliases": [
{
"From": "string",
"Alias": "string"
}
...
],
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"DirectKinesisSource": {
"Name": "string",
"WindowSize": integer,
"DetectSchema": true|false,
"StreamingOptions": {
"EndpointUrl": "string",
"StreamName": "string",
"Classification": "string",
"Delimiter": "string",
"StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
"MaxFetchTimeInMs": long,
"MaxFetchRecordsPerShard": long,
"MaxRecordPerRead": long,
"AddIdleTimeBetweenReads": true|false,
"IdleTimeBetweenReadsInMs": long,
"DescribeShardInterval": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxRetryIntervalMs": long,
"AvoidEmptyBatches": true|false,
"StreamArn": "string",
"RoleArn": "string",
"RoleSessionName": "string",
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"DirectKafkaSource": {
"Name": "string",
"StreamingOptions": {
"BootstrapServers": "string",
"SecurityProtocol": "string",
"ConnectionName": "string",
"TopicName": "string",
"Assign": "string",
"SubscribePattern": "string",
"Classification": "string",
"Delimiter": "string",
"StartingOffsets": "string",
"EndingOffsets": "string",
"PollTimeoutMs": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxOffsetsPerTrigger": long,
"MinPartitions": integer,
"IncludeHeaders": true|false,
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"WindowSize": integer,
"DetectSchema": true|false,
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"CatalogKinesisSource": {
"Name": "string",
"WindowSize": integer,
"DetectSchema": true|false,
"Table": "string",
"Database": "string",
"StreamingOptions": {
"EndpointUrl": "string",
"StreamName": "string",
"Classification": "string",
"Delimiter": "string",
"StartingPosition": "latest"|"trim_horizon"|"earliest"|"timestamp",
"MaxFetchTimeInMs": long,
"MaxFetchRecordsPerShard": long,
"MaxRecordPerRead": long,
"AddIdleTimeBetweenReads": true|false,
"IdleTimeBetweenReadsInMs": long,
"DescribeShardInterval": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxRetryIntervalMs": long,
"AvoidEmptyBatches": true|false,
"StreamArn": "string",
"RoleArn": "string",
"RoleSessionName": "string",
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"CatalogKafkaSource": {
"Name": "string",
"WindowSize": integer,
"DetectSchema": true|false,
"Table": "string",
"Database": "string",
"StreamingOptions": {
"BootstrapServers": "string",
"SecurityProtocol": "string",
"ConnectionName": "string",
"TopicName": "string",
"Assign": "string",
"SubscribePattern": "string",
"Classification": "string",
"Delimiter": "string",
"StartingOffsets": "string",
"EndingOffsets": "string",
"PollTimeoutMs": long,
"NumRetries": integer,
"RetryIntervalMs": long,
"MaxOffsetsPerTrigger": long,
"MinPartitions": integer,
"IncludeHeaders": true|false,
"AddRecordTimestamp": "string",
"EmitConsumerLagMetrics": "string",
"StartingTimestamp": timestamp
},
"DataPreviewOptions": {
"PollingTime": long,
"RecordPollingLimit": long
}
},
"DropNullFields": {
"Name": "string",
"Inputs": ["string", ...],
"NullCheckBoxList": {
"IsEmpty": true|false,
"IsNullString": true|false,
"IsNegOne": true|false
},
"NullTextList": [
{
"Value": "string",
"Datatype": {
"Id": "string",
"Label": "string"
}
}
...
]
},
"Merge": {
"Name": "string",
"Inputs": ["string", ...],
"Source": "string",
"PrimaryKeys": [
["string", ...]
...
]
},
"Union": {
"Name": "string",
"Inputs": ["string", ...],
"UnionType": "ALL"|"DISTINCT"
},
"PIIDetection": {
"Name": "string",
"Inputs": ["string", ...],
"PiiType": "RowAudit"|"RowMasking"|"ColumnAudit"|"ColumnMasking",
"EntityTypesToDetect": ["string", ...],
"OutputColumnName": "string",
"SampleFraction": double,
"ThresholdFraction": double,
"MaskValue": "string"
},
"Aggregate": {
"Name": "string",
"Inputs": ["string", ...],
"Groups": [
["string", ...]
...
],
"Aggs": [
{
"Column": ["string", ...],
"AggFunc": "avg"|"countDistinct"|"count"|"first"|"last"|"kurtosis"|"max"|"min"|"skewness"|"stddev_samp"|"stddev_pop"|"sum"|"sumDistinct"|"var_samp"|"var_pop"
}
...
]
},
"DropDuplicates": {
"Name": "string",
"Inputs": ["string", ...],
"Columns": [
["string", ...]
...
]
},
"GovernedCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"GovernedCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"PartitionPredicate": "string",
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long
}
},
"MicrosoftSQLServerCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"MySQLCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"OracleSQLCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"PostgreSQLCatalogSource": {
"Name": "string",
"Database": "string",
"Table": "string"
},
"MicrosoftSQLServerCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"MySQLCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"OracleSQLCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"PostgreSQLCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Database": "string",
"Table": "string"
},
"DynamicTransform": {
"Name": "string",
"TransformName": "string",
"Inputs": ["string", ...],
"Parameters": [
{
"Name": "string",
"Type": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
"ValidationRule": "string",
"ValidationMessage": "string",
"Value": ["string", ...],
"ListType": "str"|"int"|"float"|"complex"|"bool"|"list"|"null",
"IsOptional": true|false
}
...
],
"FunctionName": "string",
"Path": "string",
"Version": "string",
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"EvaluateDataQuality": {
"Name": "string",
"Inputs": ["string", ...],
"Ruleset": "string",
"Output": "PrimaryInput"|"EvaluationResults",
"PublishingOptions": {
"EvaluationContext": "string",
"ResultsS3Prefix": "string",
"CloudWatchMetricsEnabled": true|false,
"ResultsPublishingEnabled": true|false
},
"StopJobOnFailureOptions": {
"StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
}
},
"S3CatalogHudiSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalHudiOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogHudiSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalHudiOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3HudiSource": {
"Name": "string",
"Paths": ["string", ...],
"AdditionalHudiOptions": {"string": "string"
...},
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3HudiCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"S3HudiDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"Path": "string",
"Compression": "gzip"|"lzo"|"uncompressed"|"snappy",
"NumberTargetPartitions": "string",
"PartitionKeys": [
["string", ...]
...
],
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"DirectJDBCSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"ConnectionName": "string",
"ConnectionType": "sqlserver"|"mysql"|"oracle"|"postgresql"|"redshift",
"RedshiftTmpDir": "string"
},
"S3CatalogDeltaSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalDeltaOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"CatalogDeltaSource": {
"Name": "string",
"Database": "string",
"Table": "string",
"AdditionalDeltaOptions": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3DeltaSource": {
"Name": "string",
"Paths": ["string", ...],
"AdditionalDeltaOptions": {"string": "string"
...},
"AdditionalOptions": {
"BoundedSize": long,
"BoundedFiles": long,
"EnableSamplePath": true|false,
"SamplePath": "string"
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"S3DeltaCatalogTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Table": "string",
"Database": "string",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG"
}
},
"S3DeltaDirectTarget": {
"Name": "string",
"Inputs": ["string", ...],
"PartitionKeys": [
["string", ...]
...
],
"Path": "string",
"Compression": "uncompressed"|"snappy",
"NumberTargetPartitions": "string",
"Format": "json"|"csv"|"avro"|"orc"|"parquet"|"hudi"|"delta"|"iceberg"|"hyper"|"xml",
"AdditionalOptions": {"string": "string"
...},
"SchemaChangePolicy": {
"EnableUpdateCatalog": true|false,
"UpdateBehavior": "UPDATE_IN_DATABASE"|"LOG",
"Table": "string",
"Database": "string"
}
},
"AmazonRedshiftSource": {
"Name": "string",
"Data": {
"AccessType": "string",
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Table": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogDatabase": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogTable": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogRedshiftSchema": "string",
"CatalogRedshiftTable": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdvancedOptions": [
{
"Key": "string",
"Value": "string"
}
...
],
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"TablePrefix": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"CrawlerConnection": "string",
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
}
},
"AmazonRedshiftTarget": {
"Name": "string",
"Data": {
"AccessType": "string",
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Table": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogDatabase": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogTable": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"CatalogRedshiftSchema": "string",
"CatalogRedshiftTable": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdvancedOptions": [
{
"Key": "string",
"Value": "string"
}
...
],
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"TablePrefix": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"CrawlerConnection": "string",
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
},
"Inputs": ["string", ...]
},
"EvaluateDataQualityMultiFrame": {
"Name": "string",
"Inputs": ["string", ...],
"AdditionalDataSources": {"string": "string"
...},
"Ruleset": "string",
"PublishingOptions": {
"EvaluationContext": "string",
"ResultsS3Prefix": "string",
"CloudWatchMetricsEnabled": true|false,
"ResultsPublishingEnabled": true|false
},
"AdditionalOptions": {"performanceTuning.caching"|"observations.scope": "string"
...},
"StopJobOnFailureOptions": {
"StopJobOnFailureTiming": "Immediate"|"AfterDataLoad"
}
},
"Recipe": {
"Name": "string",
"Inputs": ["string", ...],
"RecipeReference": {
"RecipeArn": "string",
"RecipeVersion": "string"
},
"RecipeSteps": [
{
"Action": {
"Operation": "string",
"Parameters": {"string": "string"
...}
},
"ConditionExpressions": [
{
"Condition": "string",
"Value": "string",
"TargetColumn": "string"
}
...
]
}
...
]
},
"SnowflakeSource": {
"Name": "string",
"Data": {
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": "string",
"Table": "string",
"Database": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdditionalOptions": {"string": "string"
...},
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"AutoPushdown": true|false,
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"SnowflakeTarget": {
"Name": "string",
"Data": {
"SourceType": "string",
"Connection": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"Schema": "string",
"Table": "string",
"Database": "string",
"TempDir": "string",
"IamRole": {
"Value": "string",
"Label": "string",
"Description": "string"
},
"AdditionalOptions": {"string": "string"
...},
"SampleQuery": "string",
"PreAction": "string",
"PostAction": "string",
"Action": "string",
"Upsert": true|false,
"MergeAction": "string",
"MergeWhenMatched": "string",
"MergeWhenNotMatched": "string",
"MergeClause": "string",
"StagingTable": "string",
"SelectedColumns": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
],
"AutoPushdown": true|false,
"TableSchema": [
{
"Value": "string",
"Label": "string",
"Description": "string"
}
...
]
},
"Inputs": ["string", ...]
},
"ConnectorDataSource": {
"Name": "string",
"ConnectionType": "string",
"Data": {"string": "string"
...},
"OutputSchemas": [
{
"Columns": [
{
"Name": "string",
"Type": "string"
}
...
]
}
...
]
},
"ConnectorDataTarget": {
"Name": "string",
"ConnectionType": "string",
"Data": {"string": "string"
...},
"Inputs": ["string", ...]
}
}
...},
"ExecutionClass": "FLEX"|"STANDARD",
"SourceControlDetails": {
"Provider": "GITHUB"|"GITLAB"|"BITBUCKET"|"AWS_CODE_COMMIT",
"Repository": "string",
"Owner": "string",
"Branch": "string",
"Folder": "string",
"LastCommitId": "string",
"AuthStrategy": "PERSONAL_ACCESS_TOKEN"|"AWS_SECRETS_MANAGER",
"AuthToken": "string"
},
"MaintenanceWindow": "string"
}
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределяют значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью предоставленного JSON-значения, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод, не отправляя запрос API. При отсутствии значения или значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании yaml-input он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логический)
Включить отладовую запись в журнал.
--endpoint-url (строка)
Переопределить значение URL по умолчанию команды указанным URL.
--no-verify-ssl (логический)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.
--no-paginate (логический)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команд.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использование определенного профиля из файла учетных данных.
--region (строка)
Используемый регион. Переопределяет параметры конфигурации/окружения.
--version (строка)
Отображение версии этого инструмента.
--color (строка)
Включение/выключение цветного вывода.
- вкл
- выкл
- авто
--no-sign-request (логический)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.
--ca-bundle (строка)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/окружения.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде строки, закодированной в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла непосредственно независимо от настроек cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логический)
Отключение пейджера CLI для вывода.
--cli-auto-prompt (логический)
Автоматически запрашивать параметры входных данных CLI.
--no-cli-auto-prompt (логический)
Отключение автоматического запроса параметров входных данных CLI.
Вывод
JobName -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.