batch-get-jobs
Описание
Возвращает список метаданных ресурсов для заданного списка имен задач. После вызова операции ListJobs, вы можете вызвать эту операцию для доступа к данным, на которые у вас есть разрешения. Данная операция поддерживает все разрешения IAM, включая условия разрешений, использующие теги.
См. также: Документация API AWS
Синтаксис
batch-get-jobs
--job-names <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--job-names (список)
Список имен задач, которые могут быть именами, возвращенными операцией ListJobs.
(строка)
Синтаксис:
"string" "string" ...
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения перепишут значения, предоставленные в JSON. Невозможно передавать произвольные двоичные данные с использованием предоставленного JSON-значения, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если указано без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладочную запись журнала.
--endpoint-url (строка)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с сервисами AWS. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет поведение проверки сертификатов SSL по умолчанию.
--no-paginate (логическое значение)
Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использование определенного профиля из вашего файла учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отображение версии этого инструмента.
--color (строка)
Включение/выключение цветного вывода.
- включено
- выключено
- автоматически
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.
--ca-bundle (строка)
Файл сертификата CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. По умолчанию формат — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как закодированная в base64 строка. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое отображается как двоичный блок fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить пейджер CLI для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать входные параметры CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическое запросы ввода параметров CLI.
Вывод
Работы -> (список)
Список определений работ.
(структура)
Определяет определение работы.
Имя -> (строка)
РежимРаботы -> (строка)
Режим, описывающий способ создания работы. Допустимые значения:
-
SCRIPT- Работа была создана с помощью редактора сценариев Glue Studio. -
VISUAL- Работа была создана с помощью визуального редактора Glue Studio. -
NOTEBOOK- Работа была создана с помощью блокнота интерактивных сеансов.
Если поле JobMode отсутствует или равно null, по умолчанию используется значение SCRIPT.
JobRunQueuingEnabled -> (булево)
Указывает, включено ли очередирование запусков работ для этой работы.
Значение true означает, что очередирование запусков работ включено. Если значение false или поле не заполнено, запуски работ не будут учитываться в очереди.
Если это поле не соответствует значению, заданному в запуске работы, будет использоваться значение из поля запуска работы.
Описание -> (строка)
LogUri -> (строка)
Роль -> (строка)
Создано -> (метка времени)
Изменено -> (метка времени)
СвойствоВыполнения -> (структура)
ExecutionProperty, определяющий максимальное количество одновременных запусков, разрешенных для этой работы.
MaxConcurrentRuns -> (целое число)
Команда -> (структура)
JobCommand, которая выполняет эту работу.
Имя -> (строка)
glueetl. Для работы с интерпретатором Python должно быть pythonshell. Для работы Apache Spark streaming ETL должно быть gluestreaming. Для работы Ray должно быть glueray.РасположениеСценария -> (строка)
PythonVersion -> (строка)
Runtime -> (строка)
АргументыПоУмолчанию -> (карта)
Аргументы по умолчанию для каждого запуска этой работы, указанные в виде пар имя-значение.
Здесь можно указать аргументы, которые использует собственный сценарий выполнения работы, а также аргументы, которые использует сам Glue.
Аргументы работы могут быть записаны в журнал. Не передавайте незащищенные секреты в качестве аргументов. Извлекайте секреты из подключения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в рамках работы.
Дополнительную информацию о способе указания и использования собственных аргументов работы см. в руководстве для разработчиков в разделе Вызов API Glue на Python.
Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке работ Spark, см. в руководстве для разработчиков в разделе Специальные параметры, используемые Glue.
Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке работ Ray, см. в руководстве для разработчиков в разделе Использование параметров работы в работах Ray.
ключ -> (строка)
значение -> (строка)
НеПерезаписываемыеАргументы -> (карта)
Аргументы этой работы, которые не перезаписываются при указании аргументов работы в запуске работы, указанные в виде пар имя-значение.
ключ -> (строка)
значение -> (строка)
Подключения -> (структура)
Подключения, используемые для этой работы.
Подключения -> (список)
Список подключений, используемых работой.
(строка)
МаксимальноеКоличествоПовторов -> (целое число)
ВыделеннаяЁмкость -> (целое число)
Это поле устарело. Используйте MaxCapacity вместо него.
Количество единиц обработки данных Glue (DPUs), выделенных для запусков этой работы. Вы можете выделить как минимум 2 DPU; по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессорных ядер (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.
Таймаут -> (целое число)
Таймаут работы в минутах. Это максимальное время, которое запуск работы может использовать ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT.
Значения таймаута работы должны быть меньше 7 дней или 10080 минут. В противном случае работы будут вызывать исключение.
Если значение не указано, по умолчанию устанавливается таймаут 2880 минут.
Любые существующие работы Glue, у которых значение таймаута было больше 7 дней, будут установлены по умолчанию на 7 дней. Например, если вы задали таймаут в 20 дней для работы пакетной обработки, она будет остановлена на 7-й день.
Для потоковых работ, если вы настроите окно технического обслуживания, оно будет перезапущено в течение окна технического обслуживания после 7 дней.
МаксимальнаяЁмкость -> (двойное значение)
Для работ Glue версии 1.0 или более ранних, использующих стандартный тип рабочих узлов, количество единиц обработки данных Glue (DPUs), которые могут быть выделены при запуске этой работы. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессорных ядер (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.
Для работ Glue версии 2.0 или более поздних вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.
Не устанавливайте MaxCapacity, если используете WorkerType и NumberOfWorkers.
Значение, которое может быть выделено для MaxCapacity, зависит от того, запускаете ли вы работу с интерпретатором Python, работу Apache Spark ETL или работу Apache Spark streaming ETL:
- При указании работы с интерпретатором Python (
JobCommand.Name=”pythonshell”) можно выделить либо 0,0625, либо 1 DPU. По умолчанию 0,0625 DPU. - При указании работы Apache Spark ETL (
JobCommand.Name=”glueetl”) или работы Apache Spark streaming ETL (JobCommand.Name=”gluestreaming”) можно выделить от 2 до 100 DPU. По умолчанию 10 DPU. Для этого типа работы не допускается выделение дробных DPU.
ТипРабочегоУзла -> (строка)
Тип предварительно определенного рабочего узла, который выделяется при запуске работы. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для работ Spark. Принимает значение Z.2X для работ Ray.
- Для типа рабочего узла
G.1Xкаждый рабочий узел соответствует 1 DPU (4 виртуальных процессорных ядра (vCPU), 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач преобразования данных, объединения и запросов, что обеспечивает масштабируемый и экономически эффективный способ выполнения большинства работ. - Для типа рабочего узла
G.2Xкаждый рабочий узел соответствует 2 DPU (8 виртуальных процессорных ядер (vCPU), 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач преобразования данных, объединения и запросов, что обеспечивает масштабируемый и экономически эффективный способ выполнения большинства работ. - Для типа рабочего узла
G.4Xкаждый рабочий узел соответствует 4 DPU (16 виртуальных процессорных ядер (vCPU), 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач, которые включают наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для работ Glue версии 3.0 или более поздних работ Apache Spark ETL в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm). - Для типа рабочего узла
G.8Xкаждый рабочий узел соответствует 8 DPU (32 виртуальных процессорных ядра (vCPU), 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач, которые включают наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для работ Glue версии 3.0 или более поздних работ Apache Spark ETL в тех же регионах Amazon Web Services, что и для типа рабочего узлаG.4X. - Для типа рабочего узла
G.025Xкаждый рабочий узел соответствует 0,25 DPU (2 виртуальных процессорных ядра (vCPU), 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для потоковых работ с небольшим объемом данных. Этот тип рабочего узла доступен только для потоковых работ Glue версии 3.0 или более поздних. - Для типа рабочего узла
Z.2Xкаждый рабочий узел соответствует 2 DPU (8 виртуальных процессорных ядер (vCPU), 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 рабочих узлов Ray на основе масштабирования.
КоличествоРабочихУзлов -> (целое число)
workerType, которые выделяются при запуске работы.НастройкаБезопасности -> (строка)
SecurityConfiguration, которая должна использоваться с этой работой.СвойствоУведомления -> (структура)
Указывает конфигурационные свойства уведомления о работе.
NotifyDelayAfter -> (целое число)
GlueVersion -> (строка)
В работах Spark параметр GlueVersion определяет версии Apache Spark и Python, которые доступны Glue в работе. Версия Python указывает версию, поддерживаемую для работ типа Spark.
Для работ Ray необходимо установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступных в вашей работе Ray, определяются параметром Runtime команды работы.
Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в руководстве для разработчиков в разделе версия Glue.
Работы, созданные без указания версии Glue, по умолчанию используют Glue 0.9.
CodeGenConfigurationNodes -> (карта)
Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.
ключ -> (строка)
значение -> (структура)
CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная члена может быть заполнена.AthenaConnectorSource -> (структура)
Указывает соединение с источником данных Amazon Athena.
Имя -> (строка)
ИмяСоединения -> (строка)
ИмяПодключения -> (строка)
ТипСоединения -> (строка)
ТаблицаСоединения -> (строка)
ИмяСхемы -> (строка)
/aws-glue/jobs/output .СхемыВывода -> (список)
Указывает схему данных для пользовательского источника Athena.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
JDBCConnectorSource -> (структура)
Указывает подключение к источнику данных JDBC.
Имя -> (строка)
ИмяСоединения -> (строка)
ИмяПодключения -> (строка)
ТипСоединения -> (строка)
ДополнительныеПараметры -> (структура)
Дополнительные параметры подключения для подключения.
ПредикатФильтрации -> (строка)
Дополнительное условие фильтрации данных из источника. Например:
BillingCity='Mountain View'При использовании запроса вместо имени таблицы, необходимо убедиться, что запрос работает с указанным filterPredicate .
СтолбецРазбиения -> (строка)
lowerBound , upperBound и numPartitions . Этот параметр работает так же, как и в Spark SQL JDBC-читателе.НижняяГраница -> (длинное целое)
partitionColumn, используемое для определения шага разбиения.ВерхняяГраница -> (длинное целое)
partitionColumn, используемое для определения шага разбиения.ЧислоРазбиений -> (длинное целое)
lowerBound (включительно) и upperBound (исключительно), образует шаги разбиения для сгенерированных WHERE выражений, используемых для разделения partitionColumn .КлючиЗакладкиРаботы -> (список)
Имя ключей закладки работы, по которым нужно отсортировать.
(строка)
ПорядокСортировкиКлючейЗакладкиРаботы -> (строка)
СопоставлениеТиповДанных -> (карта)
Пользовательское сопоставление типов данных, которое создает сопоставление между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} отображает поля данных типа JDBC FLOAT в тип Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение специфично для используемого драйвера. Обратитесь к документации вашего JDBC-драйвера, чтобы понять, как драйвер выполняет преобразования.
ключ -> (строка)
значение -> (строка)
ТаблицаСоединения -> (строка)
Запрос -> (строка)
ConnectionTable, либо query, но не оба.СхемыВывода -> (список)
Указывает схему данных для пользовательского JDBC-источника.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorSource -> (структура)
Указывает подключение к источнику данных Apache Spark.
Имя -> (строка)
ИмяСоединения -> (строка)
ИмяПодключения -> (строка)
ТипСоединения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры подключения для подключения.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для пользовательского источника Spark.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogSource -> (структура)
Указывает хранилище данных в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftSource -> (структура)
Указывает хранилище данных Amazon Redshift.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
S3CatalogSource -> (структура)
Указывает хранилище данных Amazon S3 в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ПредикатРазбиения -> (строка)
"" – по умолчанию пусто.ДополнительныеПараметры -> (структура)
Указывает дополнительные параметры подключения.
ОграниченныйРазмер -> (длинное целое)
ОграниченноеКоличествоФайлов -> (длинное целое)
S3CsvSource -> (структура)
Указывает хранилище данных со значениями, разделёнными запятыми (CSV), хранящееся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip".Exclusions -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" должно быть установлено в "inPartition" для его применения.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (длинное целое число)
BoundedFiles -> (длинное целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
Separator -> (строка)
Escaper -> (строка)
none. Если включено, символ, который следует непосредственно за ним, используется как есть, за исключением небольшого набора известных экранированных символов (\n, \r, \t и \0).QuoteChar -> (строка)
'"'. Установите значение -1, чтобы полностью отключить кавычки.Multiline -> (булево)
False, что позволяет для более агрессивного разделения файлов во время разбора.WithHeader -> (булево)
False.WriteHeader -> (булево)
True.SkipFirst -> (булево)
False.OptimizePerformance -> (булево)
OutputSchemas -> (список)
Указывает схему данных для источника CSV S3.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3ExcelSource -> (структура)
Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.
Name -> (строка)
Paths -> (список)
Пути S3, где находятся файлы Excel.
(строка)
CompressionType -> (строка)
Exclusions -> (список)
Шаблоны для исключения определённых файлов или путей из обработки.
(строка)
GroupSize -> (строка)
GroupFiles -> (строка)
Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Дополнительные параметры конфигурации для обработки S3 прямых источников.
BoundedSize -> (длинное целое число)
BoundedFiles -> (длинное целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
NumberRows -> (длинное целое число)
SkipFooter -> (целое число)
OutputSchemas -> (список)
Схемы AWS Glue, которые следует применить к обработанным данным.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3JsonSource -> (структура)
Указывает хранилище JSON-данных, хранящееся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip".Exclusions -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" должно быть установлено в "inPartition" для его применения.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (длинное целое число)
BoundedFiles -> (длинное целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
JsonPath -> (строка)
Multiline -> (булево)
False, что позволяет для более агрессивного разделения файлов во время разбора.OutputSchemas -> (список)
Указывает схему данных для источника JSON S3.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3ParquetSource -> (структура)
Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
CompressionType -> (строка)
"gzip" и "bzip").Исключения -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
GroupSize -> (строка)
"groupFiles" должно быть установлено в значение "inPartition", чтобы это имело эффект.GroupFiles -> (строка)
"none".Recurse -> (булево)
MaxBand -> (целое число)
MaxFilesInBand -> (целое число)
AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (длинное целое)
BoundedFiles -> (длинное целое)
EnableSamplePath -> (булево)
SamplePath -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника S3 Parquet.
(структура)
Указывает схему, определенную пользователем, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
RelationalCatalogSource -> (структура)
Указывает хранилище данных реляционной схемы в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
DynamoDBCatalogSource -> (структура)
Указывает хранилище данных DynamoDBC в каталоге данных Glue.
Имя -> (строка)
База данных -> (строка)
Таблица -> (строка)
JDBCConnectorTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
Имя подключения -> (строка)
Таблица подключения -> (строка)
Имя соединителя -> (строка)
Тип подключения -> (строка)
Дополнительные параметры -> (карта)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Указывает схему данных для целевого объекта JDBC.
(структура)
Указывает схему, определенную пользователем, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorTarget -> (структура)
Указывает целевой объект, использующий соединитель Apache Spark.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
Имя подключения -> (строка)
Имя соединителя -> (строка)
Тип подключения -> (строка)
Дополнительные параметры -> (карта)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Указывает схему данных для пользовательской Spark-цели.
(структура)
Указывает схему, определенную пользователем, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogTarget -> (структура)
Указывает целевой объект, использующий таблицу каталога данных Glue.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Ключи разделов, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.
(список)
База данных -> (строка)
Таблица -> (строка)
RedshiftTarget -> (структура)
Указывает целевой объект, использующий Amazon Redshift.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
База данных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
UpsertRedshiftOptions -> (структура)
Набор параметров для настройки операции upsert при записи в целевой объект Redshift.
TableLocation -> (строка)
Имя подключения -> (строка)
UpsertKeys -> (список)
Ключи, используемые для определения, нужно ли выполнять обновление или вставку.
(строка)
S3CatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Таблица -> (строка)
База данных -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для сканера.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
S3GlueParquetTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").NumberTargetPartitions -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для сканера.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Таблица -> (строка)
База данных -> (строка)
S3HyperDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.
Имя -> (строка)
Входы -> (список)
Указывает исходный источник данных для целевого узла HyperDirect.
(строка)
PartitionKeys -> (список)
Определяет стратегию разбиения выходных данных.
(список)
Путь -> (строка)
Сжатие -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы во время операций записи.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Таблица -> (строка)
База данных -> (строка)
S3DirectTarget -> (структура)
Указывает целевой объект данных, записывающий данные в Amazon S3.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся источниками данных для целевого объекта.
(строка)
PartitionKeys -> (список)
Указывает разбиение с использованием последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").NumberTargetPartitions -> (строка)
Формат -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для сканера.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Таблица -> (строка)
База данных -> (строка)
S3IcebergDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.
Имя -> (строка)
Входы -> (список)
Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.
(строка)
PartitionKeys -> (список)
Определяет столбцы, используемые для разбиения данных таблицы Iceberg в S3.
(список)
Путь -> (строка)
Формат -> (строка)
ДополнительныеПараметры -> (словарь)
Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.
ключ -> (строка)
значение -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Таблица -> (строка)
База данных -> (строка)
Сжатие -> (строка)
NumberTargetPartitions -> (строка)
ApplyMapping -> (структура)
Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте данных. Вы можете переименовать ключи, изменить типы данных для ключей и выбрать, какие ключи исключить из набора данных.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Сопоставление -> (список)
Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте данных.
(структура)
Указывает сопоставление ключей свойств данных.
ToKey -> (строка)
FromPath .FromPath -> (список)
Таблица или столбец, подлежащие изменению.
(строка)
FromType -> (строка)
ToType -> (строка)
Удалено -> (булево)
Children -> (список)
Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, но также и одного из ее потомков, вы можете заполнить эту структуру данных. Также Mapping, но ее FromPath будет родительским FromPath плюс FromPath из этой структуры.
Для части children, предположим, что у вас есть структура:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }Вы можете указать Mapping, которая выглядит следующим образом:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }(структура)
Указывает сопоставление ключей свойств данных.
ToKey -> (строка)
FromPath .FromPath -> (список)
Таблица или столбец, подлежащие изменению.
(строка)
FromType -> (строка)
ToType -> (строка)
Удалено -> (булево)
SelectFields -> (структура)
Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите сохранить.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Пути -> (список)
Путь JSON к переменной в структуре данных.
(список)
DropFields -> (структура)
Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите удалить.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Пути -> (список)
Путь JSON к переменной в структуре данных.
(список)
RenameField -> (структура)
Указывает преобразование, которое переименовывает один ключ свойства данных.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
ИсходныйПуть -> (список)
Путь JSON к переменной в структуре данных для исходных данных.
(строка)
ЦелевойПуть -> (список)
Путь JSON к переменной в структуре данных для целевых данных.
(строка)
Spigot -> (структура)
Указывает преобразование, которое записывает образцы данных в ведро Amazon S3.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Путь -> (строка)
Topk -> (целое число)
Prob -> (двойное число)
Join -> (структура)
Указывает преобразование, которое объединяет два набора данных в один набор данных с использованием сравнительной фразы по указанным ключам свойств данных. Вы можете использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
JoinType -> (строка)
Столбцы -> (список)
Список из двух столбцов, которые необходимо объединить.
(структура)
Указывает столбец, подлежащий объединению.
From -> (строка)
Keys -> (список)
Ключ столбца, подлежащего объединению.
(список)
SplitFields -> (структура)
Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных и один с оставшимися ключами свойств данных.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Пути -> (список)
Путь JSON к переменной в структуре данных.
(список)
SelectFromCollection -> (структура)
Указывает преобразование, которое выбирает один DynamicFrame из набора DynamicFrames. Выход — выбранный DynamicFrame.
Имя -> (строка)
Входы -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Индекс -> (целое число)
FillMissingValues -> (структура)
Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определяемым методом импутации. Входной набор данных используется для обучения модели машинного обучения, определяющей, каким должно быть пропущенное значение.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
ImputedPath -> (строка)
FilledPath -> (строка)
Filter -> (структура)
Указывает преобразование, которое разделяет набор данных на два, основываясь на условии фильтрации.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
LogicalOperator -> (строка)
Filters -> (список)
Указывает выражение фильтра.
(структура)
Указывает выражение фильтра.
Operation -> (строка)
Negated -> (булево)
Values -> (список)
Список значений фильтра.
(структура)
Представляет один элемент в списке значений для FilterExpression .
Type -> (строка)
Value -> (список)
Значение, которое должно быть связано.
(строка)
CustomCode -> (структура)
Указывает преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Выход представляет собой коллекцию DynamicFrames.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Code -> (строка)
ClassName -> (строка)
OutputSchemas -> (список)
Указывает схему данных для преобразования пользовательского кода.
(структура)
Указывает схему, определённую пользователем, когда Glue не может определить схему автоматически.
Columns -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
SparkSQL -> (структура)
Указывает преобразование, в котором вы вводите SQL-запрос, используя синтаксис Spark SQL, для преобразования данных. Выход — один DynamicFrame .
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов. Вы можете ассоциировать имя таблицы с каждым входным узлом для использования в SQL-запросе. Выбранное вами имя должно соответствовать ограничениям именования Spark SQL.
(строка)
SqlQuery -> (строка)
SqlAliases -> (список)
Список псевдонимов. Псевдоним позволяет указать, какое имя использовать в SQL для данного входа. Например, у вас есть источник данных под названием “MyDataSource”. Если вы укажете From как MyDataSource, а Alias как SqlName, то в своём SQL вы можете сделать:
select * from SqlNameи это получит данные из MyDataSource.
(структура)
Представляет один элемент в списке значений для SqlAliases .
From -> (строка)
Alias -> (строка)
OutputSchemas -> (список)
Указывает схему данных для преобразования SparkSQL.
(структура)
Указывает схему, определённую пользователем, когда Glue не может определить схему автоматически.
Columns -> (список)
Указывает определения столбцов, составляющие схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
DirectKinesisSource -> (структура)
Указывает прямой источник данных Amazon Kinesis.
Name -> (строка)
WindowSize -> (целое число)
DetectSchema -> (булево)
StreamingOptions -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
EndpointUrl -> (строка)
StreamName -> (строка)
Classification -> (строка)
Delimiter -> (строка)
StartingPosition -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest" , "trim_horizon" , "earliest" или строка даты и времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию — "latest" .
Примечание: Использование значения, которое представляет собой строку даты и времени в формате UTC, для «startingPosition» поддерживается только для версии Glue 4.0 и выше.
MaxFetchTimeInMs -> (длинное целое)
GetRecords вызовов API в течение этого времени. Значение по умолчанию — 1000 .MaxFetchRecordsPerShard -> (длинное целое)
MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратным MaxRecordPerRead . Значение по умолчанию — 100000 .MaxRecordPerRead -> (длинное целое)
10000 .AddIdleTimeBetweenReads -> (булево)
"False" . Этот параметр настраивается только для версии Glue 2.0 и выше.IdleTimeBetweenReadsInMs -> (длинное целое)
1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.DescribeShardInterval -> (длинное целое)
1s .NumRetries -> (целое число)
3 .RetryIntervalMs -> (длинное целое)
1000 .MaxRetryIntervalMs -> (длинное целое)
10000 .AvoidEmptyBatches -> (булево)
"False" .StreamArn -> (строка)
RoleArn -> (строка)
"awsSTSSessionName" .RoleSessionName -> (строка)
"awsSTSRoleARN" .AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (временная метка)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).DataPreviewOptions -> (структура)
Дополнительные параметры для предварительного просмотра данных.
PollingTime -> (длинное целое)
RecordPollingLimit -> (длинное целое)
DirectKafkaSource -> (структура)
Указывает хранилище данных Apache Kafka.
Имя -> (строка)
StreamingOptions -> (структура)
Указывает параметры потоковой передачи.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094 . Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT" .ConnectionName -> (строка)
TopicName -> (строка)
"topicName" , "assign" или "subscribePattern" .Assign -> (строка)
TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName" , "assign" или "subscribePattern" .SubscribePattern -> (строка)
"topicName" , "assign" или "subscribePattern" .Classification -> (строка)
Delimiter -> (строка)
StartingOffsets -> (строка)
"earliest" или "latest" . Значение по умолчанию - "latest" .EndingOffsets -> (строка)
"latest" или строка JSON, указывающая конечную позицию смещения для каждого TopicPartition .PollTimeoutMs -> (целое число)
512 .NumRetries -> (целое число)
3 .RetryIntervalMs -> (целое число)
10 .MaxOffsetsPerTrigger -> (целое число)
topicPartitions различных объемов. Значение по умолчанию - null, что означает, что потребитель считывает все смещения до известного последнего смещения.MinPartitions -> (целое число)
IncludeHeaders -> (логическое значение)
Array[Struct(key: String, value: String)] . Значение по умолчанию - «false». Этот параметр доступен только в версии Glue 3.0 и выше.AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (дата/время)
Маркер времени записи в теме Kafka, с которой начинается чтение данных. Возможные значения - строка даты/времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).
Только один из StartingTimestamp или StartingOffsets должен быть задан.
WindowSize -> (целое число)
DetectSchema -> (логическое значение)
DataPreviewOptions -> (структура)
Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.
PollingTime -> (целое число)
RecordPollingLimit -> (целое число)
CatalogKinesisSource -> (структура)
Указывает источник данных Kinesis в каталоге данных Glue.
Имя -> (строка)
WindowSize -> (целое число)
DetectSchema -> (логическое значение)
Table -> (строка)
Database -> (строка)
StreamingOptions -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
EndpointUrl -> (строка)
StreamName -> (строка)
Classification -> (строка)
Delimiter -> (строка)
StartingPosition -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения - "latest" , "trim_horizon" , "earliest" или строка даты/времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию - "latest" .
Примечание: Использование значения, представляющего строку даты/времени в формате UTC для «startingPosition», поддерживается только для версии Glue 4.0 и выше.
MaxFetchTimeInMs -> (целое число)
GetRecords API-вызовов. Значение по умолчанию - 1000 .MaxFetchRecordsPerShard -> (целое число)
MaxFetchRecordsPerShard нужно строго соблюдать, то оно должно быть кратно MaxRecordPerRead . Значение по умолчанию - 100000 .MaxRecordPerRead -> (целое число)
10000 .AddIdleTimeBetweenReads -> (логическое значение)
"False" . Этот параметр настраивается только для версии Glue 2.0 и выше.IdleTimeBetweenReadsInMs -> (целое число)
1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.DescribeShardInterval -> (целое число)
1s .NumRetries -> (целое число)
3 .RetryIntervalMs -> (целое число)
1000 .MaxRetryIntervalMs -> (целое число)
10000 .AvoidEmptyBatches -> (логическое значение)
"False" .StreamArn -> (строка)
RoleArn -> (строка)
"awsSTSSessionName" .RoleSessionName -> (строка)
"awsSTSRoleARN" .AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (дата/время)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).DataPreviewOptions -> (структура)
Дополнительные параметры для предварительного просмотра данных.
PollingTime -> (целое число)
RecordPollingLimit -> (целое число)
CatalogKafkaSource -> (структура)
Указывает хранилище данных Apache Kafka в каталоге данных.
Name -> (строка)
WindowSize -> (целое число)
DetectSchema -> (булево)
Table -> (строка)
Database -> (строка)
StreamingOptions -> (структура)
Указывает параметры потоковой передачи.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT".ConnectionName -> (строка)
TopicName -> (строка)
"topicName", "assign" или "subscribePattern".Assign -> (строка)
TopicPartitions для потребления. Необходимо указать хотя бы один из "topicName", "assign" или "subscribePattern".SubscribePattern -> (строка)
"topicName", "assign" или "subscribePattern".Classification -> (строка)
Delimiter -> (строка)
StartingOffsets -> (строка)
"earliest" или "latest". Значение по умолчанию — "latest".EndingOffsets -> (строка)
"latest" или строка JSON, указывающая конечную позицию для каждого TopicPartition.PollTimeoutMs -> (целое с плавающей запятой)
512.NumRetries -> (целое число)
3.RetryIntervalMs -> (целое с плавающей запятой)
10.MaxOffsetsPerTrigger -> (целое с плавающей запятой)
topicPartitions разных объемов. Значение по умолчанию — null, что означает, что потребитель читает все смещения до известной последней позиции.MinPartitions -> (целое число)
IncludeHeaders -> (булево)
Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и выше.AddRecordTimestamp -> (строка)
EmitConsumerLagMetrics -> (строка)
StartingTimestamp -> (временная метка)
Временная метка записи в теме Kafka для начала чтения данных. Возможные значения — строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).
Только один из StartingTimestamp или StartingOffsets должен быть установлен.
DataPreviewOptions -> (структура)
Указывает параметры, связанные с предварительным просмотром данных для просмотра выборки данных.
PollingTime -> (целое с плавающей запятой)
RecordPollingLimit -> (целое с плавающей запятой)
DropNullFields -> (структура)
Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, представляющие «null», -1 целые числа или другие заполнитель, такие как нули, не распознаются автоматически как нулевые.
Name -> (строка)
Inputs -> (список)
Входы данных, определенные по их именам узлов.
(строка)
NullCheckBoxList -> (структура)
Структура, представляющая, считаются ли определенные значения нулевыми значениями для удаления.
IsEmpty -> (булево)
IsNullString -> (булево)
IsNegOne -> (булево)
NullTextList -> (список)
Структура, указывающая список NullValueField-структур, представляющих пользовательское нулевое значение, например, ноль или другое значение, используемое в качестве нулевого заполнителя, уникального для набора данных.
Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение заполнителя нулевого значения и тип данных совпадают с данными.
(структура)
Представляет пользовательское нулевое значение, например, нуль или другое значение, используемое в качестве нулевого заполнителя, уникального для набора данных.
Value -> (строка)
Datatype -> (структура)
Тип данных значения.
Id -> (строка)
Label -> (строка)
Merge -> (структура)
Указывает преобразование, объединяющее DynamicFrame со стекинговым DynamicFrame на основе указанных первичных ключей для идентификации записей. Дублирующие записи (записи с одинаковыми первичными ключами) не удаляются.
Name -> (строка)
Inputs -> (список)
Входы данных, определенные по их именам узлов.
(строка)
Source -> (строка)
DynamicFrame, который будет объединен со стекинговым DynamicFrame.PrimaryKeys -> (список)
Список полей первичного ключа для сопоставления записей из исходной и стекинговой динамических рамок.
(список)
Union -> (структура)
Указывает преобразование, объединяющее строки из двух и более наборов данных в один результат.
Name -> (строка)
Inputs -> (список)
Входы узла ID в преобразование.
(строка)
UnionType -> (строка)
Указывает тип преобразования Union.
Укажите ALL для объединения всех строк из источников данных с результирующей DynamicFrame. Результирующее объединение не удаляет дублирующие строки.
Укажите DISTINCT для удаления дублирующих строк в результирующей DynamicFrame.
PIIDetection -> (структура)
Указывает преобразование, идентифицирующее, удаляющее или маскирующее данные PII.
Name -> (строка)
Inputs -> (список)
Входы узла ID в преобразование.
(строка)
PiiType -> (строка)
EntityTypesToDetect -> (список)
Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.
Типы сущностей PII включают: ИМЯ_ЛИЦА, ДАТА, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, НОМЕР_ТЕЛЕФОНА, БАНКОВСКИЙ_СЧЕТ, IP_АДРЕС, MAC_АДРЕС, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER, КРЕДИТНАЯ_КАРТА,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE
(строка)
OutputColumnName -> (строка)
SampleFraction -> (двойное)
ThresholdFraction -> (двойное)
MaskValue -> (строка)
Aggregate -> (структура)
Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по указанной функции.
Name -> (строка)
Inputs -> (список)
Указывает поля и строки, которые будут использоваться в качестве входов для преобразования агрегации.
(строка)
Groups -> (список)
Указывает поля для группировки.
(список)
Aggs -> (список)
Указывает агрегационные функции, которые будут выполняться по указанным полям.
(структура)
Указывает набор параметров, необходимых для выполнения агрегации в преобразовании агрегации.
Column -> (список)
Указывает столбец в наборе данных, к которому будет применена функция агрегации.
(строка)
AggFunc -> (строка)
Указывает функцию агрегации.
Возможные функции агрегации: avg, countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop
DropDuplicates -> (структура)
Указывает преобразование, удаляющее строки повторяющихся данных из набора данных.
Name -> (строка)
Inputs -> (список)
Входы данных, определенные по их именам узлов.
(строка)
Columns -> (список)
Имя столбцов, которые будут объединены или удалены, если повторяются.
(список)
GovernedCatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в управляемый каталог.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает собственное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для управляемого каталога.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
GovernedCatalogSource -> (структура)
Указывает источник данных в управляемом каталоге данных.
Name -> (строка)
Database -> (строка)
Table -> (строка)
PartitionPredicate -> (строка)
"" – по умолчанию пусто.AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (целое число)
BoundedFiles -> (целое число)
MicrosoftSQLServerCatalogSource -> (структура)
Указывает источник данных Microsoft SQL-сервера в Glue Data Catalog.
Name -> (строка)
Database -> (строка)
Table -> (строка)
MySQLCatalogSource -> (структура)
Указывает источник данных MySQL в Glue Data Catalog.
Name -> (строка)
Database -> (строка)
Table -> (строка)
OracleSQLCatalogSource -> (структура)
Указывает источник данных Oracle в Glue Data Catalog.
Name -> (строка)
Database -> (строка)
Table -> (строка)
PostgreSQLCatalogSource -> (структура)
Указывает источник данных PostgresSQL в Glue Data Catalog.
Name -> (строка)
Database -> (строка)
Table -> (строка)
MicrosoftSQLServerCatalogTarget -> (структура)
Указывает целевой объект, использующий Microsoft SQL.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
MySQLCatalogTarget -> (структура)
Указывает целевой объект, использующий MySQL.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
OracleSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Oracle SQL.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
PostgreSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Postgres SQL.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
DynamicTransform -> (структура)
Указывает пользовательскую визуальную трансформацию, созданную пользователем.
Name -> (строка)
TransformName -> (строка)
Inputs -> (список)
Указывает входные данные для динамической трансформации, которые необходимы.
(строка)
Parameters -> (список)
Указывает параметры динамической трансформации.
(структура)
Указывает параметры в файле конфигурации динамической трансформации.
Name -> (строка)
Type -> (строка)
ValidationRule -> (строка)
ValidationMessage -> (строка)
Value -> (список)
Указывает значение параметра в файле конфигурации динамической трансформации.
(строка)
ListType -> (строка)
IsOptional -> (булево)
FunctionName -> (строка)
Path -> (строка)
Version -> (строка)
OutputSchemas -> (список)
Указывает схему данных для динамической трансформации.
(структура)
Указывает определённую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, которые составляют схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
EvaluateDataQuality -> (структура)
Указывает критерии оценки качества ваших данных.
Name -> (строка)
Inputs -> (список)
Входы вашей оценки качества данных.
(строка)
Ruleset -> (строка)
Output -> (строка)
PublishingOptions -> (структура)
Параметры, определяющие, как будут опубликованы ваши результаты.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
StopJobOnFailureOptions -> (структура)
Параметры, определяющие, как работа будет останавливаться, если ваша оценка качества данных завершается неудачно.
StopJobOnFailureTiming -> (строка)
S3CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в Glue Data Catalog. Источник данных должен храниться в Amazon S3.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalHudiOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает определённую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, которые составляют схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в Glue Data Catalog.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalHudiOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает определённую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, которые составляют схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3HudiSource -> (структура)
Указывает на источник данных Hudi, хранящийся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
AdditionalHudiOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
AdditionalOptions -> (структура)
Указывает дополнительные параметры для коннектора.
BoundedSize -> (целое число)
BoundedFiles -> (целое число)
EnableSamplePath -> (логическое значение)
SamplePath -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3HudiCatalogTarget -> (структура)
Указывает целевой объект, который записывает данные в источник Hudi в каталоге данных Glue.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
AdditionalOptions -> (карта)
Указывает дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для кроулера.
EnableUpdateCatalog -> (логическое значение)
UpdateBehavior -> (строка)
S3HudiDirectTarget -> (структура)
Указывает целевой объект, который записывает данные в источник Hudi в Amazon S3.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
Path -> (строка)
Compression -> (строка)
"gzip" и "bzip".NumberTargetPartitions -> (строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Format -> (строка)
AdditionalOptions -> (карта)
Указывает дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для кроулера.
EnableUpdateCatalog -> (логическое значение)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
DirectJDBCSource -> (структура)
Указывает прямое подключение JDBC-источника.
Name -> (строка)
Database -> (строка)
Table -> (строка)
ConnectionName -> (строка)
ConnectionType -> (строка)
RedshiftTmpDir -> (строка)
S3CatalogDeltaSource -> (структура)
Указывает источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalDeltaOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Delta Lake.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
CatalogDeltaSource -> (структура)
Указывает источник данных Delta Lake, зарегистрированный в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalDeltaOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Delta Lake.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3DeltaSource -> (структура)
Указывает источник данных Delta Lake, хранящийся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
AdditionalDeltaOptions -> (карта)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
AdditionalOptions -> (структура)
Указывает дополнительные параметры для коннектора.
BoundedSize -> (целое число)
BoundedFiles -> (целое число)
EnableSamplePath -> (логическое значение)
SamplePath -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Delta Lake.
(структура)
Указывает пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3DeltaCatalogTarget -> (структура)
Указывает целевой объект, который записывает данные в источник Delta Lake в каталоге данных Glue.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
AdditionalOptions -> (карта)
Указывает дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для кроулера.
EnableUpdateCatalog -> (логическое значение)
UpdateBehavior -> (строка)
S3DeltaDirectTarget -> (структура)
Указывает целевой объект, который записывает в источник данных Delta Lake в Amazon S3.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает собственное разбиение с помощью последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip".Количество целевых разделов -> (строка)
Формат -> (строка)
Дополнительные параметры -> (карта)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
Политика изменения схемы -> (структура)
Политика, которая определяет поведение обновления для обхода.
Включить обновление каталога -> (булево)
Поведение при обновлении -> (строка)
Таблица -> (строка)
База данных -> (строка)
AmazonRedshiftSource -> (структура)
Указывает целевой объект, который записывает в источник данных в Amazon Redshift.
Имя -> (строка)
Данные -> (структура)
Указывает данные узла источника Amazon Reshift.
Тип доступа -> (строка)
Тип источника -> (строка)
Подключение -> (структура)
Подключение Glue к кластеру Redshift.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
База данных каталога -> (структура)
Имя базы данных Glue Data Catalog при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица каталога -> (структура)
Имя таблицы Glue Data Catalog при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема Redshift каталога -> (строка)
Таблица Redshift каталога -> (строка)
Временная папка -> (строка)
Роль IAM -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. Роль IAM по умолчанию будет ролью в задаче, если поле оставлено пустым.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Дополнительные параметры -> (список)
Необязательные значения при подключении к кластеру Redshift.
(структура)
Указывает необязательное значение при подключении к кластеру Redshift.
Ключ -> (строка)
Значение -> (строка)
Пример запроса -> (строка)
Действие до -> (строка)
Действие после -> (строка)
Действие -> (строка)
Префикс таблицы -> (строка)
Upsert -> (булево)
Действие MERGE -> (строка)
MERGE при совпадении -> (строка)
MERGE при отсутствии совпадения -> (строка)
Оператор MERGE -> (строка)
Подключение обхода -> (строка)
Схема таблицы -> (список)
Массив выходных данных схемы для данного узла.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица временного хранения -> (строка)
Выбранные столбцы -> (список)
Список имён столбцов, используемых для определения совпадающей записи при выполнении MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
AmazonRedshiftTarget -> (структура)
Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.
Name -> (строка)
Data -> (структура)
Указывает данные узла целевого объекта Amazon Redshift.
AccessType -> (строка)
SourceType -> (строка)
Connection -> (структура)
Подключение Glue к кластеру Redshift.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Table -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogDatabase -> (структура)
Имя базы данных Glue Data Catalog при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogTable -> (структура)
Имя таблицы Glue Data Catalog при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogRedshiftSchema -> (строка)
CatalogRedshiftTable -> (строка)
TempDir -> (строка)
IamRole -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. Если оставлено пустым, роль IAM будет по умолчанию взята из роли задания.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdvancedOptions -> (список)
Дополнительные значения при подключении к кластеру Redshift.
(структура)
Указывает дополнительное значение при подключении к кластеру Redshift.
Key -> (строка)
Value -> (строка)
SampleQuery -> (строка)
PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
TablePrefix -> (строка)
Upsert -> (булево)
MergeAction -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
MergeClause -> (строка)
CrawlerConnection -> (строка)
TableSchema -> (список)
Массив схем вывода для данного узла.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
StagingTable -> (строка)
SelectedColumns -> (список)
Список имён столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
EvaluateDataQualityMultiFrame -> (структура)
Указывает критерии оценки качества данных. Поддерживает несколько входных данных и возвращает набор динамических фреймов.
Name -> (строка)
Inputs -> (список)
Входы для оценки качества данных. Первый вход в этом списке — основной источник данных.
(строка)
AdditionalDataSources -> (карта)
Псевдонимы всех источников данных, кроме основного.
ключ -> (строка)
значение -> (строка)
Ruleset -> (строка)
PublishingOptions -> (структура)
Параметры для настройки публикации результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
AdditionalOptions -> (карта)
Параметры для настройки поведения преобразования во время выполнения.
ключ -> (строка)
значение -> (строка)
StopJobOnFailureOptions -> (структура)
Параметры для настройки остановки задания при неудачной оценке качества данных.
StopJobOnFailureTiming -> (строка)
Recipe -> (структура)
Указывает узел Glue DataBrew recipe.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для узла recipe, определяются по id.
(строка)
RecipeReference -> (структура)
Ссылка на рецепт DataBrew, используемый узлом.
RecipeArn -> (строка)
RecipeVersion -> (строка)
RecipeSteps -> (список)
Шаги преобразования, используемые в узле recipe.
(структура)
Шаг рецепта, используемый в узле подготовки данных Glue Studio.
Action -> (структура)
Действие преобразования шага рецепта.
Operation -> (строка)
Parameters -> (карта)
Параметры действия рецепта.
ключ -> (строка)
значение -> (строка)
ConditionExpressions -> (список)
Условные выражения для шага рецепта.
(структура)
Условное выражение, определённое в узле подготовки данных рецепта Glue Studio.
Condition -> (строка)
Value -> (строка)
TargetColumn -> (строка)
SnowflakeSource -> (структура)
Определяет источник данных Snowflake.
Имя -> (строка)
Данные -> (структура)
Настройка источника данных Snowflake.
ТипИсточника -> (строка)
"table" , "query" .Подключение -> (структура)
Указывает подключение Glue Data Catalog к Snowflake-эндопоинту.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема -> (строка)
Таблица -> (строка)
База данных -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
ДополнительныеПараметры -> (карта)
Указывает дополнительные параметры, передаваемые в коннектор Snowflake. Если параметры указаны в другом месте этого узла, эти параметры будут иметь приоритет.
ключ -> (строка)
значение -> (строка)
ПримерЗапроса -> (строка)
query .Предусловие -> (строка)
ПоследующееДействие -> (строка)
Действие -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Указывает поведение разрешения при уже существующей строке. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.ДействиеСлияния -> (строка)
simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если настраиваемое, определяется MergeClause .СлияниеПриСовпадении -> (строка)
update , delete .СлияниеПриОтсутствииСовпадения -> (строка)
insert , none .ОператорСлияния -> (строка)
StagingTable -> (строка)
merge или upsert append . Данные записываются в эту таблицу, затем перемещаются в table с помощью сгенерированного последействия.ВыбранныеСтолбцы -> (список)
Определяет столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description . Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
АвтоматическоеВыполнение -> (булево)
СтруктураТаблицы -> (список)
Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
СхемыВывода -> (список)
Определяет схемы, определенные пользователем, для ваших выходных данных.
(структура)
Определяет схему, определенную пользователем, когда схема не может быть определена Glue.
Столбцы -> (список)
Определяет определения столбцов, составляющих схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SnowflakeЦелевой -> (структура)
Определяет целевой объект для записи в источник данных Snowflake.
Имя -> (строка)
Данные -> (структура)
Указывает данные целевого узла Snowflake.
ТипИсточника -> (строка)
"table" , "query" .Подключение -> (структура)
Указывает подключение Glue Data Catalog к Snowflake-эндопоинту.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема -> (строка)
Таблица -> (строка)
База данных -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
ДополнительныеПараметры -> (карта)
Указывает дополнительные параметры, передаваемые в коннектор Snowflake. Если параметры указаны в другом месте этого узла, эти параметры будут иметь приоритет.
ключ -> (строка)
значение -> (строка)
ПримерЗапроса -> (строка)
query .Предусловие -> (строка)
ПоследующееДействие -> (строка)
Действие -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Указывает поведение разрешения при уже существующей строке. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.ДействиеСлияния -> (строка)
simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если настраиваемое, определяется MergeClause .СлияниеПриСовпадении -> (строка)
update , delete .СлияниеПриОтсутствииСовпадения -> (строка)
insert , none .ОператорСлияния -> (строка)
StagingTable -> (строка)
merge или upsert append . Данные записываются в эту таблицу, затем перемещаются в table с помощью сгенерированного последействия.ВыбранныеСтолбцы -> (список)
Определяет столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description . Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
АвтоматическоеВыполнение -> (булево)
СтруктураТаблицы -> (список)
Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
ConnectorDataSource -> (структура)
Указывает источник, созданный со стандартными параметрами подключения.
Name -> (строка)
ConnectionType -> (строка)
connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Data -> (карта)
Карта, определяющая параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.
ключ -> (строка)
значение -> (строка)
OutputSchemas -> (список)
Указывает схему данных для этого источника.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
ConnectorDataTarget -> (структура)
Указывает целевой объект, созданный со стандартными параметрами подключения.
Name -> (строка)
ConnectionType -> (строка)
connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Data -> (карта)
Карта, определяющая параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.
ключ -> (строка)
значение -> (строка)
Inputs -> (список)
Узлы, которые являются входными данными для целевого объекта данных.
(строка)
ExecutionClass -> (строка)
Указывает, запускается ли работа со стандартным или гибким классом выполнения. Стандартный класс выполнения идеально подходит для задач с временными ограничениями, требующих быстрого запуска работы и выделенных ресурсов.
Гибкий класс выполнения подходит для задач, не зависящих от времени, начало и завершение которых могут меняться.
Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для задач Spark.
SourceControlDetails -> (структура)
Подробности конфигурации системы управления версиями для задачи, позволяющие синхронизировать артефакты задачи с удалённым хранилищем или из него.
Provider -> (строка)
Repository -> (строка)
Owner -> (строка)
Branch -> (строка)
Folder -> (строка)
LastCommitId -> (строка)
AuthStrategy -> (строка)
AuthToken -> (строка)
MaintenanceWindow -> (строка)
Это поле определяет день недели и час для окна обслуживания для потоковых задач. Glue периодически выполняет задачи обслуживания. В эти окна обслуживания Glue потребуется перезапустить ваши потоковые задачи.
Glue перезапустит задачу в течение 3 часов от указанного окна обслуживания. Например, если вы настроили окно обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.
ProfileName -> (строка)
JobsNotFound -> (список)
Список имён задач, не найденных.
(строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.