get-jobs
Описание
Получает все текущие определения заданий.
См. также: Документацию API AWS
get-jobs является постраничной операцией. Для получения всего набора результатов могут быть выполнены несколько вызовов API. Вы можете отключить постраничный вывод, предоставив аргумент --no-paginate. При использовании --output text и аргумента --query в ответе с постраничным выводом, аргумент --query должен извлекать данные из результатов следующих выражений запроса: Jobs
Синтаксис
get-jobs
[--cli-input-json | --cli-input-yaml]
[--starting-token <value>]
[--page-size <value>]
[--max-items <value>]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения, используя значение, предоставленное в JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--starting-token (строка)
Токен для указания места начала постраничного вывода. Это NextToken из ранее укороченного ответа.
Примеры использования см. в разделе «Постраничный вывод» в Руководстве пользователя AWS Command Line Interface.
--page-size (целое число)
Размер каждой страницы для получения в вызове AWS-сервиса. Это не влияет на количество элементов, возвращаемых в выводе команды. Установка меньшего размера страницы приводит к большему количеству вызовов AWS-сервиса, получая меньше элементов в каждом вызове. Это может помочь предотвратить временное превышение лимита вызовов AWS-сервиса.
Примеры использования см. в разделе «Постраничный вывод» в Руководстве пользователя AWS Command Line Interface.
--max-items (целое число)
Общее количество элементов для возврата в выводе команды. Если общее количество доступных элементов больше указанного значения, в выводе команды предоставляется NextToken. Для продолжения постраничного вывода укажите значение NextToken в аргументе starting-token последующей команды. Не используйте элемент ответа NextToken напрямую вне AWS CLI.
Примеры использования см. в разделе «Постраничный вывод» в Руководстве пользователя AWS Command Line Interface.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При указании без значения или со значением input выводит пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании yaml-input выведет пример YAML-ввода, который можно использовать с --cli-input-yaml. При указании значения output он валидирует входные данные команды и возвращает пример JSON-вывода для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладку.
--endpoint-url (строка)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (логическое значение)
Отключить автоматический постраничный вывод. Если автоматический постраничный вывод отключен, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Выражение JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет параметры конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.
--ca-bundle (строка)
Файл с набором сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться без ожидания таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться без ожидания таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить постраничный вывод для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запросить параметры ввода CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическое запроса параметров ввода CLI.
Вывод
Задачи -> (список)
Список определений задач.
(структура)
Определяет определение задачи.
Имя -> (строка)
JobMode -> (строка)
Режим, описывающий способ создания задачи. Допустимые значения:
-
SCRIPT- Задача создана с помощью редактора сценариев Glue Studio. -
VISUAL- Задача создана с помощью визуального редактора Glue Studio. -
NOTEBOOK- Задача создана с помощью блокнота интерактивных сессий.
Если поле JobMode отсутствует или имеет значение null, по умолчанию используется значение SCRIPT.
JobRunQueuingEnabled -> (булево)
Указывает, включено ли очередирование запусков задач для запусков этой задачи.
Значение true означает, что очередирование запусков задач включено для запусков этой задачи. Если значение false или оно не указано, запуски задач не будут учитываться для очередирования.
Если это поле не совпадает со значением, заданным в запуске задачи, то будет использовано значение из поля запуска задачи.
Описание -> (строка)
LogUri -> (строка)
Роль -> (строка)
Создано -> (метка времени)
Последнее изменение -> (метка времени)
ExecutionProperty -> (структура)
ExecutionProperty, определяющий максимальное количество одновременных запусков, разрешенных для этой задачи.
MaxConcurrentRuns -> (целое число)
Команда -> (структура)
JobCommand, выполняющая эту задачу.
Имя -> (строка)
glueetl . Для задачи Python shell это должно быть pythonshell . Для задачи Apache Spark streaming ETL это должно быть gluestreaming . Для задачи Ray это должно быть glueray .ScriptLocation -> (строка)
PythonVersion -> (строка)
Runtime -> (строка)
DefaultArguments -> (массив)
Значения аргументов по умолчанию для каждого запуска этой задачи, указанные в виде пар имя-значение.
Вы можете указать здесь аргументы, которые использует ваш собственный скрипт выполнения задачи, а также аргументы, которые использует сам Glue.
Аргументы задач могут быть записаны в журнал. Не передавайте секреты в открытом виде в качестве аргументов. Извлекайте секреты из соединения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в пределах задачи.
Дополнительную информацию о том, как указать и использовать свои собственные аргументы задач, см. в разделе Вызов API Glue на Python в руководстве разработчика.
Дополнительную информацию об аргументах, которые вы можете указать в этом поле при настройке задач Spark, см. в разделе Специальные параметры, используемые Glue, в руководстве разработчика.
Дополнительную информацию об аргументах, которые вы можете указать в этом поле при настройке задач Ray, см. в разделе Использование параметров задач в задачах Ray в руководстве разработчика.
ключ -> (строка)
значение -> (строка)
NonOverridableArguments -> (массив)
Аргументы для этой задачи, которые не переопределяются при предоставлении аргументов задачи в запуске задачи, указанные в виде пар имя-значение.
ключ -> (строка)
значение -> (строка)
Connections -> (структура)
Подключения, используемые для этой задачи.
Connections -> (список)
Список подключений, используемых задачей.
(строка)
MaxRetries -> (целое число)
AllocatedCapacity -> (целое число)
Это поле устарело. Используйте MaxCapacity вместо него.
Количество единиц обработки данных Glue (DPU), выделенных для запусков этой задачи. Вы можете выделить минимум 2 DPU; по умолчанию используется 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.
Timeout -> (целое число)
Таймаут задачи в минутах. Это максимальное время, которое запуск задачи может использовать ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT.
Значения таймаута задач должны быть меньше 7 дней или 10080 минут. В противном случае задачи вызовут исключение.
Если значение не указано, таймаут по умолчанию равен 2880 минутам.
Все существующие задачи Glue, у которых значение таймаута было больше 7 дней, будут по умолчанию установлены в 7 дней. Например, если вы указали таймаут в 20 дней для пакетной задачи, она будет остановлена на 7-й день.
Для потоковых задач, если вы настроите окно обслуживания, оно будет перезапущено во время окна обслуживания через 7 дней.
MaxCapacity -> (двойное)
Для задач Glue версии 1.0 или более ранних, использующих стандартный тип рабочих узлов, количество единиц обработки данных Glue (DPU), которое может быть выделено при выполнении этой задачи. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.
Для задач Glue версии 2.0 или более поздних вы не можете указать Maximum capacity . Вместо этого вы должны указать Worker type и Number of workers.
Не устанавливайте MaxCapacity, если используется WorkerType и NumberOfWorkers.
Значение, которое можно выделить для MaxCapacity, зависит от того, выполняете ли вы задачу Python shell, задачу Apache Spark ETL или задачу Apache Spark streaming ETL:
- Когда вы указываете задачу Python shell (
JobCommand.Name=”pythonshell”), вы можете выделить либо 0,0625, либо 1 DPU. По умолчанию используется 0,0625 DPU. - Когда вы указываете задачу Apache Spark ETL (
JobCommand.Name=”glueetl”) или задачу Apache Spark streaming ETL (JobCommand.Name=”gluestreaming”), вы можете выделить от 2 до 100 DPU. По умолчанию используется 10 DPU. Для этого типа задач не допускается выделение дробных значений DPU.
WorkerType -> (строка)
Тип предопределенного рабочего узла, который выделяется при выполнении задачи. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для задач Spark. Принимает значение Z.2X для задач Ray.
- Для типа рабочих узлов
G.1Xкаждый рабочий узел соответствует 1 DPU (4 виртуальных процессора (vCPU), 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономически эффективный способ выполнения большинства задач. - Для типа рабочих узлов
G.2Xкаждый рабочий узел соответствует 2 DPU (8 виртуальных процессоров (vCPU), 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономически эффективный способ выполнения большинства задач. - Для типа рабочих узлов
G.4Xкаждый рабочий узел соответствует 4 DPU (16 виртуальных процессоров (vCPU), 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для задач, рабочая нагрузка которых содержит наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочих узлов доступен только для задач Spark ETL Glue версии 3.0 или более поздних в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm). - Для типа рабочих узлов
G.8Xкаждый рабочий узел соответствует 8 DPU (32 виртуальных процессора (vCPU), 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для задач, рабочая нагрузка которых содержит наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочих узлов доступен только для задач Spark ETL Glue версии 3.0 или более поздних в тех же регионах Amazon Web Services, что и для типа рабочих узловG.4X. - Для типа рабочих узлов
G.025Xкаждый рабочий узел соответствует 0,25 DPU (2 виртуальных процессора (vCPU), 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для потоковых задач с низким объемом. Этот тип рабочих узлов доступен только для потоковых задач Glue версии 3.0 или более поздних. - Для типа рабочих узлов
Z.2Xкаждый рабочий узел соответствует 2 M-DPU (8vCPU, 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 рабочих узлов Ray на основе автоматического масштабирования.
NumberOfWorkers -> (целое число)
workerType, которые выделяются при запуске задачи.SecurityConfiguration -> (строка)
SecurityConfiguration, которая должна использоваться с этой задачей.NotificationProperty -> (структура)
Указывает параметры конфигурации уведомления о задаче.
NotifyDelayAfter -> (целое число)
GlueVersion -> (строка)
В задачах Spark, GlueVersion определяет версии Apache Spark и Python, которые доступны Glue в задаче. Версия Python указывает версию, поддерживаемую для задач типа Spark.
Задачи Ray должны установить GlueVersion на значение 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступные в вашей задаче Ray, определяются параметром Runtime команды задачи.
Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в разделе Версия Glue в руководстве разработчика.
Задачи, созданные без указания версии Glue, по умолчанию используют Glue 0.9.
CodeGenConfigurationNodes -> (массив)
Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.
ключ -> (строка)
значение -> (структура)
CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.AthenaConnectorSource -> (структура)
Определяет подключение к источнику данных Amazon Athena.
Имя -> (строка)
ИмяПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ИмяТаблицыПодключения -> (строка)
ИмяСхемы -> (строка)
/aws-glue/jobs/output .ВыходныеСхемы -> (список)
Указывает схему данных для пользовательского источника Athena.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, которые составляют схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
JDBCConnectorSource -> (структура)
Определяет подключение к источнику данных JDBC.
Имя -> (строка)
ИмяПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (структура)
Дополнительные параметры подключения для соединителя.
ФильтрПредсказания -> (строка)
Дополнительное условие для фильтрации данных из источника. Например:
BillingCity='Mountain View'При использовании запроса вместо имени таблицы, необходимо убедиться, что запрос работает с указанным filterPredicate .
СтолбецРазбиения -> (строка)
lowerBound , upperBound и numPartitions . Этот параметр работает так же, как и в Spark SQL JDBC reader.НижняяГраница -> (длинное целое число)
partitionColumn, которое используется для определения шага разбиения.ВерхняяГраница -> (длинное целое число)
partitionColumn, которое используется для определения шага разбиения.КоличествоРазбиений -> (длинное целое число)
lowerBound (включительно) и upperBound (исключительно) формируют шаги разбиения для сгенерированных WHERE выражений условия, используемых для разделения partitionColumn .КлючиЗакладкиРаботы -> (список)
Имя ключей закладок работы, по которым необходимо отсортировать.
(строка)
ПорядокКлючейЗакладкиРаботы -> (строка)
СопоставлениеТиповДанных -> (карта)
Пользовательское сопоставление типов данных, которое создаёт сопоставление между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} сопоставляет поля данных типа JDBC FLOAT с типом Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение специфично для используемого вами драйвера. Обратитесь к документации вашего JDBC драйвера, чтобы понять, как драйвер выполняет преобразования.
ключ -> (строка)
значение -> (строка)
ИмяТаблицыПодключения -> (строка)
Запрос -> (строка)
ConnectionTable, либо query, но не оба.ВыходныеСхемы -> (список)
Указывает схему данных для пользовательского источника JDBC.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, которые составляют схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorSource -> (структура)
Определяет подключение к источнику данных Apache Spark.
Имя -> (строка)
ИмяПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
ВыходныеСхемы -> (список)
Указывает схему данных для пользовательского источника Spark.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, которые составляют схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogSource -> (структура)
Указывает хранилище данных в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftSource -> (структура)
Указывает хранилище данных Amazon Redshift.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
S3CatalogSource -> (структура)
Указывает хранилище данных Amazon S3 в каталоге данных Glue.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
УсловиеРазбиения -> (строка)
"" – по умолчанию пусто.ДополнительныеПараметры -> (структура)
Определяет дополнительные параметры подключения.
ОграниченноеРазмер -> (длинное целое число)
ОграниченноеФайлы -> (длинное целое число)
S3CsvSource -> (структура)
Определяет хранилище данных с разделителями (CSV), хранящееся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ТипСжатия -> (строка)
"gzip" и "bzip").Исключения -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
РазмерГруппы -> (строка)
"groupFiles" в значение "inPartition", чтобы это имело эффект.ФайлыГруппы -> (строка)
"none".Рекурсия -> (логическое значение)
МаксимальнаяГруппа -> (целое число)
МаксимальноеКоличествоФайловВГруппе -> (целое число)
ДополнительныеПараметры -> (структура)
Определяет дополнительные параметры подключения.
ОграниченныйРазмер -> (длинное целое число)
ОграниченноеКоличествоФайлов -> (длинное целое число)
ВключитьПримерныйПуть -> (логическое значение)
ПримерныйПуть -> (строка)
Разделитель -> (строка)
СимволЭкранирования -> (строка)
none. Если включен, символ, который следует за ним, используется как есть, за исключением небольшого набора известных экранирований (\n, \r, \t и \0).СимволКавычек -> (строка)
'"'. Установите это значение в -1, чтобы полностью отключить кавычки.Многострочный -> (логическое значение)
False, что позволяет более агрессивно разбивать файлы во время разбора.СЗаголовком -> (логическое значение)
False.НаписатьЗаголовок -> (логическое значение)
True.ПропуститьПервуюСтроку -> (логическое значение)
False.ОптимизироватьПроизводительность -> (логическое значение)
СхемыВывода -> (список)
Определяет схему данных для источника CSV S3.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3ExcelSource -> (структура)
Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.
Имя -> (строка)
Пути -> (список)
Пути S3, где находятся файлы Excel.
(строка)
ТипСжатия -> (строка)
Исключения -> (список)
Шаблоны для исключения определенных файлов или путей из обработки.
(строка)
РазмерГруппы -> (строка)
ФайлыГруппы -> (строка)
Рекурсия -> (логическое значение)
МаксимальнаяГруппа -> (целое число)
МаксимальноеКоличествоФайловВГруппе -> (целое число)
ДополнительныеПараметры -> (структура)
Дополнительные параметры конфигурации для обработки прямых источников S3.
ОграниченныйРазмер -> (длинное целое число)
ОграниченноеКоличествоФайлов -> (длинное целое число)
ВключитьПримерныйПуть -> (логическое значение)
ПримерныйПуть -> (строка)
КоличествоСтрок -> (длинное целое число)
ПропуститьПодвал -> (целое число)
СхемыВывода -> (список)
Схемы AWS Glue, которые следует применить к обработанным данным.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3JsonSource -> (структура)
Определяет хранилище JSON-данных, хранящееся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ТипСжатия -> (строка)
"gzip" и "bzip").Исключения -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
РазмерГруппы -> (строка)
"groupFiles" в значение "inPartition", чтобы это имело эффект.ФайлыГруппы -> (строка)
"none".Рекурсия -> (логическое значение)
МаксимальнаяГруппа -> (целое число)
МаксимальноеКоличествоФайловВГруппе -> (целое число)
ДополнительныеПараметры -> (структура)
Определяет дополнительные параметры подключения.
ОграниченныйРазмер -> (длинное целое число)
ОграниченноеКоличествоФайлов -> (длинное целое число)
ВключитьПримерныйПуть -> (логическое значение)
ПримерныйПуть -> (строка)
JsonPath -> (строка)
Многострочный -> (логическое значение)
False, что позволяет более агрессивно разбивать файлы во время разбора.СхемыВывода -> (список)
Определяет схему данных для источника JSON S3.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
S3ParquetSource -> (структура)
Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.
Имя -> (строка)
Пути -> (список)
Список путей Amazon S3 для чтения.
(строка)
ТипСжатия -> (строка)
"gzip" и "bzip").Исключения -> (список)
Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.
(строка)
РазмерГруппы -> (строка)
"groupFiles" в значение "inPartition", чтобы это имело эффект.ФайлыГруппы -> (строка)
"none".Рекурсивно -> (булево)
МаксимальнаяПолоса -> (целое число)
МаксимальноеКоличествоФайловВПолосе -> (целое число)
ДополнительныеПараметры -> (структура)
Указывает дополнительные параметры подключения.
ОграниченныйРазмер -> (длинное целое число)
ОграниченноеКоличествоФайлов -> (длинное целое число)
ВключитьОбразецПути -> (булево)
ОбразецПути -> (строка)
СхемыВывода -> (список)
Указывает схему данных для источника S3 Parquet.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
ИсточникКаталогаОтношений -> (структура)
Указывает хранилище данных реляционного каталога в Glue Data Catalog.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
ИсточникКаталогаDynamoDB -> (структура)
Указывает хранилище данных DynamoDBC Catalog в Glue Data Catalog.
Имя -> (строка)
БазаДанных -> (строка)
Таблица -> (строка)
JDBCConnectorTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в колончатом хранилище Apache Parquet.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
ИмяПодключения -> (строка)
ТаблицаПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для целевого объекта JDBC.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkConnectorTarget -> (структура)
Указывает целевой объект, использующий соединитель Apache Spark.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
ИмяПодключения -> (строка)
ИмяСоединителя -> (строка)
ТипПодключения -> (строка)
ДополнительныеПараметры -> (карта)
Дополнительные параметры подключения для соединителя.
ключ -> (строка)
значение -> (строка)
СхемыВывода -> (список)
Указывает схему данных для пользовательской Spark-цели.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Столбцы -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
CatalogTarget -> (структура)
Указывает целевой объект, использующий таблицу Glue Data Catalog.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
КлючиРазделения -> (список)
Ключи разделения, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.
(список)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTarget -> (структура)
Указывает целевой объект, использующий Amazon Redshift.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
БазаДанных -> (строка)
Таблица -> (строка)
RedshiftTmpDir -> (строка)
TmpDirIAMRole -> (строка)
UpsertRedshiftOptions -> (структура)
Набор параметров для настройки операции upsert при записи в целевой объект Redshift.
РасположениеТаблицы -> (строка)
ИмяПодключения -> (строка)
КлючиUpsert -> (список)
Ключи, используемые для определения, нужно ли выполнить обновление или вставку.
(строка)
S3CatalogTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 с использованием Glue Data Catalog.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
КлючиРазделения -> (список)
Указывает нативное разделение с помощью последовательности ключей.
(список)
Таблица -> (строка)
БазаДанных -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для программы-скроллера.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
S3GlueParquetTarget -> (структура)
Указывает целевой объект данных, который записывает в Amazon S3 в колончатом хранилище Apache Parquet.
Имя -> (строка)
Входы -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
КлючиРазделения -> (список)
Указывает нативное разделение с помощью последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").КоличествоЦелевыхРазделов -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для программы-скроллера.
ВключитьОбновлениеКаталога -> (булево)
ПоведениеОбновления -> (строка)
Таблица -> (строка)
БазаДанных -> (строка)
S3HyperDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.
Name -> (строка)
Inputs -> (список)
Указывает источник входных данных для целевого объекта HyperDirect.
(строка)
PartitionKeys -> (список)
Определяет стратегию разбиения выходных данных.
(список)
Path -> (строка)
Compression -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы во время операций записи.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
S3DirectTarget -> (структура)
Указывает целевой объект данных, записывающий данные в Amazon S3.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся источниками данных для целевого объекта.
(строка)
PartitionKeys -> (список)
Указывает внутреннее разбиение с помощью последовательности ключей.
(список)
Path -> (строка)
Compression -> (строка)
"gzip" и "bzip".NumberTargetPartitions -> (строка)
Format -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для средства извлечения данных.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
S3IcebergDirectTarget -> (структура)
Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.
Name -> (строка)
Inputs -> (список)
Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.
(строка)
PartitionKeys -> (список)
Указывает столбцы, используемые для разбиения данных таблицы Iceberg в S3.
(список)
Path -> (строка)
Format -> (строка)
AdditionalOptions -> (карта)
Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
Compression -> (строка)
NumberTargetPartitions -> (строка)
ApplyMapping -> (структура)
Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте. Можно переименовывать ключи, изменять типы данных ключей и выбирать, какие ключи нужно удалить из набора данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Mapping -> (список)
Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте.
(структура)
Указывает сопоставление ключей свойств данных.
ToKey -> (строка)
FromPath.FromPath -> (список)
Таблица или столбец, подлежащие изменению.
(строка)
FromType -> (строка)
ToType -> (строка)
Dropped -> (булево)
Children -> (список)
Применимо только к вложенным структурам данных. Если нужно изменить родительскую структуру, а также одного из её потомков, можно заполнить эту структуру данных. Также Mapping, но её FromPath будет родительским FromPath плюс FromPath из этой структуры.
Для части children, предположим, что у вас есть структура:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }Можно указать Mapping, который выглядит так:
{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }(структура)
Указывает сопоставление ключей свойств данных.
ToKey -> (строка)
FromPath.FromPath -> (список)
Таблица или столбец, подлежащие изменению.
(строка)
FromType -> (строка)
ToType -> (строка)
Dropped -> (булево)
SelectFields -> (структура)
Указывает преобразование, которое выбирает ключи свойств данных, которые необходимо сохранить.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Paths -> (список)
Путь JSON к переменной в структуре данных.
(список)
DropFields -> (структура)
Указывает преобразование, которое выбирает ключи свойств данных, которые необходимо удалить.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Paths -> (список)
Путь JSON к переменной в структуре данных.
(список)
RenameField -> (структура)
Указывает преобразование, которое переименовывает один ключ свойства данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
SourcePath -> (список)
Путь JSON к переменной в структуре данных для исходных данных.
(строка)
TargetPath -> (список)
Путь JSON к переменной в структуре данных для целевых данных.
(строка)
Spigot -> (структура)
Указывает преобразование, которое записывает выборки данных в ведро Amazon S3.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Path -> (строка)
Topk -> (целое число)
Prob -> (двойное)
Join -> (структура)
Указывает преобразование, которое объединяет два набора данных в один набор данных с помощью сравнения по указанным ключам свойств данных. Можно использовать внутренние, внешние, левые, правые, левые полуобъединения и левые антиобъединения.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
JoinType -> (строка)
Columns -> (список)
Список двух столбцов, подлежащих объединению.
(структура)
Указывает столбец, подлежащий объединению.
From -> (строка)
Keys -> (список)
Ключ столбца, подлежащего объединению.
(список)
SplitFields -> (структура)
Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой коллекцию DynamicFrames: одну с выбранными ключами свойств данных и одну с оставшимися ключами свойств данных.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Paths -> (список)
Путь JSON к переменной в структуре данных.
(список)
SelectFromCollection -> (структура)
Указывает преобразование, которое выбирает один DynamicFrame из коллекции DynamicFrames. Выход — выбранный DynamicFrame.
Name -> (строка)
Inputs -> (список)
Входы данных, идентифицированные по их именам узлов.
(строка)
Index -> (целое число)
FillMissingValues -> (структура)
Определяет преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определяемым с помощью импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.
Имя -> (строка)
Входы -> (список)
Входы данных, определенные по их именам узлов.
(строка)
ПутьИмпутации -> (строка)
ПутьЗаполнения -> (строка)
Фильтр -> (структура)
Определяет преобразование, которое разбивает набор данных на два, на основе условия фильтра.
Имя -> (строка)
Входы -> (список)
Входы данных, определенные по их именам узлов.
(строка)
ЛогическийОператор -> (строка)
Фильтры -> (список)
Определяет выражение фильтра.
(структура)
Определяет выражение фильтра.
Операция -> (строка)
Отрицание -> (булево)
Значения -> (список)
Список значений фильтра.
(структура)
Представляет одну запись в списке значений для FilterExpression .
Тип -> (строка)
Значение -> (список)
Значение, которое нужно связать.
(строка)
ПользовательскийКод -> (структура)
Определяет преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Результатом является коллекция DynamicFrames.
Имя -> (строка)
Входы -> (список)
Входы данных, определенные по их именам узлов.
(строка)
Код -> (строка)
ИмяКласса -> (строка)
СхемыВывода -> (список)
Определяет схему данных для преобразования пользовательского кода.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, которые составляют схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
SparkSQL -> (структура)
Определяет преобразование, где вы вводите SQL-запрос, используя синтаксис Spark SQL для преобразования данных. Результатом является один DynamicFrame .
Имя -> (строка)
Входы -> (список)
Входы данных, определенные по их именам узлов. Вы можете связать имя таблицы с каждым узлом входа для использования в SQL-запросе. Выбранное вами имя должно соответствовать ограничениям именования Spark SQL.
(строка)
SqlQuery -> (строка)
SqlAliases -> (список)
Список псевдонимов. Псевдоним позволяет указать, какое имя использовать в SQL для данного входа. Например, у вас есть источник данных с именем «MyDataSource». Если вы укажете From как MyDataSource, и Alias как SqlName, то в вашем SQL вы можете сделать:
select * from SqlNameи это получит данные из MyDataSource.
(структура)
Представляет одну запись в списке значений для SqlAliases .
От -> (строка)
Псевдоним -> (строка)
СхемыВывода -> (список)
Определяет схему данных для преобразования SparkSQL.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Столбцы -> (список)
Определяет определения столбцов, которые составляют схему Glue.
(структура)
Определяет один столбец в определении схемы Glue.
Имя -> (строка)
Тип -> (строка)
DirectKinesisSource -> (структура)
Определяет прямой источник данных Amazon Kinesis.
Имя -> (строка)
РазмерОкна -> (целое число)
ОбнаружениеСхемы -> (булево)
ПараметрыПотока -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
АдресЭндпоинта -> (строка)
ИмяПотока -> (строка)
Классификация -> (строка)
Разделитель -> (строка)
НачальнаяПозиция -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest" , "trim_horizon" , "earliest" или строка временной метки в формате UTC в формате yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию — "latest" .
Примечание: Использование значения, являющегося строкой временной метки в формате UTC, для «начальной позиции», поддерживается только для версии Glue 4.0 и выше.
МаксимальноеВремяОбработкиВМиллисекундах -> (длинное целое число)
GetRecords API-вызовов. Значение по умолчанию — 1000 .МаксимальноеКоличествоЗаписейВСегменте -> (длинное целое число)
MaxFetchRecordsPerShard требует строгости, то оно должно быть кратно MaxRecordPerRead . Значение по умолчанию — 100000 .МаксимальноеКоличествоЗаписейВЧтении -> (длинное целое число)
10000 .ДобавитьВремяПростояМеждуЧтениями -> (булево)
"False" . Этот параметр настраивается только для версии Glue 2.0 и выше.ВремяПростояМеждуЧтениямиВМиллисекундах -> (длинное целое число)
1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.ИнтервалОписанияСегментов -> (длинное целое число)
1s .КоличествоПовторныхПопыток -> (целое число)
3 .ИнтервалПовторныхПопытокВМиллисекундах -> (длинное целое число)
1000 .МаксимальныйИнтервалПовторныхПопытокВМиллисекундах -> (длинное целое число)
10000 .ИзбегатьПустыхПакетов -> (булево)
"False" .StreamArn -> (строка)
RoleArn -> (строка)
"awsSTSSessionName" .RoleSessionName -> (строка)
"awsSTSRoleARN" .ДобавитьВременнуюМеткуЗаписи -> (строка)
ВыводитьМетрикиЗадержкиПотребителя -> (строка)
НачальнаяВременнаяМетка -> (временная метка)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).ПараметрыПредварительногоПросмотраДанных -> (структура)
Дополнительные параметры для предварительного просмотра данных.
ВремяОпроса -> (длинное целое число)
ОграничениеОпросаЗаписей -> (длинное целое число)
DirectKafkaSource -> (структура)
Определяет хранилище данных Apache Kafka.
Имя -> (строка)
ПараметрыПотоковойПередачи -> (структура)
Определяет параметры потоковой передачи.
BootstrapServers -> (строка)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (строка)
"SSL" или "PLAINTEXT".ИмяСоединения -> (строка)
ИмяТемы -> (строка)
"topicName", "assign" или "subscribePattern".Присвоение -> (строка)
TopicPartitions для потребления. Вы должны указать хотя бы одно из "topicName", "assign" или "subscribePattern".ШаблонПодписки -> (строка)
"topicName", "assign" или "subscribePattern".Классификация -> (строка)
Разделитель -> (строка)
НачальныеСмещения -> (строка)
"earliest" или "latest". Значение по умолчанию: "latest".КонечныеСмещения -> (строка)
"latest", либо строка JSON, которая определяет конечное смещение для каждого TopicPartition.ВремяОжиданияОбработкиМс -> (длинное целое число)
512.КоличествоПовторныхПопыток -> (целое число)
3.ИнтервалПовторнойПопыткиМс -> (длинное целое число)
10.МаксимальноеСмещениеНаТриггер -> (длинное целое число)
topicPartitions различных объемов. Значение по умолчанию: null, что означает, что потребитель считывает все смещения до известного последнего смещения.МинимальноеКоличествоРазделов -> (целое число)
ВключатьЗаголовки -> (логическое значение)
Array[Struct(key: String, value: String)]. Значение по умолчанию: «false». Этот параметр доступен только в версии Glue 3.0 и выше.ДобавитьМаркерВремениЗаписи -> (строка)
ИспользоватьМетрикиОжиданияПотребителя -> (строка)
НачальноеВремя -> (маркер времени)
Маркер времени записи в теме Kafka для начала чтения данных. Возможные значения: строка маркера времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).
Только один из StartingTimestamp или StartingOffsets должен быть установлен.
РазмерОкна -> (целое число)
ОбнаружениеСхемы -> (логическое значение)
ПараметрыПредварительногоПросмотраДанных -> (структура)
Определяет параметры, связанные с предварительным просмотром данных для просмотра образца ваших данных.
ВремяОпроса -> (длинное целое число)
ПределОпросаЗаписей -> (длинное целое число)
ИсточникKinesisВКаталоге -> (структура)
Определяет источник данных Kinesis в каталоге данных Glue.
Имя -> (строка)
РазмерОкна -> (целое число)
ОбнаружениеСхемы -> (логическое значение)
Таблица -> (строка)
БазаДанных -> (строка)
ПараметрыПотоковойПередачи -> (структура)
Дополнительные параметры для источника потоковых данных Kinesis.
UrlКонтроллера -> (строка)
ИмяПотока -> (строка)
Классификация -> (строка)
Разделитель -> (строка)
НачальнаяПозиция -> (строка)
Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения: "latest", "trim_horizon", "earliest" или строка маркера времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию: "latest".
Примечание: Использование значения, являющегося строкой маркера времени в формате UTC для «начальной позиции», поддерживается только для версии Glue 4.0 или выше.
МаксимальноеВремяОбработкиМс -> (длинное целое число)
GetRecords вызовов API. Значение по умолчанию: 1000.МаксимальноеКоличествоЗаписейНаРаздел -> (длинное целое число)
MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратным MaxRecordPerRead. Значение по умолчанию: 100000.МаксимальноеКоличествоЗаписейНаЧтение -> (длинное целое число)
10000.ДобавитьВремяПростояМеждуЧтениями -> (логическое значение)
"False". Этот параметр настраивается только для версии Glue 2.0 и выше.ВремяПростояМеждуЧтениямиМс -> (длинное целое число)
1000. Этот параметр настраивается только для версии Glue 2.0 и выше.ИнтервалОписанияРаздела -> (длинное целое число)
1s.КоличествоПовторныхПопыток -> (целое число)
3.ИнтервалПовторнойПопыткиМс -> (длинное целое число)
1000.МаксимальныйИнтервалПовторнойПопыткиМс -> (длинное целое число)
10000.ИзбегатьПустыхПакет -> (логическое значение)
"False".ArnПотока -> (строка)
ArnРоли -> (строка)
"awsSTSSessionName".ИмяСессииРоли -> (строка)
"awsSTSRoleARN".ДобавитьМаркерВремениЗаписи -> (строка)
ИспользоватьМетрикиОжиданияПотребителя -> (строка)
НачальноеВремя -> (маркер времени)
yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).ПараметрыПредварительногоПросмотраДанных -> (структура)
Дополнительные параметры для предварительного просмотра данных.
ВремяОпроса -> (длинное целое число)
ПределОпросаЗаписей -> (длинное целое число)
ИсточникKafkaВКаталоге -> (структура)
Указывает хранилище данных Apache Kafka в каталоге данных.
Name -> (string)
WindowSize -> (integer)
DetectSchema -> (boolean)
Table -> (string)
Database -> (string)
StreamingOptions -> (structure)
Указывает параметры потоковой передачи.
BootstrapServers -> (string)
b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.SecurityProtocol -> (string)
"SSL" или "PLAINTEXT".ConnectionName -> (string)
TopicName -> (string)
"topicName", "assign" или "subscribePattern".Assign -> (string)
TopicPartitions для потребления. Необходимо указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".SubscribePattern -> (string)
"topicName", "assign" или "subscribePattern".Classification -> (string)
Delimiter -> (string)
StartingOffsets -> (string)
"earliest" или "latest". Значение по умолчанию — "latest".EndingOffsets -> (string)
"latest", либо строка JSON, которая определяет конечную позицию для каждого TopicPartition.PollTimeoutMs -> (long)
512.NumRetries -> (integer)
3.RetryIntervalMs -> (long)
10.MaxOffsetsPerTrigger -> (long)
topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель считывает все смещения до известного последнего смещения.MinPartitions -> (integer)
IncludeHeaders -> (boolean)
Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и более поздних.AddRecordTimestamp -> (string)
EmitConsumerLagMetrics -> (string)
StartingTimestamp -> (timestamp)
Отметка времени записи в теме Kafka для начала чтения данных. Возможные значения — строка даты и времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z обозначает смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).
Только один из параметров StartingTimestamp или StartingOffsets должен быть установлен.
DataPreviewOptions -> (structure)
Указывает параметры, связанные с предварительным просмотром данных для просмотра выборки ваших данных.
PollingTime -> (long)
RecordPollingLimit -> (long)
DropNullFields -> (structure)
Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает null-объекты, но некоторые значения, такие как пустые строки, строки, являющиеся «null», целочисленные значения -1 или другие заполнитель, такие как нули, не распознаются автоматически как null.
Name -> (string)
Inputs -> (list)
Вводные данные, определяемые по именам узлов.
(string)
NullCheckBoxList -> (structure)
Структура, представляющая, считаются ли определённые значения как null-значения для удаления.
IsEmpty -> (boolean)
IsNullString -> (boolean)
IsNegOne -> (boolean)
NullTextList -> (list)
Структура, указывающая список NullValueField структур, представляющих пользовательское null-значение, например, ноль или другое значение, используемое в качестве null-заполнителя, уникального для набора данных.
Преобразование DropNullFields удаляет пользовательские null-значения только если значение null-заполнителя и тип данных совпадают с данными.
(structure)
Представляет пользовательское null-значение, такое как нули или другое значение, используемое в качестве null-заполнителя, уникального для набора данных.
Value -> (string)
Datatype -> (structure)
Тип данных значения.
Id -> (string)
Label -> (string)
Merge -> (structure)
Указывает преобразование, которое объединяет DynamicFrame с эталонным DynamicFrame на основе указанных первичных ключей для идентификации записей. Дублирующие записи (записи с одинаковыми первичными ключами) не удаляются.
Name -> (string)
Inputs -> (list)
Вводные данные, определяемые по именам узлов.
(string)
Source -> (string)
DynamicFrame, который будет объединён с эталонным DynamicFrame.PrimaryKeys -> (list)
Список полей первичного ключа для сопоставления записей из исходной и эталонной динамических рамок.
(list)
Union -> (structure)
Указывает преобразование, объединяющее строки из двух или более наборов данных в один результат.
Name -> (string)
Inputs -> (list)
Входящие идентификаторы узлов для преобразования.
(string)
UnionType -> (string)
Указывает тип преобразования Union.
Укажите ALL, чтобы объединить все строки из источников данных в результирующей DynamicFrame. Результирующее объединение не удаляет дублирующие строки.
Укажите DISTINCT, чтобы удалить дублирующие строки в результирующей DynamicFrame.
PIIDetection -> (structure)
Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.
Name -> (string)
Inputs -> (list)
Входящие идентификаторы узлов для преобразования.
(string)
PiiType -> (string)
EntityTypesToDetect -> (list)
Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.
Сущности типа PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE
(string)
OutputColumnName -> (string)
SampleFraction -> (double)
ThresholdFraction -> (double)
MaskValue -> (string)
Aggregate -> (structure)
Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по указанной функции.
Name -> (string)
Inputs -> (list)
Указывает поля и строки, которые будут использованы в качестве входных данных для преобразования агрегирования.
(string)
Groups -> (list)
Указывает поля для группировки.
(list)
Aggs -> (list)
Указывает агрегирующие функции, которые будут выполняться над указанными полями.
(structure)
Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании агрегирования.
Column -> (list)
Указывает столбец в наборе данных, к которому будет применена функция агрегирования.
(string)
AggFunc -> (string)
Указывает функцию агрегирования.
Возможные функции агрегирования включают: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop
DropDuplicates -> (structure)
Указывает преобразование, которое удаляет повторяющиеся строки данных из набора данных.
Name -> (string)
Inputs -> (list)
Вводные данные, определяемые по именам узлов.
(string)
Columns -> (list)
Имя столбцов, которые будут объединены или удалены, если повторяются.
(list)
GovernedCatalogTarget -> (structure)
Указывает целевой объект данных, который записывает в управляемый каталог.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение обновления для управляемого каталога.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
GovernedCatalogSource -> (структура)
Указывает источник данных в управляемом каталоге данных.
Name -> (строка)
Database -> (строка)
Table -> (строка)
PartitionPredicate -> (строка)
"" — по умолчанию пусто.AdditionalOptions -> (структура)
Указывает дополнительные параметры подключения.
BoundedSize -> (целое)
BoundedFiles -> (целое)
MicrosoftSQLServerCatalogSource -> (структура)
Указывает источник данных Microsoft SQL Server в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
MySQLCatalogSource -> (структура)
Указывает источник данных MySQL в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
OracleSQLCatalogSource -> (структура)
Указывает источник данных Oracle в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
PostgreSQLCatalogSource -> (структура)
Указывает источник данных PostgresSQL в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
MicrosoftSQLServerCatalogTarget -> (структура)
Указывает целевой объект, использующий Microsoft SQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
MySQLCatalogTarget -> (структура)
Указывает целевой объект, использующий MySQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
OracleSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Oracle SQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
PostgreSQLCatalogTarget -> (структура)
Указывает целевой объект, использующий Postgres SQL.
Name -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
Database -> (строка)
Table -> (строка)
DynamicTransform -> (структура)
Указывает пользовательскую визуальную трансформацию, созданную пользователем.
Name -> (строка)
TransformName -> (строка)
Inputs -> (список)
Указывает входные данные для динамической трансформации, которые необходимы.
(строка)
Parameters -> (список)
Указывает параметры динамической трансформации.
(структура)
Указывает параметры в файле конфигурации динамической трансформации.
Name -> (строка)
Type -> (строка)
ValidationRule -> (строка)
ValidationMessage -> (строка)
Value -> (список)
Указывает значение параметра в файле конфигурации динамической трансформации.
(строка)
ListType -> (строка)
IsOptional -> (булево)
FunctionName -> (строка)
Path -> (строка)
Version -> (строка)
OutputSchemas -> (список)
Указывает схему данных для динамической трансформации.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
EvaluateDataQuality -> (структура)
Указывает критерии оценки качества данных.
Name -> (строка)
Inputs -> (список)
Входы вашей оценки качества данных.
(строка)
Ruleset -> (строка)
Output -> (строка)
PublishingOptions -> (структура)
Параметры для настройки публикации результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
StopJobOnFailureOptions -> (структура)
Параметры для настройки остановки работы, если оценка качества данных завершается неудачей.
StopJobOnFailureTiming -> (строка)
S3CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalHudiOptions -> (словарь)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
CatalogHudiSource -> (структура)
Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalHudiOptions -> (словарь)
Указывает дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Указывает схему данных для источника Hudi.
(структура)
Указывает определяемую пользователем схему, когда Glue не может определить схему.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3HudiSource -> (структура)
Определяет источник данных Hudi, хранящийся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
AdditionalHudiOptions -> (карта)
Определяет дополнительные параметры подключения.
key -> (строка)
value -> (строка)
AdditionalOptions -> (структура)
Определяет дополнительные параметры для коннектора.
BoundedSize -> (целое число)
BoundedFiles -> (целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
OutputSchemas -> (список)
Определяет схему данных для источника Hudi.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3HudiCatalogTarget -> (структура)
Определяет целевой объект для записи в источник данных Hudi в каталоге данных Glue.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными данными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Определяет нативное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
AdditionalOptions -> (карта)
Определяет дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, определяющая поведение обновления для программы-обработчика.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
S3HudiDirectTarget -> (структура)
Определяет целевой объект для записи в источник данных Hudi в Amazon S3.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными данными для целевого объекта данных.
(строка)
Path -> (строка)
Compression -> (строка)
"gzip" и "bzip").NumberTargetPartitions -> (строка)
PartitionKeys -> (список)
Определяет нативное разбиение с помощью последовательности ключей.
(список)
Format -> (строка)
AdditionalOptions -> (карта)
Определяет дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, определяющая поведение обновления для программы-обработчика.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Table -> (строка)
Database -> (строка)
DirectJDBCSource -> (структура)
Определяет подключение прямого источника JDBC.
Name -> (строка)
Database -> (строка)
Table -> (строка)
ConnectionName -> (строка)
ConnectionType -> (строка)
RedshiftTmpDir -> (строка)
S3CatalogDeltaSource -> (структура)
Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalDeltaOptions -> (карта)
Определяет дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Определяет схему данных для источника Delta Lake.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
CatalogDeltaSource -> (структура)
Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue.
Name -> (строка)
Database -> (строка)
Table -> (строка)
AdditionalDeltaOptions -> (карта)
Определяет дополнительные параметры подключения.
key -> (строка)
value -> (строка)
OutputSchemas -> (список)
Определяет схему данных для источника Delta Lake.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3DeltaSource -> (структура)
Определяет источник данных Delta Lake, хранящийся в Amazon S3.
Name -> (строка)
Paths -> (список)
Список путей Amazon S3 для чтения.
(строка)
AdditionalDeltaOptions -> (карта)
Определяет дополнительные параметры подключения.
key -> (строка)
value -> (строка)
AdditionalOptions -> (структура)
Определяет дополнительные параметры для коннектора.
BoundedSize -> (целое число)
BoundedFiles -> (целое число)
EnableSamplePath -> (булево)
SamplePath -> (строка)
OutputSchemas -> (список)
Определяет схему данных для источника Delta Lake.
(структура)
Определяет пользовательскую схему, когда Glue не может определить схему.
Columns -> (список)
Определяет определения столбцов, составляющие схему Glue.
(структура)
Определяет отдельный столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
S3DeltaCatalogTarget -> (структура)
Определяет целевой объект для записи в источник данных Delta Lake в каталоге данных Glue.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными данными для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Определяет нативное разбиение с помощью последовательности ключей.
(список)
Table -> (строка)
Database -> (строка)
AdditionalOptions -> (карта)
Определяет дополнительные параметры подключения для коннектора.
key -> (строка)
value -> (строка)
SchemaChangePolicy -> (структура)
Политика, определяющая поведение обновления для программы-обработчика.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
S3DeltaDirectTarget -> (структура)
Указывает целевой объект, который записывает данные в источник Delta Lake в Amazon S3.
Имя -> (строка)
Входы -> (список)
Узлы, которые являются входами для целевого объекта данных.
(строка)
PartitionKeys -> (список)
Указывает нативное разбиение по последовательности ключей.
(список)
Путь -> (строка)
Сжатие -> (строка)
"gzip" и "bzip").NumberTargetPartitions -> (строка)
Формат -> (строка)
Дополнительные параметры -> (словарь)
Указывает дополнительные параметры подключения для коннектора.
ключ -> (строка)
значение -> (строка)
SchemaChangePolicy -> (структура)
Политика, которая определяет поведение при обновлении для сканера.
EnableUpdateCatalog -> (булево)
UpdateBehavior -> (строка)
Таблица -> (строка)
База данных -> (строка)
AmazonRedshiftSource -> (структура)
Указывает целевой объект, который записывает данные в источник данных в Amazon Redshift.
Имя -> (строка)
Данные -> (структура)
Указывает данные узла источника Amazon Reshift.
Тип доступа -> (строка)
Тип источника -> (строка)
Подключение -> (структура)
Подключение Glue к кластеру Redshift.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Схема -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Таблица -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
CatalogDatabase -> (структура)
Имя базы данных каталога данных Glue при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
CatalogTable -> (структура)
Имя таблицы каталога данных Glue при работе с каталогом данных.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
CatalogRedshiftSchema -> (строка)
CatalogRedshiftTable -> (строка)
Временная папка -> (строка)
IamRole -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. При оставлении пустым, роль IAM будет по умолчанию соответствовать роли в задаче.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
Дополнительные параметры -> (список)
Необязательные значения при подключении к кластеру Redshift.
(структура)
Указывает необязательное значение при подключении к кластеру Redshift.
Ключ -> (строка)
Значение -> (строка)
Образец запроса -> (строка)
Действие перед -> (строка)
Действие после -> (строка)
Действие -> (строка)
Префикс таблицы -> (строка)
Upsert -> (булево)
Действие merge -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
MergeClause -> (строка)
CrawlerConnection -> (строка)
TableSchema -> (список)
Массив выходных данных схемы для данного узла.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
StagingTable -> (строка)
SelectedColumns -> (список)
Список имён столбцов, используемых для определения совпадения записи при MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Значение -> (строка)
Метка -> (строка)
Описание -> (строка)
AmazonRedshiftTarget -> (структура)
Определяет целевой объект, который записывает данные в целевой объект Amazon Redshift.
Name -> (строка)
Data -> (структура)
Определяет данные узла целевого объекта Amazon Redshift.
AccessType -> (строка)
SourceType -> (строка)
Connection -> (структура)
Подключение Glue к кластеру Redshift.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (структура)
Имя схемы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Table -> (структура)
Имя таблицы Redshift при работе с прямым подключением.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogDatabase -> (структура)
Имя базы данных каталога данных Glue при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogTable -> (структура)
Имя таблицы каталога данных Glue при работе с каталогом данных.
Value -> (строка)
Label -> (строка)
Description -> (строка)
CatalogRedshiftSchema -> (строка)
CatalogRedshiftTable -> (строка)
TempDir -> (строка)
IamRole -> (структура)
Необязательно. Имя роли, используемой при подключении к S3. Если поле пустое, роль IAM будет по умолчанию взята из роли задания.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdvancedOptions -> (список)
Необязательные значения при подключении к кластеру Redshift.
(структура)
Указывает необязательное значение при подключении к кластеру Redshift.
Key -> (строка)
Value -> (строка)
SampleQuery -> (строка)
PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
TablePrefix -> (строка)
Upsert -> (булево)
MergeAction -> (строка)
MergeWhenMatched -> (строка)
MergeWhenNotMatched -> (строка)
MergeClause -> (строка)
CrawlerConnection -> (строка)
TableSchema -> (список)
Массив выходных схем для заданного узла.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
StagingTable -> (строка)
SelectedColumns -> (список)
Список имен столбцов, используемых для определения совпадения записей при выполнении MERGE или APPEND с upsert.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для целевого объекта данных.
(строка)
EvaluateDataQualityMultiFrame -> (структура)
Определяет критерии оценки качества данных. Поддерживает несколько входных данных и возвращает набор динамических кадров.
Name -> (строка)
Inputs -> (список)
Входы для оценки качества данных. Первый вход в этом списке — основной источник данных.
(строка)
AdditionalDataSources -> (карта)
Псевдонимы всех источников данных, кроме основного.
key -> (строка)
value -> (строка)
Ruleset -> (строка)
PublishingOptions -> (структура)
Параметры для настройки публикации результатов.
EvaluationContext -> (строка)
ResultsS3Prefix -> (строка)
CloudWatchMetricsEnabled -> (булево)
ResultsPublishingEnabled -> (булево)
AdditionalOptions -> (карта)
Параметры для настройки поведения преобразования во время выполнения.
key -> (строка)
value -> (строка)
StopJobOnFailureOptions -> (структура)
Параметры для настройки остановки задания при сбое оценки качества данных.
StopJobOnFailureTiming -> (строка)
Recipe -> (структура)
Определяет узел рецепта Glue DataBrew.
Name -> (строка)
Inputs -> (список)
Узлы, являющиеся входными для узла рецепта, определены по id.
(строка)
RecipeReference -> (структура)
Ссылка на рецепт DataBrew, используемый узлом.
RecipeArn -> (строка)
RecipeVersion -> (строка)
RecipeSteps -> (список)
Шаги преобразования, используемые в узле рецепта.
(структура)
Шаг рецепта, используемый в узле подготовки данных рецепта Glue Studio.
Action -> (структура)
Действие преобразования шага рецепта.
Operation -> (строка)
Parameters -> (карта)
Параметры действия рецепта.
key -> (строка)
value -> (строка)
ConditionExpressions -> (список)
Условные выражения для шага рецепта.
(структура)
Условное выражение, определенное в узле подготовки данных рецепта Glue Studio.
Condition -> (строка)
Value -> (строка)
TargetColumn -> (строка)
SnowflakeSource -> (структура)
Определяет источник данных Snowflake.
Name -> (строка)
Data -> (структура)
Настройка источника данных Snowflake.
SourceType -> (строка)
"table" , "query" .Connection -> (структура)
Указывает соединение Glue Data Catalog с конечной точкой Snowflake.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (строка)
Table -> (строка)
Database -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdditionalOptions -> (массив)
Указывает дополнительные параметры, передаваемые соединителю Snowflake. Если параметры указаны в другом месте на этом узле, эти параметры будут иметь приоритет.
key -> (строка)
value -> (строка)
SampleQuery -> (строка)
query .PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Указывает поведение разрешения, когда строка уже существует. Если значение true, существующие строки будут обновлены. Если false, эти строки будут добавлены.MergeAction -> (строка)
simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если пользовательское, определяется MergeClause .MergeWhenMatched -> (строка)
update , delete .MergeWhenNotMatched -> (строка)
insert , none .MergeClause -> (строка)
StagingTable -> (строка)
merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table с помощью сгенерированного постдействия.SelectedColumns -> (список)
Указывает столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с value , label и description ключами. Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AutoPushdown -> (булево)
TableSchema -> (список)
Вручную определяет целевую схему для узла. Список структур с value , label и description ключами. Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
OutputSchemas -> (список)
Указывает определяемые пользователем схемы для выходных данных.
(структура)
Указывает определяемую пользователем схему, когда схему невозможно определить с помощью Glue.
Columns -> (список)
Указывает определения столбцов, составляющих схему Glue.
(структура)
Указывает один столбец в определении схемы Glue.
Name -> (строка)
Type -> (строка)
SnowflakeTarget -> (структура)
Указывает целевой объект, который записывает данные в источник данных Snowflake.
Name -> (строка)
Data -> (структура)
Указывает данные узла целевого объекта Snowflake.
SourceType -> (строка)
"table" , "query" .Connection -> (структура)
Указывает соединение Glue Data Catalog с конечной точкой Snowflake.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Schema -> (строка)
Table -> (строка)
Database -> (строка)
TempDir -> (строка)
IamRole -> (структура)
В настоящее время не используется.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AdditionalOptions -> (массив)
Указывает дополнительные параметры, передаваемые соединителю Snowflake. Если параметры указаны в другом месте на этом узле, эти параметры будут иметь приоритет.
key -> (строка)
value -> (строка)
SampleQuery -> (строка)
query .PreAction -> (строка)
PostAction -> (строка)
Action -> (строка)
append , merge , truncate , drop .Upsert -> (булево)
append . Указывает поведение разрешения, когда строка уже существует. Если значение true, существующие строки будут обновлены. Если false, эти строки будут добавлены.MergeAction -> (строка)
simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если пользовательское, определяется MergeClause .MergeWhenMatched -> (строка)
update , delete .MergeWhenNotMatched -> (строка)
insert , none .MergeClause -> (строка)
StagingTable -> (строка)
merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table с помощью сгенерированного постдействия.SelectedColumns -> (список)
Указывает столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с value , label и description ключами. Каждая структура описывает столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
AutoPushdown -> (булево)
TableSchema -> (список)
Вручную определяет целевую схему для узла. Список структур с value , label и description ключами. Каждая структура определяет столбец.
(структура)
Указывает значение параметра.
Value -> (строка)
Label -> (строка)
Description -> (строка)
Inputs -> (список)
Узлы, которые являются входными для целевого объекта данных.
(строка)
ConnectorDataSource -> (структура)
Указывает источник, сгенерированный со стандартными параметрами подключения.
Name -> (string)
ConnectionType -> (string)
connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Data -> (map)
Отображает параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.
key -> (string)
value -> (string)
OutputSchemas -> (list)
Указывает схему данных для этого источника.
(structure)
Указывает схему, определённую пользователем, когда Glue не может определить схему.
Columns -> (list)
Определяет определения столбцов, составляющих схему Glue.
(structure)
Определяет один столбец в определении схемы Glue.
Name -> (string)
Type -> (string)
ConnectorDataTarget -> (structure)
Указывает целевой объект, сгенерированный со стандартными параметрами подключения.
Name -> (string)
ConnectionType -> (string)
connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:
opensearchazuresqlazurecosmosbigquerysaphanateradatavertica
Data -> (map)
Отображает параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.
key -> (string)
value -> (string)
Inputs -> (list)
Узлы, являющиеся входными для целевого объекта данных.
(string)
ExecutionClass -> (string)
Указывает, выполняется ли задача со стандартным или гибким классом выполнения. Стандартный класс выполнения подходит для задач с жёсткими временными ограничениями, требующих быстрого запуска задачи и выделенных ресурсов.
Гибкий класс выполнения подходит для задач, не зависящих от времени, время начала и окончания которых может варьироваться.
Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для задач Spark.
SourceControlDetails -> (structure)
Подробности для конфигурации управления исходным кодом для задачи, позволяющие синхронизировать артефакты задачи с удалённым репозиторием или из него.
Provider -> (string)
Repository -> (string)
Owner -> (string)
Branch -> (string)
Folder -> (string)
LastCommitId -> (string)
AuthStrategy -> (string)
AuthToken -> (string)
MaintenanceWindow -> (string)
Это поле определяет день недели и час для окна технического обслуживания для потоковых задач. Glue периодически выполняет задачи технического обслуживания. Во время этих окон технического обслуживания Glue потребуется перезапустить ваши потоковые задачи.
Glue перезапустит задачу в течение 3 часов от указанного окна технического обслуживания. Например, если вы настроили окно технического обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.
ProfileName -> (string)
NextToken -> (string)
© Copyright 2025, Amazon Web Services. Created using Sphinx.