Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

get-jobs

Описание

Получает все текущие определения заданий.

См. также: Документацию API AWS

get-jobs является постраничной операцией. Для получения всего набора результатов могут быть выполнены несколько вызовов API. Вы можете отключить постраничный вывод, предоставив аргумент --no-paginate. При использовании --output text и аргумента --query в ответе с постраничным выводом, аргумент --query должен извлекать данные из результатов следующих выражений запроса: Jobs

Синтаксис

  get-jobs
[--cli-input-json | --cli-input-yaml]
[--starting-token <value>]
[--page-size <value>]
[--max-items <value>]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения, используя значение, предоставленное в JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.

--starting-token (строка)

Токен для указания места начала постраничного вывода. Это NextToken из ранее укороченного ответа.

Примеры использования см. в разделе «Постраничный вывод» в Руководстве пользователя AWS Command Line Interface.

--page-size (целое число)

Размер каждой страницы для получения в вызове AWS-сервиса. Это не влияет на количество элементов, возвращаемых в выводе команды. Установка меньшего размера страницы приводит к большему количеству вызовов AWS-сервиса, получая меньше элементов в каждом вызове. Это может помочь предотвратить временное превышение лимита вызовов AWS-сервиса.

Примеры использования см. в разделе «Постраничный вывод» в Руководстве пользователя AWS Command Line Interface.

--max-items (целое число)

Общее количество элементов для возврата в выводе команды. Если общее количество доступных элементов больше указанного значения, в выводе команды предоставляется NextToken. Для продолжения постраничного вывода укажите значение NextToken в аргументе starting-token последующей команды. Не используйте элемент ответа NextToken напрямую вне AWS CLI.

Примеры использования см. в разделе «Постраничный вывод» в Руководстве пользователя AWS Command Line Interface.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При указании без значения или со значением input выводит пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании yaml-input выведет пример YAML-ввода, который можно использовать с --cli-input-yaml. При указании значения output он валидирует входные данные команды и возвращает пример JSON-вывода для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включить отладку.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (логическое значение)

Отключить автоматический постраничный вывод. Если автоматический постраничный вывод отключен, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Выражение JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет параметры конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/выключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (логическое значение)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл с набором сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться без ожидания таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться без ожидания таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить постраничный вывод для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запросить параметры ввода CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запроса параметров ввода CLI.

Вывод

Задачи -> (список)

Список определений задач.

(структура)

Определяет определение задачи.

Имя -> (строка)

Имя, которое вы присваиваете этому определению задачи.

JobMode -> (строка)

Режим, описывающий способ создания задачи. Допустимые значения:

  • SCRIPT - Задача создана с помощью редактора сценариев Glue Studio.
  • VISUAL - Задача создана с помощью визуального редактора Glue Studio.
  • NOTEBOOK - Задача создана с помощью блокнота интерактивных сессий.

Если поле JobMode отсутствует или имеет значение null, по умолчанию используется значение SCRIPT.

JobRunQueuingEnabled -> (булево)

Указывает, включено ли очередирование запусков задач для запусков этой задачи.

Значение true означает, что очередирование запусков задач включено для запусков этой задачи. Если значение false или оно не указано, запуски задач не будут учитываться для очередирования.

Если это поле не совпадает со значением, заданным в запуске задачи, то будет использовано значение из поля запуска задачи.

Описание -> (строка)

Описание задачи.

LogUri -> (строка)

Это поле зарезервировано для использования в будущем.

Роль -> (строка)

Имя или Amazon Resource Name (ARN) роли IAM, связанной с этой задачей.

Создано -> (метка времени)

Дата и время создания этого определения задачи.

Последнее изменение -> (метка времени)

Последняя точка во времени, когда это определение задачи было изменено.

ExecutionProperty -> (структура)

ExecutionProperty, определяющий максимальное количество одновременных запусков, разрешенных для этой задачи.

MaxConcurrentRuns -> (целое число)

Максимальное количество одновременных запусков, разрешенных для задачи. По умолчанию 1. При достижении этого порога возвращается ошибка. Максимальное значение, которое вы можете указать, ограничено лимитом службы.

Команда -> (структура)

JobCommand, выполняющая эту задачу.

Имя -> (строка)

Имя команды задачи. Для задачи Apache Spark ETL это должно быть glueetl . Для задачи Python shell это должно быть pythonshell . Для задачи Apache Spark streaming ETL это должно быть gluestreaming . Для задачи Ray это должно быть glueray .

ScriptLocation -> (строка)

Указывает путь Amazon Simple Storage Service (Amazon S3) к скрипту, выполняющему задачу.

PythonVersion -> (строка)

Версия Python, используемая для выполнения задачи Python shell. Допустимые значения 2 или 3.

Runtime -> (строка)

В задачах Ray параметр Runtime используется для указания версий Ray, Python и дополнительных библиотек, доступных в вашей среде. Это поле не используется в других типах задач. Доступные значения для среды выполнения см. в Руководстве разработчика Glue в разделе Поддерживаемые среды выполнения Ray.

DefaultArguments -> (массив)

Значения аргументов по умолчанию для каждого запуска этой задачи, указанные в виде пар имя-значение.

Вы можете указать здесь аргументы, которые использует ваш собственный скрипт выполнения задачи, а также аргументы, которые использует сам Glue.

Аргументы задач могут быть записаны в журнал. Не передавайте секреты в открытом виде в качестве аргументов. Извлекайте секреты из соединения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в пределах задачи.

Дополнительную информацию о том, как указать и использовать свои собственные аргументы задач, см. в разделе Вызов API Glue на Python в руководстве разработчика.

Дополнительную информацию об аргументах, которые вы можете указать в этом поле при настройке задач Spark, см. в разделе Специальные параметры, используемые Glue, в руководстве разработчика.

Дополнительную информацию об аргументах, которые вы можете указать в этом поле при настройке задач Ray, см. в разделе Использование параметров задач в задачах Ray в руководстве разработчика.

ключ -> (строка)

значение -> (строка)

NonOverridableArguments -> (массив)

Аргументы для этой задачи, которые не переопределяются при предоставлении аргументов задачи в запуске задачи, указанные в виде пар имя-значение.

ключ -> (строка)

значение -> (строка)

Connections -> (структура)

Подключения, используемые для этой задачи.

Connections -> (список)

Список подключений, используемых задачей.

(строка)

MaxRetries -> (целое число)

Максимальное количество попыток повторного выполнения этой задачи после того, как JobRun завершился ошибкой.

AllocatedCapacity -> (целое число)

Это поле устарело. Используйте MaxCapacity вместо него.

Количество единиц обработки данных Glue (DPU), выделенных для запусков этой задачи. Вы можете выделить минимум 2 DPU; по умолчанию используется 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.

Timeout -> (целое число)

Таймаут задачи в минутах. Это максимальное время, которое запуск задачи может использовать ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT.

Значения таймаута задач должны быть меньше 7 дней или 10080 минут. В противном случае задачи вызовут исключение.

Если значение не указано, таймаут по умолчанию равен 2880 минутам.

Все существующие задачи Glue, у которых значение таймаута было больше 7 дней, будут по умолчанию установлены в 7 дней. Например, если вы указали таймаут в 20 дней для пакетной задачи, она будет остановлена на 7-й день.

Для потоковых задач, если вы настроите окно обслуживания, оно будет перезапущено во время окна обслуживания через 7 дней.

MaxCapacity -> (двойное)

Для задач Glue версии 1.0 или более ранних, использующих стандартный тип рабочих узлов, количество единиц обработки данных Glue (DPU), которое может быть выделено при выполнении этой задачи. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.

Для задач Glue версии 2.0 или более поздних вы не можете указать Maximum capacity . Вместо этого вы должны указать Worker type и Number of workers.

Не устанавливайте MaxCapacity, если используется WorkerType и NumberOfWorkers.

Значение, которое можно выделить для MaxCapacity, зависит от того, выполняете ли вы задачу Python shell, задачу Apache Spark ETL или задачу Apache Spark streaming ETL:

  • Когда вы указываете задачу Python shell (JobCommand.Name =”pythonshell”), вы можете выделить либо 0,0625, либо 1 DPU. По умолчанию используется 0,0625 DPU.
  • Когда вы указываете задачу Apache Spark ETL (JobCommand.Name =”glueetl”) или задачу Apache Spark streaming ETL (JobCommand.Name =”gluestreaming”), вы можете выделить от 2 до 100 DPU. По умолчанию используется 10 DPU. Для этого типа задач не допускается выделение дробных значений DPU.

WorkerType -> (строка)

Тип предопределенного рабочего узла, который выделяется при выполнении задачи. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для задач Spark. Принимает значение Z.2X для задач Ray.

  • Для типа рабочих узлов G.1X каждый рабочий узел соответствует 1 DPU (4 виртуальных процессора (vCPU), 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономически эффективный способ выполнения большинства задач.
  • Для типа рабочих узлов G.2X каждый рабочий узел соответствует 2 DPU (8 виртуальных процессоров (vCPU), 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для таких задач, как преобразования данных, объединения и запросы, чтобы предложить масштабируемый и экономически эффективный способ выполнения большинства задач.
  • Для типа рабочих узлов G.4X каждый рабочий узел соответствует 4 DPU (16 виртуальных процессоров (vCPU), 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для задач, рабочая нагрузка которых содержит наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочих узлов доступен только для задач Spark ETL Glue версии 3.0 или более поздних в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm).
  • Для типа рабочих узлов G.8X каждый рабочий узел соответствует 8 DPU (32 виртуальных процессора (vCPU), 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для задач, рабочая нагрузка которых содержит наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочих узлов доступен только для задач Spark ETL Glue версии 3.0 или более поздних в тех же регионах Amazon Web Services, что и для типа рабочих узлов G.4X.
  • Для типа рабочих узлов G.025X каждый рабочий узел соответствует 0,25 DPU (2 виртуальных процессора (vCPU), 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполнитель на рабочий узел. Мы рекомендуем этот тип рабочих узлов для потоковых задач с низким объемом. Этот тип рабочих узлов доступен только для потоковых задач Glue версии 3.0 или более поздних.
  • Для типа рабочих узлов Z.2X каждый рабочий узел соответствует 2 M-DPU (8vCPU, 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 рабочих узлов Ray на основе автоматического масштабирования.

NumberOfWorkers -> (целое число)

Количество рабочих узлов определенного типа workerType, которые выделяются при запуске задачи.

SecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, которая должна использоваться с этой задачей.

NotificationProperty -> (структура)

Указывает параметры конфигурации уведомления о задаче.

NotifyDelayAfter -> (целое число)

Количество минут, которое следует ждать после запуска запуска задачи, прежде чем отправлять уведомление о задержке запуска задачи.

GlueVersion -> (строка)

В задачах Spark, GlueVersion определяет версии Apache Spark и Python, которые доступны Glue в задаче. Версия Python указывает версию, поддерживаемую для задач типа Spark.

Задачи Ray должны установить GlueVersion на значение 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступные в вашей задаче Ray, определяются параметром Runtime команды задачи.

Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в разделе Версия Glue в руководстве разработчика.

Задачи, созданные без указания версии Glue, по умолчанию используют Glue 0.9.

CodeGenConfigurationNodes -> (массив)

Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.

ключ -> (строка)

значение -> (структура)

CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.

AthenaConnectorSource -> (структура)

Определяет подключение к источнику данных Amazon Athena.

Имя -> (строка)

Имя источника данных.

ИмяПодключения -> (строка)

Имя подключения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипПодключения -> (строка)

Тип подключения, например, marketplace.athena или custom.athena, обозначающий подключение к хранилищу данных Amazon Athena.

ИмяТаблицыПодключения -> (строка)

Имя таблицы в источнике данных.

ИмяСхемы -> (строка)

Имя группы журналов Cloudwatch для чтения. Например, /aws-glue/jobs/output .

ВыходныеСхемы -> (список)

Указывает схему данных для пользовательского источника Athena.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, которые составляют схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

JDBCConnectorSource -> (структура)

Определяет подключение к источнику данных JDBC.

Имя -> (строка)

Имя источника данных.

ИмяПодключения -> (строка)

Имя подключения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипПодключения -> (строка)

Тип подключения, например, marketplace.jdbc или custom.jdbc, обозначающий подключение к хранилищу данных JDBC.

ДополнительныеПараметры -> (структура)

Дополнительные параметры подключения для соединителя.

ФильтрПредсказания -> (строка)

Дополнительное условие для фильтрации данных из источника. Например:

BillingCity='Mountain View'

При использовании запроса вместо имени таблицы, необходимо убедиться, что запрос работает с указанным filterPredicate .

СтолбецРазбиения -> (строка)

Имя целочисленного столбца, используемого для разбиения. Этот параметр работает только при включении lowerBound , upperBound и numPartitions . Этот параметр работает так же, как и в Spark SQL JDBC reader.

НижняяГраница -> (длинное целое число)

Минимальное значение partitionColumn, которое используется для определения шага разбиения.

ВерхняяГраница -> (длинное целое число)

Максимальное значение partitionColumn, которое используется для определения шага разбиения.

КоличествоРазбиений -> (длинное целое число)

Количество разбиений. Это значение вместе с lowerBound (включительно) и upperBound (исключительно) формируют шаги разбиения для сгенерированных WHERE выражений условия, используемых для разделения partitionColumn .

КлючиЗакладкиРаботы -> (список)

Имя ключей закладок работы, по которым необходимо отсортировать.

(строка)

ПорядокКлючейЗакладкиРаботы -> (строка)

Указывает порядок сортировки: возрастающий или убывающий.

СопоставлениеТиповДанных -> (карта)

Пользовательское сопоставление типов данных, которое создаёт сопоставление между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} сопоставляет поля данных типа JDBC FLOAT с типом Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение специфично для используемого вами драйвера. Обратитесь к документации вашего JDBC драйвера, чтобы понять, как драйвер выполняет преобразования.

ключ -> (строка)

значение -> (строка)

ИмяТаблицыПодключения -> (строка)

Имя таблицы в источнике данных.

Запрос -> (строка)

Таблица или SQL запрос для получения данных. Вы можете указать либо ConnectionTable, либо query, но не оба.

ВыходныеСхемы -> (список)

Указывает схему данных для пользовательского источника JDBC.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, которые составляют схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorSource -> (структура)

Определяет подключение к источнику данных Apache Spark.

Имя -> (строка)

Имя источника данных.

ИмяПодключения -> (строка)

Имя подключения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипПодключения -> (строка)

Тип подключения, например, marketplace.spark или custom.spark, обозначающий подключение к хранилищу данных Apache Spark.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

ВыходныеСхемы -> (список)

Указывает схему данных для пользовательского источника Spark.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, которые составляют схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogSource -> (структура)

Указывает хранилище данных в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

RedshiftSource -> (структура)

Указывает хранилище данных Amazon Redshift.

Имя -> (строка)

Имя хранилища данных Amazon Redshift.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

S3CatalogSource -> (структура)

Указывает хранилище данных Amazon S3 в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

УсловиеРазбиения -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разбиениях не удаляются. Установлено в "" – по умолчанию пусто.

ДополнительныеПараметры -> (структура)

Определяет дополнительные параметры подключения.

ОграниченноеРазмер -> (длинное целое число)

Устанавливает верхний предел для целевого размера набора данных в байтах, который будет обработан.

ОграниченноеФайлы -> (длинное целое число)

Устанавливает верхний предел для целевого количества файлов, которые будут обработаны.

S3CsvSource -> (структура)

Определяет хранилище данных с разделителями (CSV), хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ТипСжатия -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

РазмерГруппы -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Если количество входных файлов меньше 50 000, необходимо установить "groupFiles" в значение "inPartition", чтобы это имело эффект.

ФайлыГруппы -> (строка)

Группировка файлов включена по умолчанию, когда входной набор содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлов, установите этот параметр в «inPartition». Чтобы отключить группировку, когда файлов более 50 000, установите этот параметр в "none".

Рекурсия -> (логическое значение)

Если установлено в значение true, файлы в всех подкаталогах по указанным путям считываются рекурсивно.

МаксимальнаяГруппа -> (целое число)

Этот параметр контролирует длительность в миллисекундах, после которой перечень объектов s3, вероятно, будет согласован. Файлы с метками времени изменения, попавшими в последние maxBand миллисекунд, отслеживаются особо при использовании JobBookmarks, чтобы учесть неявную согласованность Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию равно 900000 миллисекунд или 15 минутам.

МаксимальноеКоличествоФайловВГруппе -> (целое число)

Этот параметр указывает максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только при следующем запуске задачи.

ДополнительныеПараметры -> (структура)

Определяет дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

ВключитьПримерныйПуть -> (логическое значение)

Устанавливает параметр для включения примера пути.

ПримерныйПуть -> (строка)

Если включено, указывает примерный путь.

Разделитель -> (строка)

Указывает разделительный символ. По умолчанию это запятая: «,» но можно указать любой другой символ.

СимволЭкранирования -> (строка)

Указывает символ для экранирования. Этот параметр используется только при чтении CSV-файлов. Значение по умолчанию — none. Если включен, символ, который следует за ним, используется как есть, за исключением небольшого набора известных экранирований (\n, \r, \t и \0).

СимволКавычек -> (строка)

Указывает символ для кавычек. По умолчанию это двойная кавычка: '"'. Установите это значение в -1, чтобы полностью отключить кавычки.

Многострочный -> (логическое значение)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ новой строки в кавычках. Вам необходимо установить этот параметр в значение True, если какая-либо запись занимает несколько строк. Значение по умолчанию — False, что позволяет более агрессивно разбивать файлы во время разбора.

СЗаголовком -> (логическое значение)

Булево значение, указывающее, следует ли рассматривать первую строку как заголовок. Значение по умолчанию — False.

НаписатьЗаголовок -> (логическое значение)

Булево значение, указывающее, следует ли записать заголовок в выходные данные. Значение по умолчанию — True.

ПропуститьПервуюСтроку -> (логическое значение)

Булево значение, указывающее, следует ли пропустить первую строку данных. Значение по умолчанию — False.

ОптимизироватьПроизводительность -> (логическое значение)

Булево значение, указывающее, следует ли использовать расширенный SIMD-читатель CSV вместе с основанными на Apache Arrow столбчатыми форматами памяти. Доступно только в версии Glue 3.0.

СхемыВывода -> (список)

Определяет схему данных для источника CSV S3.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ExcelSource -> (структура)

Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.

Имя -> (строка)

Имя источника данных Excel S3.

Пути -> (список)

Пути S3, где находятся файлы Excel.

(строка)

ТипСжатия -> (строка)

Формат сжатия, используемый для файлов Excel.

Исключения -> (список)

Шаблоны для исключения определенных файлов или путей из обработки.

(строка)

РазмерГруппы -> (строка)

Определяет размер групп файлов для пакетной обработки.

ФайлыГруппы -> (строка)

Указывает, как файлы должны быть сгруппированы для обработки.

Рекурсия -> (логическое значение)

Указывает, следует ли обрабатывать подкаталоги рекурсивно.

МаксимальнаяГруппа -> (целое число)

Максимальное количество групп обработки, которые необходимо использовать.

МаксимальноеКоличествоФайловВГруппе -> (целое число)

Максимальное количество файлов для обработки в каждой группе.

ДополнительныеПараметры -> (структура)

Дополнительные параметры конфигурации для обработки прямых источников S3.

ОграниченныйРазмер -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

ВключитьПримерныйПуть -> (логическое значение)

Устанавливает параметр для включения примера пути.

ПримерныйПуть -> (строка)

Если включено, указывает примерный путь.

КоличествоСтрок -> (длинное целое число)

Количество строк для обработки из каждого файла Excel.

ПропуститьПодвал -> (целое число)

Количество строк, которые следует пропустить в конце каждого файла Excel.

СхемыВывода -> (список)

Схемы AWS Glue, которые следует применить к обработанным данным.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3JsonSource -> (структура)

Определяет хранилище JSON-данных, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ТипСжатия -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

РазмерГруппы -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Если количество входных файлов меньше 50 000, необходимо установить "groupFiles" в значение "inPartition", чтобы это имело эффект.

ФайлыГруппы -> (строка)

Группировка файлов включена по умолчанию, когда входной набор содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлов, установите этот параметр в «inPartition». Чтобы отключить группировку, когда файлов более 50 000, установите этот параметр в "none".

Рекурсия -> (логическое значение)

Если установлено в значение true, файлы в всех подкаталогах по указанным путям считываются рекурсивно.

МаксимальнаяГруппа -> (целое число)

Этот параметр контролирует длительность в миллисекундах, после которой перечень объектов s3, вероятно, будет согласован. Файлы с метками времени изменения, попавшими в последние maxBand миллисекунд, отслеживаются особо при использовании JobBookmarks, чтобы учесть неявную согласованность Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию равно 900000 миллисекунд или 15 минутам.

МаксимальноеКоличествоФайловВГруппе -> (целое число)

Этот параметр указывает максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только при следующем запуске задачи.

ДополнительныеПараметры -> (структура)

Определяет дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

ВключитьПримерныйПуть -> (логическое значение)

Устанавливает параметр для включения примера пути.

ПримерныйПуть -> (строка)

Если включено, указывает примерный путь.

JsonPath -> (строка)

Строка JsonPath, определяющая JSON-данные.

Многострочный -> (логическое значение)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ новой строки в кавычках. Вам необходимо установить этот параметр в значение True, если какая-либо запись занимает несколько строк. Значение по умолчанию — False, что позволяет более агрессивно разбивать файлы во время разбора.

СхемыВывода -> (список)

Определяет схему данных для источника JSON S3.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ParquetSource -> (структура)

Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ТипСжатия -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

РазмерГруппы -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда файлов входных данных меньше 50 000, необходимо установить "groupFiles" в значение "inPartition", чтобы это имело эффект.

ФайлыГруппы -> (строка)

Группировка файлов включена по умолчанию, если входные данные содержат более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку, когда файлов более 50 000, установите этот параметр в "none".

Рекурсивно -> (булево)

Если установлено в значение true, то файлы в всех подкаталогах по указанным путям читаются рекурсивно.

МаксимальнаяПолоса -> (целое число)

Этот параметр контролирует длительность в миллисекундах, после которой список s3, вероятно, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются особенно при использовании JobBookmarks для учета несинхронной согласованности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию 900000 миллисекунд, или 15 минут.

МаксимальноеКоличествоФайловВПолосе -> (целое число)

Этот параметр указывает максимальное количество файлов для сохранения из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

ДополнительныеПараметры -> (структура)

Указывает дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (длинное целое число)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

ВключитьОбразецПути -> (булево)

Устанавливает параметр для включения образца пути.

ОбразецПути -> (строка)

Если включено, указывает образец пути.

СхемыВывода -> (список)

Указывает схему данных для источника S3 Parquet.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ИсточникКаталогаОтношений -> (структура)

Указывает хранилище данных реляционного каталога в Glue Data Catalog.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

ИсточникКаталогаDynamoDB -> (структура)

Указывает хранилище данных DynamoDBC Catalog в Glue Data Catalog.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

JDBCConnectorTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в колончатом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения, связанного с соединителем.

ТаблицаПодключения -> (строка)

Имя таблицы в целевом объекте данных.

ИмяСоединителя -> (строка)

Имя соединителя, которое будет использоваться.

ТипПодключения -> (строка)

Тип подключения, например marketplace.jdbc или custom.jdbc, определяющий подключение к целевому объекту данных JDBC.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для целевого объекта JDBC.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorTarget -> (структура)

Указывает целевой объект, использующий соединитель Apache Spark.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения для соединителя Apache Spark.

ИмяСоединителя -> (строка)

Имя соединителя Apache Spark.

ТипПодключения -> (строка)

Тип подключения, например marketplace.spark или custom.spark, определяющий подключение к хранилищу данных Apache Spark.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для пользовательской Spark-цели.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogTarget -> (структура)

Указывает целевой объект, использующий таблицу Glue Data Catalog.

Имя -> (строка)

Имя вашего целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

КлючиРазделения -> (список)

Ключи разделения, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.

(список)

(строка)

БазаДанных -> (строка)

База данных, содержащая таблицу, которую вы хотите использовать в качестве цели. Эта база данных должна уже существовать в каталоге данных.

Таблица -> (строка)

Таблица, определяющая схему ваших выходных данных. Эта таблица должна уже существовать в каталоге данных.

RedshiftTarget -> (структура)

Указывает целевой объект, использующий Amazon Redshift.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

БазаДанных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

UpsertRedshiftOptions -> (структура)

Набор параметров для настройки операции upsert при записи в целевой объект Redshift.

РасположениеТаблицы -> (строка)

Физическое расположение таблицы Redshift.

ИмяПодключения -> (строка)

Имя подключения для записи в Redshift.

КлючиUpsert -> (список)

Ключи, используемые для определения, нужно ли выполнить обновление или вставку.

(строка)

S3CatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 с использованием Glue Data Catalog.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

КлючиРазделения -> (список)

Указывает нативное разделение с помощью последовательности ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

БазаДанных -> (строка)

Имя базы данных для записи.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для программы-скроллера.

ВключитьОбновлениеКаталога -> (булево)

Используется ли указанное поведение обновления, когда программа-скроллер обнаруживает измененную схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда программа-скроллер находит измененную схему.

S3GlueParquetTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в колончатом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

КлючиРазделения -> (список)

Указывает нативное разделение с помощью последовательности ключей.

(список)

(строка)

Путь -> (строка)

Один путь Amazon S3 для записи.

Сжатие -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

КоличествоЦелевыхРазделов -> (строка)

Указывает количество целевых разделов для файлов Parquet при записи в Amazon S3 с использованием AWS Glue.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для программы-скроллера.

ВключитьОбновлениеКаталога -> (булево)

Используется ли указанное поведение обновления, когда программа-скроллер обнаруживает измененную схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда программа-скроллер находит измененную схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3HyperDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.

Name -> (строка)

Уникальный идентификатор узла целевого объекта HyperDirect.

Inputs -> (список)

Указывает источник входных данных для целевого объекта HyperDirect.

(строка)

PartitionKeys -> (список)

Определяет стратегию разбиения выходных данных.

(список)

(строка)

Path -> (строка)

Местоположение S3, куда будут записаны выходные данные.

Compression -> (строка)

Тип сжатия, применяемый к выходным данным.

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы во время операций записи.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда средство извлечения данных находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда средство извлечения данных находит изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3DirectTarget -> (структура)

Указывает целевой объект данных, записывающий данные в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся источниками данных для целевого объекта.

(строка)

PartitionKeys -> (список)

Указывает внутреннее разбиение с помощью последовательности ключей.

(список)

(строка)

Path -> (строка)

Единственный путь в Amazon S3 для записи.

Compression -> (строка)

Указывает способ сжатия данных. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip".

NumberTargetPartitions -> (строка)

Указывает количество целевых разбиений при записи данных напрямую в Amazon S3.

Format -> (строка)

Указывает формат выходных данных для целевого объекта.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для средства извлечения данных.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда средство извлечения данных находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда средство извлечения данных находит изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3IcebergDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.

Name -> (строка)

Указывает уникальный идентификатор узла Iceberg в вашей цепочке обработки данных.

Inputs -> (список)

Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.

(строка)

PartitionKeys -> (список)

Указывает столбцы, используемые для разбиения данных таблицы Iceberg в S3.

(список)

(строка)

Path -> (строка)

Определяет расположение в S3, где будут храниться данные таблицы Iceberg.

Format -> (строка)

Указывает формат файлов, используемый для хранения данных таблицы Iceberg (например, Parquet, ORC).

AdditionalOptions -> (карта)

Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда средство извлечения данных находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда средство извлечения данных находит изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

Compression -> (строка)

Указывает кодек сжатия, используемый для файлов таблицы Iceberg в S3.

NumberTargetPartitions -> (строка)

Устанавливает количество целевых разбиений для распределения файлов таблицы Iceberg по S3.

ApplyMapping -> (структура)

Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте. Можно переименовывать ключи, изменять типы данных ключей и выбирать, какие ключи нужно удалить из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Mapping -> (список)

Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте.

(структура)

Указывает сопоставление ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, как должно называться поле. Может быть таким же, как FromPath.

FromPath -> (список)

Таблица или столбец, подлежащие изменению.

(строка)

FromType -> (строка)

Тип данных, подлежащих изменению.

ToType -> (строка)

Тип данных, на который следует изменить данные.

Dropped -> (булево)

Если истинно, то столбец удаляется.

Children -> (список)

Применимо только к вложенным структурам данных. Если нужно изменить родительскую структуру, а также одного из её потомков, можно заполнить эту структуру данных. Также Mapping, но её FromPath будет родительским FromPath плюс FromPath из этой структуры.

Для части children, предположим, что у вас есть структура:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

Можно указать Mapping, который выглядит так:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

(структура)

Указывает сопоставление ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, как должно называться поле. Может быть таким же, как FromPath.

FromPath -> (список)

Таблица или столбец, подлежащие изменению.

(строка)

FromType -> (строка)

Тип данных, подлежащих изменению.

ToType -> (строка)

Тип данных, на который следует изменить данные.

Dropped -> (булево)

Если истинно, то столбец удаляется.

SelectFields -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые необходимо сохранить.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Paths -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

DropFields -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые необходимо удалить.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Paths -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

RenameField -> (структура)

Указывает преобразование, которое переименовывает один ключ свойства данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

SourcePath -> (список)

Путь JSON к переменной в структуре данных для исходных данных.

(строка)

TargetPath -> (список)

Путь JSON к переменной в структуре данных для целевых данных.

(строка)

Spigot -> (структура)

Указывает преобразование, которое записывает выборки данных в ведро Amazon S3.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Path -> (строка)

Путь в Amazon S3, куда преобразование запишет подмножество записей из набора данных в файл JSON в ведро Amazon S3.

Topk -> (целое число)

Указывает количество записей, которые нужно записать, начиная с начала набора данных.

Prob -> (двойное)

Вероятность (десятичное значение с максимальным значением 1) выбора любой заданной записи. Значение 1 указывает, что каждая строка, прочитанная из набора данных, должна включаться в выходную выборку.

Join -> (структура)

Указывает преобразование, которое объединяет два набора данных в один набор данных с помощью сравнения по указанным ключам свойств данных. Можно использовать внутренние, внешние, левые, правые, левые полуобъединения и левые антиобъединения.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

JoinType -> (строка)

Указывает тип объединения, который должен быть выполнен для наборов данных.

Columns -> (список)

Список двух столбцов, подлежащих объединению.

(структура)

Указывает столбец, подлежащий объединению.

From -> (строка)

Столбец, подлежащий объединению.

Keys -> (список)

Ключ столбца, подлежащего объединению.

(список)

(строка)

SplitFields -> (структура)

Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой коллекцию DynamicFrames: одну с выбранными ключами свойств данных и одну с оставшимися ключами свойств данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Paths -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

SelectFromCollection -> (структура)

Указывает преобразование, которое выбирает один DynamicFrame из коллекции DynamicFrames. Выход — выбранный DynamicFrame.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Index -> (целое число)

Индекс DynamicFrame, который нужно выбрать.

FillMissingValues -> (структура)

Определяет преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определяемым с помощью импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определенные по их именам узлов.

(строка)

ПутьИмпутации -> (строка)

Путь JSON к переменной в структуре данных для набора данных, который импутируется.

ПутьЗаполнения -> (строка)

Путь JSON к переменной в структуре данных для набора данных, который заполняется.

Фильтр -> (структура)

Определяет преобразование, которое разбивает набор данных на два, на основе условия фильтра.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определенные по их именам узлов.

(строка)

ЛогическийОператор -> (строка)

Оператор, используемый для фильтрации строк путем сравнения значения ключа со значением, указанным в фильтре.

Фильтры -> (список)

Определяет выражение фильтра.

(структура)

Определяет выражение фильтра.

Операция -> (строка)

Тип операции, которую необходимо выполнить в выражении.

Отрицание -> (булево)

Требуется ли отрицание выражения.

Значения -> (список)

Список значений фильтра.

(структура)

Представляет одну запись в списке значений для FilterExpression .

Тип -> (строка)

Тип значения фильтра.

Значение -> (список)

Значение, которое нужно связать.

(строка)

ПользовательскийКод -> (структура)

Определяет преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Результатом является коллекция DynamicFrames.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определенные по их именам узлов.

(строка)

Код -> (строка)

Пользовательский код, используемый для выполнения преобразования данных.

ИмяКласса -> (строка)

Определенное имя класса для узла пользовательского кода.

СхемыВывода -> (список)

Определяет схему данных для преобразования пользовательского кода.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, которые составляют схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkSQL -> (структура)

Определяет преобразование, где вы вводите SQL-запрос, используя синтаксис Spark SQL для преобразования данных. Результатом является один DynamicFrame .

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, определенные по их именам узлов. Вы можете связать имя таблицы с каждым узлом входа для использования в SQL-запросе. Выбранное вами имя должно соответствовать ограничениям именования Spark SQL.

(строка)

SqlQuery -> (строка)

SQL-запрос, который должен использовать синтаксис Spark SQL и возвращать один набор данных.

SqlAliases -> (список)

Список псевдонимов. Псевдоним позволяет указать, какое имя использовать в SQL для данного входа. Например, у вас есть источник данных с именем «MyDataSource». Если вы укажете From как MyDataSource, и Alias как SqlName, то в вашем SQL вы можете сделать:

select * from SqlName

и это получит данные из MyDataSource.

(структура)

Представляет одну запись в списке значений для SqlAliases .

От -> (строка)

Таблица или столбец в таблице.

Псевдоним -> (строка)

Временное имя, данное таблице или столбцу в таблице.

СхемыВывода -> (список)

Определяет схему данных для преобразования SparkSQL.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, которые составляют схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

DirectKinesisSource -> (структура)

Определяет прямой источник данных Amazon Kinesis.

Имя -> (строка)

Имя источника данных.

РазмерОкна -> (целое число)

Время, затрачиваемое на обработку каждого микро-пакета.

ОбнаружениеСхемы -> (булево)

Автоматически определить схему из входящих данных.

ПараметрыПотока -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

АдресЭндпоинта -> (строка)

Адрес конечной точки Kinesis.

ИмяПотока -> (строка)

Имя потока данных Kinesis.

Классификация -> (строка)

Необязательная классификация.

Разделитель -> (строка)

Указывает символ-разделитель.

НачальнаяПозиция -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest" , "trim_horizon" , "earliest" или строка временной метки в формате UTC в формате yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию — "latest" .

Примечание: Использование значения, являющегося строкой временной метки в формате UTC, для «начальной позиции», поддерживается только для версии Glue 4.0 и выше.

МаксимальноеВремяОбработкиВМиллисекундах -> (длинное целое число)

Максимальное время, затрачиваемое исполнителем задания на чтение записей для текущей партии из потока данных Kinesis, заданное в миллисекундах (мс). В это время могут быть выполнены несколько GetRecords API-вызовов. Значение по умолчанию — 1000 .

МаксимальноеКоличествоЗаписейВСегменте -> (длинное целое число)

Максимальное количество записей для извлечения на сегмент в потоке данных Kinesis за один микро-пакет. Примечание: клиент может превысить это ограничение, если задача потоковой обработки уже прочитала дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard требует строгости, то оно должно быть кратно MaxRecordPerRead . Значение по умолчанию — 100000 .

МаксимальноеКоличествоЗаписейВЧтении -> (длинное целое число)

Максимальное количество записей для извлечения из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию — 10000 .

ДобавитьВремяПростояМеждуЧтениями -> (булево)

Добавляет задержку во времени между двумя последовательными операциями getRecords. Значение по умолчанию — "False" . Этот параметр настраивается только для версии Glue 2.0 и выше.

ВремяПростояМеждуЧтениямиВМиллисекундах -> (длинное целое число)

Минимальная задержка между двумя последовательными операциями getRecords, заданная в мс. Значение по умолчанию — 1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.

ИнтервалОписанияСегментов -> (длинное целое число)

Минимальный интервал времени между двумя вызовами ListShards API для вашего скрипта, чтобы рассмотреть возможность изменения сегментов. Значение по умолчанию — 1s .

КоличествоПовторныхПопыток -> (целое число)

Максимальное количество попыток повтора запросов API Kinesis Data Streams. Значение по умолчанию — 3 .

ИнтервалПовторныхПопытокВМиллисекундах -> (длинное целое число)

Период охлаждения (заданный в мс) перед повтором вызова API Kinesis Data Streams. Значение по умолчанию — 1000 .

МаксимальныйИнтервалПовторныхПопытокВМиллисекундах -> (длинное целое число)

Максимальный период охлаждения (заданный в мс) между двумя повторами вызова API Kinesis Data Streams. Значение по умолчанию — 10000 .

ИзбегатьПустыхПакетов -> (булево)

Избегает создания пустой задачи микро-пакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед запуском пакета. Значение по умолчанию — "False" .

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли для принятия с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для описания или чтения операций записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется в сочетании с "awsSTSSessionName" .

RoleSessionName -> (строка)

Идентификатор сессии для принятия роли с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется в сочетании с "awsSTSRoleARN" .

ДобавитьВременнуюМеткуЗаписи -> (строка)

При установке этого параметра в «true», выходные данные данных будут содержать дополнительный столбец с именем «__src_timestamp», который указывает время, когда соответствующая запись была получена потоком. Значение по умолчанию — «false». Этот параметр поддерживается в версии Glue 4.0 и выше.

ВыводитьМетрикиЗадержкиПотребителя -> (строка)

При установке этого параметра в «true», для каждой партии он будет выводить метрики для периода между самой старой записью, полученной потоком, и временем ее прихода в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — «false». Этот параметр поддерживается в версии Glue 4.0 и выше.

НачальнаяВременнаяМетка -> (временная метка)

Временная метка записи в потоке данных Kinesis для начала чтения данных. Возможные значения — строка временной метки в формате UTC шаблона yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).

ПараметрыПредварительногоПросмотраДанных -> (структура)

Дополнительные параметры для предварительного просмотра данных.

ВремяОпроса -> (длинное целое число)

Время опроса в миллисекундах.

ОграничениеОпросаЗаписей -> (длинное целое число)

Ограничение количества опрошенных записей.

DirectKafkaSource -> (структура)

Определяет хранилище данных Apache Kafka.

Имя -> (строка)

Имя хранилища данных.

ПараметрыПотоковойПередачи -> (структура)

Определяет параметры потоковой передачи.

BootstrapServers -> (строка)

Список URL-адресов серверов начальной загрузки, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения: "SSL" или "PLAINTEXT".

ИмяСоединения -> (строка)

Имя подключения.

ИмяТемы -> (строка)

Имя темы, указанное в Apache Kafka. Вы должны указать хотя бы одно из "topicName", "assign" или "subscribePattern".

Присвоение -> (строка)

Конкретное TopicPartitions для потребления. Вы должны указать хотя бы одно из "topicName", "assign" или "subscribePattern".

ШаблонПодписки -> (строка)

Строка Java-регулярных выражений, определяющая список тем для подписки. Вы должны указать хотя бы одно из "topicName", "assign" или "subscribePattern".

Классификация -> (строка)

Необязательная классификация.

Разделитель -> (строка)

Определяет символ разделителя.

НачальныеСмещения -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения: "earliest" или "latest". Значение по умолчанию: "latest".

КонечныеСмещения -> (строка)

Конечная точка, когда пакетный запрос завершается. Возможные значения: либо "latest", либо строка JSON, которая определяет конечное смещение для каждого TopicPartition.

ВремяОжиданияОбработкиМс -> (длинное целое число)

Время ожидания в миллисекундах для опроса данных из Kafka в исполнителях задач Spark. Значение по умолчанию: 512.

КоличествоПовторныхПопыток -> (целое число)

Количество попыток повторной обработки, прежде чем произойдет сбой получения смещений Kafka. Значение по умолчанию: 3.

ИнтервалПовторнойПопыткиМс -> (длинное целое число)

Время ожидания в миллисекундах перед повторной попыткой получения смещений Kafka. Значение по умолчанию: 10.

МаксимальноеСмещениеНаТриггер -> (длинное целое число)

Лимит на максимальное количество смещений, обрабатываемых за интервал триггера. Указанное общее количество смещений пропорционально разделено между topicPartitions различных объемов. Значение по умолчанию: null, что означает, что потребитель считывает все смещения до известного последнего смещения.

МинимальноеКоличествоРазделов -> (целое число)

Желаемое минимальное количество разделов для чтения из Kafka. Значение по умолчанию: null, что означает, что количество партиций spark равно количеству партиций Kafka.

ВключатьЗаголовки -> (логическое значение)

Включать ли заголовки Kafka. Когда параметр установлен в «true», выходные данные данных будут содержать дополнительный столбец с именем «glue_streaming_kafka_headers» типа Array[Struct(key: String, value: String)]. Значение по умолчанию: «false». Этот параметр доступен только в версии Glue 3.0 и выше.

ДобавитьМаркерВремениЗаписи -> (строка)

Когда этот параметр установлен в ‘true’, выходные данные данных будут содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующей записи темой. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 или выше.

ИспользоватьМетрикиОжиданияПотребителя -> (строка)

Когда этот параметр установлен в ‘true’, для каждой группы будет вычисляться время между самой старой полученной записью темы и временем ее получения в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 или выше.

НачальноеВремя -> (маркер времени)

Маркер времени записи в теме Kafka для начала чтения данных. Возможные значения: строка маркера времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).

Только один из StartingTimestamp или StartingOffsets должен быть установлен.

РазмерОкна -> (целое число)

Время обработки каждого микропакета.

ОбнаружениеСхемы -> (логическое значение)

Автоматически определять схему из входных данных.

ПараметрыПредварительногоПросмотраДанных -> (структура)

Определяет параметры, связанные с предварительным просмотром данных для просмотра образца ваших данных.

ВремяОпроса -> (длинное целое число)

Время опроса в миллисекундах.

ПределОпросаЗаписей -> (длинное целое число)

Предел количества опрошенных записей.

ИсточникKinesisВКаталоге -> (структура)

Определяет источник данных Kinesis в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

РазмерОкна -> (целое число)

Время обработки каждого микропакета.

ОбнаружениеСхемы -> (логическое значение)

Автоматически определять схему из входных данных.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

БазаДанных -> (строка)

Имя базы данных для чтения.

ПараметрыПотоковойПередачи -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

UrlКонтроллера -> (строка)

URL-адрес контроллера Kinesis.

ИмяПотока -> (строка)

Имя потока данных Kinesis.

Классификация -> (строка)

Необязательная классификация.

Разделитель -> (строка)

Определяет символ разделителя.

НачальнаяПозиция -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения: "latest", "trim_horizon", "earliest" или строка маркера времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00-04:00»). Значение по умолчанию: "latest".

Примечание: Использование значения, являющегося строкой маркера времени в формате UTC для «начальной позиции», поддерживается только для версии Glue 4.0 или выше.

МаксимальноеВремяОбработкиМс -> (длинное целое число)

Максимальное время, затраченное исполнителем задачи на чтение записей для текущей группы из потока данных Kinesis, указанное в миллисекундах (мс). В течение этого времени могут быть сделаны несколько GetRecords вызовов API. Значение по умолчанию: 1000.

МаксимальноеКоличествоЗаписейНаРаздел -> (длинное целое число)

Максимальное количество записей для извлечения на раздел в потоке данных Kinesis за микропакет. Примечание: клиент может превысить этот лимит, если задача потоковой обработки уже прочитала дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратным MaxRecordPerRead. Значение по умолчанию: 100000.

МаксимальноеКоличествоЗаписейНаЧтение -> (длинное целое число)

Максимальное количество записей для извлечения из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию: 10000.

ДобавитьВремяПростояМеждуЧтениями -> (логическое значение)

Добавляет задержку между двумя последовательными операциями getRecords. Значение по умолчанию: "False". Этот параметр настраивается только для версии Glue 2.0 и выше.

ВремяПростояМеждуЧтениямиМс -> (длинное целое число)

Минимальная задержка между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию: 1000. Этот параметр настраивается только для версии Glue 2.0 и выше.

ИнтервалОписанияРаздела -> (длинное целое число)

Минимальный интервал времени между двумя вызовами ListShards API для вашей программы, чтобы рассмотреть возможность изменения разбиения. Значение по умолчанию: 1s.

КоличествоПовторныхПопыток -> (целое число)

Максимальное количество повторов для запросов API Kinesis Data Streams. Значение по умолчанию: 3.

ИнтервалПовторнойПопыткиМс -> (длинное целое число)

Период охлаждения (в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию: 1000.

МаксимальныйИнтервалПовторнойПопыткиМс -> (длинное целое число)

Максимальный период охлаждения (в мс) между двумя повторами вызова API Kinesis Data Streams. Значение по умолчанию: 10000.

ИзбегатьПустыхПакет -> (логическое значение)

Избегает создания пустой задачи микропакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед началом пакета. Значение по умолчанию: "False".

ArnПотока -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

ArnРоли -> (строка)

Amazon Resource Name (ARN) роли, которую необходимо принять с использованием AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для операций describe или чтения записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется в сочетании с "awsSTSSessionName".

ИмяСессииРоли -> (строка)

Идентификатор сессии для принятия роли с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется в сочетании с "awsSTSRoleARN".

ДобавитьМаркерВремениЗаписи -> (строка)

Если этот параметр установлен в ‘true’, выходные данные данных будут содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующей записи потоком. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 или выше.

ИспользоватьМетрикиОжиданияПотребителя -> (строка)

Если этот параметр установлен в ‘true’, для каждой группы будут вычисляться метрики для интервала времени между самой старой записью потока и временем ее получения в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 или выше.

НачальноеВремя -> (маркер времени)

Маркер времени записи в потоке данных Kinesis для начала чтения данных. Возможные значения: строка маркера времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC со знаком +/-. Например: «2023-04-04T08:00:00+08:00»).

ПараметрыПредварительногоПросмотраДанных -> (структура)

Дополнительные параметры для предварительного просмотра данных.

ВремяОпроса -> (длинное целое число)

Время опроса в миллисекундах.

ПределОпросаЗаписей -> (длинное целое число)

Предел количества опрошенных записей.

ИсточникKafkaВКаталоге -> (структура)

Указывает хранилище данных Apache Kafka в каталоге данных.

Name -> (string)

Имя хранилища данных.

WindowSize -> (integer)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (boolean)

Автоматически определять схему из входящих данных.

Table -> (string)

Имя таблицы в базе данных для чтения.

Database -> (string)

Имя базы данных для чтения.

StreamingOptions -> (structure)

Указывает параметры потоковой передачи.

BootstrapServers -> (string)

Список URL-адресов серверов Bootstrap, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (string)

Протокол, используемый для связи с брокерами. Возможные значения — "SSL" или "PLAINTEXT".

ConnectionName -> (string)

Имя подключения.

TopicName -> (string)

Имя темы, как указано в Apache Kafka. Необходимо указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

Assign -> (string)

Конкретный TopicPartitions для потребления. Необходимо указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

SubscribePattern -> (string)

Строка Java-регулярного выражения, определяющая список тем для подписки. Необходимо указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

Classification -> (string)

Необязательная классификация.

Delimiter -> (string)

Указывает разделитель.

StartingOffsets -> (string)

Начальная позиция в теме Kafka для чтения данных. Возможные значения — "earliest" или "latest". Значение по умолчанию — "latest".

EndingOffsets -> (string)

Конечная точка при завершении запроса пакета. Возможные значения — либо "latest", либо строка JSON, которая определяет конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (long)

Таймаут в миллисекундах для опроса данных из Kafka в исполнителях задач Spark. Значение по умолчанию — 512.

NumRetries -> (integer)

Количество попыток повторного подключения перед отказом от получения смещений Kafka. Значение по умолчанию — 3.

RetryIntervalMs -> (long)

Время ожидания в миллисекундах перед повторной попыткой получить смещения Kafka. Значение по умолчанию — 10.

MaxOffsetsPerTrigger -> (long)

Предел скорости на максимальное количество смещений, обрабатываемых за интервал триггера. Указанное общее количество смещений пропорционально разделяется между topicPartitions различных объемов. Значение по умолчанию — null, что означает, что потребитель считывает все смещения до известного последнего смещения.

MinPartitions -> (integer)

Желаемое минимальное количество партиций для чтения из Kafka. Значение по умолчанию — null, что означает, что количество партиций Spark равно количеству партиций Kafka.

IncludeHeaders -> (boolean)

Включать заголовки Kafka. При установке параметра в «true», выходные данные будут содержать дополнительный столбец под названием «glue_streaming_kafka_headers» со типом Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и более поздних.

AddRecordTimestamp -> (string)

При установке этого параметра в ‘true’, выходные данные будут содержать дополнительный столбец под названием «__src_timestamp», который указывает время получения соответствующего записями по теме. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и более поздних.

EmitConsumerLagMetrics -> (string)

При установке этого параметра в ‘true’, для каждого пакета будут передаваться метрики, показывающие продолжительность между самой старой записью, полученной по теме, и временем ее прибытия в Glue в CloudWatch. Имя метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и более поздних.

StartingTimestamp -> (timestamp)

Отметка времени записи в теме Kafka для начала чтения данных. Возможные значения — строка даты и времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z обозначает смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).

Только один из параметров StartingTimestamp или StartingOffsets должен быть установлен.

DataPreviewOptions -> (structure)

Указывает параметры, связанные с предварительным просмотром данных для просмотра выборки ваших данных.

PollingTime -> (long)

Время опроса в миллисекундах.

RecordPollingLimit -> (long)

Предел количества опрошенных записей.

DropNullFields -> (structure)

Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает null-объекты, но некоторые значения, такие как пустые строки, строки, являющиеся «null», целочисленные значения -1 или другие заполнитель, такие как нули, не распознаются автоматически как null.

Name -> (string)

Имя узла преобразования.

Inputs -> (list)

Вводные данные, определяемые по именам узлов.

(string)

NullCheckBoxList -> (structure)

Структура, представляющая, считаются ли определённые значения как null-значения для удаления.

IsEmpty -> (boolean)

Указывает, что пустая строка считается null-значением.

IsNullString -> (boolean)

Указывает, что значение, написанное словом «null», считается null-значением.

IsNegOne -> (boolean)

Указывает, что целочисленное значение -1 считается null-значением.

NullTextList -> (list)

Структура, указывающая список NullValueField структур, представляющих пользовательское null-значение, например, ноль или другое значение, используемое в качестве null-заполнителя, уникального для набора данных.

Преобразование DropNullFields удаляет пользовательские null-значения только если значение null-заполнителя и тип данных совпадают с данными.

(structure)

Представляет пользовательское null-значение, такое как нули или другое значение, используемое в качестве null-заполнителя, уникального для набора данных.

Value -> (string)

Значение null-заполнителя.

Datatype -> (structure)

Тип данных значения.

Id -> (string)

Тип данных значения.

Label -> (string)

Метка, присвоенная типу данных.

Merge -> (structure)

Указывает преобразование, которое объединяет DynamicFrame с эталонным DynamicFrame на основе указанных первичных ключей для идентификации записей. Дублирующие записи (записи с одинаковыми первичными ключами) не удаляются.

Name -> (string)

Имя узла преобразования.

Inputs -> (list)

Вводные данные, определяемые по именам узлов.

(string)

Source -> (string)

Исходный DynamicFrame, который будет объединён с эталонным DynamicFrame.

PrimaryKeys -> (list)

Список полей первичного ключа для сопоставления записей из исходной и эталонной динамических рамок.

(list)

(string)

Union -> (structure)

Указывает преобразование, объединяющее строки из двух или более наборов данных в один результат.

Name -> (string)

Имя узла преобразования.

Inputs -> (list)

Входящие идентификаторы узлов для преобразования.

(string)

UnionType -> (string)

Указывает тип преобразования Union.

Укажите ALL, чтобы объединить все строки из источников данных в результирующей DynamicFrame. Результирующее объединение не удаляет дублирующие строки.

Укажите DISTINCT, чтобы удалить дублирующие строки в результирующей DynamicFrame.

PIIDetection -> (structure)

Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.

Name -> (string)

Имя узла преобразования.

Inputs -> (list)

Входящие идентификаторы узлов для преобразования.

(string)

PiiType -> (string)

Указывает тип преобразования PIIDetection.

EntityTypesToDetect -> (list)

Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.

Сущности типа PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE

(string)

OutputColumnName -> (string)

Указывает имя выходного столбца, который будет содержать любой тип сущности, обнаруженной в этой строке.

SampleFraction -> (double)

Указывает долю данных для выборки при сканировании сущностей PII.

ThresholdFraction -> (double)

Указывает долю данных, которая должна быть достигнута, чтобы столбец был идентифицирован как данные PII.

MaskValue -> (string)

Указывает значение, которое заменит обнаруженную сущность.

Aggregate -> (structure)

Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по указанной функции.

Name -> (string)

Имя узла преобразования.

Inputs -> (list)

Указывает поля и строки, которые будут использованы в качестве входных данных для преобразования агрегирования.

(string)

Groups -> (list)

Указывает поля для группировки.

(list)

(string)

Aggs -> (list)

Указывает агрегирующие функции, которые будут выполняться над указанными полями.

(structure)

Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании агрегирования.

Column -> (list)

Указывает столбец в наборе данных, к которому будет применена функция агрегирования.

(string)

AggFunc -> (string)

Указывает функцию агрегирования.

Возможные функции агрегирования включают: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

DropDuplicates -> (structure)

Указывает преобразование, которое удаляет повторяющиеся строки данных из набора данных.

Name -> (string)

Имя узла преобразования.

Inputs -> (list)

Вводные данные, определяемые по именам узлов.

(string)

Columns -> (list)

Имя столбцов, которые будут объединены или удалены, если повторяются.

(list)

(string)

GovernedCatalogTarget -> (structure)

Указывает целевой объект данных, который записывает в управляемый каталог.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных, в которую нужно записать.

Database -> (строка)

Имя базы данных, в которую нужно записать.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для управляемого каталога.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда ползунок обнаруживает изменение схемы.

UpdateBehavior -> (строка)

Поведение обновления, когда ползунок обнаруживает изменение схемы.

GovernedCatalogSource -> (структура)

Указывает источник данных в управляемом каталоге данных.

Name -> (строка)

Имя хранилища данных.

Database -> (строка)

База данных для чтения.

Table -> (строка)

Таблица базы данных для чтения.

PartitionPredicate -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разбиениях не удаляются. Установлено на "" — по умолчанию пусто.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (целое)

Устанавливает верхний предел размера целевого набора данных в байтах, который будет обрабатываться.

BoundedFiles -> (целое)

Устанавливает верхний предел целевого количества файлов, которые будут обрабатываться.

MicrosoftSQLServerCatalogSource -> (структура)

Указывает источник данных Microsoft SQL Server в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MySQLCatalogSource -> (структура)

Указывает источник данных MySQL в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

OracleSQLCatalogSource -> (структура)

Указывает источник данных Oracle в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

PostgreSQLCatalogSource -> (структура)

Указывает источник данных PostgresSQL в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MicrosoftSQLServerCatalogTarget -> (структура)

Указывает целевой объект, использующий Microsoft SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

MySQLCatalogTarget -> (структура)

Указывает целевой объект, использующий MySQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

OracleSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Oracle SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

PostgreSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Postgres SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

DynamicTransform -> (структура)

Указывает пользовательскую визуальную трансформацию, созданную пользователем.

Name -> (строка)

Указывает имя динамической трансформации.

TransformName -> (строка)

Указывает имя динамической трансформации, как оно отображается в визуальном редакторе Glue Studio.

Inputs -> (список)

Указывает входные данные для динамической трансформации, которые необходимы.

(строка)

Parameters -> (список)

Указывает параметры динамической трансформации.

(структура)

Указывает параметры в файле конфигурации динамической трансформации.

Name -> (строка)

Указывает имя параметра в файле конфигурации динамической трансформации.

Type -> (строка)

Указывает тип параметра в файле конфигурации динамической трансформации.

ValidationRule -> (строка)

Указывает правило валидации в файле конфигурации динамической трансформации.

ValidationMessage -> (строка)

Указывает сообщение валидации в файле конфигурации динамической трансформации.

Value -> (список)

Указывает значение параметра в файле конфигурации динамической трансформации.

(строка)

ListType -> (строка)

Указывает тип списка параметра в файле конфигурации динамической трансформации.

IsOptional -> (булево)

Указывает, является ли параметр необязательным или нет в файле конфигурации динамической трансформации.

FunctionName -> (строка)

Указывает имя функции динамической трансформации.

Path -> (строка)

Указывает путь к исходным файлам и файлам конфигурации динамической трансформации.

Version -> (строка)

Это поле не используется и будет устаревать в будущих выпусках.

OutputSchemas -> (список)

Указывает схему данных для динамической трансформации.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

EvaluateDataQuality -> (структура)

Указывает критерии оценки качества данных.

Name -> (строка)

Имя оценки качества данных.

Inputs -> (список)

Входы вашей оценки качества данных.

(строка)

Ruleset -> (строка)

Набор правил для вашей оценки качества данных.

Output -> (строка)

Вывод вашей оценки качества данных.

PublishingOptions -> (структура)

Параметры для настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

StopJobOnFailureOptions -> (структура)

Параметры для настройки остановки работы, если оценка качества данных завершается неудачей.

StopJobOnFailureTiming -> (строка)

Когда остановить работу, если оценка качества данных завершится неудачей. Варианты — Immediate или AfterDataLoad.

S3CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (словарь)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (словарь)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiSource -> (структура)

Определяет источник данных Hudi, хранящийся в Amazon S3.

Name -> (строка)

Название источника Hudi.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalHudiOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Определяет дополнительные параметры для коннектора.

BoundedSize -> (целое число)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число)

Устанавливает верхнюю границу целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения выборочного пути.

SamplePath -> (строка)

Если включено, указывает выборочный путь.

OutputSchemas -> (список)

Определяет схему данных для источника Hudi.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiCatalogTarget -> (структура)

Определяет целевой объект для записи в источник данных Hudi в каталоге данных Glue.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными данными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Определяет нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (карта)

Определяет дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для программы-обработчика.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда программа-обработчик обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда программа-обработчик обнаруживает изменённую схему.

S3HudiDirectTarget -> (структура)

Определяет целевой объект для записи в источник данных Hudi в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными данными для целевого объекта данных.

(строка)

Path -> (строка)

Путь Amazon S3 для вашего источника данных Hudi для записи.

Compression -> (строка)

Определяет способ сжатия данных. Как правило, это не нужно, если данные имеют стандартное расширение файла. Возможные значения: "gzip" и "bzip").

NumberTargetPartitions -> (строка)

Указывает количество целевых разделов для распределения файлов набора данных Hudi по Amazon S3.

PartitionKeys -> (список)

Определяет нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Format -> (строка)

Определяет формат выходных данных для целевого объекта.

AdditionalOptions -> (карта)

Определяет дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для программы-обработчика.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда программа-обработчик обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда программа-обработчик обнаруживает изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

DirectJDBCSource -> (структура)

Определяет подключение прямого источника JDBC.

Name -> (строка)

Имя подключения JDBC-источника.

Database -> (строка)

База данных подключения JDBC-источника.

Table -> (строка)

Таблица подключения JDBC-источника.

ConnectionName -> (строка)

Имя подключения JDBC-источника.

ConnectionType -> (строка)

Тип подключения JDBC-источника.

RedshiftTmpDir -> (строка)

Временная директория источника JDBC Redshift.

S3CatalogDeltaSource -> (структура)

Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogDeltaSource -> (структура)

Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaSource -> (структура)

Определяет источник данных Delta Lake, хранящийся в Amazon S3.

Name -> (строка)

Имя источника Delta Lake.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalDeltaOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Определяет дополнительные параметры для коннектора.

BoundedSize -> (целое число)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число)

Устанавливает верхнюю границу целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения выборочного пути.

SamplePath -> (строка)

Если включено, указывает выборочный путь.

OutputSchemas -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaCatalogTarget -> (структура)

Определяет целевой объект для записи в источник данных Delta Lake в каталоге данных Glue.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными данными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Определяет нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (карта)

Определяет дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для программы-обработчика.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда программа-обработчик обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда программа-обработчик обнаруживает изменённую схему.

S3DeltaDirectTarget -> (структура)

Указывает целевой объект, который записывает данные в источник Delta Lake в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входами для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение по последовательности ключей.

(список)

(строка)

Путь -> (строка)

Путь Amazon S3 для вашего источника данных Delta Lake, в который нужно записать данные.

Сжатие -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip").

NumberTargetPartitions -> (строка)

Указывает количество целевых разбиений для распределения файлов набора данных Delta Lake по Amazon S3.

Формат -> (строка)

Указывает формат выходных данных для целевого объекта.

Дополнительные параметры -> (словарь)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение при обновлении для сканера.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение при обновлении, когда сканер обнаруживает изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

AmazonRedshiftSource -> (структура)

Указывает целевой объект, который записывает данные в источник данных в Amazon Redshift.

Имя -> (строка)

Имя источника Amazon Redshift.

Данные -> (структура)

Указывает данные узла источника Amazon Reshift.

Тип доступа -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

Тип источника -> (строка)

Тип источника, чтобы указать, является ли источником конкретная таблица или пользовательский запрос.

Подключение -> (структура)

Подключение Glue к кластеру Redshift.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

CatalogDatabase -> (структура)

Имя базы данных каталога данных Glue при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

CatalogTable -> (структура)

Имя таблицы каталога данных Glue при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

CatalogRedshiftSchema -> (строка)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (строка)

Таблица базы данных для чтения.

Временная папка -> (строка)

Путь Amazon S3 для временного размещения данных при копировании из базы данных.

IamRole -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. При оставлении пустым, роль IAM будет по умолчанию соответствовать роли в задаче.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Дополнительные параметры -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Ключ -> (строка)

Ключ дополнительного параметра подключения.

Значение -> (строка)

Значение дополнительного параметра подключения.

Образец запроса -> (строка)

SQL, используемый для извлечения данных из источника Redshift, когда SourceType равен ‘query’.

Действие перед -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Действие после -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Действие -> (строка)

Указывает, как произойдёт запись в кластер Redshift.

Префикс таблицы -> (строка)

Указывает префикс таблицы.

Upsert -> (булево)

Действие, используемое для Redshift sinks при APPEND.

Действие merge -> (строка)

Действие, используемое для определения, как будет обрабатываться MERGE в Redshift sink.

MergeWhenMatched -> (строка)

Действие, используемое для определения, как будет обрабатываться MERGE в Redshift sink при совпадении записи.

MergeWhenNotMatched -> (строка)

Действие, используемое для определения, как будет обрабатываться MERGE в Redshift sink при отсутствии совпадения записи.

MergeClause -> (строка)

SQL, используемый в пользовательском merge для обработки совпадающих записей.

CrawlerConnection -> (строка)

Указывает имя подключения, связанное с таблицей каталога, используемой в запросе.

TableSchema -> (список)

Массив выходных данных схемы для данного узла.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

StagingTable -> (строка)

Имя временной таблицы staging, используемой при MERGE или APPEND с upsert.

SelectedColumns -> (список)

Список имён столбцов, используемых для определения совпадения записи при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

AmazonRedshiftTarget -> (структура)

Определяет целевой объект, который записывает данные в целевой объект Amazon Redshift.

Name -> (строка)

Имя целевого объекта Amazon Redshift.

Data -> (структура)

Определяет данные узла целевого объекта Amazon Redshift.

AccessType -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

SourceType -> (строка)

Тип источника, чтобы указать, является ли источником конкретная таблица или пользовательский запрос.

Connection -> (структура)

Подключение Glue к кластеру Redshift.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Table -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogDatabase -> (структура)

Имя базы данных каталога данных Glue при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogTable -> (структура)

Имя таблицы каталога данных Glue при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogRedshiftSchema -> (строка)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (строка)

Таблица базы данных для чтения.

TempDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

IamRole -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Если поле пустое, роль IAM будет по умолчанию взята из роли задания.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdvancedOptions -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Key -> (строка)

Ключ дополнительного параметра подключения.

Value -> (строка)

Значение дополнительного параметра подключения.

SampleQuery -> (строка)

SQL, используемый для извлечения данных из источника Redshift, когда SourceType равен ‘запрос’.

PreAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

PostAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Action -> (строка)

Указывает, как будет производиться запись в кластер Redshift.

TablePrefix -> (строка)

Указывает префикс к таблице.

Upsert -> (булево)

Действие, используемое для Redshift-целей при выполнении APPEND.

MergeAction -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-цели.

MergeWhenMatched -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-цели, когда существующая запись совпадает с новой.

MergeWhenNotMatched -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-цели, когда существующая запись не совпадает с новой.

MergeClause -> (строка)

SQL, используемый в пользовательском MERGE для обработки совпадающих записей.

CrawlerConnection -> (строка)

Указывает имя подключения, связанное с используемой таблицей каталога.

TableSchema -> (список)

Массив выходных схем для заданного узла.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

StagingTable -> (строка)

Имя временной таблицы подготовки, используемой при выполнении MERGE или APPEND с upsert.

SelectedColumns -> (список)

Список имен столбцов, используемых для определения совпадения записей при выполнении MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

EvaluateDataQualityMultiFrame -> (структура)

Определяет критерии оценки качества данных. Поддерживает несколько входных данных и возвращает набор динамических кадров.

Name -> (строка)

Название оценки качества данных.

Inputs -> (список)

Входы для оценки качества данных. Первый вход в этом списке — основной источник данных.

(строка)

AdditionalDataSources -> (карта)

Псевдонимы всех источников данных, кроме основного.

key -> (строка)

value -> (строка)

Ruleset -> (строка)

Набор правил для оценки качества данных.

PublishingOptions -> (структура)

Параметры для настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

AdditionalOptions -> (карта)

Параметры для настройки поведения преобразования во время выполнения.

key -> (строка)

value -> (строка)

StopJobOnFailureOptions -> (структура)

Параметры для настройки остановки задания при сбое оценки качества данных.

StopJobOnFailureTiming -> (строка)

Время остановки задания при сбое оценки качества данных. Варианты: Immediate или AfterDataLoad.

Recipe -> (структура)

Определяет узел рецепта Glue DataBrew.

Name -> (строка)

Имя узла Glue Studio.

Inputs -> (список)

Узлы, являющиеся входными для узла рецепта, определены по id.

(строка)

RecipeReference -> (структура)

Ссылка на рецепт DataBrew, используемый узлом.

RecipeArn -> (строка)

ARN рецепта DataBrew.

RecipeVersion -> (строка)

Версия рецепта DataBrew.

RecipeSteps -> (список)

Шаги преобразования, используемые в узле рецепта.

(структура)

Шаг рецепта, используемый в узле подготовки данных рецепта Glue Studio.

Action -> (структура)

Действие преобразования шага рецепта.

Operation -> (строка)

Операция действия рецепта.

Parameters -> (карта)

Параметры действия рецепта.

key -> (строка)

value -> (строка)

ConditionExpressions -> (список)

Условные выражения для шага рецепта.

(структура)

Условное выражение, определенное в узле подготовки данных рецепта Glue Studio.

Condition -> (строка)

Условие условного выражения.

Value -> (строка)

Значение условного выражения.

TargetColumn -> (строка)

Целевой столбец условных выражений.

SnowflakeSource -> (структура)

Определяет источник данных Snowflake.

Name -> (строка)

Имя источника данных Snowflake.

Data -> (структура)

Настройка источника данных Snowflake.

SourceType -> (строка)

Указывает, как задаются извлеченные данные. Допустимые значения: "table" , "query" .

Connection -> (структура)

Указывает соединение Glue Data Catalog с конечной точкой Snowflake.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (строка)

Определяет схему базы данных Snowflake, которую должен использовать узел.

Table -> (строка)

Определяет таблицу Snowflake, которую должен использовать узел.

Database -> (строка)

Определяет базу данных Snowflake, которую должен использовать узел.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdditionalOptions -> (массив)

Указывает дополнительные параметры, передаваемые соединителю Snowflake. Если параметры указаны в другом месте на этом узле, эти параметры будут иметь приоритет.

key -> (строка)

value -> (строка)

SampleQuery -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

PreAction -> (строка)

Строка SQL, выполняемая перед тем, как соединитель Snowflake выполнит стандартные действия.

PostAction -> (строка)

Строка SQL, выполняемая после того, как соединитель Snowflake выполнит стандартные действия.

Action -> (строка)

Указывает действие, которое необходимо выполнить при записи в таблицу с существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Action равен append . Указывает поведение разрешения, когда строка уже существует. Если значение true, существующие строки будут обновлены. Если false, эти строки будут добавлены.

MergeAction -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если пользовательское, определяется MergeClause .

MergeWhenMatched -> (строка)

Указывает, как разрешить записи, которые совпадают с существующими данными при слиянии. Допустимые значения: update , delete .

MergeWhenNotMatched -> (строка)

Указывает, как обработать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

MergeClause -> (строка)

Запрос SQL, который определяет пользовательское поведение слияния.

StagingTable -> (строка)

Имя таблицы подготовки, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table с помощью сгенерированного постдействия.

SelectedColumns -> (список)

Указывает столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с value , label и description ключами. Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AutoPushdown -> (булево)

Указывает, включена ли автоматическая передача запросов вниз. Если передача вниз включена, то при выполнении запроса на Spark, если часть запроса может быть «передана вниз» на сервер Snowflake, она передаётся вниз. Это повышает производительность некоторых запросов.

TableSchema -> (список)

Вручную определяет целевую схему для узла. Список структур с value , label и description ключами. Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

OutputSchemas -> (список)

Указывает определяемые пользователем схемы для выходных данных.

(структура)

Указывает определяемую пользователем схему, когда схему невозможно определить с помощью Glue.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SnowflakeTarget -> (структура)

Указывает целевой объект, который записывает данные в источник данных Snowflake.

Name -> (строка)

Имя целевого объекта Snowflake.

Data -> (структура)

Указывает данные узла целевого объекта Snowflake.

SourceType -> (строка)

Указывает, как задаются извлеченные данные. Допустимые значения: "table" , "query" .

Connection -> (структура)

Указывает соединение Glue Data Catalog с конечной точкой Snowflake.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (строка)

Определяет схему базы данных Snowflake, которую должен использовать узел.

Table -> (строка)

Определяет таблицу Snowflake, которую должен использовать узел.

Database -> (строка)

Определяет базу данных Snowflake, которую должен использовать узел.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdditionalOptions -> (массив)

Указывает дополнительные параметры, передаваемые соединителю Snowflake. Если параметры указаны в другом месте на этом узле, эти параметры будут иметь приоритет.

key -> (строка)

value -> (строка)

SampleQuery -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

PreAction -> (строка)

Строка SQL, выполняемая перед тем, как соединитель Snowflake выполнит стандартные действия.

PostAction -> (строка)

Строка SQL, выполняемая после того, как соединитель Snowflake выполнит стандартные действия.

Action -> (строка)

Указывает действие, которое необходимо выполнить при записи в таблицу с существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Action равен append . Указывает поведение разрешения, когда строка уже существует. Если значение true, существующие строки будут обновлены. Если false, эти строки будут добавлены.

MergeAction -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если пользовательское, определяется MergeClause .

MergeWhenMatched -> (строка)

Указывает, как разрешить записи, которые совпадают с существующими данными при слиянии. Допустимые значения: update , delete .

MergeWhenNotMatched -> (строка)

Указывает, как обработать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

MergeClause -> (строка)

Запрос SQL, который определяет пользовательское поведение слияния.

StagingTable -> (строка)

Имя таблицы подготовки, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, а затем перемещаются в table с помощью сгенерированного постдействия.

SelectedColumns -> (список)

Указывает столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с value , label и description ключами. Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AutoPushdown -> (булево)

Указывает, включена ли автоматическая передача запросов вниз. Если передача вниз включена, то при выполнении запроса на Spark, если часть запроса может быть «передана вниз» на сервер Snowflake, она передаётся вниз. Это повышает производительность некоторых запросов.

TableSchema -> (список)

Вручную определяет целевую схему для узла. Список структур с value , label и description ключами. Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

ConnectorDataSource -> (структура)

Указывает источник, сгенерированный со стандартными параметрами подключения.

Name -> (string)

Имя этого узла источника.

ConnectionType -> (string)

connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (map)

Отображает параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.

key -> (string)

value -> (string)

OutputSchemas -> (list)

Указывает схему данных для этого источника.

(structure)

Указывает схему, определённую пользователем, когда Glue не может определить схему.

Columns -> (list)

Определяет определения столбцов, составляющих схему Glue.

(structure)

Определяет один столбец в определении схемы Glue.

Name -> (string)

Имя столбца в схеме Glue Studio.

Type -> (string)

Тип Hive для этого столбца в схеме Glue Studio.

ConnectorDataTarget -> (structure)

Указывает целевой объект, сгенерированный со стандартными параметрами подключения.

Name -> (string)

Имя этого целевого узла.

ConnectionType -> (string)

connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (map)

Отображает параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.

key -> (string)

value -> (string)

Inputs -> (list)

Узлы, являющиеся входными для целевого объекта данных.

(string)

ExecutionClass -> (string)

Указывает, выполняется ли задача со стандартным или гибким классом выполнения. Стандартный класс выполнения подходит для задач с жёсткими временными ограничениями, требующих быстрого запуска задачи и выделенных ресурсов.

Гибкий класс выполнения подходит для задач, не зависящих от времени, время начала и окончания которых может варьироваться.

Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для задач Spark.

SourceControlDetails -> (structure)

Подробности для конфигурации управления исходным кодом для задачи, позволяющие синхронизировать артефакты задачи с удалённым репозиторием или из него.

Provider -> (string)

Поставщик удалённого репозитория.

Repository -> (string)

Имя удалённого репозитория, содержащего артефакты задачи.

Owner -> (string)

Владелец удалённого репозитория, содержащего артефакты задачи.

Branch -> (string)

Необязательная ветвь в удалённом репозитории.

Folder -> (string)

Необязательная папка в удалённом репозитории.

LastCommitId -> (string)

Идентификатор последнего коммита в удалённом репозитории.

AuthStrategy -> (string)

Тип аутентификации, который может быть токеном аутентификации, хранящимся в Amazon Web Services Secrets Manager, или личным токеном доступа.

AuthToken -> (string)

Значение токена авторизации.

MaintenanceWindow -> (string)

Это поле определяет день недели и час для окна технического обслуживания для потоковых задач. Glue периодически выполняет задачи технического обслуживания. Во время этих окон технического обслуживания Glue потребуется перезапустить ваши потоковые задачи.

Glue перезапустит задачу в течение 3 часов от указанного окна технического обслуживания. Например, если вы настроили окно технического обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.

ProfileName -> (string)

Имя профиля использования Glue, связанного с задачей.

NextToken -> (string)

Токен продолжения, если не все определения задач ещё возвращены.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API