Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

batch-get-workflows

Описание

Возвращает список метаданных ресурсов для заданного списка имён рабочих процессов. После вызова операции ListWorkflows, вы можете вызвать эту операцию для доступа к данным, на которые у вас есть разрешения. Эта операция поддерживает все разрешения IAM, включая условия разрешений, использующие теги.

См. также: Документация API AWS

Синтаксис

  batch-get-workflows
--names <value>
[--include-graph | --no-include-graph]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--names (список)

Список имён рабочих процессов, которые могут быть возвращены операцией ListWorkflows.

(строка)

Синтаксис:

"string" "string" ...

--no-include-graph (логическое значение)

Указывает, следует ли включать график при возвращении метаданных ресурса рабочего процесса.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, полученные из JSON. Невозможно передавать произвольные двоичные значения с помощью JSON-значения, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если не указано никакого значения или значение равно input, выводит пример JSON-ввода, который может быть использован в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, выведет пример YAML-ввода, который можно использовать с --cli-input-yaml. Если указано значение output, проверяет входные данные команды и возвращает пример JSON-вывода для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включить отладочную запись в журнал.

--endpoint-url (строка)

Переопределить URL по умолчанию команды на указанный URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверяет SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определённый профиль из вашего файла с данными учетной записи.

--region (строка)

Используемый регион. Переопределяет параметры конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/отключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (логическое значение)

Не подписывать запросы. Кредиты не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл с пакетом сертификатов CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, которое соотносится с двоичным блоком, fileb:// всегда будет рассматриваться как двоичный и будет использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить пейджер cli для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запросить параметры ввода CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запроса параметров ввода CLI.

Вывод

Рабочие процессы -> (список)

Список метаданных ресурсов рабочего процесса.

(структура)

Рабочий процесс — это набор нескольких зависимых заданий и ползунков Glue, которые выполняются для завершения сложной задачи ETL. Рабочий процесс управляет выполнением и мониторингом всех своих заданий и ползунков.

Имя -> (строка)

Имя рабочего процесса.

Описание -> (строка)

Описание рабочего процесса.

DefaultRunProperties -> (массив)

Коллекция свойств, используемых в рамках каждого выполнения рабочего процесса. Свойства выполнения доступны каждому заданию в рабочем процессе. Задание может изменить свойства для последующих заданий в потоке.

ключ -> (строка)

значение -> (строка)

Создано -> (метка времени)

Дата и время создания рабочего процесса.

Изменено -> (метка времени)

Дата и время последнего изменения рабочего процесса.

Последнее выполнение -> (структура)

Информация о последнем выполнении рабочего процесса.

Имя -> (строка)

Имя выполненного рабочего процесса.

Id выполнения рабочего процесса -> (строка)

Идентификатор этого выполнения рабочего процесса.

Id предыдущего выполнения -> (строка)

Идентификатор предыдущего выполнения рабочего процесса.

WorkflowRunProperties -> (массив)

Свойства выполнения рабочего процесса, заданные во время выполнения.

ключ -> (строка)

значение -> (строка)

Начало -> (метка времени)

Дата и время начала выполнения рабочего процесса.

Завершено -> (метка времени)

Дата и время завершения выполнения рабочего процесса.

Статус -> (строка)

Статус выполнения рабочего процесса.

Сообщение об ошибке -> (строка)

Это сообщение об ошибке описывает любую ошибку, которая могла возникнуть при запуске выполнения рабочего процесса. В настоящее время единственное сообщение об ошибке — «Превышено количество одновременных запусков для рабочего процесса: foo .»

Статистика -> (структура)

Статистика выполнения.

Общее число действий -> (целое число)

Общее количество действий в выполнении рабочего процесса.

Действия с превышением времени ожидания -> (целое число)

Общее количество действий, которые истекли по времени ожидания.

Неудачные действия -> (целое число)

Общее количество действий, которые завершились неудачно.

Остановленные действия -> (целое число)

Общее количество действий, которые были остановлены.

Успешные действия -> (целое число)

Общее количество действий, которые были выполнены успешно.

Действия в состоянии выполнения -> (целое число)

Общее количество действий в состоянии выполнения.

Действия с ошибками -> (целое число)

Указывает количество запусков заданий в состоянии ERROR в выполнении рабочего процесса.

Ожидающие действия -> (целое число)

Указывает количество запусков заданий в состоянии WAITING в выполнении рабочего процесса.

Граф -> (структура)

Граф, представляющий все компоненты Glue, относящиеся к рабочему процессу, как узлы и направленные соединения между ними как ребра.

Узлы -> (список)

Список компонентов Glue, относящихся к рабочему процессу, представленных в виде узлов.

(структура)

Узел представляет собой компонент Glue (триггер, ползунок или задание) в графическом представлении рабочего процесса.

Тип -> (строка)

Тип компонента Glue, представленного узлом.

Имя -> (строка)

Имя компонента Glue, представленного узлом.

Уникальный идентификатор -> (строка)

Уникальный идентификатор, присвоенный узлу в рабочем процессе.

TriggerDetails -> (структура)

Подробности триггера, когда узел представляет собой триггер.

Триггер -> (структура)

Информация о триггере, представленном узлом триггера.

Имя -> (строка)

Имя триггера.

Имя рабочего процесса -> (строка)

Имя рабочего процесса, связанного с триггером.

Id -> (строка)

Зарезервировано для будущего использования.

Тип -> (строка)

Тип триггера.

Состояние -> (строка)

Текущее состояние триггера.

Описание -> (строка)

Описание этого триггера.

Расписание -> (строка)

Выражение cron, используемое для задания расписания (см. Расписания по времени для заданий и ползунков . Например, для запуска чего-либо каждый день в 12:15 UTC, вы бы указали: cron(15 12 * * ? *) .

Действия -> (список)

Действия, инициированные этим триггером.

(структура)

Определяет действие, которое должно быть инициировано триггером.

Имя задания -> (строка)

Имя задания, которое должно быть запущено.

Аргументы -> (массив)

Аргументы задания, используемые при срабатывании этого триггера. Для этого выполнения задания они заменяют стандартные аргументы, заданные в определении задания.

Вы можете указать здесь аргументы, которые использует ваша собственная скрипт выполнения задания, а также аргументы, которые использует сам Glue.

Для получения информации о том, как указать и использовать свои собственные аргументы задания, см. раздел «Вызов API Glue на языке Python» в руководстве разработчика.

Для получения информации о парах ключ-значение, которые потребляет Glue для настройки вашего задания, см. раздел «Особые параметры, используемые Glue» в руководстве разработчика.

ключ -> (строка)

значение -> (строка)

Превышение времени ожидания -> (целое число)

Время ожидания JobRun в минутах. Это максимальное время, которое запуск задания может потреблять ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT . Это переопределяет значение таймаута, заданное в родительском задании.

У заданий должны быть значения таймаута меньше 7 дней или 10080 минут. В противном случае задания вызовут исключение.

Если значение не указано, таймаут по умолчанию составляет 2880 минут.

Любые существующие задания Glue, у которых значение таймаута было больше 7 дней, будут по умолчанию установлено в 7 дней. Например, если вы указали таймаут в 20 дней для пакетного задания, оно будет остановлено на 7-й день.

Для потоковых заданий, если вы настроили окно обслуживания, оно будет перезапущено во время окна обслуживания после 7 дней.

SecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, которая будет использоваться с этим действием.

NotificationProperty -> (структура)

Указывает конфигурационные свойства уведомления о запуске задания.

NotifyDelayAfter -> (целое число)

После запуска выполнения задания количество минут, которые нужно подождать, прежде чем отправить уведомление о задержке запуска задания.

CrawlerName -> (строка)

Имя ползунка, которое будет использоваться с этим действием.

Предикат -> (структура)

Предикат этого триггера, который определяет, когда он сработает.

Логический -> (строка)

Необязательное поле, если указано только одно условие. Если указано несколько условий, то это поле обязательно.

Условия -> (список)

Список условий, определяющих, когда будет срабатывать триггер.

(структура)

Определяет условие, при котором срабатывает триггер.

Логический оператор -> (строка)

Логический оператор.

Имя задания -> (строка)

Имя задания, к которому относится это условие, и на котором этот триггер ожидает.

Состояние -> (строка)

Состояние условия. В настоящее время только состояния заданий, на которые может реагировать триггер, это SUCCEEDED , STOPPED , FAILED и TIMEOUT . Только состояния ползунков, на которые может реагировать триггер, это SUCCEEDED , FAILED и CANCELLED .

Имя ползунка -> (строка)

Имя ползунка, к которому относится это условие.

CrawlState -> (строка)

Состояние ползунка, к которому относится это условие.

EventBatchingCondition -> (структура)

Условие группировки событий, которое должно быть выполнено (указано количество полученных событий или истекло время окна группировки), прежде чем триггер события EventBridge сработает.

Размер группы -> (целое число)

Количество событий, которое должно быть получено из Amazon EventBridge, прежде чем триггер события EventBridge сработает.

Окно группировки -> (целое число)

Время в секундах, по истечении которого триггер события EventBridge сработает. Окно начинается, когда получено первое событие.

JobDetails -> (структура)

Подробности задания, когда узел представляет собой задание.

JobRuns -> (список)

Информация для запусков заданий, представленных узлом задания.

(структура)

Содержит информацию о выполнении задания.

Id -> (строка)

Идентификатор этого выполнения задания.

Attempt -> (целое число)

Номер попытки выполнения этого задания.

PreviousRunId -> (строка)

Идентификатор предыдущего выполнения этого задания. Например, JobRunId, указанный в действии StartJobRun.

TriggerName -> (строка)

Имя триггера, запустившего это выполнение задания.

JobName -> (строка)

Имя определения задания, используемого в этом выполнении.

JobMode -> (строка)

Режим, описывающий способ создания задания. Допустимые значения:

  • SCRIPT - Задание создано с помощью редактора сценариев Glue Studio.
  • VISUAL - Задание создано с помощью визуального редактора Glue Studio.
  • NOTEBOOK - Задание создано с помощью блокнота интерактивных сессий.

Если поле JobMode отсутствует или равно null, по умолчанию используется значение SCRIPT.

JobRunQueuingEnabled -> (булево)

Указывает, включена ли очередь выполнения заданий для этого выполнения задания.

Значение true означает, что очередь выполнения заданий включена для этого выполнения. Если значение false или поле не задано, выполнение задания не будет учитываться для очереди.

StartedOn -> (метка времени)

Дата и время начала выполнения этого задания.

LastModifiedOn -> (метка времени)

Последнее время изменения этого выполнения задания.

CompletedOn -> (метка времени)

Дата и время завершения этого выполнения задания.

JobRunState -> (строка)

Текущее состояние выполнения задания. Дополнительную информацию о состояниях заданий, завершившихся с ошибкой, см. в Glue Job Run Statuses.

Arguments -> (карта)

Аргументы задания, связанные с этим выполнением. Для этого выполнения задания они заменяют значения аргументов по умолчанию, заданные в определении задания.

Вы можете указать здесь аргументы, используемые собственным скриптом выполнения задания, а также аргументы, используемые самим Glue.

Аргументы задания могут регистрироваться. Не передавайте текстовые секреты в качестве аргументов. Получайте секреты из Glue Connection, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в рамках задания.

Дополнительную информацию о способах указания и использования собственных аргументов задания см. в разделе Calling Glue APIs in Python в руководстве разработчика.

Дополнительную информацию об аргументах, которые можно указать для этого поля при настройке заданий Spark, см. в разделе Special Parameters Used by Glue в руководстве разработчика.

Дополнительную информацию об аргументах, которые можно указать для этого поля при настройке заданий Ray, см. в разделе Using job parameters in Ray jobs в руководстве разработчика.

ключ -> (строка)

значение -> (строка)

ErrorMessage -> (строка)

Сообщение об ошибке, связанное с этим выполнением задания.

PredecessorRuns -> (список)

Список предшественников для этого выполнения задания.

(структура)

Выполнение задания, используемое в предикате условного триггера, который запустил это выполнение задания.

JobName -> (строка)

Имя определения задания, используемого предшествующим выполнением задания.

RunId -> (строка)

Идентификатор выполнения предшествующего задания.

AllocatedCapacity -> (целое число)

Это поле устарело. Используйте MaxCapacity вместо него.

Количество выделенных единиц обработки данных Glue (DPUs) для этого JobRun. Можно выделить от 2 до 100 DPUs; по умолчанию - 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессорных ядер (vCPU) и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.

ExecutionTime -> (целое число)

Время (в секундах), которое выполнение задания использовало ресурсы.

Timeout -> (целое число)

Таймаут в минутах для JobRun. Это максимальное время, которое выполнение задания может использовать ресурсы, прежде чем будет завершено и перейдет в состояние TIMEOUT. Это значение переопределяет значение таймаута, установленное в родительском задании.

Значения таймаута заданий должны быть меньше 7 дней или 10080 минут. В противном случае задания вызовут исключение.

Если значение не указано, таймаут по умолчанию равен 2880 минутам.

Любые существующие задания Glue, у которых значение таймаута было больше 7 дней, будут по умолчанию установлены в 7 дней. Например, если вы указали таймаут в 20 дней для задания пакетной обработки, оно будет остановлено на 7-й день.

Для потоковых заданий, если вы настроили окно обслуживания, оно будет перезапущено во время окна обслуживания после 7 дней.

MaxCapacity -> (двойное число)

Для заданий Glue версии 1.0 или более ранних, использующих стандартный тип исполнителя, количество единиц обработки данных Glue (DPUs), которые могут быть выделены при выполнении этого задания. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессорных ядер (vCPU) и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.

Для заданий Glue версии 2.0 и выше вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.

Не устанавливайте MaxCapacity, если используете WorkerType и NumberOfWorkers.

Значение, которое можно выделить для MaxCapacity, зависит от того, выполняете ли вы задание Python shell, задание Apache Spark ETL или задание Apache Spark потоковой ETL:

  • При указании задания Python shell (JobCommand.Name =”pythonshell”) можно выделить 0,0625 или 1 DPU. По умолчанию - 0,0625 DPU.
  • При указании задания Apache Spark ETL (JobCommand.Name =”glueetl”) или задания Apache Spark потоковой ETL (JobCommand.Name =”gluestreaming”) можно выделить от 2 до 100 DPUs. По умолчанию - 10 DPUs. Для этого типа задания не допускается дробное выделение DPU.

WorkerType -> (строка)

Тип предварительно определенного исполнителя, который выделяется при запуске задания. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для заданий Spark. Принимает значение Z.2X для заданий Ray.

  • Для типа исполнителя G.1X каждый исполнитель соответствует 1 DPU (4 vCPU, 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполнитель на исполнитель. Мы рекомендуем этот тип исполнителя для таких задач, как преобразование данных, объединение и запросы, чтобы предложить масштабируемый и экономичный способ запуска большинства заданий.
  • Для типа исполнителя G.2X каждый исполнитель соответствует 2 DPU (8 vCPU, 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполнитель на исполнитель. Мы рекомендуем этот тип исполнителя для таких задач, как преобразование данных, объединение и запросы, чтобы предложить масштабируемый и экономичный способ запуска большинства заданий.
  • Для типа исполнителя G.4X каждый исполнитель соответствует 4 DPU (16 vCPU, 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполнитель на исполнитель. Мы рекомендуем этот тип исполнителя для задач, которые включают наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип исполнителя доступен только для заданий Spark ETL Glue версии 3.0 или более поздних версий в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm).
  • Для типа исполнителя G.8X каждый исполнитель соответствует 8 DPU (32 vCPU, 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполнитель на исполнитель. Мы рекомендуем этот тип исполнителя для задач, которые включают наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип исполнителя доступен только для заданий Spark ETL Glue версии 3.0 или более поздних версий в тех же регионах Amazon Web Services, что и для типа исполнителя G.4X.
  • Для типа исполнителя G.025X каждый исполнитель соответствует 0,25 DPU (2 vCPU, 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполнитель на исполнитель. Мы рекомендуем этот тип исполнителя для потоковых заданий с низким объемом. Этот тип исполнителя доступен только для потоковых заданий Glue версии 3.0 или более поздних.
  • Для типа исполнителя Z.2X каждый исполнитель соответствует 2 M-DPU (8 vCPU, 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 исполнителей Ray на основе автоматического масштабирования.

NumberOfWorkers -> (целое число)

Количество исполнителей определенного типа workerType, выделенных при запуске задания.

SecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, используемой с этим выполнением задания.

LogGroupName -> (строка)

Имя группы журналов для безопасного ведения журналов, которое может быть зашифровано на стороне сервера в Amazon CloudWatch с помощью KMS. Это имя может быть /aws-glue/jobs/, в этом случае шифрование по умолчанию — NONE. Если вы добавите имя роли и имя SecurityConfiguration (другими словами, /aws-glue/jobs-yourRoleName-yourSecurityConfigurationName/), то для шифрования группы журналов будет использоваться эта конфигурация безопасности.

NotificationProperty -> (структура)

Указывает конфигурационные свойства уведомления о выполнении задания.

NotifyDelayAfter -> (целое число)

Количество минут, которые нужно подождать после начала выполнения задания, прежде чем отправить уведомление о задержке выполнения задания.

GlueVersion -> (строка)

В заданиях Spark, GlueVersion определяет версии Apache Spark и Python, доступные в задании Glue. Версия Python указывает поддерживаемую версию для заданий типа Spark.

Задания Ray должны установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступных в вашем задании Ray, определяются параметром Runtime команды Job.

Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в разделе Glue version в руководстве разработчика.

Задания, созданные без указания версии Glue, используют Glue 0.9 по умолчанию.

DPUSeconds -> (двойное число)

Это поле может быть установлено для заданий с классом выполнения FLEX или при включенном автоматическом масштабировании и представляет собой общее время работы каждого исполнителя в течение жизненного цикла выполнения задания в секундах, умноженное на фактор DPU (1 для G.1X, 2 для G.2X или 0,25 для G.025X исполнителей). Это значение может отличаться от executionEngineRuntime * MaxCapacity, как в случае заданий с автоматическим масштабированием, поскольку количество работающих исполнителей в определенный момент может быть меньше, чем MaxCapacity. Следовательно, возможно, что значение DPUSeconds меньше, чем executionEngineRuntime * MaxCapacity.

ExecutionClass -> (строка)

Указывает, запускается ли задание со стандартным или гибким классом выполнения. Стандартный класс выполнения подходит для задач, чувствительных к времени, которые требуют быстрого запуска задания и выделенных ресурсов.

Гибкий класс выполнения подходит для задач, не чувствительных к времени, время запуска и завершения которых может меняться.

Только задания с версией Glue 3.0 и выше и типом команды glueetl будут допускать установку ExecutionClass в значение FLEX. Гибкий класс выполнения доступен для заданий Spark.

MaintenanceWindow -> (строка)

Это поле указывает день недели и час для окна технического обслуживания для потоковых задач. Glue периодически выполняет задачи технического обслуживания. Во время этих окон технического обслуживания Glue потребуется перезапустить ваши потоковые задачи.

Glue перезапустит задачу в течение 3 часов с момента указанного окна технического обслуживания. Например, если вы настроили окно технического обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены в период с 10:00 по Гринвичу до 13:00 по Гринвичу.

ProfileName -> (строка)

Имя профиля использования Glue, связанного с запуском задачи.

StateDetail -> (строка)

Это поле содержит подробную информацию о состоянии запуска задачи. Поле может быть пустым.

Например, когда запуск задачи находится в состоянии ОЖИДАНИЯ в результате очереди запусков задач, в поле указана причина, по которой запуск задачи находится в этом состоянии.

CrawlerDetails -> (структура)

Подробная информация о кроулере, когда узел представляет кроулер.

Crawls -> (список)

Список кроулов, представленных узлом кроула.

(структура)

Подробности кроула в рабочем процессе.

State -> (строка)

Состояние кроулера.

StartedOn -> (метка времени)

Дата и время начала кроула.

CompletedOn -> (метка времени)

Дата и время завершения кроула.

ErrorMessage -> (строка)

Сообщение об ошибке, связанное с кроулом.

LogGroup -> (строка)

Группа журналов, связанная с кроулом.

LogStream -> (строка)

Поток журнала, связанный с кроулом.

Edges -> (список)

Список всех направленных соединений между узлами, принадлежащими рабочему процессу.

(структура)

Ребро представляет собой направленное соединение между двумя компонентами Glue, которые являются частью рабочего процесса, к которому принадлежит ребро.

SourceId -> (строка)

Уникальный идентификатор узла в рабочем процессе, с которого начинается ребро.

DestinationId -> (строка)

Уникальный идентификатор узла в рабочем процессе, в котором заканчивается ребро.

StartingEventBatchCondition -> (структура)

Условие пакетной обработки, которое инициировало запуск рабочего процесса.

BatchSize -> (целое число)

Количество событий в пакете.

BatchWindow -> (целое число)

Продолжительность окна пакетной обработки в секундах.

Graph -> (структура)

Граф, представляющий все компоненты Glue, которые принадлежат рабочему процессу, как узлы, и направленные соединения между ними, как рёбра.

Nodes -> (список)

Список компонентов Glue, принадлежащих рабочему процессу, представленных в виде узлов.

(структура)

Узел представляет собой компонент Glue (триггер, кроулер или задачу) на графе рабочего процесса.

Type -> (строка)

Тип компонента Glue, представленного узлом.

Name -> (строка)

Имя компонента Glue, представленного узлом.

UniqueId -> (строка)

Уникальный идентификатор, присвоенный узлу в рамках рабочего процесса.

TriggerDetails -> (структура)

Подробная информация о триггере, когда узел представляет триггер.

Trigger -> (структура)

Информация о триггере, представленном узлом триггера.

Name -> (строка)

Имя триггера.

WorkflowName -> (строка)

Имя рабочего процесса, связанного с триггером.

Id -> (строка)

Зарезервировано для будущего использования.

Type -> (строка)

Тип триггера.

State -> (строка)

Текущее состояние триггера.

Description -> (строка)

Описание этого триггера.

Schedule -> (строка)

cron выражение, используемое для указания расписания (см. Расписания по времени для задач и кроулеров . Например, чтобы запустить что-то каждый день в 12:15 по UTC, вы бы указали: cron(15 12 * * ? *) .

Actions -> (список)

Действия, инициированные этим триггером.

(структура)

Определяет действие, которое должно быть инициировано триггером.

JobName -> (строка)

Имя задачи, которая должна быть выполнена.

Arguments -> (отображение)

Аргументы задачи, используемые при срабатывании этого триггера. Для этого запуска задачи они заменяют аргументы по умолчанию, установленные в определении задачи.

Вы можете указать аргументы здесь, которые использует ваша собственная скрипт выполнения задачи, а также аргументы, которые использует сам Glue.

Сведения о том, как указать и использовать свои собственные аргументы задачи, см. в разделе Вызов API Glue на Python в руководстве разработчика.

Сведения о парах ключ-значение, которые Glue использует для настройки вашей задачи, см. в разделе Специальные параметры, используемые Glue в руководстве разработчика.

key -> (строка)

value -> (строка)

Timeout -> (целое число)

JobRun таймаут в минутах. Это максимальное время, которое запуск задачи может потреблять ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT. Это переопределяет значение таймаута, установленное в родительской задаче.

Задачи должны иметь значения таймаута менее 7 дней или 10080 минут. В противном случае задачи генерируют исключение.

Если значение не указано, таймаут устанавливается по умолчанию в 2880 минут.

Любые существующие задачи Glue, у которых было значение таймаута больше 7 дней, будут установлены по умолчанию на 7 дней. Например, если вы указали таймаут 20 дней для задачи пакетной обработки, он будет остановлен на 7-й день.

Для потоковых задач, если вы настроили окно технического обслуживания, оно будет перезапущено в течение окна технического обслуживания по истечении 7 дней.

SecurityConfiguration -> (строка)

Имя SecurityConfiguration структуры, которая будет использоваться с этим действием.

NotificationProperty -> (структура)

Указывает конфигурационные свойства уведомления о запуске задачи.

NotifyDelayAfter -> (целое число)

По истечении определенного времени после запуска задачи, в минутах, система ожидает отправки уведомления о задержке запуска задачи.

CrawlerName -> (строка)

Имя кроулера, которое будет использоваться с этим действием.

Predicate -> (структура)

Предикат этого триггера, определяющий, когда он сработает.

Logical -> (строка)

Необязательное поле, если указано только одно условие. Если перечислены несколько условий, это поле необходимо.

Conditions -> (список)

Список условий, определяющих, когда сработает триггер.

(структура)

Определяет условие, при котором срабатывает триггер.

LogicalOperator -> (строка)

Логический оператор.

JobName -> (строка)

Имя задачи, к которой относится это условие, и на которой этот триггер ожидает.

State -> (строка)

Состояние условия. В настоящее время единственными состояниями задач, на которые может реагировать триггер, являются SUCCEEDED , STOPPED , FAILED и TIMEOUT. Единственными состояниями кроулера, на которые может реагировать триггер, являются SUCCEEDED , FAILED и CANCELLED.

CrawlerName -> (строка)

Имя кроулера, к которому относится это условие.

CrawlState -> (строка)

Состояние кроулера, к которому относится это условие.

EventBatchingCondition -> (структура)

Условие пакетной обработки, которое должно быть выполнено (определенное количество полученных событий или истечение временного окна пакетной обработки), прежде чем триггер события EventBridge сработает.

BatchSize -> (целое число)

Количество событий, которые должны быть получены от Amazon EventBridge, прежде чем сработает триггер события EventBridge.

BatchWindow -> (целое число)

Временной интервал в секундах, после истечения которого сработает триггер события EventBridge. Интервал начинается с получения первого события.

JobDetails -> (структура)

Подробная информация о задаче, когда узел представляет задачу.

JobRuns -> (список)

Информация о запусках задач, представленных узлом задачи.

(структура)

Содержит информацию о запуске задания.

Id -> (строка)

Идентификатор этого запуска задания.

Attempt -> (целое число)

Номер попытки запустить это задание.

PreviousRunId -> (строка)

Идентификатор предыдущего запуска этого задания. Например, JobRunId, указанный в действии StartJobRun.

TriggerName -> (строка)

Имя триггера, запустившего этот запуск задания.

JobName -> (строка)

Имя определения задания, используемого в этом запуске.

JobMode -> (строка)

Режим, описывающий способ создания задания. Допустимые значения:

  • SCRIPT - Задание было создано с помощью редактора сценариев Glue Studio.
  • VISUAL - Задание было создано с помощью визуального редактора Glue Studio.
  • NOTEBOOK - Задание было создано с помощью интерактивной записной книжки.

Если поле JobMode отсутствует или имеет значение null, по умолчанию устанавливается значение SCRIPT.

JobRunQueuingEnabled -> (булево)

Указывает, включена ли очередь запусков заданий для запуска задания.

Значение true означает, что очередь запусков заданий включена для запуска задания. Если значение false или оно не указано, запуск задания не будет учтен для очереди.

StartedOn -> (отметка времени)

Дата и время начала этого запуска задания.

LastModifiedOn -> (отметка времени)

Последний раз, когда этот запуск задания был изменен.

CompletedOn -> (отметка времени)

Дата и время завершения этого запуска задания.

JobRunState -> (строка)

Текущее состояние запуска задания. Более подробную информацию о состояниях заданий, завершившихся с ошибками, см. в разделе Glue Job Run Statuses.

Arguments -> (карта)

Аргументы задания, связанные с этим запуском. Для этого запуска задания они заменяют аргументы по умолчанию, заданные в определении задания.

Вы можете указать здесь аргументы, используемые собственным скриптом выполнения задания, а также аргументы, используемые самим Glue.

Аргументы задания могут регистрироваться. Не передавайте текстовые секреты в качестве аргументов. Получайте секреты из подключения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите сохранить их в задании.

Дополнительную информацию о том, как указать и использовать собственные аргументы задания, см. в разделе «Вызов API Glue на Python» в руководстве для разработчиков.

Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке заданий Spark, см. в разделе «Специальные параметры, используемые Glue» в руководстве для разработчиков.

Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке заданий Ray, см. в разделе «Использование параметров задания в заданиях Ray» в руководстве для разработчиков.

ключ -> (строка)

значение -> (строка)

ErrorMessage -> (строка)

Сообщение об ошибке, связанное с этим запуском задания.

PredecessorRuns -> (список)

Список предшественников этого запуска задания.

(структура)

Запуск задания, который использовался в предикате условного триггера, вызвавшего этот запуск задания.

JobName -> (строка)

Имя определения задания, используемого предшествующим запуском задания.

RunId -> (строка)

Идентификатор запуска задания предшественника.

AllocatedCapacity -> (целое число)

Это поле устарело. Используйте MaxCapacity вместо него.

Количество выделенных единиц обработки данных Glue (DPU) для этого запуска задания. Можно выделить от 2 до 100 DPU; по умолчанию — 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.

ExecutionTime -> (целое число)

Время (в секундах), в течение которого запуск задания потреблял ресурсы.

Timeout -> (целое число)

Таймаут JobRun в минутах. Это максимальное время, в течение которого запуск задания может потреблять ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT. Это значение переопределяет значение таймаута, заданное в родительском задании.

Значения таймаута заданий должны быть меньше 7 дней или 10080 минут. В противном случае задания вызовут исключение.

Если значение не указано, таймаут по умолчанию устанавливается в 2880 минут.

Все существующие задания Glue, для которых было задано значение таймаута больше 7 дней, будут установлены по умолчанию в 7 дней. Например, если вы указали таймаут в 20 дней для задания пакетной обработки, оно будет остановлено на 7-й день.

Для заданий потоковой обработки, если вы настроили окно обслуживания, оно будет перезапущено во время окна обслуживания через 7 дней.

MaxCapacity -> (двойное)

Для заданий Glue версии 1.0 или более ранних, использующих стандартный тип работ, количество единиц обработки данных Glue (DPU), которые могут быть выделены при запуске этого задания. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице цен Glue.

Для заданий Glue версии 2.0+ вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.

Не устанавливайте MaxCapacity, если используете WorkerType и NumberOfWorkers.

Значение, которое можно выделить для MaxCapacity, зависит от того, запускаете ли вы задание Python shell, задание Apache Spark ETL или задание Apache Spark потоковой ETL:

  • Если вы указали задание Python shell (JobCommand.Name =”pythonshell”), вы можете выделить либо 0,0625, либо 1 DPU. По умолчанию устанавливается 0,0625 DPU.
  • Если вы указали задание Apache Spark ETL (JobCommand.Name =”glueetl”) или задание Apache Spark потоковой ETL (JobCommand.Name =”gluestreaming”), вы можете выделить от 2 до 100 DPU. По умолчанию — 10 DPU. Этот тип задания не может иметь дробное выделение DPU.

WorkerType -> (строка)

Тип предварительно определенного работника, который выделяется при запуске задания. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для заданий Spark. Принимает значение Z.2X для заданий Ray.

  • Для типа работника G.1X каждый работник соответствует 1 DPU (4 vCPU, 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполнителя на работника. Мы рекомендуем этот тип работника для задач, таких как преобразования данных, объединения и запросы, чтобы обеспечить масштабируемый и экономически эффективный способ запуска большинства заданий.
  • Для типа работника G.2X каждый работник соответствует 2 DPU (8 vCPU, 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполнителя на работника. Мы рекомендуем этот тип работника для задач, таких как преобразования данных, объединения и запросы, чтобы обеспечить масштабируемый и экономически эффективный способ запуска большинства заданий.
  • Для типа работника G.4X каждый работник соответствует 4 DPU (16 vCPU, 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполнителя на работника. Мы рекомендуем этот тип работника для заданий, рабочие нагрузки которых содержат ваши самые сложные преобразования, агрегации, объединения и запросы. Этот тип работника доступен только для заданий Spark ETL Glue версии 3.0 или более поздней в следующих регионах Amazon Web Services: США-Восток (Огайо), США-Восток (Северная Вирджиния), США-Запад (Орегон), Азия-Тихоокеанский регион (Сингапур), Азия-Тихоокеанский регион (Сидней), Азия-Тихоокеанский регион (Токио), Канада (Центр), Европа (Франкфурт), Европа (Ирландия) и Европа (Стокгольм).
  • Для типа работника G.8X каждый работник соответствует 8 DPU (32 vCPU, 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполнителя на работника. Мы рекомендуем этот тип работника для заданий, рабочие нагрузки которых содержат ваши самые сложные преобразования, агрегации, объединения и запросы. Этот тип работника доступен только для заданий Spark ETL Glue версии 3.0 или более поздней в тех же регионах Amazon Web Services, что и для типа работника G.4X.
  • Для типа работника G.025X каждый работник соответствует 0,25 DPU (2 vCPU, 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполнителя на работника. Мы рекомендуем этот тип работника для заданий потоковой обработки с небольшим объемом данных. Этот тип работника доступен только для заданий потоковой обработки Glue версии 3.0 или более поздней.
  • Для типа работника Z.2X каждый работник соответствует 2 M-DPU (8 vCPU, 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 Ray-работников на основе системы автоматического масштабирования.

NumberOfWorkers -> (целое число)

Количество работников определенного workerType, выделенных при запуске задания.

SecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, используемой с этим запуском задания.

LogGroupName -> (строка)

Имя группы журналов для безопасного ведения журнала, которое может быть зашифровано на серверной стороне в Amazon CloudWatch с помощью KMS. Это имя может быть /aws-glue/jobs/, в этом случае шифрование по умолчанию — NONE. Если вы добавите имя роли и имя SecurityConfiguration (другими словами, /aws-glue/jobs-yourRoleName-yourSecurityConfigurationName/), то будет использоваться соответствующая конфигурация безопасности для шифрования группы журналов.

NotificationProperty -> (структура)

Указывает конфигурационные свойства уведомления о запуске задания.

NotifyDelayAfter -> (целое число)

Количество минут ожидания отправки уведомления о задержке запуска задания после его начала.

GlueVersion -> (строка)

В заданиях Spark, GlueVersion определяет версии Apache Spark и Python, доступные в задании Glue. Версия Python указывает поддерживаемую версию для заданий типа Spark.

Задания Ray должны установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступных в вашем задании Ray, определяются параметром Runtime команды задания.

Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в руководстве для разработчиков в разделе «Версия Glue».

Задания, созданные без указания версии Glue, по умолчанию используют Glue 0.9.

DPUSeconds -> (двойное)

Это поле можно установить для запусков заданий с классом выполнения FLEX или при включении автоматического масштабирования и представляет собой общее время работы каждого исполнителя в течение жизненного цикла запуска задания в секундах, умноженное на множитель DPU (1 для G.1X, 2 для G.2X или 0,25 для G.025X работников). Это значение может отличаться от executionEngineRuntime * MaxCapacity, как в случае заданий с автоматическим масштабированием, так как количество исполнителей, работающих в данный момент, может быть меньше MaxCapacity. Поэтому возможно, что значение DPUSeconds меньше executionEngineRuntime * MaxCapacity.

ExecutionClass -> (строка)

Указывает, выполняется ли задание со стандартным или гибким классом выполнения. Стандартный класс выполнения подходит для задач, критически важных с точки зрения времени, которые требуют быстрого запуска задания и выделенных ресурсов.

Гибкий класс выполнения подходит для заданий, не критичных с точки зрения времени, время запуска и завершения которых может изменяться.

Только задания с Glue версии 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для заданий Spark.

MaintenanceWindow -> (string)

Это поле указывает день недели и час для окна технического обслуживания для потоковых задач. Glue периодически выполняет задачи технического обслуживания. Во время этих окон технического обслуживания Glue потребуется перезапустить ваши потоковые задачи.

Glue перезапустит задачу в течение 3 часов с момента указанного окна технического обслуживания. Например, если вы настроили окно технического обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.

ProfileName -> (string)

Имя профиля использования Glue, связанного с выполнением задачи.

StateDetail -> (string)

Это поле содержит подробную информацию о состоянии выполнения задачи. Поле может быть пустым.

Например, когда выполнение задачи находится в состоянии ОЖИДАНИЯ в результате очереди выполнения задачи, поле содержит причину, по которой выполнение задачи находится в этом состоянии.

CrawlerDetails -> (structure)

Подробная информация о пауке, когда узел представляет собой паука.

Crawls -> (list)

Список выполнений паука, представленный узлом выполнения паука.

(structure)

Подробности выполнения паука в потоке.

State -> (string)

Состояние паука.

StartedOn -> (timestamp)

Дата и время начала выполнения паука.

CompletedOn -> (timestamp)

Дата и время завершения выполнения паука.

ErrorMessage -> (string)

Сообщение об ошибке, связанное с выполнением паука.

LogGroup -> (string)

Группа журналов, связанная с выполнением паука.

LogStream -> (string)

Поток журналов, связанный с выполнением паука.

Edges -> (list)

Список всех направленных связей между узлами, принадлежащими потоку.

(structure)

Ребро представляет собой направленную связь между двумя компонентами Glue, которые являются частью потока, к которому относится ребро.

SourceId -> (string)

Уникальный идентификатор узла в потоке, с которого начинается ребро.

DestinationId -> (string)

Уникальный идентификатор узла в потоке, в который заканчивается ребро.

MaxConcurrentRuns -> (integer)

Этот параметр можно использовать, чтобы предотвратить нежелательные многократные обновления данных, управлять затратами или в некоторых случаях предотвратить превышение максимального числа одновременных запусков любых задач компонентов. Если этот параметр оставить пустым, ограничений на количество одновременных запусков потока нет.

BlueprintDetails -> (structure)

Эта структура указывает подробности шаблона, из которого создан этот конкретный поток.

BlueprintName -> (string)

Имя шаблона.

RunId -> (string)

Идентификатор выполнения для этого шаблона.

MissingWorkflows -> (list)

Список имен не найденных потоков.

(string)

© Copyright 2025, Amazon Web Services. Created using Sphinx.

END_OF_DOCUMENT_MARKER

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API