Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

batch-get-jobs

Описание

Возвращает список метаданных ресурсов для заданного списка имен задач. После вызова операции ListJobs, вы можете вызвать эту операцию для доступа к данным, на которые у вас есть разрешения. Данная операция поддерживает все разрешения IAM, включая условия разрешений, использующие теги.

См. также: Документация API AWS

Синтаксис

  batch-get-jobs
--job-names <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--job-names (список)

Список имен задач, которые могут быть именами, возвращенными операцией ListJobs.

(строка)

Синтаксис:

"string" "string" ...

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения перепишут значения, предоставленные в JSON. Невозможно передавать произвольные двоичные данные с использованием предоставленного JSON-значения, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если указано без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включить отладочную запись журнала.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при общении с сервисами AWS. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет поведение проверки сертификатов SSL по умолчанию.

--no-paginate (логическое значение)

Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использование определенного профиля из вашего файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отображение версии этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • включено
  • выключено
  • автоматически

--no-sign-request (логическое значение)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл сертификата CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. По умолчанию формат — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как закодированная в base64 строка. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое отображается как двоичный блок fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить пейджер CLI для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запрашивать входные параметры CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запросы ввода параметров CLI.

Вывод

Работы -> (список)

Список определений работ.

(структура)

Определяет определение работы.

Имя -> (строка)

Имя, которое вы присваиваете этому определению работы.

РежимРаботы -> (строка)

Режим, описывающий способ создания работы. Допустимые значения:

  • SCRIPT - Работа была создана с помощью редактора сценариев Glue Studio.
  • VISUAL - Работа была создана с помощью визуального редактора Glue Studio.
  • NOTEBOOK - Работа была создана с помощью блокнота интерактивных сеансов.

Если поле JobMode отсутствует или равно null, по умолчанию используется значение SCRIPT.

JobRunQueuingEnabled -> (булево)

Указывает, включено ли очередирование запусков работ для этой работы.

Значение true означает, что очередирование запусков работ включено. Если значение false или поле не заполнено, запуски работ не будут учитываться в очереди.

Если это поле не соответствует значению, заданному в запуске работы, будет использоваться значение из поля запуска работы.

Описание -> (строка)

Описание работы.

LogUri -> (строка)

Это поле зарезервировано для будущего использования.

Роль -> (строка)

Имя или Amazon Resource Name (ARN) роли IAM, связанной с этой работой.

Создано -> (метка времени)

Дата и время создания этого определения работы.

Изменено -> (метка времени)

Последнее время изменения этого определения работы.

СвойствоВыполнения -> (структура)

ExecutionProperty, определяющий максимальное количество одновременных запусков, разрешенных для этой работы.

MaxConcurrentRuns -> (целое число)

Максимальное количество одновременных запусков, разрешенных для работы. По умолчанию 1. При достижении этого порога возвращается ошибка. Максимальное значение, которое можно указать, ограничено лимитом сервиса.

Команда -> (структура)

JobCommand, которая выполняет эту работу.

Имя -> (строка)

Имя команды работы. Для работы Apache Spark ETL должно быть glueetl. Для работы с интерпретатором Python должно быть pythonshell. Для работы Apache Spark streaming ETL должно быть gluestreaming. Для работы Ray должно быть glueray.

РасположениеСценария -> (строка)

Указывает путь к сценарию в Amazon Simple Storage Service (Amazon S3), который выполняет работу.

PythonVersion -> (строка)

Версия Python, используемая для выполнения работы с интерпретатором Python. Допустимые значения 2 или 3.

Runtime -> (строка)

В работах Ray параметр Runtime используется для указания версий Ray, Python и дополнительных библиотек, доступных в вашей среде. Это поле не используется в других типах работ. Доступные значения среды выполнения см. в руководстве для разработчиков Glue в разделе Поддерживаемые среды выполнения Ray.

АргументыПоУмолчанию -> (карта)

Аргументы по умолчанию для каждого запуска этой работы, указанные в виде пар имя-значение.

Здесь можно указать аргументы, которые использует собственный сценарий выполнения работы, а также аргументы, которые использует сам Glue.

Аргументы работы могут быть записаны в журнал. Не передавайте незащищенные секреты в качестве аргументов. Извлекайте секреты из подключения Glue, Secrets Manager или другого механизма управления секретами, если вы хотите хранить их в рамках работы.

Дополнительную информацию о способе указания и использования собственных аргументов работы см. в руководстве для разработчиков в разделе Вызов API Glue на Python.

Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке работ Spark, см. в руководстве для разработчиков в разделе Специальные параметры, используемые Glue.

Дополнительную информацию об аргументах, которые можно указать в этом поле при настройке работ Ray, см. в руководстве для разработчиков в разделе Использование параметров работы в работах Ray.

ключ -> (строка)

значение -> (строка)

НеПерезаписываемыеАргументы -> (карта)

Аргументы этой работы, которые не перезаписываются при указании аргументов работы в запуске работы, указанные в виде пар имя-значение.

ключ -> (строка)

значение -> (строка)

Подключения -> (структура)

Подключения, используемые для этой работы.

Подключения -> (список)

Список подключений, используемых работой.

(строка)

МаксимальноеКоличествоПовторов -> (целое число)

Максимальное количество попыток повторить эту работу после сбоя JobRun.

ВыделеннаяЁмкость -> (целое число)

Это поле устарело. Используйте MaxCapacity вместо него.

Количество единиц обработки данных Glue (DPUs), выделенных для запусков этой работы. Вы можете выделить как минимум 2 DPU; по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессорных ядер (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.

Таймаут -> (целое число)

Таймаут работы в минутах. Это максимальное время, которое запуск работы может использовать ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT.

Значения таймаута работы должны быть меньше 7 дней или 10080 минут. В противном случае работы будут вызывать исключение.

Если значение не указано, по умолчанию устанавливается таймаут 2880 минут.

Любые существующие работы Glue, у которых значение таймаута было больше 7 дней, будут установлены по умолчанию на 7 дней. Например, если вы задали таймаут в 20 дней для работы пакетной обработки, она будет остановлена на 7-й день.

Для потоковых работ, если вы настроите окно технического обслуживания, оно будет перезапущено в течение окна технического обслуживания после 7 дней.

МаксимальнаяЁмкость -> (двойное значение)

Для работ Glue версии 1.0 или более ранних, использующих стандартный тип рабочих узлов, количество единиц обработки данных Glue (DPUs), которые могут быть выделены при запуске этой работы. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессорных ядер (vCPU) вычислительной мощности и 16 ГБ памяти. Дополнительную информацию см. на странице ценообразования Glue.

Для работ Glue версии 2.0 или более поздних вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.

Не устанавливайте MaxCapacity, если используете WorkerType и NumberOfWorkers.

Значение, которое может быть выделено для MaxCapacity, зависит от того, запускаете ли вы работу с интерпретатором Python, работу Apache Spark ETL или работу Apache Spark streaming ETL:

  • При указании работы с интерпретатором Python (JobCommand.Name =”pythonshell”) можно выделить либо 0,0625, либо 1 DPU. По умолчанию 0,0625 DPU.
  • При указании работы Apache Spark ETL (JobCommand.Name =”glueetl”) или работы Apache Spark streaming ETL (JobCommand.Name =”gluestreaming”) можно выделить от 2 до 100 DPU. По умолчанию 10 DPU. Для этого типа работы не допускается выделение дробных DPU.

ТипРабочегоУзла -> (строка)

Тип предварительно определенного рабочего узла, который выделяется при запуске работы. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для работ Spark. Принимает значение Z.2X для работ Ray.

  • Для типа рабочего узла G.1X каждый рабочий узел соответствует 1 DPU (4 виртуальных процессорных ядра (vCPU), 16 ГБ памяти) с диском 94 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач преобразования данных, объединения и запросов, что обеспечивает масштабируемый и экономически эффективный способ выполнения большинства работ.
  • Для типа рабочего узла G.2X каждый рабочий узел соответствует 2 DPU (8 виртуальных процессорных ядер (vCPU), 32 ГБ памяти) с диском 138 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач преобразования данных, объединения и запросов, что обеспечивает масштабируемый и экономически эффективный способ выполнения большинства работ.
  • Для типа рабочего узла G.4X каждый рабочий узел соответствует 4 DPU (16 виртуальных процессорных ядер (vCPU), 64 ГБ памяти) с диском 256 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач, которые включают наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для работ Glue версии 3.0 или более поздних работ Apache Spark ETL в следующих регионах Amazon Web Services: US East (Ohio), US East (N. Virginia), US West (Oregon), Asia Pacific (Singapore), Asia Pacific (Sydney), Asia Pacific (Tokyo), Canada (Central), Europe (Frankfurt), Europe (Ireland) и Europe (Stockholm).
  • Для типа рабочего узла G.8X каждый рабочий узел соответствует 8 DPU (32 виртуальных процессорных ядра (vCPU), 128 ГБ памяти) с диском 512 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для задач, которые включают наиболее сложные преобразования, агрегации, объединения и запросы. Этот тип рабочего узла доступен только для работ Glue версии 3.0 или более поздних работ Apache Spark ETL в тех же регионах Amazon Web Services, что и для типа рабочего узла G.4X.
  • Для типа рабочего узла G.025X каждый рабочий узел соответствует 0,25 DPU (2 виртуальных процессорных ядра (vCPU), 4 ГБ памяти) с диском 84 ГБ и предоставляет 1 исполняющий узел на рабочий узел. Мы рекомендуем использовать этот тип рабочего узла для потоковых работ с небольшим объемом данных. Этот тип рабочего узла доступен только для потоковых работ Glue версии 3.0 или более поздних.
  • Для типа рабочего узла Z.2X каждый рабочий узел соответствует 2 DPU (8 виртуальных процессорных ядер (vCPU), 64 ГБ памяти) с диском 128 ГБ и предоставляет до 8 рабочих узлов Ray на основе масштабирования.

КоличествоРабочихУзлов -> (целое число)

Количество рабочих узлов определенного типа workerType, которые выделяются при запуске работы.

НастройкаБезопасности -> (строка)

Имя структуры SecurityConfiguration, которая должна использоваться с этой работой.

СвойствоУведомления -> (структура)

Указывает конфигурационные свойства уведомления о работе.

NotifyDelayAfter -> (целое число)

Количество минут ожидания отправки уведомления о задержке запуска работы после начала запуска работы.

GlueVersion -> (строка)

В работах Spark параметр GlueVersion определяет версии Apache Spark и Python, которые доступны Glue в работе. Версия Python указывает версию, поддерживаемую для работ типа Spark.

Для работ Ray необходимо установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступных в вашей работе Ray, определяются параметром Runtime команды работы.

Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в руководстве для разработчиков в разделе версия Glue.

Работы, созданные без указания версии Glue, по умолчанию используют Glue 0.9.

CodeGenConfigurationNodes -> (карта)

Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.

ключ -> (строка)

значение -> (структура)

CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная члена может быть заполнена.

AthenaConnectorSource -> (структура)

Указывает соединение с источником данных Amazon Athena.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с подключением.

ИмяПодключения -> (строка)

Имя подключения, которое помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, например, marketplace.athena или custom.athena, определяющий подключение к хранилищу данных Amazon Athena.

ТаблицаСоединения -> (строка)

Имя таблицы в источнике данных.

ИмяСхемы -> (строка)

Имя группы журналов Cloudwatch для чтения. Например, /aws-glue/jobs/output .

СхемыВывода -> (список)

Указывает схему данных для пользовательского источника Athena.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

JDBCConnectorSource -> (структура)

Указывает подключение к источнику данных JDBC.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с подключением.

ИмяПодключения -> (строка)

Имя подключения, которое помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, например, marketplace.jdbc или custom.jdbc, определяющий подключение к хранилищу данных JDBC.

ДополнительныеПараметры -> (структура)

Дополнительные параметры подключения для подключения.

ПредикатФильтрации -> (строка)

Дополнительное условие фильтрации данных из источника. Например:

BillingCity='Mountain View'

При использовании запроса вместо имени таблицы, необходимо убедиться, что запрос работает с указанным filterPredicate .

СтолбецРазбиения -> (строка)

Имя целочисленного столбца, используемого для разбиения. Этот параметр работает только при включении его с lowerBound , upperBound и numPartitions . Этот параметр работает так же, как и в Spark SQL JDBC-читателе.

НижняяГраница -> (длинное целое)

Минимальное значение partitionColumn, используемое для определения шага разбиения.

ВерхняяГраница -> (длинное целое)

Максимальное значение partitionColumn, используемое для определения шага разбиения.

ЧислоРазбиений -> (длинное целое)

Количество разбиений. Это значение, вместе с lowerBound (включительно) и upperBound (исключительно), образует шаги разбиения для сгенерированных WHERE выражений, используемых для разделения partitionColumn .

КлючиЗакладкиРаботы -> (список)

Имя ключей закладки работы, по которым нужно отсортировать.

(строка)

ПорядокСортировкиКлючейЗакладкиРаботы -> (строка)

Указывает порядок сортировки (возрастающий или убывающий).

СопоставлениеТиповДанных -> (карта)

Пользовательское сопоставление типов данных, которое создает сопоставление между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} отображает поля данных типа JDBC FLOAT в тип Java String, вызывая метод ResultSet.getString() драйвера, и использует его для создания записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение специфично для используемого драйвера. Обратитесь к документации вашего JDBC-драйвера, чтобы понять, как драйвер выполняет преобразования.

ключ -> (строка)

значение -> (строка)

ТаблицаСоединения -> (строка)

Имя таблицы в источнике данных.

Запрос -> (строка)

Таблица или SQL-запрос для получения данных. Вы можете указать либо ConnectionTable, либо query, но не оба.

СхемыВывода -> (список)

Указывает схему данных для пользовательского JDBC-источника.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorSource -> (структура)

Указывает подключение к источнику данных Apache Spark.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с подключением.

ИмяПодключения -> (строка)

Имя подключения, которое помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, например, marketplace.spark или custom.spark, определяющий подключение к хранилищу данных Apache Spark.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для подключения.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для пользовательского источника Spark.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogSource -> (структура)

Указывает хранилище данных в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

RedshiftSource -> (структура)

Указывает хранилище данных Amazon Redshift.

Имя -> (строка)

Имя хранилища данных Amazon Redshift.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

IAM-роль с разрешениями.

S3CatalogSource -> (структура)

Указывает хранилище данных Amazon S3 в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

ПредикатРазбиения -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разбиениях не удаляются. Установлено в "" – по умолчанию пусто.

ДополнительныеПараметры -> (структура)

Указывает дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое)

Устанавливает верхний предел для целевого размера набора данных в байтах, который будет обрабатываться.

ОграниченноеКоличествоФайлов -> (длинное целое)

Устанавливает верхний предел для целевого количества файлов, которые будут обрабатываться.

S3CsvSource -> (структура)

Указывает хранилище данных со значениями, разделёнными запятыми (CSV), хранящееся в Amazon S3.

Name -> (строка)

Имя хранилища данных.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает способ сжатия данных. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip".

Exclusions -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера кластера. Когда количество входных файлов меньше 50 000, "groupFiles" должно быть установлено в "inPartition" для его применения.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, когда вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлов, установите этот параметр в «inPartition». Чтобы отключить группировку при более чем 50 000 файлах, установите этот параметр в "none".

Recurse -> (булево)

Если установлено в значение «true», читает файлы во всех подкаталогах по указанным путям рекурсивно.

MaxBand -> (целое число)

Этот параметр управляет длительностью в миллисекундах, после которой перечень s3, скорее всего, будет согласован. Файлы с метками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учёта неявной согласованности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию — 900000 миллисекунд или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр определяет максимальное количество файлов, сохраняемых за последние maxBand секунд. Если это число превышено, дополнительные файлы пропускаются, и они обрабатываются только в следующем запуске задачи.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое число)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

Separator -> (строка)

Указывает разделительный символ. По умолчанию — запятая: «,» , но можно указать любой другой символ.

Escaper -> (строка)

Указывает символ для экранирования. Этот параметр используется только при чтении файлов CSV. Значение по умолчанию — none. Если включено, символ, который следует непосредственно за ним, используется как есть, за исключением небольшого набора известных экранированных символов (\n, \r, \t и \0).

QuoteChar -> (строка)

Указывает символ для кавычек. По умолчанию — двойная кавычка: '"'. Установите значение -1, чтобы полностью отключить кавычки.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ перевода строки в кавычках. Вы должны установить этот параметр в значение «True», если какая-либо запись занимает несколько строк. Значение по умолчанию — False, что позволяет для более агрессивного разделения файлов во время разбора.

WithHeader -> (булево)

Булево значение, указывающее, следует ли рассматривать первую строку как заголовок. Значение по умолчанию — False.

WriteHeader -> (булево)

Булево значение, указывающее, следует ли записать заголовок в выходные данные. Значение по умолчанию — True.

SkipFirst -> (булево)

Булево значение, указывающее, следует ли пропустить первую строку данных. Значение по умолчанию — False.

OptimizePerformance -> (булево)

Булево значение, указывающее, следует ли использовать расширенный читатель SIMD CSV вместе с столбцовыми форматами памяти Apache Arrow. Доступно только в версии Glue 3.0.

OutputSchemas -> (список)

Указывает схему данных для источника CSV S3.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ExcelSource -> (структура)

Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.

Name -> (строка)

Имя источника данных Excel S3.

Paths -> (список)

Пути S3, где находятся файлы Excel.

(строка)

CompressionType -> (строка)

Формат сжатия, используемый для файлов Excel.

Exclusions -> (список)

Шаблоны для исключения определённых файлов или путей из обработки.

(строка)

GroupSize -> (строка)

Определяет размер групп файлов для пакетной обработки.

GroupFiles -> (строка)

Указывает, как следует группировать файлы для обработки.

Recurse -> (булево)

Указывает, следует ли обрабатывать подкаталоги рекурсивно.

MaxBand -> (целое число)

Максимальное количество полос обработки.

MaxFilesInBand -> (целое число)

Максимальное количество файлов для обработки в каждой полосе.

AdditionalOptions -> (структура)

Дополнительные параметры конфигурации для обработки S3 прямых источников.

BoundedSize -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое число)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

NumberRows -> (длинное целое число)

Количество строк для обработки из каждого файла Excel.

SkipFooter -> (целое число)

Количество строк для пропуска в конце каждого файла Excel.

OutputSchemas -> (список)

Схемы AWS Glue, которые следует применить к обработанным данным.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3JsonSource -> (структура)

Указывает хранилище JSON-данных, хранящееся в Amazon S3.

Name -> (строка)

Имя хранилища данных.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает способ сжатия данных. Это обычно не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip".

Exclusions -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера кластера. Когда количество входных файлов меньше 50 000, "groupFiles" должно быть установлено в "inPartition" для его применения.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, когда вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлов, установите этот параметр в «inPartition». Чтобы отключить группировку при более чем 50 000 файлах, установите этот параметр в "none".

Recurse -> (булево)

Если установлено в значение «true», читает файлы во всех подкаталогах по указанным путям рекурсивно.

MaxBand -> (целое число)

Этот параметр управляет длительностью в миллисекундах, после которой перечень s3, скорее всего, будет согласован. Файлы с метками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учёта неявной согласованности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию — 900000 миллисекунд или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр определяет максимальное количество файлов, сохраняемых за последние maxBand секунд. Если это число превышено, дополнительные файлы пропускаются, и они обрабатываются только в следующем запуске задачи.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое число)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

JsonPath -> (строка)

Строка JsonPath, определяющая JSON-данные.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ перевода строки в кавычках. Вы должны установить этот параметр в значение «True», если какая-либо запись занимает несколько строк. Значение по умолчанию — False, что позволяет для более агрессивного разделения файлов во время разбора.

OutputSchemas -> (список)

Указывает схему данных для источника JSON S3.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ParquetSource -> (структура)

Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает способ сжатия данных. Это обычно не нужно, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда количество входных файлов меньше 50 000, "groupFiles" должно быть установлено в значение "inPartition", чтобы это имело эффект.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, когда входной набор содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку, когда файлов более 50 000, установите этот параметр в значение "none".

Recurse -> (булево)

Если установлено в значение true, рекурсивно считывает файлы во всех подкаталогах по указанным путям.

MaxBand -> (целое число)

Этот параметр управляет продолжительностью (в миллисекундах), после которой список файлов в s3, скорее всего, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks, чтобы учесть конечную согласованность Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. Значение по умолчанию составляет 900000 миллисекунд, или 15 минут.

MaxFilesInBand -> (целое число)

Этот параметр определяет максимальное количество файлов, которые нужно сохранить из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образцовый путь.

OutputSchemas -> (список)

Указывает схему данных для источника S3 Parquet.

(структура)

Указывает схему, определенную пользователем, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

RelationalCatalogSource -> (структура)

Указывает хранилище данных реляционной схемы в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

DynamoDBCatalogSource -> (структура)

Указывает хранилище данных DynamoDBC в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

База данных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

JDBCConnectorTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

Имя подключения -> (строка)

Имя подключения, связанного с соединителем.

Таблица подключения -> (строка)

Имя таблицы в целевом объекте данных.

Имя соединителя -> (строка)

Имя соединителя, который будет использоваться.

Тип подключения -> (строка)

Тип подключения, например marketplace.jdbc или custom.jdbc, обозначающий подключение к целевому объекту данных JDBC.

Дополнительные параметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Указывает схему данных для целевого объекта JDBC.

(структура)

Указывает схему, определенную пользователем, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorTarget -> (структура)

Указывает целевой объект, использующий соединитель Apache Spark.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

Имя подключения -> (строка)

Имя подключения для соединителя Apache Spark.

Имя соединителя -> (строка)

Имя соединителя Apache Spark.

Тип подключения -> (строка)

Тип подключения, такой как marketplace.spark или custom.spark, обозначающий подключение к хранилищу данных Apache Spark.

Дополнительные параметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Указывает схему данных для пользовательской Spark-цели.

(структура)

Указывает схему, определенную пользователем, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogTarget -> (структура)

Указывает целевой объект, использующий таблицу каталога данных Glue.

Имя -> (строка)

Имя вашего целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Ключи разделов, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.

(список)

(строка)

База данных -> (строка)

База данных, которая содержит таблицу, которую вы хотите использовать в качестве целевого объекта. Эта база данных должна уже существовать в каталоге данных.

Таблица -> (строка)

Таблица, которая определяет схему ваших выходных данных. Эта таблица должна уже существовать в каталоге данных.

RedshiftTarget -> (структура)

Указывает целевой объект, использующий Amazon Redshift.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

База данных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

UpsertRedshiftOptions -> (структура)

Набор параметров для настройки операции upsert при записи в целевой объект Redshift.

TableLocation -> (строка)

Физическое расположение таблицы Redshift.

Имя подключения -> (строка)

Имя подключения для записи в Redshift.

UpsertKeys -> (список)

Ключи, используемые для определения, нужно ли выполнять обновление или вставку.

(строка)

S3CatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

База данных -> (строка)

Имя базы данных для записи.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для сканера.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления, когда сканер обнаруживает измененную схему.

S3GlueParquetTarget -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Путь -> (строка)

Один путь Amazon S3 для записи.

Сжатие -> (строка)

Указывает способ сжатия данных. Это обычно не нужно, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip").

NumberTargetPartitions -> (строка)

Указывает количество целевых разделов для файлов Parquet при записи в Amazon S3 с помощью AWS Glue.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для сканера.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления, когда сканер обнаруживает измененную схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3HyperDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.

Имя -> (строка)

Уникальный идентификатор узла HyperDirect целевого назначения.

Входы -> (список)

Указывает исходный источник данных для целевого узла HyperDirect.

(строка)

PartitionKeys -> (список)

Определяет стратегию разбиения выходных данных.

(список)

(строка)

Путь -> (строка)

Расположение в S3, куда будут записаны выходные данные.

Сжатие -> (строка)

Тип сжатия, применяемый к выходным данным.

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы во время операций записи.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления, когда сканер обнаруживает измененную схему.

Таблица -> (строка)

Таблица в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

База данных, к которой применяется политика изменения схемы.

S3DirectTarget -> (структура)

Указывает целевой объект данных, записывающий данные в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся источниками данных для целевого объекта.

(строка)

PartitionKeys -> (список)

Указывает разбиение с использованием последовательности ключей.

(список)

(строка)

Путь -> (строка)

Единственный путь в Amazon S3 для записи.

Сжатие -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip").

NumberTargetPartitions -> (строка)

Указывает количество целевых разделов при непосредственной записи данных в Amazon S3.

Формат -> (строка)

Указывает формат выходных данных для целевого объекта.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для сканера.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления, когда сканер обнаруживает измененную схему.

Таблица -> (строка)

Таблица в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

База данных, к которой применяется политика изменения схемы.

S3IcebergDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.

Имя -> (строка)

Уникальный идентификатор узла Iceberg в вашей конвейерной системе обработки данных.

Входы -> (список)

Определяет единственный источник входных данных, предоставляющий данные этому целевому объекту Iceberg.

(строка)

PartitionKeys -> (список)

Определяет столбцы, используемые для разбиения данных таблицы Iceberg в S3.

(список)

(строка)

Путь -> (строка)

Определяет расположение в S3, где будут храниться данные таблицы Iceberg.

Формат -> (строка)

Указывает формат файлов таблицы Iceberg (например, Parquet, ORC).

ДополнительныеПараметры -> (словарь)

Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.

ключ -> (строка)

значение -> (строка)

SchemaChangePolicy -> (структура)

Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает измененную схему.

UpdateBehavior -> (строка)

Поведение обновления, когда сканер обнаруживает измененную схему.

Таблица -> (строка)

Таблица в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

База данных, к которой применяется политика изменения схемы.

Сжатие -> (строка)

Указывает кодек сжатия, используемый для файлов таблицы Iceberg в S3.

NumberTargetPartitions -> (строка)

Устанавливает количество целевых разделов для распределения файлов таблицы Iceberg по S3.

ApplyMapping -> (структура)

Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте данных. Вы можете переименовать ключи, изменить типы данных для ключей и выбрать, какие ключи исключить из набора данных.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Сопоставление -> (список)

Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте данных.

(структура)

Указывает сопоставление ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, каким должно быть имя столбца. Может быть таким же, как FromPath .

FromPath -> (список)

Таблица или столбец, подлежащие изменению.

(строка)

FromType -> (строка)

Тип данных, подлежащих изменению.

ToType -> (строка)

Тип данных, к которому данные должны быть изменены.

Удалено -> (булево)

Если true, то столбец удаляется.

Children -> (список)

Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, но также и одного из ее потомков, вы можете заполнить эту структуру данных. Также Mapping, но ее FromPath будет родительским FromPath плюс FromPath из этой структуры.

Для части children, предположим, что у вас есть структура:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

Вы можете указать Mapping, которая выглядит следующим образом:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

(структура)

Указывает сопоставление ключей свойств данных.

ToKey -> (строка)

После применения сопоставления, каким должно быть имя столбца. Может быть таким же, как FromPath .

FromPath -> (список)

Таблица или столбец, подлежащие изменению.

(строка)

FromType -> (строка)

Тип данных, подлежащих изменению.

ToType -> (строка)

Тип данных, к которому данные должны быть изменены.

Удалено -> (булево)

Если true, то столбец удаляется.

SelectFields -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите сохранить.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Пути -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

DropFields -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите удалить.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Пути -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

RenameField -> (структура)

Указывает преобразование, которое переименовывает один ключ свойства данных.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

ИсходныйПуть -> (список)

Путь JSON к переменной в структуре данных для исходных данных.

(строка)

ЦелевойПуть -> (список)

Путь JSON к переменной в структуре данных для целевых данных.

(строка)

Spigot -> (структура)

Указывает преобразование, которое записывает образцы данных в ведро Amazon S3.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Путь -> (строка)

Путь в Amazon S3, куда преобразование запишет подмножество записей из набора данных в файл JSON в ведре Amazon S3.

Topk -> (целое число)

Указывает количество записей, которые будут записаны, начиная с начала набора данных.

Prob -> (двойное число)

Вероятность (десятичное значение с максимальным значением 1) выбора любой заданной записи. Значение 1 указывает, что каждая строка, считанная из набора данных, должна быть включена в выходной образец.

Join -> (структура)

Указывает преобразование, которое объединяет два набора данных в один набор данных с использованием сравнительной фразы по указанным ключам свойств данных. Вы можете использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

JoinType -> (строка)

Указывает тип объединения, который необходимо выполнить для наборов данных.

Столбцы -> (список)

Список из двух столбцов, которые необходимо объединить.

(структура)

Указывает столбец, подлежащий объединению.

From -> (строка)

Столбец, подлежащий объединению.

Keys -> (список)

Ключ столбца, подлежащего объединению.

(список)

(строка)

SplitFields -> (структура)

Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных и один с оставшимися ключами свойств данных.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Пути -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

SelectFromCollection -> (структура)

Указывает преобразование, которое выбирает один DynamicFrame из набора DynamicFrames. Выход — выбранный DynamicFrame.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Индекс -> (целое число)

Индекс DynamicFrame для выбора.

FillMissingValues -> (структура)

Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определяемым методом импутации. Входной набор данных используется для обучения модели машинного обучения, определяющей, каким должно быть пропущенное значение.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

ImputedPath -> (строка)

JSON-путь к переменной в структуре данных для набора данных, который подвергается импутации.

FilledPath -> (строка)

JSON-путь к переменной в структуре данных для набора данных, который заполняется.

Filter -> (структура)

Указывает преобразование, которое разделяет набор данных на два, основываясь на условии фильтрации.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

LogicalOperator -> (строка)

Оператор, используемый для фильтрации строк путём сравнения значения ключа со значением, указанным в списке.

Filters -> (список)

Указывает выражение фильтра.

(структура)

Указывает выражение фильтра.

Operation -> (строка)

Тип операции, выполняемой в выражении.

Negated -> (булево)

Нужно ли инвертировать выражение.

Values -> (список)

Список значений фильтра.

(структура)

Представляет один элемент в списке значений для FilterExpression .

Type -> (строка)

Тип значения фильтра.

Value -> (список)

Значение, которое должно быть связано.

(строка)

CustomCode -> (структура)

Указывает преобразование, которое использует предоставленный вами пользовательский код для выполнения преобразования данных. Выход представляет собой коллекцию DynamicFrames.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов.

(строка)

Code -> (строка)

Пользовательский код, используемый для выполнения преобразования данных.

ClassName -> (строка)

Имя, определенное для класса узла пользовательского кода.

OutputSchemas -> (список)

Указывает схему данных для преобразования пользовательского кода.

(структура)

Указывает схему, определённую пользователем, когда Glue не может определить схему автоматически.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkSQL -> (структура)

Указывает преобразование, в котором вы вводите SQL-запрос, используя синтаксис Spark SQL, для преобразования данных. Выход — один DynamicFrame .

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, идентифицированные по их именам узлов. Вы можете ассоциировать имя таблицы с каждым входным узлом для использования в SQL-запросе. Выбранное вами имя должно соответствовать ограничениям именования Spark SQL.

(строка)

SqlQuery -> (строка)

SQL-запрос, который должен использовать синтаксис Spark SQL и возвращать один набор данных.

SqlAliases -> (список)

Список псевдонимов. Псевдоним позволяет указать, какое имя использовать в SQL для данного входа. Например, у вас есть источник данных под названием “MyDataSource”. Если вы укажете From как MyDataSource, а Alias как SqlName, то в своём SQL вы можете сделать:

select * from SqlName

и это получит данные из MyDataSource.

(структура)

Представляет один элемент в списке значений для SqlAliases .

From -> (строка)

Таблица или столбец в таблице.

Alias -> (строка)

Временное имя, данное таблице или столбцу в таблице.

OutputSchemas -> (список)

Указывает схему данных для преобразования SparkSQL.

(структура)

Указывает схему, определённую пользователем, когда Glue не может определить схему автоматически.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

DirectKinesisSource -> (структура)

Указывает прямой источник данных Amazon Kinesis.

Name -> (строка)

Имя источника данных.

WindowSize -> (целое число)

Время, которое тратится на обработку каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из поступающих данных?

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL конечной точки Kinesis.

StreamName -> (строка)

Имя потока данных Kinesis.

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделительный символ.

StartingPosition -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения — "latest" , "trim_horizon" , "earliest" или строка даты и времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию — "latest" .

Примечание: Использование значения, которое представляет собой строку даты и времени в формате UTC, для «startingPosition» поддерживается только для версии Glue 4.0 и выше.

MaxFetchTimeInMs -> (длинное целое)

Максимальное время, которое выполняет исполняющий узел задания для чтения записей для текущей партии из потока данных Kinesis, указанное в миллисекундах (мс). Может быть выполнено несколько GetRecords вызовов API в течение этого времени. Значение по умолчанию — 1000 .

MaxFetchRecordsPerShard -> (длинное целое)

Максимальное количество записей, которые нужно извлечь на каждый фрагмент в потоке данных Kinesis за микропакет. Примечание: клиент может превысить этот предел, если потоковое задание уже прочитало дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратным MaxRecordPerRead . Значение по умолчанию — 100000 .

MaxRecordPerRead -> (длинное целое)

Максимальное количество записей, которые нужно извлечь из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию — 10000 .

AddIdleTimeBetweenReads -> (булево)

Добавляет задержку времени между двумя последовательными операциями getRecords. Значение по умолчанию — "False" . Этот параметр настраивается только для версии Glue 2.0 и выше.

IdleTimeBetweenReadsInMs -> (длинное целое)

Минимальная задержка времени между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию — 1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.

DescribeShardInterval -> (длинное целое)

Минимальный интервал времени между двумя вызовами API ListShards для вашего скрипта, чтобы рассмотреть возможность перераспределения. Значение по умолчанию — 1s .

NumRetries -> (целое число)

Максимальное количество попыток повтора для запросов API Kinesis Data Streams. Значение по умолчанию — 3 .

RetryIntervalMs -> (длинное целое)

Период охлаждения (указанный в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию — 1000 .

MaxRetryIntervalMs -> (длинное целое)

Максимальный период охлаждения (указанный в мс) между двумя повторными попытками вызова API Kinesis Data Streams. Значение по умолчанию — 10000 .

AvoidEmptyBatches -> (булево)

Избегает создания пустых микропакетных заданий, проверяя наличие непрочитанных данных в потоке данных Kinesis до начала пакета. Значение по умолчанию — "False" .

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли, которую нужно принять, используя AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для описания или чтения записей для потока данных Kinesis. Вам нужно использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSSessionName" .

RoleSessionName -> (строка)

Идентификатор сессии, принимающей роль с помощью AWS STS. Вам нужно использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSRoleARN" .

AddRecordTimestamp -> (строка)

Когда этот параметр установлен в 'true', выходные данные будут содержать дополнительный столбец с именем “__src_timestamp”, который указывает время получения соответствующей записи потоком. Значение по умолчанию — 'false'. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

Когда этот параметр установлен в 'true', для каждой партии будут выводиться метрики для времени между самой старой полученной записью и моментом, когда она прибывает в Glue в CloudWatch. Имя метрики — “glue.driver.streaming.maxConsumerLagInMs”. Значение по умолчанию — 'false'. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (временная метка)

Временная метка записи в потоке данных Kinesis для начала чтения данных. Возможные значения — строка даты и времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

PollingTime -> (длинное целое)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое)

Предел количества опрошенных записей.

DirectKafkaSource -> (структура)

Указывает хранилище данных Apache Kafka.

Имя -> (строка)

Название хранилища данных.

StreamingOptions -> (структура)

Указывает параметры потоковой передачи.

BootstrapServers -> (строка)

Список адресов серверов начальной загрузки, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094 . Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения - "SSL" или "PLAINTEXT" .

ConnectionName -> (строка)

Имя подключения.

TopicName -> (строка)

Имя темы, указанное в Apache Kafka. Вы должны указать хотя бы один из "topicName" , "assign" или "subscribePattern" .

Assign -> (строка)

Конкретная TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName" , "assign" или "subscribePattern" .

SubscribePattern -> (строка)

Строка Java-регулярного выражения, определяющая список тем для подписки. Вы должны указать хотя бы один из "topicName" , "assign" или "subscribePattern" .

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделительный символ.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения - "earliest" или "latest" . Значение по умолчанию - "latest" .

EndingOffsets -> (строка)

Конечная точка завершения пакетного запроса. Возможные значения - "latest" или строка JSON, указывающая конечную позицию смещения для каждого TopicPartition .

PollTimeoutMs -> (целое число)

Таймаут в миллисекундах для выборки данных из Kafka в исполнителях задач Spark. Значение по умолчанию - 512 .

NumRetries -> (целое число)

Количество попыток повторного обращения перед отказом от получения смещений Kafka. Значение по умолчанию - 3 .

RetryIntervalMs -> (целое число)

Время ожидания в миллисекундах перед повторной попыткой получения смещений Kafka. Значение по умолчанию - 10 .

MaxOffsetsPerTrigger -> (целое число)

Предельная скорость обработки максимального количества смещений за интервал срабатывания. Указанное общее количество смещений пропорционально разделено между topicPartitions различных объемов. Значение по умолчанию - null, что означает, что потребитель считывает все смещения до известного последнего смещения.

MinPartitions -> (целое число)

Желаемое минимальное количество партиций для чтения из Kafka. Значение по умолчанию - null, что означает, что количество партиций spark равно количеству партиций Kafka.

IncludeHeaders -> (логическое значение)

Включать заголовки Kafka. Если параметр установлен в «true», вывод данных будет содержать дополнительный столбец с именем «glue_streaming_kafka_headers» и типом Array[Struct(key: String, value: String)] . Значение по умолчанию - «false». Этот параметр доступен только в версии Glue 3.0 и выше.

AddRecordTimestamp -> (строка)

Если этот параметр установлен в ‘true’, вывод данных будет содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующего записываемого события темой. Значение по умолчанию - ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

Если этот параметр установлен в ‘true’, для каждой партии будут выводиться метрики для периода времени между старейшей записью, полученной темой, и временем её прибытия в Glue в CloudWatch. Название метрики - «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию - ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (дата/время)

Маркер времени записи в теме Kafka, с которой начинается чтение данных. Возможные значения - строка даты/времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

Только один из StartingTimestamp или StartingOffsets должен быть задан.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждой микропачки.

DetectSchema -> (логическое значение)

Автоматически определять схему из входных данных.

DataPreviewOptions -> (структура)

Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.

PollingTime -> (целое число)

Время выборки в миллисекундах.

RecordPollingLimit -> (целое число)

Предел количества выбранных записей.

CatalogKinesisSource -> (структура)

Указывает источник данных Kinesis в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждой микропачки.

DetectSchema -> (логическое значение)

Автоматически определять схему из входных данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL кинетического конечного пункта.

StreamName -> (строка)

Имя потока данных Kinesis.

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделительный символ.

StartingPosition -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения - "latest" , "trim_horizon" , "earliest" или строка даты/времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию - "latest" .

Примечание: Использование значения, представляющего строку даты/времени в формате UTC для «startingPosition», поддерживается только для версии Glue 4.0 и выше.

MaxFetchTimeInMs -> (целое число)

Максимальное время, затраченное исполнителем задачи на чтение записей для текущей партии из потока данных Kinesis, указанное в миллисекундах (мс). В течение этого времени могут быть выполнены несколько GetRecords API-вызовов. Значение по умолчанию - 1000 .

MaxFetchRecordsPerShard -> (целое число)

Максимальное количество записей для выборки на каждый фрагмент в потоке данных Kinesis за каждую микропачку. Примечание: клиент может превысить этот предел, если задача потоковой передачи уже прочитала дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard нужно строго соблюдать, то оно должно быть кратно MaxRecordPerRead . Значение по умолчанию - 100000 .

MaxRecordPerRead -> (целое число)

Максимальное количество записей для выборки из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию - 10000 .

AddIdleTimeBetweenReads -> (логическое значение)

Добавляет задержку времени между двумя последовательными операциями getRecords. Значение по умолчанию - "False" . Этот параметр настраивается только для версии Glue 2.0 и выше.

IdleTimeBetweenReadsInMs -> (целое число)

Минимальная задержка времени между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию - 1000 . Этот параметр настраивается только для версии Glue 2.0 и выше.

DescribeShardInterval -> (целое число)

Минимальный интервал времени между двумя вызовами ListShards API для вашей программы, чтобы рассмотреть возможность изменения фрагментов. Значение по умолчанию - 1s .

NumRetries -> (целое число)

Максимальное количество повторов для запросов API Kinesis Data Streams. Значение по умолчанию - 3 .

RetryIntervalMs -> (целое число)

Период охлаждения (указанный в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию - 1000 .

MaxRetryIntervalMs -> (целое число)

Максимальный период охлаждения (указанный в мс) между двумя повторными попытками вызова API Kinesis Data Streams. Значение по умолчанию - 10000 .

AvoidEmptyBatches -> (логическое значение)

Избегает создания пустых микропачек, проверяя наличие непрочитанных данных в потоке данных Kinesis перед началом партии. Значение по умолчанию - "False" .

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли, которую нужно принять с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения на операции describe или чтение записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSSessionName" .

RoleSessionName -> (строка)

Идентификатор сеанса принятия роли с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSRoleARN" .

AddRecordTimestamp -> (строка)

Если этот параметр установлен в ‘true’, вывод данных будет содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующей записи потоком. Значение по умолчанию - ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

Если этот параметр установлен в ‘true’, для каждой партии будут выводиться метрики для периода времени между старейшей записью, полученной потоком, и временем её прибытия в Glue в CloudWatch. Название метрики - «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию - ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (дата/время)

Маркер времени записи в потоке данных Kinesis, с которой начинается чтение данных. Возможные значения - строка даты/времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

PollingTime -> (целое число)

Время выборки в миллисекундах.

RecordPollingLimit -> (целое число)

Предел количества выбранных записей.

CatalogKafkaSource -> (структура)

END_OF_DOCUMENT_MARKER

Указывает хранилище данных Apache Kafka в каталоге данных.

Name -> (строка)

Имя хранилища данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из входящих данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Указывает параметры потоковой передачи.

BootstrapServers -> (строка)

Список адресов серверов загрузки, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения — "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя подключения.

TopicName -> (строка)

Имя темы, указанное в Apache Kafka. Необходимо указать хотя бы один из "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретный TopicPartitions для потребления. Необходимо указать хотя бы один из "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярного выражения, определяющая список тем для подписки. Необходимо указать хотя бы один из "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения — "earliest" или "latest". Значение по умолчанию — "latest".

EndingOffsets -> (строка)

Конечная точка, когда запрос пакета завершается. Возможные значения — "latest" или строка JSON, указывающая конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (целое с плавающей запятой)

Таймаут в миллисекундах для опроса данных из Kafka в исполнителях Spark-задач. Значение по умолчанию — 512.

NumRetries -> (целое число)

Количество попыток повторного обращения перед ошибкой при получении смещений Kafka. Значение по умолчанию — 3.

RetryIntervalMs -> (целое с плавающей запятой)

Время ожидания в миллисекундах перед повторной попыткой получения смещений Kafka. Значение по умолчанию — 10.

MaxOffsetsPerTrigger -> (целое с плавающей запятой)

Предельная скорость обработки максимального количества смещений за интервал срабатывания. Указанное общее число смещений пропорционально разделяется между topicPartitions разных объемов. Значение по умолчанию — null, что означает, что потребитель читает все смещения до известной последней позиции.

MinPartitions -> (целое число)

Желаемое минимальное количество разделов для чтения из Kafka. Значение по умолчанию — null, что означает, что количество разделов Spark равно количеству разделов Kafka.

IncludeHeaders -> (булево)

Включать ли заголовки Kafka. При установке параметра в «true», выходные данные будут содержать дополнительный столбец с именем «glue_streaming_kafka_headers» и типом Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в версии Glue 3.0 и выше.

AddRecordTimestamp -> (строка)

При установке этого параметра в «true», выходные данные будут содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующего записи темой. Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При установке этого параметра в ‘true’, для каждого пакета будет выводиться метрика продолжительности между самой старой записью, полученной темой, и моментом, когда она поступает в Glue в CloudWatch. Название метрики — «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию — ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (временная метка)

Временная метка записи в теме Kafka для начала чтения данных. Возможные значения — строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: «2023-04-04T08:00:00+08:00»).

Только один из StartingTimestamp или StartingOffsets должен быть установлен.

DataPreviewOptions -> (структура)

Указывает параметры, связанные с предварительным просмотром данных для просмотра выборки данных.

PollingTime -> (целое с плавающей запятой)

Время опроса в миллисекундах.

RecordPollingLimit -> (целое с плавающей запятой)

Предел количества опрошенных записей.

DropNullFields -> (структура)

Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, представляющие «null», -1 целые числа или другие заполнитель, такие как нули, не распознаются автоматически как нулевые.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, определенные по их именам узлов.

(строка)

NullCheckBoxList -> (структура)

Структура, представляющая, считаются ли определенные значения нулевыми значениями для удаления.

IsEmpty -> (булево)

Указывает, что пустая строка считается нулевым значением.

IsNullString -> (булево)

Указывает, что значение, представляющее слово «null», считается нулевым значением.

IsNegOne -> (булево)

Указывает, что целочисленное значение -1 считается нулевым значением.

NullTextList -> (список)

Структура, указывающая список NullValueField-структур, представляющих пользовательское нулевое значение, например, ноль или другое значение, используемое в качестве нулевого заполнителя, уникального для набора данных.

Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение заполнителя нулевого значения и тип данных совпадают с данными.

(структура)

Представляет пользовательское нулевое значение, например, нуль или другое значение, используемое в качестве нулевого заполнителя, уникального для набора данных.

Value -> (строка)

Значение заполнителя нулевого значения.

Datatype -> (структура)

Тип данных значения.

Id -> (строка)

Тип данных значения.

Label -> (строка)

Метка, присвоенная типу данных.

Merge -> (структура)

Указывает преобразование, объединяющее DynamicFrame со стекинговым DynamicFrame на основе указанных первичных ключей для идентификации записей. Дублирующие записи (записи с одинаковыми первичными ключами) не удаляются.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, определенные по их именам узлов.

(строка)

Source -> (строка)

Исходный DynamicFrame, который будет объединен со стекинговым DynamicFrame.

PrimaryKeys -> (список)

Список полей первичного ключа для сопоставления записей из исходной и стекинговой динамических рамок.

(список)

(строка)

Union -> (структура)

Указывает преобразование, объединяющее строки из двух и более наборов данных в один результат.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узла ID в преобразование.

(строка)

UnionType -> (строка)

Указывает тип преобразования Union.

Укажите ALL для объединения всех строк из источников данных с результирующей DynamicFrame. Результирующее объединение не удаляет дублирующие строки.

Укажите DISTINCT для удаления дублирующих строк в результирующей DynamicFrame.

PIIDetection -> (структура)

Указывает преобразование, идентифицирующее, удаляющее или маскирующее данные PII.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узла ID в преобразование.

(строка)

PiiType -> (строка)

Указывает тип преобразования PIIDetection.

EntityTypesToDetect -> (список)

Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.

Типы сущностей PII включают: ИМЯ_ЛИЦА, ДАТА, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, НОМЕР_ТЕЛЕФОНА, БАНКОВСКИЙ_СЧЕТ, IP_АДРЕС, MAC_АДРЕС, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER, КРЕДИТНАЯ_КАРТА,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE

(строка)

OutputColumnName -> (строка)

Указывает имя выходного столбца, который будет содержать любой тип сущности, обнаруженный в этой строке.

SampleFraction -> (двойное)

Указывает долю данных для выборки при сканировании на PII-сущности.

ThresholdFraction -> (двойное)

Указывает долю данных, которая должна быть достигнута, чтобы столбец был идентифицирован как данные PII.

MaskValue -> (строка)

Указывает значение, которое заменит обнаруженную сущность.

Aggregate -> (структура)

Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по указанной функции.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Указывает поля и строки, которые будут использоваться в качестве входов для преобразования агрегации.

(строка)

Groups -> (список)

Указывает поля для группировки.

(список)

(строка)

Aggs -> (список)

Указывает агрегационные функции, которые будут выполняться по указанным полям.

(структура)

Указывает набор параметров, необходимых для выполнения агрегации в преобразовании агрегации.

Column -> (список)

Указывает столбец в наборе данных, к которому будет применена функция агрегации.

(строка)

AggFunc -> (строка)

Указывает функцию агрегации.

Возможные функции агрегации: avg, countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

DropDuplicates -> (структура)

Указывает преобразование, удаляющее строки повторяющихся данных из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы данных, определенные по их именам узлов.

(строка)

Columns -> (список)

Имя столбцов, которые будут объединены или удалены, если повторяются.

(список)

(строка)

GovernedCatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в управляемый каталог.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для управляемого каталога.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаруживает изменение схемы.

UpdateBehavior -> (строка)

Поведение при обновлении, когда сканер находит изменённую схему.

GovernedCatalogSource -> (структура)

Указывает источник данных в управляемом каталоге данных.

Name -> (строка)

Имя хранилища данных.

Database -> (строка)

База данных для чтения.

Table -> (строка)

Таблица базы данных для чтения.

PartitionPredicate -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разбиениях не удаляются. Установлено в "" – по умолчанию пусто.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (целое число)

Устанавливает максимальный размер целевого набора данных в байтах, которые будут обработаны.

BoundedFiles -> (целое число)

Устанавливает максимальное количество целевых файлов, которые будут обработаны.

MicrosoftSQLServerCatalogSource -> (структура)

Указывает источник данных Microsoft SQL-сервера в Glue Data Catalog.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MySQLCatalogSource -> (структура)

Указывает источник данных MySQL в Glue Data Catalog.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

OracleSQLCatalogSource -> (структура)

Указывает источник данных Oracle в Glue Data Catalog.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

PostgreSQLCatalogSource -> (структура)

Указывает источник данных PostgresSQL в Glue Data Catalog.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MicrosoftSQLServerCatalogTarget -> (структура)

Указывает целевой объект, использующий Microsoft SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

MySQLCatalogTarget -> (структура)

Указывает целевой объект, использующий MySQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

OracleSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Oracle SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

PostgreSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Postgres SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

DynamicTransform -> (структура)

Указывает пользовательскую визуальную трансформацию, созданную пользователем.

Name -> (строка)

Указывает имя динамической трансформации.

TransformName -> (строка)

Указывает имя динамической трансформации, как оно отображается в визуальном редакторе Glue Studio.

Inputs -> (список)

Указывает входные данные для динамической трансформации, которые необходимы.

(строка)

Parameters -> (список)

Указывает параметры динамической трансформации.

(структура)

Указывает параметры в файле конфигурации динамической трансформации.

Name -> (строка)

Указывает имя параметра в файле конфигурации динамической трансформации.

Type -> (строка)

Указывает тип параметра в файле конфигурации динамической трансформации.

ValidationRule -> (строка)

Указывает правило валидации в файле конфигурации динамической трансформации.

ValidationMessage -> (строка)

Указывает сообщение валидации в файле конфигурации динамической трансформации.

Value -> (список)

Указывает значение параметра в файле конфигурации динамической трансформации.

(строка)

ListType -> (строка)

Указывает тип списка параметра в файле конфигурации динамической трансформации.

IsOptional -> (булево)

Указывает, является ли параметр необязательным или нет в файле конфигурации динамической трансформации.

FunctionName -> (строка)

Указывает имя функции динамической трансформации.

Path -> (строка)

Указывает путь к исходным файлам и файлам конфигурации динамической трансформации.

Version -> (строка)

Это поле не используется и будет устаревать в будущих выпусках.

OutputSchemas -> (список)

Указывает схему данных для динамической трансформации.

(структура)

Указывает определённую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

EvaluateDataQuality -> (структура)

Указывает критерии оценки качества ваших данных.

Name -> (строка)

Имя оценки качества данных.

Inputs -> (список)

Входы вашей оценки качества данных.

(строка)

Ruleset -> (строка)

Набор правил для вашей оценки качества данных.

Output -> (строка)

Вывод вашей оценки качества данных.

PublishingOptions -> (структура)

Параметры, определяющие, как будут опубликованы ваши результаты.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для ваших результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

StopJobOnFailureOptions -> (структура)

Параметры, определяющие, как работа будет останавливаться, если ваша оценка качества данных завершается неудачно.

StopJobOnFailureTiming -> (строка)

Когда останавливать задачу, если оценка качества данных завершается неудачно. Варианты: Immediate или AfterDataLoad.

S3CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в Glue Data Catalog. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определённую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в Glue Data Catalog.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определённую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiSource -> (структура)

Указывает на источник данных Hudi, хранящийся в Amazon S3.

Name -> (строка)

Имя источника Hudi.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Указывает дополнительные параметры для коннектора.

BoundedSize -> (целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (логическое значение)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiCatalogTarget -> (структура)

Указывает целевой объект, который записывает данные в источник Hudi в каталоге данных Glue.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (карта)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для кроулера.

EnableUpdateCatalog -> (логическое значение)

Использовать ли указанное поведение обновления, когда кроулер обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении кроулером изменённой схемы.

S3HudiDirectTarget -> (структура)

Указывает целевой объект, который записывает данные в источник Hudi в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Path -> (строка)

Путь Amazon S3 для вашего источника Hudi для записи.

Compression -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip".

NumberTargetPartitions -> (строка)

Указывает количество целевых разделов для распределения файлов набора данных Hudi по Amazon S3.

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Format -> (строка)

Указывает формат выходных данных для целевого объекта.

AdditionalOptions -> (карта)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для кроулера.

EnableUpdateCatalog -> (логическое значение)

Использовать ли указанное поведение обновления, когда кроулер обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении кроулером изменённой схемы.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

DirectJDBCSource -> (структура)

Указывает прямое подключение JDBC-источника.

Name -> (строка)

Имя подключения JDBC-источника.

Database -> (строка)

База данных JDBC-источника подключения.

Table -> (строка)

Таблица JDBC-источника подключения.

ConnectionName -> (строка)

Имя подключения JDBC-источника.

ConnectionType -> (строка)

Тип подключения JDBC-источника.

RedshiftTmpDir -> (строка)

Временная директория JDBC-источника Redshift.

S3CatalogDeltaSource -> (структура)

Указывает источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Delta Lake.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogDeltaSource -> (структура)

Указывает источник данных Delta Lake, зарегистрированный в каталоге данных Glue.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Delta Lake.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaSource -> (структура)

Указывает источник данных Delta Lake, хранящийся в Amazon S3.

Name -> (строка)

Имя источника Delta Lake.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalDeltaOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Указывает дополнительные параметры для коннектора.

BoundedSize -> (целое число)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое число)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (логическое значение)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включено, указывает образец пути.

OutputSchemas -> (список)

Указывает схему данных для источника Delta Lake.

(структура)

Указывает пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaCatalogTarget -> (структура)

Указывает целевой объект, который записывает данные в источник Delta Lake в каталоге данных Glue.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает нативное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (карта)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для кроулера.

EnableUpdateCatalog -> (логическое значение)

Использовать ли указанное поведение обновления, когда кроулер обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления при обнаружении кроулером изменённой схемы.

S3DeltaDirectTarget -> (структура)

Указывает целевой объект, который записывает в источник данных Delta Lake в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Путь -> (строка)

Путь Amazon S3 для вашего источника данных Delta Lake, в который необходимо записать данные.

Сжатие -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если данные имеют стандартное расширение файла. Возможные значения: "gzip" и "bzip".

Количество целевых разделов -> (строка)

Указывает количество целевых разделов для распределения файлов набора данных Delta Lake по Amazon S3.

Формат -> (строка)

Указывает формат выходных данных для целевого объекта.

Дополнительные параметры -> (карта)

Указывает дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

Политика изменения схемы -> (структура)

Политика, которая определяет поведение обновления для обхода.

Включить обновление каталога -> (булево)

Использовать ли указанное поведение обновления, когда обход обнаруживает изменённую схему.

Поведение при обновлении -> (строка)

Поведение при обновлении, когда обход обнаруживает изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

База данных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

AmazonRedshiftSource -> (структура)

Указывает целевой объект, который записывает в источник данных в Amazon Redshift.

Имя -> (строка)

Имя источника Amazon Redshift.

Данные -> (структура)

Указывает данные узла источника Amazon Reshift.

Тип доступа -> (строка)

Тип доступа для подключения Redshift. Может быть прямым подключением или подключением к каталогу.

Тип источника -> (строка)

Тип источника, указывающий, является ли источником конкретная таблица или пользовательский запрос.

Подключение -> (структура)

Подключение Glue к кластеру Redshift.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

База данных каталога -> (структура)

Имя базы данных Glue Data Catalog при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица каталога -> (структура)

Имя таблицы Glue Data Catalog при работе с каталогом данных.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема Redshift каталога -> (строка)

Имя схемы Redshift при работе с каталогом данных.

Таблица Redshift каталога -> (строка)

Таблица базы данных для чтения.

Временная папка -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

Роль IAM -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Роль IAM по умолчанию будет ролью в задаче, если поле оставлено пустым.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Дополнительные параметры -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Ключ -> (строка)

Ключ для дополнительного параметра подключения.

Значение -> (строка)

Значение для дополнительного параметра подключения.

Пример запроса -> (строка)

SQL, используемый для извлечения данных из источников Redshift, когда тип источника — «запрос».

Действие до -> (строка)

SQL, используемый перед выполнением MERGE или APPEND с upsert.

Действие после -> (строка)

SQL, используемый перед выполнением MERGE или APPEND с upsert.

Действие -> (строка)

Указывает, как будет происходить запись в кластер Redshift.

Префикс таблицы -> (строка)

Указывает префикс для таблицы.

Upsert -> (булево)

Действие, применяемое к Redshift стокам при выполнении APPEND.

Действие MERGE -> (строка)

Действие, применяемое для определения обработки MERGE в Redshift стоке.

MERGE при совпадении -> (строка)

Действие, применяемое для определения обработки MERGE в Redshift стоке, когда существующая запись совпадает с новой.

MERGE при отсутствии совпадения -> (строка)

Действие, применяемое для определения обработки MERGE в Redshift стоке, когда существующая запись не совпадает с новой.

Оператор MERGE -> (строка)

SQL, используемый в пользовательском MERGE для обработки соответствующих записей.

Подключение обхода -> (строка)

Указывает имя подключения, связанного с таблицей каталога, используемой.

Схема таблицы -> (список)

Массив выходных данных схемы для данного узла.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Таблица временного хранения -> (строка)

Имя временной таблицы хранения, используемой при выполнении MERGE или APPEND с upsert.

Выбранные столбцы -> (список)

Список имён столбцов, используемых для определения совпадающей записи при выполнении MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

AmazonRedshiftTarget -> (структура)

Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.

Name -> (строка)

Имя целевого объекта Amazon Redshift.

Data -> (структура)

Указывает данные узла целевого объекта Amazon Redshift.

AccessType -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

SourceType -> (строка)

Тип источника, указывающий, является ли источником определённая таблица или пользовательский запрос.

Connection -> (структура)

Подключение Glue к кластеру Redshift.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Table -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogDatabase -> (структура)

Имя базы данных Glue Data Catalog при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogTable -> (структура)

Имя таблицы Glue Data Catalog при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogRedshiftSchema -> (строка)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (строка)

Таблица базы данных для чтения.

TempDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

IamRole -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Если оставлено пустым, роль IAM будет по умолчанию взята из роли задания.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdvancedOptions -> (список)

Дополнительные значения при подключении к кластеру Redshift.

(структура)

Указывает дополнительное значение при подключении к кластеру Redshift.

Key -> (строка)

Ключ дополнительного параметра подключения.

Value -> (строка)

Значение дополнительного параметра подключения.

SampleQuery -> (строка)

SQL-запрос для извлечения данных из источника Redshift, когда SourceType равен ‘query’.

PreAction -> (строка)

SQL-запрос, выполняемый перед MERGE или APPEND с upsert.

PostAction -> (строка)

SQL-запрос, выполняемый перед MERGE или APPEND с upsert.

Action -> (строка)

Указывает способ записи в кластер Redshift.

TablePrefix -> (строка)

Указывает префикс таблицы.

Upsert -> (булево)

Действие, выполняемое в Redshift sink при APPEND.

MergeAction -> (строка)

Действие, определяющее, как будет обрабатываться MERGE в Redshift sink.

MergeWhenMatched -> (строка)

Действие, определяющее, как будет обрабатываться MERGE в Redshift sink при совпадении существующей записи с новой.

MergeWhenNotMatched -> (строка)

Действие, определяющее, как будет обрабатываться MERGE в Redshift sink при отсутствии совпадения существующей записи с новой.

MergeClause -> (строка)

SQL-запрос для обработки совпадающих записей в пользовательском MERGE.

CrawlerConnection -> (строка)

Указывает имя подключения, связанного с таблицей каталога.

TableSchema -> (список)

Массив схем вывода для данного узла.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

StagingTable -> (строка)

Имя временной таблицы накопления, используемой при MERGE или APPEND с upsert.

SelectedColumns -> (список)

Список имён столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

EvaluateDataQualityMultiFrame -> (структура)

Указывает критерии оценки качества данных. Поддерживает несколько входных данных и возвращает набор динамических фреймов.

Name -> (строка)

Имя оценки качества данных.

Inputs -> (список)

Входы для оценки качества данных. Первый вход в этом списке — основной источник данных.

(строка)

AdditionalDataSources -> (карта)

Псевдонимы всех источников данных, кроме основного.

ключ -> (строка)

значение -> (строка)

Ruleset -> (строка)

Набор правил для оценки качества данных.

PublishingOptions -> (структура)

Параметры для настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию результатов оценки качества данных.

AdditionalOptions -> (карта)

Параметры для настройки поведения преобразования во время выполнения.

ключ -> (строка)

значение -> (строка)

StopJobOnFailureOptions -> (структура)

Параметры для настройки остановки задания при неудачной оценке качества данных.

StopJobOnFailureTiming -> (строка)

Когда остановить задание при неудачной оценке качества данных. Доступные значения: Immediate или AfterDataLoad.

Recipe -> (структура)

Указывает узел Glue DataBrew recipe.

Name -> (строка)

Имя узла Glue Studio.

Inputs -> (список)

Узлы, являющиеся входными для узла recipe, определяются по id.

(строка)

RecipeReference -> (структура)

Ссылка на рецепт DataBrew, используемый узлом.

RecipeArn -> (строка)

ARN рецепта DataBrew.

RecipeVersion -> (строка)

Версия рецепта DataBrew.

RecipeSteps -> (список)

Шаги преобразования, используемые в узле recipe.

(структура)

Шаг рецепта, используемый в узле подготовки данных Glue Studio.

Action -> (структура)

Действие преобразования шага рецепта.

Operation -> (строка)

Операция действия рецепта.

Parameters -> (карта)

Параметры действия рецепта.

ключ -> (строка)

значение -> (строка)

ConditionExpressions -> (список)

Условные выражения для шага рецепта.

(структура)

Условное выражение, определённое в узле подготовки данных рецепта Glue Studio.

Condition -> (строка)

Условие условного выражения.

Value -> (строка)

Значение условного выражения.

TargetColumn -> (строка)

Целевой столбец условных выражений.

SnowflakeSource -> (структура)

Определяет источник данных Snowflake.

Имя -> (строка)

Имя источника данных Snowflake.

Данные -> (структура)

Настройка источника данных Snowflake.

ТипИсточника -> (строка)

Указывает, как задаются извлеченные данные. Допустимые значения: "table" , "query" .

Подключение -> (структура)

Указывает подключение Glue Data Catalog к Snowflake-эндопоинту.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (строка)

Определяет схему базы данных Snowflake, которую должен использовать узел.

Таблица -> (строка)

Определяет таблицу Snowflake, которую должен использовать узел.

База данных -> (строка)

Определяет базу данных Snowflake, которую должен использовать узел.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ДополнительныеПараметры -> (карта)

Указывает дополнительные параметры, передаваемые в коннектор Snowflake. Если параметры указаны в другом месте этого узла, эти параметры будут иметь приоритет.

ключ -> (строка)

значение -> (строка)

ПримерЗапроса -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

Предусловие -> (строка)

Строка SQL, выполняемая перед выполнением стандартных действий коннектором Snowflake.

ПоследующееДействие -> (строка)

Строка SQL, выполняемая после выполнения стандартных действий коннектором Snowflake.

Действие -> (строка)

Указывает действие, которое нужно выполнить при записи в таблицу с существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Действие равно append . Указывает поведение разрешения при уже существующей строке. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

ДействиеСлияния -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если настраиваемое, определяется MergeClause .

СлияниеПриСовпадении -> (строка)

Указывает, как разрешать записи, которые совпадают с существующими данными при слиянии. Допустимые значения: update , delete .

СлияниеПриОтсутствииСовпадения -> (строка)

Указывает, как обрабатывать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

ОператорСлияния -> (строка)

SQL-оператор, который задает настраиваемое поведение слияния.

StagingTable -> (строка)

Имя временной таблицы, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, затем перемещаются в table с помощью сгенерированного последействия.

ВыбранныеСтолбцы -> (список)

Определяет столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description . Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

АвтоматическоеВыполнение -> (булево)

Указывает, включена ли автоматическая передача запросов вниз. Если передача вниз включена, при выполнении запроса на Spark, если часть запроса может быть «передана вниз» на сервер Snowflake, она передается вниз. Это повышает производительность некоторых запросов.

СтруктураТаблицы -> (список)

Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

СхемыВывода -> (список)

Определяет схемы, определенные пользователем, для ваших выходных данных.

(структура)

Определяет схему, определенную пользователем, когда схема не может быть определена Glue.

Столбцы -> (список)

Определяет определения столбцов, составляющих схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SnowflakeЦелевой -> (структура)

Определяет целевой объект для записи в источник данных Snowflake.

Имя -> (строка)

Имя целевого объекта Snowflake.

Данные -> (структура)

Указывает данные целевого узла Snowflake.

ТипИсточника -> (строка)

Указывает, как задаются извлеченные данные. Допустимые значения: "table" , "query" .

Подключение -> (структура)

Указывает подключение Glue Data Catalog к Snowflake-эндопоинту.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (строка)

Определяет схему базы данных Snowflake, которую должен использовать узел.

Таблица -> (строка)

Определяет таблицу Snowflake, которую должен использовать узел.

База данных -> (строка)

Определяет базу данных Snowflake, которую должен использовать узел.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ДополнительныеПараметры -> (карта)

Указывает дополнительные параметры, передаваемые в коннектор Snowflake. Если параметры указаны в другом месте этого узла, эти параметры будут иметь приоритет.

ключ -> (строка)

значение -> (строка)

ПримерЗапроса -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

Предусловие -> (строка)

Строка SQL, выполняемая перед выполнением стандартных действий коннектором Snowflake.

ПоследующееДействие -> (строка)

Строка SQL, выполняемая после выполнения стандартных действий коннектором Snowflake.

Действие -> (строка)

Указывает действие, которое нужно выполнить при записи в таблицу с существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Действие равно append . Указывает поведение разрешения при уже существующей строке. Если true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

ДействиеСлияния -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если настраиваемое, определяется MergeClause .

СлияниеПриСовпадении -> (строка)

Указывает, как разрешать записи, которые совпадают с существующими данными при слиянии. Допустимые значения: update , delete .

СлияниеПриОтсутствииСовпадения -> (строка)

Указывает, как обрабатывать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

ОператорСлияния -> (строка)

SQL-оператор, который задает настраиваемое поведение слияния.

StagingTable -> (строка)

Имя временной таблицы, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, затем перемещаются в table с помощью сгенерированного последействия.

ВыбранныеСтолбцы -> (список)

Определяет столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upsert. Список структур с ключами value , label и description . Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

АвтоматическоеВыполнение -> (булево)

Указывает, включена ли автоматическая передача запросов вниз. Если передача вниз включена, при выполнении запроса на Spark, если часть запроса может быть «передана вниз» на сервер Snowflake, она передается вниз. Это повышает производительность некоторых запросов.

СтруктураТаблицы -> (список)

Вручную определяет целевую схему для узла. Список структур с ключами value , label и description . Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ConnectorDataSource -> (структура)

Указывает источник, созданный со стандартными параметрами подключения.

Name -> (строка)

Имя этого узла источника.

ConnectionType -> (строка)

connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (карта)

Карта, определяющая параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.

ключ -> (строка)

значение -> (строка)

OutputSchemas -> (список)

Указывает схему данных для этого источника.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ConnectorDataTarget -> (структура)

Указывает целевой объект, созданный со стандартными параметрами подключения.

Name -> (строка)

Имя этого целевого узла.

ConnectionType -> (строка)

connectionType, предоставленное библиотеке Glue. Этот тип узла поддерживает следующие типы подключений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (карта)

Карта, определяющая параметры подключения для узла. Стандартные параметры подключения для соответствующего типа подключения можно найти в разделе «Параметры подключения» документации Glue.

ключ -> (строка)

значение -> (строка)

Inputs -> (список)

Узлы, которые являются входными данными для целевого объекта данных.

(строка)

ExecutionClass -> (строка)

Указывает, запускается ли работа со стандартным или гибким классом выполнения. Стандартный класс выполнения идеально подходит для задач с временными ограничениями, требующих быстрого запуска работы и выделенных ресурсов.

Гибкий класс выполнения подходит для задач, не зависящих от времени, начало и завершение которых могут меняться.

Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass в FLEX. Гибкий класс выполнения доступен для задач Spark.

SourceControlDetails -> (структура)

Подробности конфигурации системы управления версиями для задачи, позволяющие синхронизировать артефакты задачи с удалённым хранилищем или из него.

Provider -> (строка)

Поставщик удалённого хранилища.

Repository -> (строка)

Имя удалённого хранилища, содержащего артефакты задачи.

Owner -> (строка)

Владелец удалённого хранилища, содержащего артефакты задачи.

Branch -> (строка)

Необязательная ветка в удалённом хранилище.

Folder -> (строка)

Необязательная папка в удалённом хранилище.

LastCommitId -> (строка)

Последний идентификатор коммита для коммита в удалённом хранилище.

AuthStrategy -> (строка)

Тип аутентификации, который может быть маркером аутентификации, хранящимся в Amazon Web Services Secrets Manager, или личным маркером доступа.

AuthToken -> (строка)

Значение маркера авторизации.

MaintenanceWindow -> (строка)

Это поле определяет день недели и час для окна обслуживания для потоковых задач. Glue периодически выполняет задачи обслуживания. В эти окна обслуживания Glue потребуется перезапустить ваши потоковые задачи.

Glue перезапустит задачу в течение 3 часов от указанного окна обслуживания. Например, если вы настроили окно обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.

ProfileName -> (строка)

Имя профиля использования Glue, связанного с задачей.

JobsNotFound -> (список)

Список имён задач, не найденных.

(строка)

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API