Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

get-job

Описание

Возвращает определение существующей задачи.

См. также: Документацию API AWS

Синтаксис

  get-job
--job-name <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--job-name (строка)

Имя определения задачи для извлечения.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределят значения, полученные из JSON. Невозможно передавать произвольные двоичные значения с помощью JSON-значения, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. При отсутствии значения или значении input выводит JSON-пример входных данных, который можно использовать как аргумент для --cli-input-json. Аналогично, если указано yaml-input, выведет пример входных данных YAML, которые можно использовать с --cli-input-yaml. Если указано значение output, оно проверяет входные данные команды и возвращает JSON-пример выходных данных для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включить отладку.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение по умолчанию по проверке SSL-сертификатов.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/выключить цветной вывод.

  • включено
  • выключено
  • автоматически

--no-sign-request (логическое значение)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл с набором сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться в режиме блокировки без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения к сокету в секундах. Если значение установлено в 0, подключение к сокету будет выполняться в режиме блокировки без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, который будет использоваться для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI версии 1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить вывод CLI-пейджера.

--cli-auto-prompt (логическое значение)

Автоматически запрашивать параметры CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запросы параметров CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.

Если не указано иное, во всех примерах используются правила цитирования Unix. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной оболочки. См. Использование кавычек со строками в Руководстве пользователя AWS CLI.

Для получения информации о задаче

Следующий get-job пример извлекает информацию о задаче.

aws glue get-job \
    --job-name my-testing-job

Вывод:

{
    "Job": {
        "Name": "my-testing-job",
        "Role": "Glue_DefaultRole",
        "CreatedOn": 1602805698.167,
        "LastModifiedOn": 1602805698.167,
        "ExecutionProperty": {
            "MaxConcurrentRuns": 1
        },
        "Command": {
            "Name": "gluestreaming",
            "ScriptLocation": "s3://janetst-bucket-01/Scripts/test_script.scala",
            "PythonVersion": "2"
        },
        "DefaultArguments": {
            "--class": "GlueApp",
            "--job-language": "scala"
        },
        "MaxRetries": 0,
        "AllocatedCapacity": 10,
        "MaxCapacity": 10.0,
        "GlueVersion": "1.0"
    }
}

Дополнительную информацию см. в разделе Задачи в Руководстве разработчика AWS Glue.

Вывод

Задача -> (структура)

Запрашиваемое определение задачи.

Имя -> (строка)

Имя, присваиваемое этому определению задачи.

Режим задачи -> (строка)

Режим, описывающий способ создания задачи. Допустимые значения:

  • SCRIPT - Задача создана с помощью редактора скриптов Glue Studio.
  • VISUAL - Задача создана с помощью визуального редактора Glue Studio.
  • NOTEBOOK - Задача создана с помощью блокнота интерактивных сеансов.

Если поле JobMode отсутствует или равно null, по умолчанию используется значение SCRIPT.

JobRunQueuingEnabled -> (булево)

Указывает, включено ли очередирование запусков задач для запусков этой задачи.

Значение true означает, что очередирование запусков задач включено. Если false или не задано, запуски задач не будут рассматриваться для очередирования.

Если это поле не соответствует значению, заданному в запуске задачи, то будет использоваться значение из поля запуска задачи.

Описание -> (строка)

Описание задачи.

LogUri -> (строка)

Это поле зарезервировано для будущего использования.

Роль -> (строка)

Имя или Amazon Resource Name (ARN) роли IAM, связанной с этой задачей.

Создано -> (временная метка)

Время и дата создания этого определения задачи.

Изменено -> (временная метка)

Последний момент времени, когда это определение задачи было изменено.

Свойство выполнения -> (структура)

ExecutionProperty, определяющий максимальное количество одновременных запусков, разрешенных для этой задачи.

MaxConcurrentRuns -> (целое число)

Максимальное количество одновременных запусков, разрешенных для задачи. По умолчанию 1. При достижении этого порога возвращается ошибка. Максимальное значение, которое можно указать, ограничено лимитом сервиса.

Команда -> (структура)

JobCommand, выполняющая эту задачу.

Имя -> (строка)

Имя команды задачи. Для задачи ETL Apache Spark это должно быть glueetl. Для задачи Python shell - pythonshell. Для задачи ETL потоковой обработки Apache Spark - gluestreaming. Для задачи Ray - glueray.

ScriptLocation -> (строка)

Указывает путь к скрипту, выполняющему задачу, в Amazon Simple Storage Service (Amazon S3).

PythonVersion -> (строка)

Версия Python, используемая для выполнения задачи Python shell. Допустимые значения 2 или 3.

Runtime -> (строка)

В задачах Ray параметр Runtime используется для указания версий Ray, Python и дополнительных библиотек, доступных в вашей среде. В других типах задач это поле не используется. Доступные значения среды выполнения см. в Руководстве разработчика Glue в разделе Поддерживаемые среды выполнения Ray.

DefaultArguments -> (отображение)

Значения аргументов по умолчанию для каждого запуска этой задачи, указанные в виде пар имя-значение.

Вы можете указать здесь аргументы, которые потребляет ваш собственный скрипт выполнения задачи, а также аргументы, которые потребляет сам Glue.

Аргументы задачи могут быть записаны в журнал. Не передавайте текстовые секреты в качестве аргументов. Извлекайте секреты из подключения Glue, Secrets Manager или другого механизма управления секретами, если вы намерены хранить их в задаче.

Дополнительную информацию о способе указания и использования собственных аргументов задач см. в разделе "Вызов API Glue на Python" в руководстве разработчика.

Дополнительную информацию об аргументах, которые можно предоставить в этом поле при настройке задач Spark, см. в разделе "Специальные параметры, используемые Glue" в руководстве разработчика.

Дополнительную информацию об аргументах, которые можно предоставить в этом поле при настройке задач Ray, см. в разделе "Использование параметров задач в задачах Ray" в руководстве разработчика.

ключ -> (строка)

значение -> (строка)

NonOverridableArguments -> (отображение)

Аргументы этой задачи, которые не переопределяются при предоставлении аргументов задачи в запуске задачи, указанные в виде пар имя-значение.

ключ -> (строка)

значение -> (строка)

Подключения -> (структура)

Подключения, используемые для этой задачи.

Подключения -> (список)

Список подключений, используемых задачей.

(строка)

MaxRetries -> (целое число)

Максимальное количество попыток повторного выполнения этой задачи после того, как JobRun завершится с ошибкой.

AllocatedCapacity -> (целое число)

Это поле устарело. Используйте MaxCapacity вместо него.

Количество единиц обработки данных Glue (DPUs), выделенных для запусков этой задачи. Вы можете выделить минимум 2 DPU; по умолчанию 10. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ оперативной памяти. Дополнительную информацию см. на странице цен Glue.

Timeout -> (целое число)

Таймаут задачи в минутах. Это максимальное время, которое запуск задачи может использовать ресурсы, прежде чем он будет завершен и перейдет в состояние TIMEOUT.

Значения таймаута задач должны быть меньше 7 дней или 10080 минут. В противном случае задачи будут генерировать исключение.

Если значение не указано, таймаут по умолчанию составляет 2880 минут.

Все существующие задачи Glue с таймаутом более 7 дней будут по умолчанию установлены на 7 дней. Например, если вы указали таймаут в 20 дней для задачи пакетной обработки, он будет остановлен на 7-й день.

Для задач потоковой обработки, если вы настроили окно обслуживания, оно будет перезапущено во время окна обслуживания после 7 дней.

MaxCapacity -> (двойное значение)

Для задач Glue версии 1.0 или более ранних, использующих стандартный тип работника, количество единиц обработки данных Glue (DPUs), которые могут быть выделены при запуске этой задачи. DPU — это относительная мера вычислительной мощности, состоящая из 4 виртуальных процессоров (vCPU) вычислительной мощности и 16 ГБ оперативной памяти. Дополнительную информацию см. на странице цен Glue.

Для задач Glue версии 2.0 или более поздних вы не можете указать Maximum capacity. Вместо этого вы должны указать Worker type и Number of workers.

Не устанавливайте MaxCapacity, если используется WorkerType и NumberOfWorkers.

Значение, которое можно выделить для MaxCapacity, зависит от того, выполняете ли вы задачу Python shell, задачу Apache Spark ETL или задачу Apache Spark streaming ETL:

  • При указании задачи Python shell (JobCommand.Name =”pythonshell”) вы можете выделить либо 0,0625, либо 1 DPU. По умолчанию 0,0625 DPU.
  • При указании задачи Apache Spark ETL (JobCommand.Name =”glueetl”) или задачи Apache Spark streaming ETL (JobCommand.Name =”gluestreaming”) вы можете выделить от 2 до 100 DPU. По умолчанию 10 DPU. Этот тип задачи не может иметь дробное выделение DPU.

WorkerType -> (строка)

Тип предопределенного рабочего процесса, выделенного при запуске задачи. Принимает значения G.1X, G.2X, G.4X, G.8X или G.025X для задач Spark. Принимает значение Z.2X для задач Ray.

  • Для типа работника G.1X каждый работник соответствует 1 DPU (4 vCPU, 16 ГБ ОЗУ) с диском 94 ГБ и предоставляет 1 исполнитель на работника. Мы рекомендуем этот тип работника для задач преобразования данных, объединения и запросов, так как он обеспечивает масштабируемый и экономичный способ выполнения большинства задач.
  • Для типа работника G.2X каждый работник соответствует 2 DPU (8 vCPU, 32 ГБ ОЗУ) с диском 138 ГБ и предоставляет 1 исполнитель на работника. Мы рекомендуем этот тип работника для задач преобразования данных, объединения и запросов, так как он обеспечивает масштабируемый и экономичный способ выполнения большинства задач.
  • Для типа работника G.4X каждый работник соответствует 4 DPU (16 vCPU, 64 ГБ ОЗУ) с диском 256 ГБ и предоставляет 1 исполнитель на работника. Мы рекомендуем этот тип работника для задач, рабочие нагрузки которых содержат самые сложные преобразования, агрегации, объединения и запросы. Этот тип работника доступен только для задач Apache Spark ETL Glue версии 3.0 или более поздних в следующих регионах Amazon Web Services: США (Огайо), США (Северная Вирджиния), США (Орегон), Азиатско-Тихоокеанский регион (Сингапур), Азиатско-Тихоокеанский регион (Сидней), Азиатско-Тихоокеанский регион (Токио), Канада (Центр), Европа (Франкфурт), Европа (Ирландия) и Европа (Стокгольм).
  • Для типа работника G.8X каждый работник соответствует 8 DPU (32 vCPU, 128 ГБ ОЗУ) с диском 512 ГБ и предоставляет 1 исполнитель на работника. Мы рекомендуем этот тип работника для задач, рабочие нагрузки которых содержат самые сложные преобразования, агрегации, объединения и запросы. Этот тип работника доступен только для задач Apache Spark ETL Glue версии 3.0 или более поздних в тех же регионах Amazon Web Services, что и для типа работника G.4X.
  • Для типа работника G.025X каждый работник соответствует 0,25 DPU (2 vCPU, 4 ГБ ОЗУ) с диском 84 ГБ и предоставляет 1 исполнитель на работника. Мы рекомендуем этот тип работника для задач потоковой обработки с низким объемом. Этот тип работника доступен только для задач потоковой обработки Glue версии 3.0 или более поздних.
  • Для типа работника Z.2X каждый работник соответствует 2 M-DPU (8 vCPU, 64 ГБ ОЗУ) с диском 128 ГБ и предоставляет до 8 рабочих Ray в зависимости от автоматического масштабирования.

NumberOfWorkers -> (целое число)

Количество рабочих заданного workerType, которое выделяется при запуске задачи.

SecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, которая должна использоваться с этой задачей.

NotificationProperty -> (структура)

Указывает конфигурационные свойства уведомления о задаче.

NotifyDelayAfter -> (целое число)

Количество минут, которые нужно подождать после начала выполнения задачи, прежде чем отправлять уведомление о задержке запуска задачи.

GlueVersion -> (строка)

В задачах Spark, GlueVersion определяет версии Apache Spark и Python, доступные в задаче Glue. Версия Python указывает версию, поддерживаемую для задач типа Spark.

Задачи Ray должны установить GlueVersion на 4.0 или выше. Однако версии Ray, Python и дополнительных библиотек, доступных в вашей задаче Ray, определяются параметром Runtime команды задачи.

Дополнительную информацию о доступных версиях Glue и соответствующих версиях Spark и Python см. в Руководстве разработчика Glue в разделе Версии Glue.

Задачи, созданные без указания версии Glue, по умолчанию используют Glue 0.9.

CodeGenConfigurationNodes -> (отображение)

Представление ориентированного ациклического графа, на котором основаны как визуальный компонент Glue Studio, так и генерация кода Glue Studio.

ключ -> (строка)

значение -> (структура)

CodeGenConfigurationNode перечисляет все допустимые типы узлов. Только одна переменная-член может быть заполнена.

AthenaConnectorSource -> (структура)

Определяет соединение с источником данных Amazon Athena.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, такой как marketplace.athena или custom.athena, определяющий соединение с хранилищем данных Amazon Athena.

ТаблицаСоединения -> (строка)

Имя таблицы в источнике данных.

ИмяСхемы -> (строка)

Имя группы журналов Cloudwatch для чтения. Например, /aws-glue/jobs/output .

СхемыВывода -> (список)

Определяет схему данных для пользовательского источника Athena.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

JDBCConnectorSource -> (структура)

Определяет соединение с источником данных JDBC.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, такой как marketplace.jdbc или custom.jdbc, определяющий соединение с хранилищем данных JDBC.

ДополнительныеПараметры -> (структура)

Дополнительные параметры подключения для соединителя.

ФильтрПредсказания -> (строка)

Дополнительная часть условия для фильтрации данных из источника. Например:

BillingCity='Mountain View'

При использовании запроса вместо имени таблицы, необходимо проверить, что запрос работает со специфицированным filterPredicate .

СтолбецРазбиения -> (строка)

Имя целочисленного столбца, используемого для разбиения. Этот параметр работает только при включении lowerBound , upperBound и numPartitions . Этот параметр работает аналогично Spark SQL JDBC reader.

НижняяГраница -> (длинное целое)

Минимальное значение partitionColumn, которое используется для определения шага разбиения.

ВерхняяГраница -> (длинное целое)

Максимальное значение partitionColumn, которое используется для определения шага разбиения.

КоличествоРазбиений -> (длинное целое)

Количество разбиений. Это значение, наряду с lowerBound (включительно) и upperBound (исключительно), формирует шаги разбиения для сгенерированных WHERE выражений, которые используются для разделения partitionColumn .

КлючиЗакладкиРаботы -> (список)

Имя ключей закладок работы, по которым необходимо отсортировать.

(строка)

ПорядокСортировкиКлючейЗакладкиРаботы -> (строка)

Указывает порядок сортировки: возрастающий или убывающий.

СопоставлениеТиповДанных -> (карта)

Пользовательское сопоставление типов данных, которое создает сопоставление между типом данных JDBC и типом данных Glue. Например, параметр "dataTypeMapping":{"FLOAT":"STRING"} сопоставляет поля данных типа JDBC FLOAT с типом Java String, вызывая метод ResultSet.getString() драйвера, и использует его для построения записи Glue. Объект ResultSet реализуется каждым драйвером, поэтому поведение специфично для используемого вами драйвера. Обратитесь к документации вашего JDBC-драйвера, чтобы понять, как драйвер выполняет преобразования.

ключ -> (строка)

значение -> (строка)

ТаблицаСоединения -> (строка)

Имя таблицы в источнике данных.

Запрос -> (строка)

Таблица или SQL-запрос для получения данных. Вы можете указать либо ConnectionTable, либо query, но не оба.

СхемыВывода -> (список)

Определяет схему данных для пользовательского источника JDBC.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkConnectorSource -> (структура)

Определяет соединение с источником данных Apache Spark.

Имя -> (строка)

Имя источника данных.

ИмяСоединения -> (строка)

Имя соединения, связанного с соединителем.

ИмяСоединителя -> (строка)

Имя соединителя, который помогает получить доступ к хранилищу данных в Glue Studio.

ТипСоединения -> (строка)

Тип соединения, такой как marketplace.spark или custom.spark, определяющий соединение с хранилищем данных Apache Spark.

ДополнительныеПараметры -> (карта)

Дополнительные параметры подключения для соединителя.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Определяет схему данных для пользовательского источника Spark.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Столбцы -> (список)

Определяет определения столбцов, составляющие схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogSource -> (структура)

Определяет хранилище данных в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

RedshiftSource -> (структура)

Определяет хранилище данных Amazon Redshift.

Имя -> (строка)

Имя хранилища данных Amazon Redshift.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

RedshiftTmpDir -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

TmpDirIAMRole -> (строка)

Роль IAM с разрешениями.

S3CatalogSource -> (структура)

Определяет хранилище данных Amazon S3 в каталоге данных Glue.

Имя -> (строка)

Имя хранилища данных.

БазаДанных -> (строка)

База данных для чтения.

Таблица -> (строка)

Таблица базы данных для чтения.

УсловиеРазбиения -> (строка)

Разбиения, удовлетворяющие этому условию, удаляются. Файлы в пределах периода удержания в этих разбиениях не удаляются. Установлено значение "" — по умолчанию пустое.

ДополнительныеПараметры -> (структура)

Определяет дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обрабатываться.

ОграниченноеКоличествоФайлов -> (длинное целое)

Устанавливает верхний предел целевого количества файлов, которые будут обрабатываться.

S3CsvSource -> (структура)

Указывает хранилище данных с разделенными запятыми (CSV) значениями, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает, как сжаты данные. Это, как правило, не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip".

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, «["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда число входных файлов меньше 50 000, необходимо установить "groupFiles" в значение "inPartition", чтобы это имело эффект.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, когда вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в значение «inPartition». Чтобы отключить группировку, когда число файлов превышает 50 000, установите этот параметр в значение "none".

Recurse -> (булево)

Если установлено в значение true, файлы в всех подкаталогах по указанным путям читаются рекурсивно.

MaxBand -> (целое)

Этот параметр контролирует продолжительность в миллисекундах, после которой список s3, скорее всего, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учета несинхронной работы Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию значение составляет 900000 миллисекунд или 15 минут.

MaxFilesInBand -> (целое)

Этот параметр задаёт максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующей работе.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения пробного пути.

SamplePath -> (строка)

Если включено, указывает пробный путь.

Separator -> (строка)

Указывает разделитель. По умолчанию это запятая «,» но можно указать любой другой символ.

Escaper -> (строка)

Указывает символ для экранирования. Этот параметр используется только при чтении файлов CSV. Значение по умолчанию — none. Если включен, символ, который следует за ним, используется как есть, за исключением небольшого набора известных экранирований (\n, \r, \t и \0).

QuoteChar -> (строка)

Указывает символ для кавычек. По умолчанию — двойная кавычка: '"'. Установите это значение в -1, чтобы полностью отключить кавычки.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ новой строки в кавычках. Необходимо установить этот параметр в значение True, если какая-либо запись занимает несколько строк. Значение по умолчанию — False, что позволяет более активно разделять файлы при разборе.

WithHeader -> (булево)

Булево значение, указывающее, следует ли рассматривать первую строку как заголовок. Значение по умолчанию — False.

WriteHeader -> (булево)

Булево значение, указывающее, следует ли записывать заголовок в выходные данные. Значение по умолчанию — True.

SkipFirst -> (булево)

Булево значение, указывающее, следует ли пропускать первую строку данных. Значение по умолчанию — False.

OptimizePerformance -> (булево)

Булево значение, указывающее, следует ли использовать усовершенствованный SIMD-читатель CSV вместе с основанными на Apache Arrow столбцовыми форматами памяти. Доступно только в версии Glue 3.0.

OutputSchemas -> (список)

Указывает схему данных для источника CSV в S3.

(структура)

Указывает определяемую пользователем схему, когда схема не может быть определена Glue.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ExcelSource -> (структура)

Определяет параметры конфигурации для чтения файлов Excel из Amazon S3.

Имя -> (строка)

Имя источника данных Excel в S3.

Пути -> (список)

Пути S3, где находятся файлы Excel.

(строка)

CompressionType -> (строка)

Формат сжатия, используемый для файлов Excel.

Исключения -> (список)

Шаблоны для исключения определённых файлов или путей из обработки.

(строка)

GroupSize -> (строка)

Определяет размер групп файлов для пакетной обработки.

GroupFiles -> (строка)

Указывает, как файлы должны быть сгруппированы для обработки.

Recurse -> (булево)

Указывает, следует ли рекурсивно обрабатывать подкаталоги.

MaxBand -> (целое)

Максимальное количество полос обработки.

MaxFilesInBand -> (целое)

Максимальное количество файлов для обработки в каждой полосе.

AdditionalOptions -> (структура)

Дополнительные параметры конфигурации для обработки источника S3.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения пробного пути.

SamplePath -> (строка)

Если включено, указывает пробный путь.

NumberRows -> (длинное целое)

Количество строк для обработки из каждого файла Excel.

SkipFooter -> (целое)

Количество строк, которые нужно пропустить в конце каждого файла Excel.

OutputSchemas -> (список)

Схемы AWS Glue, которые нужно применить к обработанным данным.

(структура)

Указывает определяемую пользователем схему, когда схема не может быть определена Glue.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3JsonSource -> (структура)

Указывает хранилище JSON-данных, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

CompressionType -> (строка)

Указывает, как сжаты данные. Это, как правило, не требуется, если данные имеют стандартное расширение файла. Возможные значения — "gzip" и "bzip".

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

GroupSize -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера вашего кластера. Когда число входных файлов меньше 50 000, "groupFiles" должно быть установлено в значение "inPartition", чтобы это имело эффект.

GroupFiles -> (строка)

Группировка файлов включена по умолчанию, когда вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в значение «inPartition». Чтобы отключить группировку, когда число файлов превышает 50 000, установите этот параметр в значение "none".

Recurse -> (булево)

Если установлено в значение true, файлы в всех подкаталогах по указанным путям читаются рекурсивно.

MaxBand -> (целое)

Этот параметр контролирует продолжительность в миллисекундах, после которой список s3, скорее всего, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются специально при использовании JobBookmarks для учета несинхронной работы Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию значение составляет 900000 миллисекунд или 15 минут.

MaxFilesInBand -> (целое)

Этот параметр задаёт максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующей работе.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел целевого количества файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения пробного пути.

SamplePath -> (строка)

Если включено, указывает пробный путь.

JsonPath -> (строка)

Строка JsonPath, определяющая JSON-данные.

Multiline -> (булево)

Булево значение, указывающее, может ли одна запись занимать несколько строк. Это может произойти, когда поле содержит символ новой строки в кавычках. Необходимо установить этот параметр в значение True, если какая-либо запись занимает несколько строк. Значение по умолчанию — False, что позволяет более активно разделять файлы при разборе.

OutputSchemas -> (список)

Указывает схему данных для источника JSON в S3.

(структура)

Указывает определяемую пользователем схему, когда схема не может быть определена Glue.

Columns -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3ParquetSource -> (структура)

Указывает хранилище данных Apache Parquet, хранящееся в Amazon S3.

Имя -> (строка)

Имя хранилища данных.

Пути -> (список)

Список путей Amazon S3 для чтения.

(строка)

ТипСжатия -> (строка)

Указывает, как сжимаются данные. Обычно это не нужно, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip").

Исключения -> (список)

Строка, содержащая JSON-список шаблонов Unix-стиля glob для исключения. Например, “["**.pdf"]” исключает все файлы PDF.

(строка)

РазмерГруппы -> (строка)

Целевой размер группы в байтах. По умолчанию вычисляется на основе размера входных данных и размера кластера. Когда входных файлов меньше 50 000, необходимо установить "groupFiles" в значение "inPartition", чтобы это имело эффект.

ГруппировкаФайлов -> (строка)

Группировка файлов включена по умолчанию, когда вход содержит более 50 000 файлов. Чтобы включить группировку с менее чем 50 000 файлами, установите этот параметр в «inPartition». Чтобы отключить группировку при наличии более 50 000 файлов, установите этот параметр в значение "none".

РекурсивныйПросмотр -> (булево)

Если установлено в значение true, файлы в всех подкаталогах по указанным путям считываются рекурсивно.

МаксимальнаяПолоса -> (целое число)

Этот параметр управляет продолжительностью (в миллисекундах), после которой список s3, вероятно, будет согласован. Файлы с отметками времени изменения, попадающими в последние maxBand миллисекунд, отслеживаются особо при использовании JobBookmarks для учета несинхронности Amazon S3. Большинству пользователей не нужно устанавливать этот параметр. По умолчанию значение составляет 900000 миллисекунд или 15 минут.

МаксимальноеКоличествоФайловВПолосе -> (целое число)

Этот параметр определяет максимальное количество файлов, сохраняемых из последних maxBand секунд. Если это число превышено, дополнительные файлы пропускаются и обрабатываются только в следующем запуске задания.

ДополнительныеПараметры -> (структура)

Указывает дополнительные параметры подключения.

ОграниченныйРазмер -> (длинное целое число)

Устанавливает верхнюю границу целевого размера набора данных в байтах, который будет обработан.

ОграниченноеКоличествоФайлов -> (длинное целое число)

Устанавливает верхнюю границу целевого количества файлов, которые будут обработаны.

ВключитьОбразецПути -> (булево)

Устанавливает параметр для включения образца пути.

ПутьОбразца -> (строка)

Если включено, указывает путь образца.

СхемыВывода -> (список)

Указывает схему данных для источника S3 Parquet.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ИсточникРеляционнойКаталога -> (структура)

Указывает хранилище данных реляционного каталога в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

ИсточникDynamoDBКаталога -> (структура)

Указывает хранилище данных DynamoDBC Catalog в каталоге данных Glue.

Имя -> (строка)

Имя источника данных.

БазаДанных -> (строка)

Имя базы данных для чтения.

Таблица -> (строка)

Имя таблицы в базе данных для чтения.

JDBCЦелевойКоннектор -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения, связанного с коннектором.

ТаблицаПодключения -> (строка)

Имя таблицы в целевом объекте данных.

ИмяКоннектора -> (строка)

Имя коннектора, который будет использоваться.

ТипПодключения -> (строка)

Тип подключения, например marketplace.jdbc или custom.jdbc, обозначающий подключение к целевому объекту данных JDBC.

ДополнительныеПараметры -> (массив)

Дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для целевого объекта JDBC.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ЦелевойКоннекторSpark -> (структура)

Указывает целевой объект, использующий коннектор Apache Spark.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

ИмяПодключения -> (строка)

Имя подключения для коннектора Apache Spark.

ИмяКоннектора -> (строка)

Имя коннектора Apache Spark.

ТипПодключения -> (строка)

Тип подключения, например marketplace.spark или custom.spark, обозначающий подключение к хранилищу данных Apache Spark.

ДополнительныеПараметры -> (массив)

Дополнительные параметры подключения для коннектора.

ключ -> (строка)

значение -> (строка)

СхемыВывода -> (список)

Указывает схему данных для настраиваемой Spark цели.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Столбцы -> (список)

Указывает определения столбцов, составляющие схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

ЦелевойКаталог -> (структура)

Указывает целевой объект, использующий таблицу каталога данных Glue.

Имя -> (строка)

Имя вашего целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Ключи разбиения, используемые для распределения данных по нескольким разделам или фрагментам на основе определенного ключа или набора ключей.

(список)

(строка)

БазаДанных -> (строка)

База данных, содержащая таблицу, которую вы хотите использовать в качестве цели. Эта база данных должна уже существовать в каталоге данных.

Таблица -> (строка)

Таблица, определяющая схему ваших выходных данных. Эта таблица должна уже существовать в каталоге данных.

ЦелевойRedshift -> (структура)

Указывает целевой объект, использующий Amazon Redshift.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

БазаДанных -> (строка)

Имя базы данных для записи.

Таблица -> (строка)

Имя таблицы в базе данных для записи.

ВременнаяПапкаRedshift -> (строка)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

ВременнаяПапкаРольIAM -> (строка)

Роль IAM с разрешениями.

ПараметрыUpsertRedshift -> (структура)

Набор параметров для настройки операции upsert при записи в целевой объект Redshift.

РасположениеТаблицы -> (строка)

Физическое расположение таблицы Redshift.

ИмяПодключения -> (строка)

Имя подключения для записи в Redshift.

КлючиUpsert -> (список)

Ключи, используемые для определения, выполнять ли обновление или вставку.

(строка)

ЦелевойS3Каталог -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 с использованием каталога данных Glue.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Указывает собственное разбиение, используя последовательность ключей.

(список)

(строка)

Таблица -> (строка)

Имя таблицы в базе данных для записи.

БазаДанных -> (строка)

Имя базы данных для записи.

ПолитикаИзмененийСхемы -> (структура)

Политика, определяющая поведение при обновлении для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение при обновлении, когда ползунок находит измененную схему.

ПоведениеПриОбновлении -> (строка)

Поведение при обновлении, когда ползунок находит измененную схему.

ЦелевойS3GlueParquet -> (структура)

Указывает целевой объект данных, который записывает в Amazon S3 в столбцовом хранилище Apache Parquet.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, являющиеся входами для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Указывает собственное разбиение, используя последовательность ключей.

(список)

(строка)

Путь -> (строка)

Один путь Amazon S3 для записи.

Сжатие -> (строка)

Указывает, как сжимаются данные. Обычно это не нужно, если данные имеют стандартное расширение файла. Возможные значения - "gzip" и "bzip").

КоличествоЦелевыхРазделов -> (строка)

Указывает количество целевых разделов для файлов Parquet при записи в Amazon S3 с помощью AWS Glue.

ПолитикаИзмененийСхемы -> (структура)

Политика, определяющая поведение при обновлении для ползунка.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение при обновлении, когда ползунок находит измененную схему.

ПоведениеПриОбновлении -> (строка)

Поведение при обновлении, когда ползунок находит измененную схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

ЦелевойS3ГиперПрямой -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 с использованием оптимизации HyperDirect.

Имя -> (строка)

Уникальный идентификатор узла целевого назначения HyperDirect.

Входы -> (список)

Указывает источник входных данных для целевого узла HyperDirect.

(строка)

КлючиРазбиения -> (список)

Определяет стратегию разбиения выходных данных.

(список)

(строка)

Путь -> (строка)

Расположение в S3, куда будут записаны выходные данные.

Сжатие -> (строка)

Тип сжатия, который будет применён к выходным данным.

ПолитикаИзмененийСхемы -> (структура)

Определяет, как обрабатываются изменения схемы во время операций записи.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаружит изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда обработчик обнаружит изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3DirectTarget -> (структура)

Указывает целевой объект данных, который записывает данные в Amazon S3.

Имя -> (строка)

Имя целевого объекта данных.

Входы -> (список)

Узлы, которые являются входными для целевого объекта данных.

(строка)

КлючиРазбиения -> (список)

Указывает собственное разбиение, используя последовательность ключей.

(список)

(строка)

Путь -> (строка)

Один путь в Amazon S3 для записи.

Сжатие -> (строка)

Указывает способ сжатия данных. Это обычно не нужно, если у данных есть стандартное расширение файла. Возможные значения — "gzip" и "bzip").

КоличествоЦелевыхРазбиений -> (строка)

Указывает количество целевых разбиений при прямой записи данных в Amazon S3.

Формат -> (строка)

Указывает формат выходных данных для целевого объекта.

ПолитикаИзмененийСхемы -> (структура)

Политика, которая определяет поведение обновления для обработчика.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаружит изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда обработчик обнаружит изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

S3IcebergDirectTarget -> (структура)

Определяет параметры конфигурации для записи данных в Amazon S3 в виде таблицы Apache Iceberg.

Имя -> (строка)

Указывает уникальный идентификатор узла Iceberg в вашей конвейере данных.

Входы -> (список)

Определяет единственный источник входных данных, который предоставляет данные этому целевому объекту Iceberg.

(строка)

КлючиРазбиения -> (список)

Указывает столбцы, используемые для разбиения данных таблицы Iceberg в S3.

(список)

(строка)

Путь -> (строка)

Определяет расположение в S3, где будут храниться данные таблицы Iceberg.

Формат -> (строка)

Указывает формат файлов, используемый для хранения данных таблицы Iceberg (например, Parquet, ORC).

ДополнительныеПараметры -> (карта)

Предоставляет дополнительные параметры конфигурации для настройки поведения таблицы Iceberg.

ключ -> (строка)

значение -> (строка)

ПолитикаИзмененийСхемы -> (структура)

Определяет, как обрабатываются изменения схемы при записи данных в таблицу Iceberg.

ВключитьОбновлениеКаталога -> (булево)

Использовать ли указанное поведение обновления, когда обработчик обнаружит изменённую схему.

ПоведениеОбновления -> (строка)

Поведение обновления, когда обработчик обнаружит изменённую схему.

Таблица -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

БазаДанных -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

Сжатие -> (строка)

Указывает кодек сжатия, используемый для файлов таблицы Iceberg в S3.

КоличествоЦелевыхРазбиений -> (строка)

Устанавливает количество целевых разбиений для распределения файлов таблицы Iceberg по S3.

ПрименитьПреобразование -> (структура)

Указывает преобразование, которое сопоставляет ключи свойств данных в источнике данных с ключами свойств данных в целевом объекте данных. Вы можете переименовывать ключи, изменять типы данных для ключей и выбирать, какие ключи исключить из набора данных.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Преобразование -> (список)

Указывает сопоставление ключей свойств данных в источнике данных с ключами свойств данных в целевом объекте данных.

(структура)

Указывает сопоставление ключей свойств данных.

ДляКлюча -> (строка)

После применения преобразования, как должно называться столбец. Может быть таким же, как FromPath.

ИзПути -> (список)

Таблица или столбец, подлежащие модификации.

(строка)

ИзТипа -> (строка)

Тип данных, подлежащих модификации.

ВТип -> (строка)

Тип данных, в который следует изменить данные.

Исключить -> (булево)

Если true, то столбец удаляется.

Подчинённые -> (список)

Применимо только к вложенным структурам данных. Если вы хотите изменить родительскую структуру, а также один из её подчинённых элементов, вы можете заполнить эту структуру данных. Также Mapping, но её FromPath будет родительским FromPath плюс FromPath из этой структуры.

Для части подчинённых, предположим, у вас есть структура:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

Вы можете указать Mapping, которая выглядит так:

{ "FromPath": "OuterStructure", "ToKey": "OuterStructure", "ToType": "Struct", "Dropped": false, "Chidlren": [{ "FromPath": "inner", "ToKey": "inner", "ToType": "Double", "Dropped": false, }] }

(структура)

Указывает сопоставление ключей свойств данных.

ДляКлюча -> (строка)

После применения преобразования, как должно называться столбец. Может быть таким же, как FromPath.

ИзПути -> (список)

Таблица или столбец, подлежащие модификации.

(строка)

ИзТипа -> (строка)

Тип данных, подлежащих модификации.

ВТип -> (строка)

Тип данных, в который следует изменить данные.

Исключить -> (булево)

Если true, то столбец удаляется.

ВыбратьПоля -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите сохранить.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Пути -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

УдалитьПоля -> (структура)

Указывает преобразование, которое выбирает ключи свойств данных, которые вы хотите удалить.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Пути -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

ПереименоватьПоле -> (структура)

Указывает преобразование, которое переименовывает один ключ свойства данных.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

ИсточникПути -> (список)

Путь JSON к переменной в структуре данных для исходных данных.

(строка)

ЦелевойПуть -> (список)

Путь JSON к переменной в структуре данных для целевых данных.

(строка)

Spigot -> (структура)

Указывает преобразование, которое записывает образцы данных в хранилище Amazon S3.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Путь -> (строка)

Путь в Amazon S3, куда преобразование запишет подмножество записей из набора данных в файл JSON в хранилище Amazon S3.

Topk -> (целое число)

Указывает количество записей для записи, начиная с начала набора данных.

Вероятность -> (двойное)

Вероятность (десятичное значение с максимальным значением 1) выбора любой заданной записи. Значение 1 указывает, что каждая строка, считанная из набора данных, должна быть включена в выходной образец.

Объединить -> (структура)

Указывает преобразование, которое объединяет два набора данных в один набор данных с использованием условия сравнения по указанным ключам свойств данных. Вы можете использовать внутренние, внешние, левые, правые, левые полученные и левые анти-объединения.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

ТипОбъединения -> (строка)

Указывает тип объединения, который нужно выполнить для наборов данных.

Столбцы -> (список)

Список двух столбцов, которые нужно объединить.

(структура)

Указывает столбец для объединения.

Из -> (строка)

Столбец для объединения.

Ключи -> (список)

Ключ столбца для объединения.

(список)

(строка)

РазделитьПоля -> (структура)

Указывает преобразование, которое разделяет ключи свойств данных на два DynamicFrames. Выход представляет собой набор DynamicFrames: один с выбранными ключами свойств данных и один с оставшимися ключами свойств данных.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Пути -> (список)

Путь JSON к переменной в структуре данных.

(список)

(строка)

ВыбратьИзКоллекции -> (структура)

Указывает преобразование, которое выбирает один DynamicFrame из коллекции DynamicFrames. Выход — выбранный DynamicFrame.

Имя -> (строка)

Имя узла преобразования.

Входы -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Индекс -> (целое число)

Индекс DynamicFrame для выбора.

ЗаполнитьПропущенныеЗначения -> (структура)

Указывает преобразование, которое находит записи в наборе данных, содержащие пропущенные значения, и добавляет новое поле со значением, определенным с помощью импутации. Входной набор данных используется для обучения модели машинного обучения, которая определяет, каким должно быть пропущенное значение.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

ImputedPath -> (строка)

JSON-путь к переменной в структуре данных для набора данных, который импутируется.

FilledPath -> (строка)

JSON-путь к переменной в структуре данных для набора данных, который заполняется.

Filter -> (структура)

Указывает преобразование, которое разбивает набор данных на два, на основе условия фильтрации.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

LogicalOperator -> (строка)

Оператор, используемый для фильтрации строк путем сравнения значения ключа со значением, указанным в условии.

Filters -> (список)

Указывает выражение фильтра.

(структура)

Указывает выражение фильтра.

Operation -> (строка)

Тип операции, которая должна быть выполнена в выражении.

Negated -> (булево)

Нужно ли инвертировать (отрицание) выражения.

Values -> (список)

Список значений фильтра.

(структура)

Представляет одну запись в списке значений для FilterExpression.

Type -> (строка)

Тип значения фильтра.

Value -> (список)

Значение, которое следует ассоциировать.

(строка)

CustomCode -> (структура)

Указывает преобразование, которое использует предоставленный вами код для выполнения преобразования данных. Выход представляет собой коллекцию DynamicFrames.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входные данные, идентифицированные по их именам узлов.

(строка)

Code -> (строка)

Пользовательский код, используемый для преобразования данных.

ClassName -> (строка)

Имя, определенное для класса узла пользовательского кода.

OutputSchemas -> (список)

Указывает схему данных для преобразования пользовательского кода.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему автоматически.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SparkSQL -> (структура)

Указывает преобразование, в котором вы вводите SQL-запрос, используя синтаксис Spark SQL для преобразования данных. Выход представляет собой один DynamicFrame.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входные данные, идентифицированные по их именам узлов. Вы можете сопоставить имя таблицы с каждым входным узлом для использования в SQL-запросе. Выбранное имя должно соответствовать ограничениям именования Spark SQL.

(строка)

SqlQuery -> (строка)

SQL-запрос, который должен использовать синтаксис Spark SQL и возвращать один набор данных.

SqlAliases -> (список)

Список псевдонимов. Псевдоним позволяет указать имя, которое следует использовать в SQL для данного входного значения. Например, у вас есть источник данных с именем «MyDataSource». Если вы укажете From как MyDataSource, и Alias как SqlName, то в вашем SQL вы можете сделать так:

select * from SqlName

и это получит данные из MyDataSource.

(структура)

Представляет одну запись в списке значений для SqlAliases.

From -> (строка)

Таблица или столбец в таблице.

Alias -> (строка)

Временное имя, данное таблице или столбцу в таблице.

OutputSchemas -> (список)

Указывает схему данных для преобразования SparkSQL.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему автоматически.

Columns -> (список)

Указывает определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

DirectKinesisSource -> (структура)

Указывает прямой источник данных Amazon Kinesis.

Name -> (строка)

Имя источника данных.

WindowSize -> (целое число)

Время обработки каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из входных данных?

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL конечной точки Kinesis.

StreamName -> (строка)

Имя потока данных Kinesis.

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделительный символ.

StartingPosition -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения: "latest", "trim_horizon", "earliest" или строка даты-времени в формате UTC в формате yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию: "latest".

Примечание: Использование значения, представляющего строку даты-времени в формате UTC, для «startingPosition» поддерживается только для версии Glue 4.0 и выше.

MaxFetchTimeInMs -> (длинное целое число)

Максимальное время, которое тратит исполнитель задания на чтение записей для текущей партии из потока данных Kinesis, указанное в миллисекундах (мс). В течение этого времени может быть сделано несколько GetRecords API-запросов. Значение по умолчанию: 1000.

MaxFetchRecordsPerShard -> (длинное целое число)

Максимальное количество записей для извлечения на каждый фрагмент в потоке данных Kinesis за один микропакет. Примечание: клиент может превысить этот предел, если задача потокового задания уже прочитала дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard должен быть строгим, то он должен быть кратен MaxRecordPerRead. Значение по умолчанию: 100000.

MaxRecordPerRead -> (длинное целое число)

Максимальное количество записей для извлечения из потока данных Kinesis в каждом запросе getRecords. Значение по умолчанию: 10000.

AddIdleTimeBetweenReads -> (булево)

Добавляет задержку между двумя последовательными операциями getRecords. Значение по умолчанию: "False". Этот параметр настраивается только для версии Glue 2.0 и выше.

IdleTimeBetweenReadsInMs -> (длинное целое число)

Минимальная задержка между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию: 1000. Этот параметр настраивается только для версии Glue 2.0 и выше.

DescribeShardInterval -> (длинное целое число)

Минимальный интервал времени между двумя вызовами API ListShards для вашей программы для учета решардинга. Значение по умолчанию: 1s.

NumRetries -> (целое число)

Максимальное количество попыток для запросов API Kinesis Data Streams. Значение по умолчанию: 3.

RetryIntervalMs -> (длинное целое число)

Период охлаждения (в мс) до повторной попытки вызова API Kinesis Data Streams. Значение по умолчанию: 1000.

MaxRetryIntervalMs -> (длинное целое число)

Максимальный период охлаждения (в мс) между двумя повторными попытками вызова API Kinesis Data Streams. Значение по умолчанию: 10000.

AvoidEmptyBatches -> (булево)

Избегает создания пустой задачи микропакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед запуском пакета. Значение по умолчанию: "False".

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли для принятия с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для описания или чтения записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSSessionName".

RoleSessionName -> (строка)

Идентификатор сессии принятия роли с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSRoleARN".

AddRecordTimestamp -> (строка)

Если этот параметр установлен в ‘true’, выходные данные будут содержать дополнительный столбец с именем «__src_timestamp», указывающий время получения соответствующей записи потоком. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

Если этот параметр установлен в ‘true’, для каждой партии он будет передавать метрики интервала времени между самой старой записью, полученной потоком, и временем ее прибытия в Glue в CloudWatch. Имя метрики: “glue.driver.streaming.maxConsumerLagInMs”. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (дата/время)

Дата и время записи в потоке данных Kinesis для начала чтения данных. Возможные значения: строка даты и времени в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

PollingTime -> (длинное целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое число)

Предел количества опрошенных записей.

DirectKafkaSource -> (структура)

Определяет хранилище данных Apache Kafka.

Name -> (строка)

Имя хранилища данных.

StreamingOptions -> (структура)

Определяет параметры потоковой передачи.

BootstrapServers -> (строка)

Список URL-адресов серверов начальной загрузки, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокерами. Возможные значения: "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя подключения.

TopicName -> (строка)

Имя темы, указанное в Apache Kafka. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретная TopicPartitions для потребления. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярного выражения, определяющая список тем для подписки. Вы должны указать хотя бы один из параметров "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения: "earliest" или "latest". Значение по умолчанию: "latest".

EndingOffsets -> (строка)

Конечная точка, когда пакетный запрос завершается. Возможные значения: "latest" или строка JSON, которая определяет конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (целое число)

Таймаут в миллисекундах для получения данных из Kafka в исполнителях задач Spark. Значение по умолчанию: 512.

NumRetries -> (целое число)

Количество попыток повторного получения смещений Kafka перед ошибкой. Значение по умолчанию: 3.

RetryIntervalMs -> (длинное целое число)

Время ожидания в миллисекундах перед повторной попыткой получить смещения Kafka. Значение по умолчанию: 10.

MaxOffsetsPerTrigger -> (длинное целое число)

Лимит на максимальное количество смещений, обрабатываемых за интервал срабатывания. Указанное общее количество смещений пропорционально разбивается между topicPartitions различных объемов. Значение по умолчанию: null, что означает, что потребитель считывает все смещения до известного последнего смещения.

MinPartitions -> (целое число)

Желаемое минимальное количество разделов для чтения из Kafka. Значение по умолчанию: null, что означает, что количество разделов Spark равно количеству разделов Kafka.

IncludeHeaders -> (булево)

Включать ли заголовки Kafka. При установке параметра в «true», выходные данные будут содержать дополнительный столбец с именем «glue_streaming_kafka_headers» типа Array[Struct(key: String, value: String)]. Значение по умолчанию: «false». Этот параметр доступен только в версии Glue 3.0 и выше.

AddRecordTimestamp -> (строка)

Если этот параметр установлен в ‘true’, выходные данные будут содержать дополнительный столбец с именем “__src_timestamp”, указывающий время получения соответствующего сообщения темой. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При установке этого параметра в ‘true’, для каждой группы данных он будет генерировать метрики разницы между старейшим сообщением, полученным темой, и временем его прибытия в Glue в CloudWatch. Имя метрики: «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (временная метка)

Временная метка сообщения в теме Kafka для начала чтения данных. Возможные значения: строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет часовой пояс UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

Только один из параметров StartingTimestamp или StartingOffsets должен быть установлен.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из входных данных.

DataPreviewOptions -> (структура)

Определяет параметры, относящиеся к предварительному просмотру данных для просмотра образца ваших данных.

PollingTime -> (длинное целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое число)

Предел количества опрошенных сообщений.

CatalogKinesisSource -> (структура)

Определяет источник данных Kinesis в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (булево)

Автоматически определять схему из входных данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Дополнительные параметры для источника потоковых данных Kinesis.

EndpointUrl -> (строка)

URL конечной точки Kinesis.

StreamName -> (строка)

Имя потока данных Kinesis.

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingPosition -> (строка)

Начальная позиция в потоке данных Kinesis для чтения данных. Возможные значения: "latest", "trim_horizon", "earliest" или строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет часовой пояс UTC с +/-. Например: “2023-04-04T08:00:00-04:00”). Значение по умолчанию: "latest".

Примечание: Использование значения, являющегося строкой временной метки в формате UTC для «startingPosition», поддерживается только в версии Glue 4.0 и выше.

MaxFetchTimeInMs -> (длинное целое число)

Максимальное время, затрачиваемое исполнителем задачи на чтение записей для текущего пакета из потока данных Kinesis, указанное в миллисекундах (мс). В течение этого времени могут быть выполнены несколько вызовов API GetRecords. Значение по умолчанию: 1000.

MaxFetchRecordsPerShard -> (длинное целое число)

Максимальное количество записей для извлечения на каждый раздел в потоке данных Kinesis за один микропакет. Примечание: клиент может превысить этот лимит, если задача потоковой передачи уже прочла дополнительные записи из Kinesis (в том же вызове get-records). Если MaxFetchRecordsPerShard должно быть строго соблюдаться, то оно должно быть кратным MaxRecordPerRead. Значение по умолчанию: 100000.

MaxRecordPerRead -> (длинное целое число)

Максимальное количество записей для извлечения из потока данных Kinesis в каждой операции getRecords. Значение по умолчанию: 10000.

AddIdleTimeBetweenReads -> (булево)

Добавляет временную задержку между двумя последовательными операциями getRecords. Значение по умолчанию: "False". Этот параметр настраивается только для версии Glue 2.0 и выше.

IdleTimeBetweenReadsInMs -> (длинное целое число)

Минимальная задержка между двумя последовательными операциями getRecords, указанная в мс. Значение по умолчанию: 1000. Этот параметр настраивается только для версии Glue 2.0 и выше.

DescribeShardInterval -> (длинное целое число)

Минимальный интервал времени между двумя вызовами ListShards API для вашего скрипта, чтобы рассмотреть возможность перераспределения. Значение по умолчанию: 1s.

NumRetries -> (целое число)

Максимальное количество попыток повтора для запросов API Kinesis Data Streams. Значение по умолчанию: 3.

RetryIntervalMs -> (длинное целое число)

Время охлаждения (указанное в мс) перед повторной попыткой вызова API Kinesis Data Streams. Значение по умолчанию: 1000.

MaxRetryIntervalMs -> (длинное целое число)

Максимальное время охлаждения (указанное в мс) между двумя попытками повтора вызова API Kinesis Data Streams. Значение по умолчанию: 10000.

AvoidEmptyBatches -> (булево)

Избегает создания пустой задачи микропакета, проверяя наличие непрочитанных данных в потоке данных Kinesis перед запуском пакета. Значение по умолчанию: "False".

StreamArn -> (строка)

Amazon Resource Name (ARN) потока данных Kinesis.

RoleArn -> (строка)

Amazon Resource Name (ARN) роли, принимаемой с помощью AWS Security Token Service (AWS STS). Эта роль должна иметь разрешения для описания или чтения записей для потока данных Kinesis. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSSessionName".

RoleSessionName -> (строка)

Идентификатор сеанса, принимающего роль с помощью AWS STS. Вы должны использовать этот параметр при доступе к потоку данных в другом аккаунте. Используется совместно с "awsSTSRoleARN".

AddRecordTimestamp -> (строка)

Если этот параметр установлен в ‘true’, выходные данные будут содержать дополнительный столбец с именем “__src_timestamp”, указывающий время получения соответствующего сообщения потоком. Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

Если этот параметр установлен в ‘true’, для каждой группы данных он будет генерировать метрики разницы между старейшим сообщением, полученным потоком, и временем его прибытия в Glue в CloudWatch. Имя метрики: «glue.driver.streaming.maxConsumerLagInMs». Значение по умолчанию: ‘false’. Этот параметр поддерживается в версии Glue 4.0 и выше.

StartingTimestamp -> (временная метка)

Временная метка сообщения в потоке данных Kinesis для начала чтения данных. Возможные значения: строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет часовой пояс UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

DataPreviewOptions -> (структура)

Дополнительные параметры для предварительного просмотра данных.

PollingTime -> (длинное целое число)

Время опроса в миллисекундах.

RecordPollingLimit -> (длинное целое число)

Предел количества опрошенных сообщений.

CatalogKafkaSource -> (структура)

Указывает хранилище данных Apache Kafka в каталоге данных.

Name -> (строка)

Имя хранилища данных.

WindowSize -> (целое число)

Время, затрачиваемое на обработку каждого микропакета.

DetectSchema -> (логическое значение)

Автоматически определять схему из входных данных.

Table -> (строка)

Имя таблицы в базе данных для чтения.

Database -> (строка)

Имя базы данных для чтения.

StreamingOptions -> (структура)

Указывает параметры потоковой передачи.

BootstrapServers -> (строка)

Список адресов серверов bootstrap, например, как b-1.vpc-test-2.o4q88o.c6.kafka.us-east-1.amazonaws.com:9094. Этот параметр должен быть указан в вызове API или определен в метаданных таблицы в каталоге данных.

SecurityProtocol -> (строка)

Протокол, используемый для связи с брокеры. Возможные значения — "SSL" или "PLAINTEXT".

ConnectionName -> (строка)

Имя подключения.

TopicName -> (строка)

Имя темы, как указано в Apache Kafka. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

Assign -> (строка)

Конкретная TopicPartitions для потребления. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

SubscribePattern -> (строка)

Строка Java-регулярных выражений, определяющая список тем для подписки. Вы должны указать хотя бы один из "topicName", "assign" или "subscribePattern".

Classification -> (строка)

Необязательная классификация.

Delimiter -> (строка)

Указывает разделитель.

StartingOffsets -> (строка)

Начальная позиция в теме Kafka для чтения данных. Возможные значения — "earliest" или "latest". Значение по умолчанию — "latest".

EndingOffsets -> (строка)

Конечная точка, когда пакетный запрос завершается. Возможные значения — либо "latest", либо строка JSON, которая указывает конечную позицию для каждого TopicPartition.

PollTimeoutMs -> (целое число с плавающей запятой)

Таймаут в миллисекундах для получения данных из Kafka в исполнителях Spark-заданий. Значение по умолчанию — 512.

NumRetries -> (целое число)

Количество попыток повтора, прежде чем произойдет ошибка при получении смещений Kafka. Значение по умолчанию — 3.

RetryIntervalMs -> (целое число с плавающей запятой)

Время ожидания в миллисекундах перед повторной попыткой получить смещения Kafka. Значение по умолчанию — 10.

MaxOffsetsPerTrigger -> (целое число с плавающей запятой)

Предел скорости обработки максимального количества смещений на интервал триггера. Указанное общее количество смещений пропорционально разделено между topicPartitions различной емкости. Значение по умолчанию — null, что означает, что потребитель читает все смещения до известного последнего смещения.

MinPartitions -> (целое число)

Желаемое минимальное количество разделов для чтения из Kafka. Значение по умолчанию — null, что означает, что количество партиций Spark равно количеству партиций Kafka.

IncludeHeaders -> (логическое значение)

Включать заголовки Kafka. При значении «true» выходные данные данных будут содержать дополнительный столбец с именем «glue_streaming_kafka_headers» и типом Array[Struct(key: String, value: String)]. Значение по умолчанию — «false». Этот параметр доступен только в Glue версии 3.0 и выше.

AddRecordTimestamp -> (строка)

При значении ‘true’ выходные данные данных будут содержать дополнительный столбец с именем «__src_timestamp», который указывает время получения соответствующего записями темой. Значение по умолчанию — ‘false’. Этот параметр поддерживается в Glue версии 4.0 и выше.

EmitConsumerLagMetrics -> (строка)

При значении ‘true’ для каждой партии вычисляются метрики времени между самой старой записью, полученной темой, и временем ее прибытия в Glue в CloudWatch. Имя метрики — “glue.driver.streaming.maxConsumerLagInMs”. Значение по умолчанию — ‘false’. Этот параметр поддерживается в Glue версии 4.0 и выше.

StartingTimestamp -> (временная метка)

Временная метка записи в теме Kafka для начала чтения данных. Возможные значения — строка временной метки в формате UTC с шаблоном yyyy-mm-ddTHH:MM:SSZ (где Z представляет смещение часового пояса UTC с +/-. Например: “2023-04-04T08:00:00+08:00”).

Только один из StartingTimestamp или StartingOffsets должен быть установлен.

DataPreviewOptions -> (структура)

Указывает параметры, связанные с предварительным просмотром данных для просмотра образца данных.

PollingTime -> (целое число с плавающей запятой)

Время опроса в миллисекундах.

RecordPollingLimit -> (целое число с плавающей запятой)

Предел количества опрошенных записей.

DropNullFields -> (структура)

Указывает преобразование, удаляющее столбцы из набора данных, если все значения в столбце равны ‘null’. По умолчанию Glue Studio распознает нулевые объекты, но некоторые значения, такие как пустые строки, строки, которые являются “null”, целые числа -1 или другие заглушки, такие как нули, не распознаются автоматически как нули.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Данные входов, идентифицированные по их именам узлов.

(строка)

NullCheckBoxList -> (структура)

Структура, представляющая, распознаются ли определенные значения как нулевые значения для удаления.

IsEmpty -> (логическое значение)

Указывает, что пустая строка рассматривается как нулевое значение.

IsNullString -> (логическое значение)

Указывает, что значение, написанное словом ‘null’, рассматривается как нулевое значение.

IsNegOne -> (логическое значение)

Указывает, что целое число -1 рассматривается как нулевое значение.

NullTextList -> (список)

Структура, которая указывает список структур NullValueField, представляющих пользовательское нулевое значение, такое как ноль или другое значение, используемое в качестве нулевой заглушки, уникальной для набора данных.

Преобразование DropNullFields удаляет пользовательские нулевые значения только в том случае, если значение нулевой заглушки и тип данных совпадают с данными.

(структура)

Представляет пользовательское нулевое значение, такое как ноль или другое значение, используемое в качестве нулевой заглушки, уникальной для набора данных.

Value -> (строка)

Значение нулевой заглушки.

Datatype -> (структура)

Тип данных значения.

Id -> (строка)

Тип данных значения.

Label -> (строка)

Метка, назначенная типу данных.

Merge -> (структура)

Указывает преобразование, которое объединяет DynamicFrame со структурой подготовки DynamicFrame на основе указанных первичных ключей для определения записей. Дублирующиеся записи (записи с одинаковыми первичными ключами) не удаляются.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Данные входов, идентифицированные по их именам узлов.

(строка)

Source -> (строка)

Исходный DynamicFrame, который будет объединен со структурой подготовки DynamicFrame.

PrimaryKeys -> (список)

Список полей первичного ключа для сопоставления записей из исходного и подготовленного динамических кадров.

(список)

(строка)

Union -> (структура)

Указывает преобразование, которое объединяет строки из двух или более наборов данных в единый результат.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узлов для преобразования.

(строка)

UnionType -> (строка)

Указывает тип преобразования Union.

Укажите ALL, чтобы объединить все строки из источников данных в результирующий DynamicFrame. Результирующее объединение не удаляет дублирующиеся строки.

Укажите DISTINCT, чтобы удалить дублирующиеся строки в результирующем DynamicFrame.

PIIDetection -> (структура)

Указывает преобразование, которое идентифицирует, удаляет или маскирует данные PII.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Входы узлов для преобразования.

(строка)

PiiType -> (строка)

Указывает тип преобразования PIIDetection.

EntityTypesToDetect -> (список)

Указывает типы сущностей, которые преобразование PIIDetection будет идентифицировать как данные PII.

Типы сущностей PII включают: PERSON_NAME, DATE, USA_SNN, EMAIL, USA_ITIN, USA_PASSPORT_NUMBER, PHONE_NUMBER, BANK_ACCOUNT, IP_ADDRESS, MAC_ADDRESS, USA_CPT_CODE, USA_HCPCS_CODE, USA_NATIONAL_DRUG_CODE, USA_MEDICARE_BENEFICIARY_IDENTIFIER, USA_HEALTH_INSURANCE_CLAIM_NUMBER,CREDIT_CARD,USA_NATIONAL_PROVIDER_IDENTIFIER,USA_DEA_NUMBER,USA_DRIVING_LICENSE

(строка)

OutputColumnName -> (строка)

Указывает имя выходного столбца, который будет содержать любой тип сущности, обнаруженный в этой строке.

SampleFraction -> (число с плавающей точкой)

Указывает долю данных для выборки при сканировании сущностей PII.

ThresholdFraction -> (число с плавающей точкой)

Указывает долю данных, которая должна быть достигнута для того, чтобы столбец был идентифицирован как данные PII.

MaskValue -> (строка)

Указывает значение, которое будет заменять обнаруженную сущность.

Aggregate -> (структура)

Указывает преобразование, которое группирует строки по выбранным полям и вычисляет агрегированное значение по заданной функции.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Указывает поля и строки, которые будут использоваться в качестве входов для преобразования aggregate.

(строка)

Groups -> (список)

Указывает поля для группировки.

(список)

(строка)

Aggs -> (список)

Указывает агрегирующие функции, которые будут выполняться над указанными полями.

(структура)

Указывает набор параметров, необходимых для выполнения агрегирования в преобразовании aggregate.

Column -> (список)

Указывает столбец в наборе данных, к которому будет применена агрегирующая функция.

(строка)

AggFunc -> (строка)

Указывает агрегирующую функцию.

Возможные агрегирующие функции: avg countDistinct, count, first, last, kurtosis, max, min, skewness, stddev_samp, stddev_pop, sum, sumDistinct, var_samp, var_pop

DropDuplicates -> (структура)

Указывает преобразование, удаляющее повторяющиеся строки из набора данных.

Name -> (строка)

Имя узла преобразования.

Inputs -> (список)

Данные входов, идентифицированные по их именам узлов.

(строка)

Columns -> (список)

Имя столбцов, которые будут объединены или удалены, если повторяются.

(список)

(строка)

GovernedCatalogTarget -> (структура)

Указывает целевой объект данных, который записывает в управляемый каталог.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для управляемого каталога.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда сканер обнаружит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда сканер обнаружит изменённую схему.

GovernedCatalogSource -> (структура)

Указывает источник данных в управляемом каталоге данных.

Name -> (строка)

Имя хранилища данных.

Database -> (строка)

База данных для чтения.

Table -> (строка)

Таблица базы данных для чтения.

PartitionPredicate -> (строка)

Разбиения, удовлетворяющие этому предикату, удаляются. Файлы в пределах периода хранения в этих разбиениях не удаляются. Установлено в "" – по умолчанию пусто.

AdditionalOptions -> (структура)

Указывает дополнительные параметры подключения.

BoundedSize -> (длинное целое)

Устанавливает верхний предел для целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (длинное целое)

Устанавливает верхний предел для целевого количества файлов, которые будут обработаны.

MicrosoftSQLServerCatalogSource -> (структура)

Указывает источник данных Microsoft SQL Server в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MySQLCatalogSource -> (структура)

Указывает источник данных MySQL в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

OracleSQLCatalogSource -> (структура)

Указывает источник данных Oracle в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

PostgreSQLCatalogSource -> (структура)

Указывает источник данных PostgresSQL в каталоге данных Glue.

Name -> (строка)

Имя источника данных.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

MicrosoftSQLServerCatalogTarget -> (структура)

Указывает целевой объект, использующий Microsoft SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

MySQLCatalogTarget -> (структура)

Указывает целевой объект, использующий MySQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

OracleSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Oracle SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

PostgreSQLCatalogTarget -> (структура)

Указывает целевой объект, использующий Postgres SQL.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Database -> (строка)

Имя базы данных для записи.

Table -> (строка)

Имя таблицы в базе данных для записи.

DynamicTransform -> (структура)

Указывает пользовательскую визуальную трансформацию, созданную пользователем.

Name -> (строка)

Указывает имя динамической трансформации.

TransformName -> (строка)

Указывает имя динамической трансформации, как оно отображается в визуальном редакторе Glue Studio.

Inputs -> (список)

Указывает входные данные для динамической трансформации, которые требуются.

(строка)

Parameters -> (список)

Указывает параметры динамической трансформации.

(структура)

Указывает параметры в файле конфигурации динамической трансформации.

Name -> (строка)

Указывает имя параметра в файле конфигурации динамической трансформации.

Type -> (строка)

Указывает тип параметра в файле конфигурации динамической трансформации.

ValidationRule -> (строка)

Указывает правило валидации в файле конфигурации динамической трансформации.

ValidationMessage -> (строка)

Указывает сообщение валидации в файле конфигурации динамической трансформации.

Value -> (список)

Указывает значение параметра в файле конфигурации динамической трансформации.

(строка)

ListType -> (строка)

Указывает тип списка параметра в файле конфигурации динамической трансформации.

IsOptional -> (булево)

Указывает, является ли параметр необязательным в файле конфигурации динамической трансформации.

FunctionName -> (строка)

Указывает имя функции динамической трансформации.

Path -> (строка)

Указывает путь к исходному файлу и файлам конфигурации динамической трансформации.

Version -> (строка)

Это поле не используется и будет устаревшим в будущих версиях.

OutputSchemas -> (список)

Указывает схему данных для динамической трансформации.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

EvaluateDataQuality -> (структура)

Указывает критерии оценки качества данных.

Name -> (строка)

Имя оценки качества данных.

Inputs -> (список)

Входы вашей оценки качества данных.

(строка)

Ruleset -> (строка)

Набор правил для вашей оценки качества данных.

Output -> (строка)

Вывод вашей оценки качества данных.

PublishingOptions -> (структура)

Параметры для настройки публикации результатов.

EvaluationContext -> (строка)

Контекст оценки.

ResultsS3Prefix -> (строка)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (булево)

Включить метрики для ваших результатов оценки качества данных.

ResultsPublishingEnabled -> (булево)

Включить публикацию для результатов оценки качества данных.

StopJobOnFailureOptions -> (структура)

Параметры для настройки остановки задания, если оценка качества данных завершается неудачно.

StopJobOnFailureTiming -> (строка)

Когда остановить задание, если оценка качества данных завершится неудачно. Доступные варианты: Immediate или AfterDataLoad.

S3CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogHudiSource -> (структура)

Указывает источник данных Hudi, зарегистрированный в каталоге данных Glue.

Name -> (строка)

Имя источника данных Hudi.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalHudiOptions -> (карта)

Указывает дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Указывает схему данных для источника Hudi.

(структура)

Указывает определяемую пользователем схему, когда Glue не может определить схему.

Columns -> (список)

Указывает определения столбцов, составляющих схему Glue.

(структура)

Указывает отдельный столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiSource -> (структура)

Определяет источник данных Hudi, хранящийся в Amazon S3.

Name -> (строка)

Название источника Hudi.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalHudiOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Определяет дополнительные параметры для коннектора.

BoundedSize -> (целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включен, определяет образцовый путь.

OutputSchemas -> (список)

Определяет схему данных для источника Hudi.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющих схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3HudiCatalogTarget -> (структура)

Определяет целевой объект для записи в источник данных Hudi в каталоге данных Glue.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Определяет нативную партицию с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (карта)

Определяет дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для ползунка.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда ползунок находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда ползунок находит изменённую схему.

S3HudiDirectTarget -> (структура)

Определяет целевой объект для записи в источник данных Hudi в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

Path -> (строка)

Путь Amazon S3 к вашему источнику данных Hudi для записи.

Compression -> (строка)

Указывает, как сжимаются данные. Это обычно не требуется, если у данных есть стандартное расширение файла. Возможные значения — "gzip" и "bzip".

NumberTargetPartitions -> (строка)

Указывает число целевых партиций для распределения файлов набора данных Hudi по Amazon S3.

PartitionKeys -> (список)

Определяет нативную партицию с помощью последовательности ключей.

(список)

(строка)

Format -> (строка)

Определяет формат выходных данных для целевого объекта.

AdditionalOptions -> (карта)

Определяет дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для ползунка.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда ползунок находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда ползунок находит изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

DirectJDBCSource -> (структура)

Определяет подключение к прямому источнику JDBC.

Name -> (строка)

Имя подключения к источнику JDBC.

Database -> (строка)

База данных подключения к источнику JDBC.

Table -> (строка)

Таблица подключения к источнику JDBC.

ConnectionName -> (строка)

Имя подключения источника JDBC.

ConnectionType -> (строка)

Тип подключения источника JDBC.

RedshiftTmpDir -> (строка)

Временная директория источника JDBC Redshift.

S3CatalogDeltaSource -> (структура)

Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue. Источник данных должен храниться в Amazon S3.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющих схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

CatalogDeltaSource -> (структура)

Определяет источник данных Delta Lake, зарегистрированный в каталоге данных Glue.

Name -> (строка)

Имя источника данных Delta Lake.

Database -> (строка)

Имя базы данных для чтения.

Table -> (строка)

Имя таблицы в базе данных для чтения.

AdditionalDeltaOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

OutputSchemas -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющих схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaSource -> (структура)

Определяет источник данных Delta Lake, хранящийся в Amazon S3.

Name -> (строка)

Имя источника Delta Lake.

Paths -> (список)

Список путей Amazon S3 для чтения.

(строка)

AdditionalDeltaOptions -> (карта)

Определяет дополнительные параметры подключения.

key -> (строка)

value -> (строка)

AdditionalOptions -> (структура)

Определяет дополнительные параметры для коннектора.

BoundedSize -> (целое)

Устанавливает верхний предел целевого размера набора данных в байтах, который будет обработан.

BoundedFiles -> (целое)

Устанавливает верхний предел целевого числа файлов, которые будут обработаны.

EnableSamplePath -> (булево)

Устанавливает параметр для включения образцового пути.

SamplePath -> (строка)

Если включен, определяет образцовый путь.

OutputSchemas -> (список)

Определяет схему данных для источника Delta Lake.

(структура)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (список)

Определяет определения столбцов, составляющих схему Glue.

(структура)

Определяет один столбец в определении схемы Glue.

Name -> (строка)

Имя столбца в схеме Glue Studio.

Type -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

S3DeltaCatalogTarget -> (структура)

Определяет целевой объект для записи в источник данных Delta Lake в каталоге данных Glue.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Определяет нативную партицию с помощью последовательности ключей.

(список)

(строка)

Table -> (строка)

Имя таблицы в базе данных для записи.

Database -> (строка)

Имя базы данных для записи.

AdditionalOptions -> (карта)

Определяет дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, определяющая поведение обновления для ползунка.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда ползунок находит изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда ползунок находит изменённую схему.

S3DeltaDirectTarget -> (структура)

Указывает целевой объект, записывающий в источник данных Delta Lake в Amazon S3.

Name -> (строка)

Имя целевого объекта данных.

Inputs -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

PartitionKeys -> (список)

Указывает собственное разбиение с использованием последовательности ключей.

(список)

(строка)

Path -> (строка)

Путь Amazon S3 для вашего источника данных Delta Lake, в который будет производиться запись.

Compression -> (строка)

Указывает способ сжатия данных. Обычно это не требуется, если у данных есть стандартное расширение файла. Возможные значения — "gzip" и "bzip".

NumberTargetPartitions -> (строка)

Указывает количество целевых разделов для распределения файлов набора данных Delta Lake по Amazon S3.

Format -> (строка)

Указывает формат выходных данных для целевого объекта.

AdditionalOptions -> (отображение)

Указывает дополнительные параметры подключения для коннектора.

key -> (строка)

value -> (строка)

SchemaChangePolicy -> (структура)

Политика, которая определяет поведение обновления для ползунка.

EnableUpdateCatalog -> (булево)

Использовать ли указанное поведение обновления, когда ползунок обнаруживает изменённую схему.

UpdateBehavior -> (строка)

Поведение обновления, когда ползунок обнаруживает изменённую схему.

Table -> (строка)

Указывает таблицу в базе данных, к которой применяется политика изменения схемы.

Database -> (строка)

Указывает базу данных, к которой применяется политика изменения схемы.

AmazonRedshiftSource -> (структура)

Указывает целевой объект, записывающий в источник данных в Amazon Redshift.

Name -> (строка)

Имя источника Amazon Redshift.

Data -> (структура)

Указывает данные узла источника Amazon Reshift.

AccessType -> (строка)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

SourceType -> (строка)

Тип источника, чтобы указать, является ли источником конкретная таблица или пользовательский запрос.

Connection -> (структура)

Подключение Glue к кластеру Redshift.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Schema -> (структура)

Имя схемы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

Table -> (структура)

Имя таблицы Redshift при работе с прямым подключением.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogDatabase -> (структура)

Имя базы данных каталога данных Glue при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogTable -> (структура)

Имя таблицы каталога данных Glue при работе с каталогом данных.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

CatalogRedshiftSchema -> (строка)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (строка)

Таблица базы данных для чтения.

TempDir -> (строка)

Путь Amazon S3 для временного хранения данных при копировании из базы данных.

IamRole -> (структура)

Необязательно. Имя роли, используемой при подключении к S3. Роль IAM по умолчанию — роль в задании, если она не указана.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AdvancedOptions -> (список)

Необязательные значения при подключении к кластеру Redshift.

(структура)

Указывает необязательное значение при подключении к кластеру Redshift.

Key -> (строка)

Ключ для дополнительного параметра подключения.

Value -> (строка)

Значение для дополнительного параметра подключения.

SampleQuery -> (строка)

SQL, используемый для извлечения данных из источников Redshift, когда SourceType равен ‘query’.

PreAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

PostAction -> (строка)

SQL, используемый перед MERGE или APPEND с upsert.

Action -> (строка)

Указывает способ записи в кластер Redshift.

TablePrefix -> (строка)

Указывает префикс для таблицы.

Upsert -> (булево)

Действие, используемое для Redshift-целей при APPEND.

MergeAction -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-цели.

MergeWhenMatched -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-цели, когда существующая запись совпадает с новой.

MergeWhenNotMatched -> (строка)

Действие, используемое для определения обработки MERGE в Redshift-цели, когда существующая запись не совпадает с новой.

MergeClause -> (строка)

SQL, используемый в пользовательском объединении для работы с совпадающими записями.

CrawlerConnection -> (строка)

Указывает имя подключения, связанного с таблицей каталога, используемой.

TableSchema -> (список)

Массив выходных схем для данного узла.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

StagingTable -> (строка)

Имя временной таблицы подготовки, используемой при MERGE или APPEND с upsert.

SelectedColumns -> (список)

Список имён столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.

(структура)

Указывает значение параметра.

Value -> (строка)

Указывает значение параметра.

Label -> (строка)

Указывает метку параметра.

Description -> (строка)

Указывает описание параметра.

AmazonRedshiftTarget -> (структура)

Указывает целевой объект, который записывает данные в целевой объект Amazon Redshift.

Name -> (string)

Имя целевого объекта Amazon Redshift.

Data -> (structure)

Указывает данные узла целевого объекта Amazon Redshift.

AccessType -> (string)

Тип доступа для подключения к Redshift. Может быть прямым подключением или подключением к каталогу.

SourceType -> (string)

Тип источника для указания, является ли конкретная таблица источником или это пользовательский запрос.

Connection -> (structure)

Подключение Glue к кластеру Redshift.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

Schema -> (structure)

Имя схемы Redshift при работе с прямым подключением.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

Table -> (structure)

Имя таблицы Redshift при работе с прямым подключением.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

CatalogDatabase -> (structure)

Имя базы данных Glue Data Catalog при работе с каталогом данных.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

CatalogTable -> (structure)

Имя таблицы Glue Data Catalog при работе с каталогом данных.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

CatalogRedshiftSchema -> (string)

Имя схемы Redshift при работе с каталогом данных.

CatalogRedshiftTable -> (string)

Таблица базы данных для чтения.

TempDir -> (string)

Путь Amazon S3, где можно разместить временные данные при копировании из базы данных.

IamRole -> (structure)

Необязательно. Имя роли, используемой при подключении к S3. Роль IAM по умолчанию — роль в задаче, если поле пустое.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

AdvancedOptions -> (list)

Необязательные значения при подключении к кластеру Redshift.

(structure)

Указывает необязательное значение при подключении к кластеру Redshift.

Key -> (string)

Ключ для дополнительного параметра подключения.

Value -> (string)

Значение для дополнительного параметра подключения.

SampleQuery -> (string)

SQL-запрос для извлечения данных из источника Redshift, если SourceType — ‘query’.

PreAction -> (string)

SQL-запрос, выполняемый перед MERGE или APPEND с upsert.

PostAction -> (string)

SQL-запрос, выполняемый перед MERGE или APPEND с upsert.

Action -> (string)

Указывает, как будет происходить запись в кластер Redshift.

TablePrefix -> (string)

Указывает префикс к таблице.

Upsert -> (boolean)

Действие, используемое для Redshift-стоков при APPEND.

MergeAction -> (string)

Действие, определяющее, как будет обрабатываться MERGE в Redshift-стоке.

MergeWhenMatched -> (string)

Действие, определяющее, как будет обрабатываться MERGE в Redshift-стоке, когда существующая запись совпадает с новой.

MergeWhenNotMatched -> (string)

Действие, определяющее, как будет обрабатываться MERGE в Redshift-стоке, когда существующая запись не совпадает с новой.

MergeClause -> (string)

SQL-запрос, используемый в пользовательском MERGE для обработки совпадающих записей.

CrawlerConnection -> (string)

Указывает имя подключения, связанного с используемой таблицей каталога.

TableSchema -> (list)

Массив выходных схем для данного узла.

(structure)

Указывает значение параметра.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

StagingTable -> (string)

Имя временной таблицы подготовки, используемой при MERGE или APPEND с upsert.

SelectedColumns -> (list)

Список имён столбцов, используемых для определения совпадающей записи при MERGE или APPEND с upsert.

(structure)

Указывает значение параметра.

Value -> (string)

Указывает значение параметра.

Label -> (string)

Указывает метку параметра.

Description -> (string)

Указывает описание параметра.

Inputs -> (list)

Узлы, которые являются входными для целевого объекта данных.

(string)

EvaluateDataQualityMultiFrame -> (structure)

Указывает критерии оценки качества данных. Поддерживает несколько входных данных и возвращает набор динамических фреймов.

Name -> (string)

Имя оценки качества данных.

Inputs -> (list)

Входы вашей оценки качества данных. Первый вход в этом списке — основной источник данных.

(string)

AdditionalDataSources -> (map)

Псевдонимы всех источников данных, кроме основного.

key -> (string)

value -> (string)

Ruleset -> (string)

Набор правил для оценки качества данных.

PublishingOptions -> (structure)

Параметры для настройки публикации результатов.

EvaluationContext -> (string)

Контекст оценки.

ResultsS3Prefix -> (string)

Префикс Amazon S3, добавляемый к результатам.

CloudWatchMetricsEnabled -> (boolean)

Включить метрики для результатов оценки качества данных.

ResultsPublishingEnabled -> (boolean)

Включить публикацию результатов оценки качества данных.

AdditionalOptions -> (map)

Параметры для настройки поведения преобразования во время выполнения.

key -> (string)

value -> (string)

StopJobOnFailureOptions -> (structure)

Параметры для настройки остановки задания в случае неудачи оценки качества данных.

StopJobOnFailureTiming -> (string)

Время остановки задания, если оценка качества данных завершается неудачно. Опции — Immediate или AfterDataLoad.

Recipe -> (structure)

Указывает узел Glue DataBrew рецепта.

Name -> (string)

Имя узла Glue Studio.

Inputs -> (list)

Узлы, являющиеся входами для узла рецепта, идентифицированные по id.

(string)

RecipeReference -> (structure)

Ссылка на рецепт DataBrew, используемый узлом.

RecipeArn -> (string)

ARN рецепта DataBrew.

RecipeVersion -> (string)

Версия рецепта DataBrew.

RecipeSteps -> (list)

Шаги преобразования, используемые в узле рецепта.

(structure)

Шаг рецепта, используемый в узле рецепта подготовки данных Glue Studio.

Action -> (structure)

Действие преобразования шага рецепта.

Operation -> (string)

Операция действия рецепта.

Parameters -> (map)

Параметры действия рецепта.

key -> (string)

value -> (string)

ConditionExpressions -> (list)

Условные выражения для шага рецепта.

(structure)

Условное выражение, определенное в узле рецепта подготовки данных Glue Studio.

Condition -> (string)

Условие условного выражения.

Value -> (string)

Значение условного выражения.

TargetColumn -> (string)

Целевой столбец условных выражений.

SnowflakeSource -> (structure)

Определяет источник данных Snowflake.

Имя -> (строка)

Имя источника данных Snowflake.

Данные -> (структура)

Настройка источника данных Snowflake.

ТипИсточника -> (строка)

Указывает, как задаются извлеченные данные. Допустимые значения: "table" , "query" .

Подключение -> (структура)

Указывает подключение к каталогу данных Glue к Snowflake-точке конечного узла.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (строка)

Указывает схему базы данных Snowflake для использования узлом.

Таблица -> (строка)

Указывает таблицу Snowflake для использования узлом.

База данных -> (строка)

Указывает базу данных Snowflake для использования узлом.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ДополнительныеПараметры -> (отображение)

Указывает дополнительные параметры, передаваемые подключению Snowflake. Если параметры указаны где-либо еще в этом узле, будут использоваться эти.

ключ -> (строка)

значение -> (строка)

ПримерЗапроса -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

ПредварительноеДействие -> (строка)

Строка SQL, выполняемая перед тем, как соединитель Snowflake выполнит стандартные действия.

ПослеДействия -> (строка)

Строка SQL, выполняемая после того, как соединитель Snowflake выполнит стандартные действия.

Действие -> (строка)

Указывает действие при записи в таблицу с существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Действие равно append . Указывает поведение при разрешении, когда строка уже существует. Если значение true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

ДействиеСлияния -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если пользовательское, определяется MergeClause .

СлияниеПриСовпадении -> (строка)

Указывает, как разрешать записи, которые совпадают с существующими данными при слиянии. Допустимые значения: update , delete .

СлияниеПриНеСовпадении -> (строка)

Указывает, как обрабатывать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

ОператорСлияния -> (строка)

SQL-выражение, определяющее пользовательское поведение слияния.

ТаблицаЭтапирования -> (строка)

Имя таблицы этапирования, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, затем перемещаются в table сгенерированным последействием.

ВыбранныеСтолбцы -> (список)

Указывает столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upserts. Список структур с value , label и description ключами. Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

АвтоматическоеВыполнение -> (булево)

Указывает, включено ли автоматическое выполнение запросов. Если выполнение включено, при выполнении запроса в Spark, если часть запроса может быть «выполнена» на сервере Snowflake, она выполняется. Это улучшает производительность некоторых запросов.

СхемаТаблицы -> (список)

Вручную определяет целевую схему для узла. Список структур с value , label и description ключами. Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

СхемыВывода -> (список)

Указывает пользовательские схемы для ваших выходных данных.

(структура)

Указывает пользовательскую схему, когда схему нельзя определить с помощью Glue.

Столбцы -> (список)

Определяет определения столбцов, которые составляют схему Glue.

(структура)

Указывает один столбец в определении схемы Glue.

Имя -> (строка)

Имя столбца в схеме Glue Studio.

Тип -> (строка)

Тип Hive для этого столбца в схеме Glue Studio.

SnowflakeTarget -> (структура)

Указывает целевой объект, записывающий данные в источник Snowflake.

Имя -> (строка)

Имя целевого объекта Snowflake.

Данные -> (структура)

Указывает данные узла целевого объекта Snowflake.

ТипИсточника -> (строка)

Указывает, как задаются извлеченные данные. Допустимые значения: "table" , "query" .

Подключение -> (структура)

Указывает подключение к каталогу данных Glue к Snowflake-точке конечного узла.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Схема -> (строка)

Указывает схему базы данных Snowflake для использования узлом.

Таблица -> (строка)

Указывает таблицу Snowflake для использования узлом.

База данных -> (строка)

Указывает базу данных Snowflake для использования узлом.

TempDir -> (строка)

В настоящее время не используется.

IamRole -> (структура)

В настоящее время не используется.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

ДополнительныеПараметры -> (отображение)

Указывает дополнительные параметры, передаваемые подключению Snowflake. Если параметры указаны где-либо еще в этом узле, будут использоваться эти.

ключ -> (строка)

значение -> (строка)

ПримерЗапроса -> (строка)

Строка SQL, используемая для извлечения данных с типом источника query .

ПредварительноеДействие -> (строка)

Строка SQL, выполняемая перед тем, как соединитель Snowflake выполнит стандартные действия.

ПослеДействия -> (строка)

Строка SQL, выполняемая после того, как соединитель Snowflake выполнит стандартные действия.

Действие -> (строка)

Указывает действие при записи в таблицу с существующими данными. Допустимые значения: append , merge , truncate , drop .

Upsert -> (булево)

Используется, когда Действие равно append . Указывает поведение при разрешении, когда строка уже существует. Если значение true, существующие строки будут обновлены. Если false, эти строки будут вставлены.

ДействиеСлияния -> (строка)

Указывает действие слияния. Допустимые значения: simple , custom . Если простое, поведение слияния определяется MergeWhenMatched и MergeWhenNotMatched . Если пользовательское, определяется MergeClause .

СлияниеПриСовпадении -> (строка)

Указывает, как разрешать записи, которые совпадают с существующими данными при слиянии. Допустимые значения: update , delete .

СлияниеПриНеСовпадении -> (строка)

Указывает, как обрабатывать записи, которые не совпадают с существующими данными при слиянии. Допустимые значения: insert , none .

ОператорСлияния -> (строка)

SQL-выражение, определяющее пользовательское поведение слияния.

ТаблицаЭтапирования -> (строка)

Имя таблицы этапирования, используемой при выполнении действий merge или upsert append . Данные записываются в эту таблицу, затем перемещаются в table сгенерированным последействием.

ВыбранныеСтолбцы -> (список)

Указывает столбцы, объединенные для идентификации записи при обнаружении совпадений для слияний и upserts. Список структур с value , label и description ключами. Каждая структура описывает столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

АвтоматическоеВыполнение -> (булево)

Указывает, включено ли автоматическое выполнение запросов. Если выполнение включено, при выполнении запроса в Spark, если часть запроса может быть «выполнена» на сервере Snowflake, она выполняется. Это улучшает производительность некоторых запросов.

СхемаТаблицы -> (список)

Вручную определяет целевую схему для узла. Список структур с value , label и description ключами. Каждая структура определяет столбец.

(структура)

Указывает значение параметра.

Значение -> (строка)

Указывает значение параметра.

Метка -> (строка)

Указывает метку параметра.

Описание -> (строка)

Указывает описание параметра.

Входы -> (список)

Узлы, являющиеся входными для целевого объекта данных.

(строка)

ConnectorDataSource -> (структура)

Указывает источник, сгенерированный со стандартными параметрами подключения.

Name -> (string)

Имя узла этого источника.

ConnectionType -> (string)

Тип соединения, предоставленный библиотеке Glue. Этот тип узла поддерживает следующие типы соединений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (map)

Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа соединения можно найти в разделе «Параметры подключения» в документации Glue.

key -> (string)

value -> (string)

OutputSchemas -> (list)

Определяет схему данных для этого источника.

(structure)

Определяет пользовательскую схему, когда Glue не может определить схему.

Columns -> (list)

Определяет определения столбцов, составляющих схему Glue.

(structure)

Определяет один столбец в определении схемы Glue.

Name -> (string)

Имя столбца в схеме Glue Studio.

Type -> (string)

Тип Hive для этого столбца в схеме Glue Studio.

ConnectorDataTarget -> (structure)

Указывает целевой объект, сгенерированный со стандартными параметрами подключения.

Name -> (string)

Имя узла этого целевого объекта.

ConnectionType -> (string)

Тип соединения, предоставленный библиотеке Glue. Этот тип узла поддерживает следующие типы соединений:

  • opensearch
  • azuresql
  • azurecosmos
  • bigquery
  • saphana
  • teradata
  • vertica

Data -> (map)

Словарь, определяющий параметры подключения для узла. Стандартные параметры подключения для соответствующего типа соединения можно найти в разделе «Параметры подключения» в документации Glue.

key -> (string)

value -> (string)

Inputs -> (list)

Узлы, являющиеся входными для целевого объекта данных.

(string)

ExecutionClass -> (string)

Указывает, выполняется ли задача со стандартным или гибким классом выполнения. Стандартный класс выполнения подходит для задач с жесткими временными требованиями, которым требуется быстрое начало работы и выделенные ресурсы.

Гибкий класс выполнения подходит для задач, не имеющих жестких временных ограничений, время запуска и завершения которых может варьироваться.

Только задачи с версией Glue 3.0 и выше и типом команды glueetl будут разрешены для установки ExecutionClass на FLEX. Гибкий класс выполнения доступен для задач Spark.

SourceControlDetails -> (structure)

Подробности конфигурации управления версиями для задачи, позволяющие синхронизировать артефакты задачи с удаленным репозиторием или из него.

Provider -> (string)

Поставщик удаленного репозитория.

Repository -> (string)

Имя удаленного репозитория, содержащего артефакты задачи.

Owner -> (string)

Владелец удаленного репозитория, содержащего артефакты задачи.

Branch -> (string)

Необязательная ветвь в удаленном репозитории.

Folder -> (string)

Необязательная папка в удаленном репозитории.

LastCommitId -> (string)

Последний идентификатор коммита для коммита в удаленном репозитории.

AuthStrategy -> (string)

Тип аутентификации, который может быть токеном аутентификации, сохраненным в Amazon Web Services Secrets Manager, или личным токеном доступа.

AuthToken -> (string)

Значение токена авторизации.

MaintenanceWindow -> (string)

Это поле определяет день недели и час для окна обслуживания для задач потоковой обработки. Glue периодически выполняет задачи технического обслуживания. Во время этих окон обслуживания Glue потребуется перезапустить ваши задачи потоковой обработки.

Glue перезапустит задачу в течение 3 часов после указанного окна обслуживания. Например, если вы настроили окно обслуживания на понедельник в 10:00 по Гринвичу, ваши задачи будут перезапущены между 10:00 по Гринвичу и 13:00 по Гринвичу.

ProfileName -> (string)

Имя профиля использования Glue, связанного с задачей.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API