Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

create-crawler

Описание

Создает новый кроулер с указанными целевыми объектами, ролью, конфигурацией и необязательным расписанием. Должен быть указан хотя бы один целевой объект сканирования в поле s3Targets, поле jdbcTargets или поле DynamoDBTargets.

См. также: Документацию API AWS

Синтаксис

  create-crawler
--name <value>
--role <value>
[--database-name <value>]
[--description <value>]
--targets <value>
[--schedule <value>]
[--classifiers <value>]
[--table-prefix <value>]
[--schema-change-policy <value>]
[--recrawl-policy <value>]
[--lineage-configuration <value>]
[--lake-formation-configuration <value>]
[--configuration <value>]
[--crawler-security-configuration <value>]
[--tags <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--name (строка)

Имя нового кроулера.

--role (строка)

Роль IAM или Amazon Resource Name (ARN) роли IAM, используемой новым кроулером для доступа к ресурсам клиента.

--database-name (строка)

База данных Glue, в которой записываются результаты, например: arn:aws:daylight:us-east-1::database/sometable/* .

--description (строка)

Описание нового кроулера.

--targets (структура)

Список целевых коллекций для сканирования.

S3Targets -> (список)

Указывает целевые объекты Amazon Simple Storage Service (Amazon S3).

(структура)

Указывает хранилище данных в Amazon Simple Storage Service (Amazon S3).

Path -> (строка)

Путь к целевому объекту Amazon S3.

Exclusions -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Дополнительная информация см. в разделе Каталог таблиц с кроулером .

(строка)

ConnectionName -> (строка)

Имя подключения, позволяющего заданию или кроулеру получить доступ к данным в Amazon S3 в среде виртуальной частной сети Amazon (Amazon VPC).

SampleSize -> (целое число)

Устанавливает количество файлов в каждой папке нижнего уровня, которые будут сканироваться при сканировании образцов файлов в наборе данных. Если не задано, все файлы сканируются. Допустимое значение - целое число от 1 до 249.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs .

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue .

JdbcTargets -> (список)

Указывает целевые объекты JDBC.

(структура)

Указывает хранилище данных JDBC для сканирования.

ConnectionName -> (строка)

Имя подключения для подключения к целевому объекту JDBC.

Path -> (строка)

Путь к целевому объекту JDBC.

Exclusions -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Дополнительная информация см. в разделе Каталог таблиц с кроулером .

(строка)

EnableAdditionalMetadata -> (список)

Укажите значение RAWTYPES или COMMENTS для включения дополнительных метаданных в ответах о таблицах. RAWTYPES предоставляет тип данных нативном уровне. COMMENTS предоставляет комментарии, связанные со столбцом или таблицей в базе данных.

Если дополнительные метаданные не нужны, оставьте поле пустым.

(строка)

MongoDBTargets -> (список)

Указывает целевые объекты Amazon DocumentDB или MongoDB.

(структура)

Указывает хранилище данных Amazon DocumentDB или MongoDB для сканирования.

ConnectionName -> (строка)

Имя подключения для подключения к целевому объекту Amazon DocumentDB или MongoDB.

Path -> (строка)

Путь к целевому объекту Amazon DocumentDB или MongoDB (база данных/коллекция).

ScanAll -> (булево)

Указывает, нужно ли сканировать все записи или брать выборку строк из таблицы. Полное сканирование может занять много времени, если таблица не является таблицей с высокой пропускной способностью.

Значение true означает сканирование всех записей, а значение false означает выборку записей. Если значение не указано, используется значение по умолчанию true .

DynamoDBTargets -> (список)

Указывает целевые объекты Amazon DynamoDB.

(структура)

Указывает таблицу Amazon DynamoDB для сканирования.

Path -> (строка)

Имя таблицы DynamoDB для сканирования.

scanAll -> (булево)

Указывает, нужно ли сканировать все записи или брать выборку строк из таблицы. Полное сканирование может занять много времени, если таблица не является таблицей с высокой пропускной способностью.

Значение true означает сканирование всех записей, а значение false означает выборку записей. Если значение не указано, используется значение по умолчанию true .

scanRate -> (вещественное число)

Процент настроенных единиц пропускной способности чтения, используемых кроулером Glue. Единицы пропускной способности чтения - термин, определяемый DynamoDB, и это числовое значение, которое действует как ограничитель скорости для количества чтений, которые могут быть выполнены для этой таблицы в секунду.

Допустимые значения: null или значение от 0,1 до 1,5. Значение null используется, когда пользователь не предоставляет значение, и по умолчанию составляет 0,5 от настроенной единицы пропускной способности чтения (для таблиц с выделенной пропускной способностью) или 0,25 от максимальной настроенной единицы пропускной способности чтения (для таблиц, использующих режим on-demand).

CatalogTargets -> (список)

Указывает целевые объекты Glue Data Catalog.

(структура)

Указывает целевой объект Glue Data Catalog.

DatabaseName -> (строка)

Имя базы данных для синхронизации.

Tables -> (список)

Список таблиц для синхронизации.

(строка)

ConnectionName -> (строка)

Имя подключения для таблицы Data Catalog, поддерживаемой Amazon S3, которая должна быть целевым объектом сканирования при использовании типа подключения Catalog в паре с типом подключения NETWORK .

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs .

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue .

DeltaTargets -> (список)

Указывает целевые объекты Delta хранилища данных.

(структура)

Указывает хранилище данных Delta для сканирования одной или нескольких таблиц Delta.

DeltaTables -> (список)

Список путей Amazon S3 к таблицам Delta.

(строка)

ConnectionName -> (строка)

Имя подключения для подключения к целевой таблице Delta.

WriteManifest -> (булево)

Указывает, нужно ли записывать файлы манифеста в путь к таблице Delta.

CreateNativeDeltaTable -> (булево)

Указывает, будет ли кроулер создавать нативные таблицы для интеграции с движками запросов, поддерживающими прямое запросы к журналу транзакций Delta.

IcebergTargets -> (список)

Указывает целевые объекты Apache Iceberg хранилища данных.

(структура)

Указывает источник данных Apache Iceberg, где таблицы Iceberg хранятся в Amazon S3.

Paths -> (список)

Один или несколько путей Amazon S3, содержащих папки метаданных Iceberg в качестве s3://bucket/prefix .

(строка)

ConnectionName -> (строка)

Имя подключения для подключения к целевому объекту Iceberg.

Exclusions -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Дополнительная информация см. в разделе Каталог таблиц с кроулером .

(строка)

MaximumTraversalDepth -> (целое число)

Максимальная глубина путей Amazon S3, которую кроулер может пройти, чтобы обнаружить папку метаданных Iceberg в вашем пути Amazon S3. Используется для ограничения времени выполнения кроулера.

HudiTargets -> (список)

Указывает целевые объекты Apache Hudi хранилища данных.

(структура)

Указывает источник данных Apache Hudi.

Paths -> (список)

Массив строк расположения Amazon S3 для Hudi, каждый из которых указывает корневую папку, в которой находятся файлы метаданных для таблицы Hudi. Папка Hudi может находиться в дочерней папке корневой папки.

Кроулер будет сканировать все папки под путем в поисках папки Hudi.

(строка)

ConnectionName -> (строка)

Имя подключения для подключения к целевому объекту Hudi. Если ваши файлы Hudi хранятся в ведрах, которые требуют авторизации VPC, вы можете задать их параметры подключения здесь.

Exclusions -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Дополнительная информация см. в разделе Каталог таблиц с кроулером .

(строка)

MaximumTraversalDepth -> (целое число)

Максимальная глубина путей Amazon S3, которую кроулер может пройти, чтобы обнаружить папку метаданных Hudi в вашем пути Amazon S3. Используется для ограничения времени выполнения кроулера.

Синтаксис JSON:

{
  "S3Targets": [
    {
      "Path": "string",
      "Exclusions": ["string", ...],
      "ConnectionName": "string",
      "SampleSize": integer,
      "EventQueueArn": "string",
      "DlqEventQueueArn": "string"
    }
    ...
  ],
  "JdbcTargets": [
    {
      "ConnectionName": "string",
      "Path": "string",
      "Exclusions": ["string", ...],
      "EnableAdditionalMetadata": ["COMMENTS"|"RAWTYPES", ...]
    }
    ...
  ],
  "MongoDBTargets": [
    {
      "ConnectionName": "string",
      "Path": "string",
      "ScanAll": true|false
    }
    ...
  ],
  "DynamoDBTargets": [
    {
      "Path": "string",
      "scanAll": true|false,
      "scanRate": double
    }
    ...
  ],
  "CatalogTargets": [
    {
      "DatabaseName": "string",
      "Tables": ["string", ...],
      "ConnectionName": "string",
      "EventQueueArn": "string",
      "DlqEventQueueArn": "string"
    }
    ...
  ],
  "DeltaTargets": [
    {
      "DeltaTables": ["string", ...],
      "ConnectionName": "string",
      "WriteManifest": true|false,
      "CreateNativeDeltaTable": true|false
    }
    ...
  ],
  "IcebergTargets": [
    {
      "Paths": ["string", ...],
      "ConnectionName": "string",
      "Exclusions": ["string", ...],
      "MaximumTraversalDepth": integer
    }
    ...
  ],
  "HudiTargets": [
    {
      "Paths": ["string", ...],
      "ConnectionName": "string",
      "Exclusions": ["string", ...],
      "MaximumTraversalDepth": integer
    }
    ...
  ]
}

--schedule (строка)

Выражение cron, используемое для задания расписания (см. Расписания по времени для заданий и кроулеров . Например, чтобы выполнить задачу каждый день в 12:15 UTC, необходимо указать: cron(15 12 * * ? *) .

--classifiers (список)

Список пользовательских классификаторов, зарегистрированных пользователем. По умолчанию все встроенные классификаторы включены в сканирование, но эти пользовательские классификаторы всегда переопределяют классификаторы по умолчанию для заданного классификатора.

(строка)

Синтаксис:

"string" "string" ...

--table-prefix (строка)

Префикс таблицы, используемый для создаваемых таблиц каталога.

--schema-change-policy (структура)

Политика для поведения кроулера при обновлении и удалении.

UpdateBehavior -> (строка)

Поведение при обновлении, когда кроулер обнаруживает изменённую схему.

DeleteBehavior -> (строка)

Поведение при удалении, когда кроулер обнаруживает удалённый объект.

Краткая форма синтаксиса:

UpdateBehavior=string,DeleteBehavior=string

Синтаксис JSON:

{
  "UpdateBehavior": "LOG"|"UPDATE_IN_DATABASE",
  "DeleteBehavior": "LOG"|"DELETE_FROM_DATABASE"|"DEPRECATE_IN_DATABASE"
}

--recrawl-policy (структура)

Политика, определяющая, нужно ли сканировать весь набор данных или только те папки, которые были добавлены с момента последнего запуска кроулера.

RecrawlBehavior -> (строка)

Указывает, нужно ли сканировать весь набор данных или только те папки, которые были добавлены с момента последнего запуска кроулера.

Значение CRAWL_EVERYTHING указывает на сканирование всего набора данных.

Значение CRAWL_NEW_FOLDERS_ONLY указывает на сканирование только тех папок, которые были добавлены с момента последнего запуска кроулера.

Значение CRAWL_EVENT_MODE указывает на сканирование только изменений, определённых событиями Amazon S3.

Краткая форма синтаксиса:

RecrawlBehavior=string

Синтаксис JSON:

{
  "RecrawlBehavior": "CRAWL_EVERYTHING"|"CRAWL_NEW_FOLDERS_ONLY"|"CRAWL_EVENT_MODE"
}

--lineage-configuration (структура)

Указывает настройки конфигурации для отслеживания данных кроулером.

CrawlerLineageSettings -> (строка)

Указывает, включено ли отслеживание данных для кроулера. Допустимые значения:

  • ENABLE: включает отслеживание данных для кроулера
  • DISABLE: отключает отслеживание данных для кроулера

Краткая форма синтаксиса:

CrawlerLineageSettings=string

Синтаксис JSON:

{
  "CrawlerLineageSettings": "ENABLE"|"DISABLE"
}

--lake-formation-configuration (структура)

Указывает настройки конфигурации Lake Formation для кроулера.

UseLakeFormationCredentials -> (булево)

Указывает, нужно ли использовать учетные данные Lake Formation для кроулера вместо учетных данных роли IAM.

AccountId -> (строка)

Требуется для кроулеров между аккаунтами. Для кроулеров внутри одного аккаунта, целевой данных, это значение можно оставить равным null.

Краткая форма синтаксиса:

UseLakeFormationCredentials=boolean,AccountId=string

Синтаксис JSON:

{
  "UseLakeFormationCredentials": true|false,
  "AccountId": "string"
}

--configuration (строка)

Информация о конфигурации ползунка. Эта версионированная строка JSON позволяет пользователям указывать аспекты поведения ползунка. Для получения дополнительной информации см. Настройка параметров конфигурации ползунка.

--crawler-security-configuration (строка)

Имя структуры SecurityConfiguration, которая должна использоваться этим ползунком.

--tags (массив)

Теги, которые следует использовать с этим запросом ползунка. Вы можете использовать теги для ограничения доступа к ползунку. Дополнительную информацию о тегах в Glue см. в руководстве разработчика по тегам Amazon Web Services в Glue.

ключ -> (строка)

значение -> (строка)

Сокращённый синтаксис:

KeyName1=string,KeyName2=string

Синтаксис JSON:

{"string": "string"
  ...}

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, заданные в JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит каркас JSON в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или значение input, выводит пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, будет напечатан пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно проверяет входные данные команд и возвращает пример выходного JSON для данной команды. Сгенерированный каркас JSON не является стабильным между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном каркасе JSON.

Общие параметры

--debug (логическое значение)

Включить отладочную запись в журнал.

--endpoint-url (строка)

Переопределить значение URL по умолчанию команды указанным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при общении с сервисами AWS. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет поведение проверки сертификатов SSL по умолчанию.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для использования при фильтрации данных ответа.

--profile (строка)

Использование определённого профиля из вашего файла аутентификации.

--region (строка)

Используемый регион. Переопределяет настройки конфигурации/среды.

--version (строка)

Отображение версии этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • включено
  • выключено
  • автоматически

--no-sign-request (логическое значение)

Не подписывать запросы. Кредиты не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл с набором сертификатов CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения к сокету в секундах. Если значение установлено в 0, подключение к сокету будет выполняться блокирующим образом без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как закодированная строка base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить пейджер CLI для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запросы параметров ввода CLI.

Вывод

Нет

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API