Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

update-crawler

Описание

Обновляет ползунок. Если ползунок работает, вы должны остановить его с помощью StopCrawler перед обновлением.

См. также: Документацию API AWS

Синтаксис

  update-crawler
--name <value>
[--role <value>]
[--database-name <value>]
[--description <value>]
[--targets <value>]
[--schedule <value>]
[--classifiers <value>]
[--table-prefix <value>]
[--schema-change-policy <value>]
[--recrawl-policy <value>]
[--lineage-configuration <value>]
[--lake-formation-configuration <value>]
[--configuration <value>]
[--crawler-security-configuration <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--name (строка)

Имя нового кроулера.

--role (строка)

Роль IAM или Amazon Resource Name (ARN) роли IAM, используемой новым кроулером для доступа к ресурсам клиента.

--database-name (строка)

База данных Glue, где хранятся результаты, например: arn:aws:daylight:us-east-1::database/sometable/*.

--description (строка)

Описание нового кроулера.

--targets (структура)

Список целей для кроулинга.

S3Targets -> (список)

Указывает цели Amazon Simple Storage Service (Amazon S3).

(структура)

Указывает хранилище данных в Amazon Simple Storage Service (Amazon S3).

Path -> (строка)

Путь к цели Amazon S3.

Exclusions -> (список)

Список шаблонов glob для исключения из кроулинга. Дополнительная информация в разделе Каталог таблиц с кроулером.

(строка)

ConnectionName -> (строка)

Имя подключения, позволяющего заданию или кроулеру получить доступ к данным в Amazon S3 в среде Amazon Virtual Private Cloud (Amazon VPC).

SampleSize -> (целое число)

Устанавливает количество файлов в каждой папке на листе для кроулинга при кроулинге выборочных файлов в наборе данных. Если не задано, все файлы будут просканированы. Допустимое значение — целое число от 1 до 249.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs.

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue.

JdbcTargets -> (список)

Указывает цели JDBC.

(структура)

Указывает хранилище JDBC для кроулинга.

ConnectionName -> (строка)

Имя подключения для подключения к цели JDBC.

Path -> (строка)

Путь к цели JDBC.

Exclusions -> (список)

Список шаблонов glob для исключения из кроулинга. Дополнительная информация в разделе Каталог таблиц с кроулером.

(строка)

EnableAdditionalMetadata -> (список)

Установите значение RAWTYPES или COMMENTS для включения дополнительных метаданных в ответах таблиц. RAWTYPES предоставляет тип данных нативном уровне. COMMENTS предоставляет комментарии, связанные с столбцом или таблицей в базе данных.

Если дополнительные метаданные не нужны, оставьте поле пустым.

(строка)

MongoDBTargets -> (список)

Указывает цели Amazon DocumentDB или MongoDB.

(структура)

Указывает хранилище данных Amazon DocumentDB или MongoDB для кроулинга.

ConnectionName -> (строка)

Имя подключения для подключения к цели Amazon DocumentDB или MongoDB.

Path -> (строка)

Путь к цели Amazon DocumentDB или MongoDB (база данных/коллекция).

ScanAll -> (булево)

Указывает, следует ли сканировать все записи или выборочно строки из таблицы. Полное сканирование всех записей может занять много времени, когда таблица не является таблицей высокой производительности.

Значение true означает сканирование всех записей, а значение false — выборочное сканирование записей. Если значение не указано, по умолчанию используется true.

DynamoDBTargets -> (список)

Указывает цели Amazon DynamoDB.

(структура)

Указывает таблицу Amazon DynamoDB для кроулинга.

Path -> (строка)

Имя таблицы DynamoDB для кроулинга.

scanAll -> (булево)

Указывает, следует ли сканировать все записи или выборочно строки из таблицы. Полное сканирование всех записей может занять много времени, когда таблица не является таблицей высокой производительности.

Значение true означает сканирование всех записей, а значение false — выборочное сканирование записей. Если значение не указано, по умолчанию используется true.

scanRate -> (дробное число)

Процент настроенных единиц пропускной способности чтения, используемых кроулером Glue. Единицы пропускной способности чтения — это термин, определенный DynamoDB, числовое значение, которое действует как ограничитель скорости для числа чтений, которые могут быть выполнены для данной таблицы в секунду.

Допустимые значения — null или значение от 0,1 до 1,5. Значение null используется, когда пользователь не предоставляет значение, и по умолчанию составляет 0,5 от настроенной единицы пропускной способности чтения (для таблиц с выделенной пропускной способностью) или 0,25 от максимальной настроенной единицы пропускной способности чтения (для таблиц, использующих режим по запросу).

CatalogTargets -> (список)

Указывает цели Glue Data Catalog.

(структура)

Указывает цель Glue Data Catalog.

DatabaseName -> (строка)

Имя базы данных для синхронизации.

Tables -> (список)

Список таблиц для синхронизации.

(строка)

ConnectionName -> (строка)

Имя подключения для таблицы Data Catalog, основанной на Amazon S3, которая должна быть целью кроулинга при использовании типа подключения Catalog, сопряженного с типом подключения NETWORK.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs.

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue.

DeltaTargets -> (список)

Указывает цели хранилища данных Delta.

(структура)

Указывает хранилище данных Delta для кроулинга одной или нескольких таблиц Delta.

DeltaTables -> (список)

Список путей Amazon S3 к таблицам Delta.

(строка)

ConnectionName -> (строка)

Имя подключения для подключения к целевой таблице Delta.

WriteManifest -> (булево)

Указывает, нужно ли записывать файлы манифеста в путь к таблице Delta.

CreateNativeDeltaTable -> (булево)

Указывает, будет ли кроулер создавать нативные таблицы для интеграции с системами запросов, поддерживающими прямой запрос журнала транзакций Delta.

IcebergTargets -> (список)

Указывает цели хранилища данных Apache Iceberg.

(структура)

Указывает источник данных Apache Iceberg, где таблицы Iceberg хранятся в Amazon S3.

Paths -> (список)

Один или несколько путей Amazon S3, содержащих папки метаданных Iceberg, как s3://bucket/prefix.

(строка)

ConnectionName -> (строка)

Имя подключения для подключения к цели Iceberg.

Exclusions -> (список)

Список шаблонов glob для исключения из кроулинга. Дополнительная информация в разделе Каталог таблиц с кроулером.

(строка)

MaximumTraversalDepth -> (целое число)

Максимальная глубина путей Amazon S3, которую может пройти кроулер для поиска папки метаданных Iceberg в вашем пути Amazon S3. Используется для ограничения времени выполнения кроулера.

HudiTargets -> (список)

Указывает цели хранилища данных Apache Hudi.

(структура)

Указывает источник данных Apache Hudi.

Paths -> (список)

Массив строк расположения Amazon S3 для Hudi, каждый из которых указывает корневую папку, в которой находятся файлы метаданных таблицы Hudi. Папка Hudi может быть расположена в дочерней папке корневой папки.

Кроулер будет сканировать все папки под указанным путем для папки Hudi.

(строка)

ConnectionName -> (строка)

Имя подключения для подключения к цели Hudi. Если ваши файлы Hudi хранятся в ведрах, требующих авторизации VPC, вы можете задать их свойства подключения здесь.

Exclusions -> (список)

Список шаблонов glob для исключения из кроулинга. Дополнительная информация в разделе Каталог таблиц с кроулером.

(строка)

MaximumTraversalDepth -> (целое число)

Максимальная глубина путей Amazon S3, которую может пройти кроулер для поиска папки метаданных Hudi в вашем пути Amazon S3. Используется для ограничения времени выполнения кроулера.

Синтаксис JSON:

{
  "S3Targets": [
    {
      "Path": "string",
      "Exclusions": ["string", ...],
      "ConnectionName": "string",
      "SampleSize": integer,
      "EventQueueArn": "string",
      "DlqEventQueueArn": "string"
    }
    ...
  ],
  "JdbcTargets": [
    {
      "ConnectionName": "string",
      "Path": "string",
      "Exclusions": ["string", ...],
      "EnableAdditionalMetadata": ["COMMENTS"|"RAWTYPES", ...]
    }
    ...
  ],
  "MongoDBTargets": [
    {
      "ConnectionName": "string",
      "Path": "string",
      "ScanAll": true|false
    }
    ...
  ],
  "DynamoDBTargets": [
    {
      "Path": "string",
      "scanAll": true|false,
      "scanRate": double
    }
    ...
  ],
  "CatalogTargets": [
    {
      "DatabaseName": "string",
      "Tables": ["string", ...],
      "ConnectionName": "string",
      "EventQueueArn": "string",
      "DlqEventQueueArn": "string"
    }
    ...
  ],
  "DeltaTargets": [
    {
      "DeltaTables": ["string", ...],
      "ConnectionName": "string",
      "WriteManifest": true|false,
      "CreateNativeDeltaTable": true|false
    }
    ...
  ],
  "IcebergTargets": [
    {
      "Paths": ["string", ...],
      "ConnectionName": "string",
      "Exclusions": ["string", ...],
      "MaximumTraversalDepth": integer
    }
    ...
  ],
  "HudiTargets": [
    {
      "Paths": ["string", ...],
      "ConnectionName": "string",
      "Exclusions": ["string", ...],
      "MaximumTraversalDepth": integer
    }
    ...
  ]
}

--schedule (строка)

Выражение cron для указания графика (см. Графики по времени для заданий и кроулеров. Например, чтобы запустить что-то каждый день в 12:15 UTC, укажите: cron(15 12 * * ? *).

--classifiers (список)

Список пользовательских классификаторов, зарегистрированных пользователем. По умолчанию все встроенные классификаторы включаются в кроулинг, но эти пользовательские классификаторы всегда переопределяют стандартные классификаторы для данного классифицирования.

(строка)

Синтаксис:

"string" "string" ...

--table-prefix (строка)

Префикс таблицы, используемый для создаваемых таблиц каталога.

--schema-change-policy (структура)

Политика поведения кроулера при обновлении и удалении.

UpdateBehavior -> (строка)

Поведение при обновлении, когда кроулер находит изменённую схему.

DeleteBehavior -> (строка)

Поведение при удалении, когда кроулер находит удалённый объект.

Сокращённый синтаксис:

UpdateBehavior=string,DeleteBehavior=string

Синтаксис JSON:

{
  "UpdateBehavior": "LOG"|"UPDATE_IN_DATABASE",
  "DeleteBehavior": "LOG"|"DELETE_FROM_DATABASE"|"DEPRECATE_IN_DATABASE"
}

--recrawl-policy (структура)

Политика, определяющая, следует ли повторно просканировать весь набор данных или только добавленные папки с момента последнего запуска кроулера.

RecrawlBehavior -> (строка)

Указывает, следует ли повторно просканировать весь набор данных или только папки, добавленные с момента последнего запуска кроулера.

Значение CRAWL_EVERYTHING указывает на повторное сканирование всего набора данных.

Значение CRAWL_NEW_FOLDERS_ONLY указывает на сканирование только добавленных папок с момента последнего запуска кроулера.

Значение CRAWL_EVENT_MODE указывает на сканирование только изменений, определенных событиями Amazon S3.

Сокращённый синтаксис:

RecrawlBehavior=string

Синтаксис JSON:

{
  "RecrawlBehavior": "CRAWL_EVERYTHING"|"CRAWL_NEW_FOLDERS_ONLY"|"CRAWL_EVENT_MODE"
}

--lineage-configuration (структура)

Указывает настройки конфигурации линий данных для кроулера.

CrawlerLineageSettings -> (строка)

Указывает, включена ли наследование данных для кроулера. Допустимые значения:

  • ENABLE: включает наследование данных для кроулера
  • DISABLE: отключает наследование данных для кроулера

Сокращённый синтаксис:

CrawlerLineageSettings=string

Синтаксис JSON:

{
  "CrawlerLineageSettings": "ENABLE"|"DISABLE"
}

--lake-formation-configuration (структура)

Указывает настройки конфигурации Lake Formation для кроулера.

UseLakeFormationCredentials -> (булево)

Указывает, следует ли использовать учетные данные Lake Formation для кроулера вместо учетных данных роли IAM.

AccountId -> (строка)

Требуется для кроулинга между аккаунтами. Для кроулинга в рамках одного аккаунта, как целевые данные, это поле можно оставить пустым.

Сокращённый синтаксис:

UseLakeFormationCredentials=boolean,AccountId=string

Синтаксис JSON:

{
  "UseLakeFormationCredentials": true|false,
  "AccountId": "string"
}

--configuration (строка)

Информация о конфигурации сканера. Эта версионированная строка JSON позволяет пользователям указать аспекты поведения сканера. Дополнительную информацию см. в разделе Настройка параметров конфигурации сканера.

--crawler-security-configuration (строка)

Имя структуры SecurityConfiguration, которую должен использовать этот сканер.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные в JSON. Передача произвольных двоичных данных с помощью значения, предоставленного в JSON, невозможна, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит скелет JSON в стандартный вывод, не отправляя запрос к API. Если указано без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, оно проверит входные данные команды и вернёт пример выходного JSON для этой команды. Сгенерированный скелет JSON не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном скелете JSON.

Глобальные параметры

--debug (логическое значение)

Включить отладку.

--endpoint-url (строка)

Переопределить стандартный URL команды заданным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определённый профиль из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/отключить цветной вывод.

  • включено
  • выключено
  • автоматически

--no-sign-request (логическое значение)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться без блокировки и без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться без блокировки и без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить кли-паджер для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запрашивать входные параметры CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запросы входных параметров CLI.

Вывод

Нет

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API