Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

get-crawler

Описание

Получает метаданные для указанного кроулера.

См. также: Документация API AWS

Синтаксис

  get-crawler
--name <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--name (строка)

Имя кроулера, для которого требуется получить метаданные.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или со значением input, выводится пример JSON-ввода, который может использоваться в качестве аргумента для --cli-input-json. Аналогично, если предоставлено значение yaml-input, выводится пример YAML-ввода, который может использоваться с --cli-input-yaml. Если предоставлено значение output, выполняется валидация входных данных команды и возвращается JSON-пример выходных данных для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (булево)

Включить отладочную регистрацию.

--endpoint-url (строка)

Переопределить URL по умолчанию команды заданным URL.

--no-verify-ssl (булево)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.

--no-paginate (булево)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команд.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определённый профиль из файла ключей.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/окружения.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/выключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (булево)

Не подписывать запросы. Ключи не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл сертификатов CA для использования при проверке сертификатов SSL. Переопределяет настройки конфигурации/окружения.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования для использования с двоичными блоками. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (булево)

Отключить страницу cli для вывода.

--cli-auto-prompt (булево)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (булево)

Отключить автоматическую запрос параметров ввода CLI.

Вывод

Crawler -> (структура)

Метаданные указанного крэулера.

Name -> (строка)

Имя крэулера.

Role -> (строка)

Amazon Resource Name (ARN) роли IAM, используемой для доступа к ресурсам клиента, таким как данные Amazon Simple Storage Service (Amazon S3).

Targets -> (структура)

Коллекция целей для сканирования.

S3Targets -> (список)

Указывает цели Amazon Simple Storage Service (Amazon S3).

(структура)

Указывает хранилище данных в Amazon Simple Storage Service (Amazon S3).

Path -> (строка)

Путь к цели Amazon S3.

Exclusions -> (список)

Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.

(строка)

ConnectionName -> (строка)

Имя подключения, позволяющего заданию или крэулеру получить доступ к данным в Amazon S3 внутри Amazon Virtual Private Cloud (Amazon VPC).

SampleSize -> (целое число)

Устанавливает количество файлов в каждом папке, которые будут сканироваться при сканировании образцов файлов в наборе данных. Если не задано, все файлы будут обработаны. Допустимое значение — целое число от 1 до 249.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs .

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue .

JdbcTargets -> (список)

Указывает цели JDBC.

(структура)

Указывает хранилище данных JDBC для сканирования.

ConnectionName -> (строка)

Имя подключения для соединения с целью JDBC.

Path -> (строка)

Путь к цели JDBC.

Exclusions -> (список)

Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.

(строка)

EnableAdditionalMetadata -> (список)

Укажите значение RAWTYPES или COMMENTS для включения дополнительных метаданных в ответах о таблицах. RAWTYPES предоставляет тип данных на уровне базы данных. COMMENTS предоставляет комментарии, связанные со столбцом или таблицей в базе данных.

Если дополнительные метаданные не нужны, оставьте поле пустым.

(строка)

MongoDBTargets -> (список)

Указывает цели Amazon DocumentDB или MongoDB.

(структура)

Указывает хранилище данных Amazon DocumentDB или MongoDB для сканирования.

ConnectionName -> (строка)

Имя подключения для соединения с целью Amazon DocumentDB или MongoDB.

Path -> (строка)

Путь к цели Amazon DocumentDB или MongoDB (база данных/коллекция).

ScanAll -> (булево)

Указывает, нужно ли сканировать все записи или взять выборку из таблицы. Сканирование всех записей может занять много времени, если таблица не имеет высокой пропускной способности.

Значение true означает сканирование всех записей, а значение false — выборку записей. Если значение не указано, оно по умолчанию равно true.

DynamoDBTargets -> (список)

Указывает цели Amazon DynamoDB.

(структура)

Указывает таблицу Amazon DynamoDB для сканирования.

Path -> (строка)

Имя таблицы DynamoDB для сканирования.

scanAll -> (булево)

Указывает, нужно ли сканировать все записи или взять выборку из таблицы. Сканирование всех записей может занять много времени, если таблица не имеет высокой пропускной способности.

Значение true означает сканирование всех записей, а значение false — выборку записей. Если значение не указано, оно по умолчанию равно true.

scanRate -> (двойное)

Процент настроенных единиц пропускной способности чтения, которые будет использовать Glue крэулер. Единицы пропускной способности чтения — термин, определенный DynamoDB, и представляет собой числовое значение, которое действует как ограничитель скорости для количества чтений, которые могут выполняться для данной таблицы в секунду.

Допустимые значения — null или значение от 0,1 до 1,5. Значение null используется, когда пользователь не предоставляет значение, и по умолчанию составляет 0,5 от настроенных единиц пропускной способности чтения (для таблиц с предоставлением ресурсов) или 0,25 от максимальных настроенных единиц пропускной способности чтения (для таблиц, использующих режим on-demand).

CatalogTargets -> (список)

Указывает цели Glue Data Catalog.

(структура)

Указывает цель Glue Data Catalog.

DatabaseName -> (строка)

Имя базы данных для синхронизации.

Tables -> (список)

Список таблиц для синхронизации.

(строка)

ConnectionName -> (строка)

Имя подключения для таблицы Data Catalog, основанной на Amazon S3, которая является целью сканирования при использовании типа подключения Catalog в паре с типом подключения NETWORK.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs .

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue .

DeltaTargets -> (список)

Указывает цели хранилища данных Delta.

(структура)

Указывает хранилище данных Delta для сканирования одной или нескольких таблиц Delta.

DeltaTables -> (список)

Список путей Amazon S3 к таблицам Delta.

(строка)

ConnectionName -> (строка)

Имя подключения для соединения с целевой таблицей Delta.

WriteManifest -> (булево)

Указывает, нужно ли записывать файлы манифеста в путь к таблице Delta.

CreateNativeDeltaTable -> (булево)

Указывает, будет ли крэулер создавать собственные таблицы, чтобы обеспечить интеграцию с движками запросов, которые поддерживают запрос журнала транзакций Delta напрямую.

IcebergTargets -> (список)

Указывает цели хранилища Apache Iceberg.

(структура)

Указывает источник данных Apache Iceberg, где таблицы Iceberg хранятся в Amazon S3.

Paths -> (список)

Один или несколько путей Amazon S3, содержащих папки метаданных Iceberg в качестве s3://bucket/prefix .

(строка)

ConnectionName -> (строка)

Имя подключения для соединения с целью Iceberg.

Exclusions -> (список)

Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.

(строка)

MaximumTraversalDepth -> (целое число)

Максимальная глубина путей Amazon S3, которые может пройти крэулер для обнаружения папки метаданных Iceberg в вашем пути Amazon S3. Используется для ограничения времени выполнения крэулера.

HudiTargets -> (список)

Указывает цели хранилища Apache Hudi.

(структура)

Указывает источник данных Apache Hudi.

Paths -> (список)

Массив строк расположения Amazon S3 для Hudi, каждая из которых указывает корневую папку, в которой находятся файлы метаданных для таблицы Hudi. Папка Hudi может находиться в подпапке корневой папки.

Крэулер будет сканировать все папки под путём для папки Hudi.

(строка)

ConnectionName -> (строка)

Имя подключения для соединения с целью Hudi. Если ваши файлы Hudi хранятся в корзинах, которые требуют авторизации VPC, вы можете настроить их свойства подключения здесь.

Exclusions -> (список)

Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.

(строка)

MaximumTraversalDepth -> (целое число)

Максимальная глубина путей Amazon S3, которые может пройти крэулер для обнаружения папки метаданных Hudi в вашем пути Amazon S3. Используется для ограничения времени выполнения крэулера.

DatabaseName -> (строка)

Имя базы данных, в которой хранятся результаты работы крэулера.

Description -> (строка)

Описание крэулера.

Classifiers -> (список)

Список строк UTF-8, которые указывают на настраиваемые классификаторы, связанные с крэулером.

(строка)

RecrawlPolicy -> (структура)

Политика, которая определяет, нужно ли сканировать весь набор данных или только папки, добавленные после последнего запуска крэулера.

RecrawlBehavior -> (строка)

Указывает, нужно ли сканировать весь набор данных или только папки, добавленные после последнего запуска крэулера.

Значение CRAWL_EVERYTHING указывает на сканирование всего набора данных.

Значение CRAWL_NEW_FOLDERS_ONLY указывает на сканирование только папок, добавленных после последнего запуска крэулера.

Значение CRAWL_EVENT_MODE указывает на сканирование только изменений, определённых событиями Amazon S3.

SchemaChangePolicy -> (структура)

Политика, определяющая поведение при обновлении и удалении для крэулера.

UpdateBehavior -> (строка)

Поведение при обновлении схемы, найденной крэулером.

DeleteBehavior -> (строка)

Поведение при удалении объекта, найденного крэулером.

LineageConfiguration -> (структура)

Настройка, указывающая, включена ли функция отслеживания происхождения данных для крэулера.

CrawlerLineageSettings -> (строка)

Указывает, включено ли отслеживание происхождения данных для крэулера. Допустимые значения:

  • ENABLE: включает отслеживание происхождения данных для крэулера
  • DISABLE: отключает отслеживание происхождения данных для крэулера

State -> (строка)

Указывает, работает ли крэулер или ожидается запуск.

TablePrefix -> (строка)

Префикс, добавляемый к именам создаваемых таблиц.

Schedule -> (структура)

Для расписанных крэулеров — расписание, по которому выполняется крэулер.

ScheduleExpression -> (строка)

cron выражение, используемое для задания расписания (см. Расписания по времени для задач и крэулеров). Например, для запуска каждые сутки в 12:15 UTC нужно указать: cron(15 12 * * ? *).

State -> (строка)

Состояние расписания.

CrawlElapsedTime -> (длинное)

Если крэулер работает, содержит общее время, прошедшее с момента начала последнего сканирования.

CreationTime -> (временная метка)

Время создания крэулера.

LastUpdated -> (временная метка)

Время последнего обновления крэулера.

LastCrawl -> (структура)

Статус последнего сканирования и, возможно, информация об ошибке, если она произошла.

Status -> (строка)

Статус последнего сканирования.

ErrorMessage -> (строка)

Если произошла ошибка, информация об ошибке последнего сканирования.

LogGroup -> (строка)

Группа журналов последнего сканирования.

LogStream -> (строка)

Поток журналов последнего сканирования.

MessagePrefix -> (строка)

Префикс для сообщения об этом сканировании.

StartTime -> (временная метка)

Время начала сканирования.

Version -> (длинное)

Версия крэулера.

Configuration -> (строка)

Информация о конфигурации ползунка. Эта версия строка JSON позволяет пользователям задать аспекты поведения ползунка. Для получения дополнительной информации см. Настройка параметров конфигурации ползунка .

CrawlerSecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, которое будет использоваться этим ползунком.

LakeFormationConfiguration -> (структура)

Указывает, должен ли ползунок использовать учетные данные Lake Formation для ползунка вместо учетных данных роли IAM.

UseLakeFormationCredentials -> (логическое значение)

Указывает, использовать ли учетные данные Lake Formation для ползунка вместо учетных данных роли IAM.

AccountId -> (строка)

Требуется для кросс-аккаунтных ползунков. Для ползунков в том же аккаунте, что и целевые данные, это можно оставить как null.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API