Spec-Zone.ru › AWS CLI v2

[ aws . glue ]

get-crawlers

Описание

Извлекает метаданные для всех определённых в учётной записи клиента кроулеров.

См. также: Документацию API AWS

get-crawlers — это операция с постраничной выборкой. Для получения всего набора результатов могут потребоваться несколько вызовов API. Вы можете отключить постраничную выборку, предоставив аргумент --no-paginate. При использовании --output text и аргумента --query в ответе с постраничной выборкой, аргумент --query должен извлечь данные из результатов следующих выражений запроса: Crawlers

Синтаксис

  get-crawlers
[--cli-input-json | --cli-input-yaml]
[--starting-token <value>]
[--page-size <value>]
[--max-items <value>]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения перепишут значения из JSON. Невозможно передавать произвольные двоичные значения с помощью значения JSON, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.

--starting-token (строка)

Токен для указания места начала постраничной выборки. Это NextToken из ранее усечённого ответа.

Примеры использования см. в разделе «Постраничная выборка» в руководстве пользователя AWS CLI.

--page-size (целое число)

Размер каждой страницы для получения в вызове AWS-сервиса. Это не влияет на количество элементов, возвращаемых в выводе команды. Установка меньшего размера страницы приводит к большему количеству вызовов AWS-сервиса, получая меньше элементов в каждом вызове. Это может помочь предотвратить таймаут вызовов AWS-сервиса.

Примеры использования см. в разделе «Постраничная выборка» в руководстве пользователя AWS CLI.

--max-items (целое число)

Общее количество элементов, возвращаемых в выводе команды. Если доступное количество элементов больше указанного значения, в выводе команды предоставляется NextToken. Для возобновления постраничной выборки предоставьте значение NextToken в аргументе starting-token последующей команды. Не используйте элемент ответа NextToken непосредственно вне AWS CLI.

Примеры использования см. в разделе «Постраничная выборка» в руководстве пользователя AWS CLI.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или значении input выводит пример входного JSON, который может быть использован в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно проверит входные данные команды и вернёт пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (булево)

Включить отладочную запись в журнал.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (булево)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (булево)

Отключить автоматическую постраничную выборку. Если автоматическая постраничная выборка отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для использования в фильтрации данных ответа.

--profile (строка)

Использовать определённый профиль из файла ваших учетных данных.

--region (строка)

Используемый регион. Переопределяет настройки конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • on
  • off
  • auto

--no-sign-request (булево)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл сертификатов CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (строка)

Стиль форматирования для использования при двоичных блобах. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде строки, закодированной в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (булево)

Отключить пэйджер CLI для вывода.

--cli-auto-prompt (булево)

Автоматически запросить параметры ввода CLI.

--no-cli-auto-prompt (булево)

Отключить автоматическое запроса параметров ввода CLI.

Вывод

Сборщики данных -> (список)

Список метаданных сборщиков данных.

(структура)

Определяет программу сборщика данных, которая проверяет источник данных и использует классификаторы для попытки определения его схемы. При успехе сборщик записывает метаданные о источнике данных в Glue Data Catalog.

Имя -> (строка)

Имя сборщика данных.

Роль -> (строка)

Amazon Resource Name (ARN) роли IAM, используемой для доступа к ресурсам клиента, таким как данные Amazon Simple Storage Service (Amazon S3).

Цели -> (структура)

Коллекция целей для сканирования.

S3Targets -> (список)

Указывает цели Amazon Simple Storage Service (Amazon S3).

(структура)

Указывает хранилище данных в Amazon Simple Storage Service (Amazon S3).

Путь -> (строка)

Путь к цели Amazon S3.

Исключения -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.

(строка)

Имя подключения -> (строка)

Имя подключения, которое позволяет заданию или сборщику данных получить доступ к данным в Amazon S3 в среде виртуальной частной сети Amazon (Amazon VPC).

Размер выборки -> (целое число)

Устанавливает количество файлов в каждом листе папки для сканирования, когда сканируются образцы файлов в наборе данных. Если не задано, сканируются все файлы. Допустимое значение - целое число от 1 до 249.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs .

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue .

JdbcTargets -> (список)

Указывает цели JDBC.

(структура)

Указывает хранилище JDBC для сканирования.

Имя подключения -> (строка)

Имя подключения, используемого для подключения к цели JDBC.

Путь -> (строка)

Путь к цели JDBC.

Исключения -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.

(строка)

EnableAdditionalMetadata -> (список)

Укажите значение RAWTYPES или COMMENTS для включения дополнительных метаданных в ответах о таблицах. RAWTYPES предоставляет тип данных нативного уровня. COMMENTS предоставляет комментарии, связанные со столбцом или таблицей в базе данных.

Если вам не нужны дополнительные метаданные, оставьте поле пустым.

(строка)

MongoDBTargets -> (список)

Указывает цели Amazon DocumentDB или MongoDB.

(структура)

Указывает хранилище Amazon DocumentDB или MongoDB для сканирования.

Имя подключения -> (строка)

Имя подключения, используемого для подключения к цели Amazon DocumentDB или MongoDB.

Путь -> (строка)

Путь к цели Amazon DocumentDB или MongoDB (база данных/коллекция).

ScanAll -> (булево)

Указывает, следует ли сканировать все записи или брать выборку строк из таблицы. Сканирование всех записей может занять много времени, когда таблица не является таблицей с высокой пропускной способностью.

Значение true означает сканирование всех записей, а значение false означает выборку записей. Если значение не указано, оно по умолчанию равно true.

DynamoDBTargets -> (список)

Указывает цели Amazon DynamoDB.

(структура)

Указывает таблицу Amazon DynamoDB для сканирования.

Путь -> (строка)

Имя таблицы DynamoDB для сканирования.

scanAll -> (булево)

Указывает, следует ли сканировать все записи или брать выборку строк из таблицы. Сканирование всех записей может занять много времени, когда таблица не является таблицей с высокой пропускной способностью.

Значение true означает сканирование всех записей, а значение false означает выборку записей. Если значение не указано, оно по умолчанию равно true.

scanRate -> (вещественное число)

Процент настроенных единиц пропускной способности чтения, используемых Glue сборщиком данных. Единицы пропускной способности чтения - термин, определенный DynamoDB, и представляет собой числовое значение, которое действует как ограничитель скорости для количества чтений, которые могут выполняться на данной таблице в секунду.

Допустимые значения: null или значение от 0,1 до 1,5. Значение null используется, когда пользователь не предоставляет значение, и по умолчанию составляет 0,5 от настроенной единицы пропускной способности чтения (для таблиц с выделенными ресурсами) или 0,25 от максимальной настроенной единицы пропускной способности чтения (для таблиц, использующих режим на основе спроса).

CatalogTargets -> (список)

Указывает цели Glue Data Catalog.

(структура)

Указывает цель Glue Data Catalog.

Имя базы данных -> (строка)

Имя базы данных, подлежащей синхронизации.

Таблицы -> (список)

Список таблиц, подлежащих синхронизации.

(строка)

Имя подключения -> (строка)

Имя подключения для таблицы Data Catalog, поддерживаемой Amazon S3, которая должна быть целью сканирования при использовании типа подключения Catalog в сочетании с типом подключения NETWORK.

EventQueueArn -> (строка)

Действительный Amazon SQS ARN. Например, arn:aws:sqs:region:account:sqs .

DlqEventQueueArn -> (строка)

Действительный Amazon dead-letter SQS ARN. Например, arn:aws:sqs:region:account:deadLetterQueue .

DeltaTargets -> (список)

Указывает цели хранилища Delta.

(структура)

Указывает хранилище Delta для сканирования одной или нескольких таблиц Delta.

DeltaTables -> (список)

Список путей Amazon S3 к таблицам Delta.

(строка)

Имя подключения -> (строка)

Имя подключения, используемого для подключения к цели таблицы Delta.

WriteManifest -> (булево)

Указывает, следует ли записывать файлы манифеста в путь к таблице Delta.

CreateNativeDeltaTable -> (булево)

Указывает, будет ли сборщик данных создавать нативные таблицы, чтобы обеспечить интеграцию с системами запросов, поддерживающими непосредственный запрос журнала транзакций Delta.

IcebergTargets -> (список)

Указывает цели хранилища Apache Iceberg.

(структура)

Указывает источник данных Apache Iceberg, где таблицы Iceberg хранятся в Amazon S3.

Пути -> (список)

Один или несколько путей Amazon S3, содержащих папки метаданных Iceberg в виде s3://bucket/prefix .

(строка)

Имя подключения -> (строка)

Имя подключения, используемого для подключения к цели Iceberg.

Исключения -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.

(строка)

Максимальная глубина обхода -> (целое число)

Максимальная глубина путей Amazon S3, которые может пройти сборщик данных для обнаружения папки метаданных Iceberg в вашем пути Amazon S3. Используется для ограничения времени выполнения сборщика данных.

HudiTargets -> (список)

Указывает цели хранилища Apache Hudi.

(структура)

Указывает источник данных Apache Hudi.

Пути -> (список)

Массив строк расположения Amazon S3 для Hudi, каждый из которых указывает корневую папку, в которой находятся файлы метаданных таблицы Hudi. Папка Hudi может располагаться в дочерней папке корневой папки.

Сборщик данных будет сканировать все папки ниже пути для папки Hudi.

(строка)

Имя подключения -> (строка)

Имя подключения, используемого для подключения к цели Hudi. Если ваши файлы Hudi хранятся в корзинах, которые требуют авторизации VPC, вы можете установить их свойства подключения здесь.

Исключения -> (список)

Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.

(строка)

Максимальная глубина обхода -> (целое число)

Максимальная глубина путей Amazon S3, которые может пройти сборщик данных для обнаружения папки метаданных Hudi в вашем пути Amazon S3. Используется для ограничения времени выполнения сборщика данных.

Имя базы данных -> (строка)

Имя базы данных, в которой хранятся результаты работы сборщика данных.

Описание -> (строка)

Описание сборщика данных.

Классификаторы -> (список)

Список строк UTF-8, которые указывают пользовательские классификаторы, связанные со сборщиком данных.

(строка)

Политика повторного сканирования -> (структура)

Политика, которая определяет, следует ли сканировать весь набор данных заново или только те папки, которые были добавлены с момента последнего запуска сборщика данных.

Поведение при повторном сканировании -> (строка)

Указывает, следует ли сканировать весь набор данных заново или только папки, добавленные с момента последнего запуска сборщика данных.

Значение CRAWL_EVERYTHING указывает на повторное сканирование всего набора данных.

Значение CRAWL_NEW_FOLDERS_ONLY указывает на сканирование только папок, добавленных с момента последнего запуска сборщика данных.

Значение CRAWL_EVENT_MODE указывает на сканирование только изменений, определенных событиями Amazon S3.

Политика изменения схемы -> (структура)

Политика, которая определяет поведение обновлений и удалений для сборщика данных.

Поведение при обновлении -> (строка)

Поведение при обновлении, когда сборщик данных обнаруживает изменённую схему.

Поведение при удалении -> (строка)

Поведение при удалении, когда сборщик данных обнаруживает удаленный объект.

Настройка цепочки -> (структура)

Настройка, которая определяет, включена ли цепочка данных для сборщика данных.

Настройки цепочки сборщика данных -> (строка)

Указывает, включена ли цепочка данных для сборщика данных. Допустимые значения:

  • ENABLE: включает цепочку данных для сборщика данных
  • DISABLE: отключает цепочку данных для сборщика данных

Состояние -> (строка)

Указывает, выполняется ли сборщик данных или выполнение ожидается.

Префикс таблицы -> (строка)

Префикс, добавляемый к именам создаваемых таблиц.

Расписание -> (структура)

Для сборщиков данных по расписанию - расписание запуска сборщика данных.

Выражение расписания -> (строка)

cron выражение, используемое для указания расписания (см. Расписание по времени для заданий и сборщиков данных). Например, чтобы запустить что-то каждый день в 12:15 по UTC, вы должны указать: cron(15 12 * * ? *) .

Состояние -> (строка)

Состояние расписания.

Время выполнения сканирования -> (длинное число)

Если сборщик данных выполняется, содержит общее время, прошедшее с момента начала последнего сканирования.

Время создания -> (временная метка)

Время создания сборщика данных.

Последнее обновление -> (временная метка)

Время последнего обновления сборщика данных.

Последнее сканирование -> (структура)

Статус последнего сканирования и, при необходимости, информация об ошибке, если произошла ошибка.

Status -> (строка)

Статус последнего сканирования.

ErrorMessage -> (строка)

Если произошла ошибка, информация об ошибке последнего сканирования.

LogGroup -> (строка)

Группа журналов для последнего сканирования.

LogStream -> (строка)

Поток журнала для последнего сканирования.

MessagePrefix -> (строка)

Префикс сообщения об этом сканировании.

StartTime -> (метка времени)

Время начала сканирования.

Version -> (целое число)

Версия сканера.

Configuration -> (строка)

Информация о конфигурации сканера. Эта версионированная строка JSON позволяет пользователям задавать аспекты поведения сканера. Дополнительные сведения см. в разделе Настройка параметров конфигурации сканера.

CrawlerSecurityConfiguration -> (строка)

Имя структуры SecurityConfiguration, которую должен использовать этот сканер.

LakeFormationConfiguration -> (структура)

Указывает, должен ли сканер использовать учетные данные Lake Formation для сканера вместо учетных данных роли IAM.

UseLakeFormationCredentials -> (булево)

Указывает, следует ли использовать учетные данные Lake Formation для сканера вместо учетных данных роли IAM.

AccountId -> (строка)

Требуется для кросс-аккаунтовых сканирований. Для сканирований в рамках одного аккаунта, как для целевых данных, это значение можно оставить равным null.

NextToken -> (строка)

Токен продолжения, если возвращенный список не достиг конца определенных в этом аккаунте клиента.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API