get-crawlers
Описание
Извлекает метаданные для всех определённых в учётной записи клиента кроулеров.
См. также: Документацию API AWS
get-crawlers — это операция с постраничной выборкой. Для получения всего набора результатов могут потребоваться несколько вызовов API. Вы можете отключить постраничную выборку, предоставив аргумент --no-paginate. При использовании --output text и аргумента --query в ответе с постраничной выборкой, аргумент --query должен извлечь данные из результатов следующих выражений запроса: Crawlers
Синтаксис
get-crawlers
[--cli-input-json | --cli-input-yaml]
[--starting-token <value>]
[--page-size <value>]
[--max-items <value>]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения перепишут значения из JSON. Невозможно передавать произвольные двоичные значения с помощью значения JSON, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.
--starting-token (строка)
Токен для указания места начала постраничной выборки. Это NextToken из ранее усечённого ответа.
Примеры использования см. в разделе «Постраничная выборка» в руководстве пользователя AWS CLI.
--page-size (целое число)
Размер каждой страницы для получения в вызове AWS-сервиса. Это не влияет на количество элементов, возвращаемых в выводе команды. Установка меньшего размера страницы приводит к большему количеству вызовов AWS-сервиса, получая меньше элементов в каждом вызове. Это может помочь предотвратить таймаут вызовов AWS-сервиса.
Примеры использования см. в разделе «Постраничная выборка» в руководстве пользователя AWS CLI.
--max-items (целое число)
Общее количество элементов, возвращаемых в выводе команды. Если доступное количество элементов больше указанного значения, в выводе команды предоставляется NextToken. Для возобновления постраничной выборки предоставьте значение NextToken в аргументе starting-token последующей команды. Не используйте элемент ответа NextToken непосредственно вне AWS CLI.
Примеры использования см. в разделе «Постраничная выборка» в руководстве пользователя AWS CLI.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или значении input выводит пример входного JSON, который может быть использован в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно проверит входные данные команды и вернёт пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включить отладочную запись в журнал.
--endpoint-url (строка)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (булево)
Отключить автоматическую постраничную выборку. Если автоматическая постраничная выборка отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для использования в фильтрации данных ответа.
--profile (строка)
Использовать определённый профиль из файла ваших учетных данных.
--region (строка)
Используемый регион. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включение/выключение цветного вывода.
- on
- off
- auto
--no-sign-request (булево)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл сертификатов CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для использования при двоичных блобах. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде строки, закодированной в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить пэйджер CLI для вывода.
--cli-auto-prompt (булево)
Автоматически запросить параметры ввода CLI.
--no-cli-auto-prompt (булево)
Отключить автоматическое запроса параметров ввода CLI.
Вывод
Сборщики данных -> (список)
Список метаданных сборщиков данных.
(структура)
Определяет программу сборщика данных, которая проверяет источник данных и использует классификаторы для попытки определения его схемы. При успехе сборщик записывает метаданные о источнике данных в Glue Data Catalog.
Имя -> (строка)
Роль -> (строка)
Цели -> (структура)
Коллекция целей для сканирования.
S3Targets -> (список)
Указывает цели Amazon Simple Storage Service (Amazon S3).
(структура)
Указывает хранилище данных в Amazon Simple Storage Service (Amazon S3).
Путь -> (строка)
Исключения -> (список)
Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.
(строка)
Имя подключения -> (строка)
Размер выборки -> (целое число)
EventQueueArn -> (строка)
arn:aws:sqs:region:account:sqs .DlqEventQueueArn -> (строка)
arn:aws:sqs:region:account:deadLetterQueue .JdbcTargets -> (список)
Указывает цели JDBC.
(структура)
Указывает хранилище JDBC для сканирования.
Имя подключения -> (строка)
Путь -> (строка)
Исключения -> (список)
Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.
(строка)
EnableAdditionalMetadata -> (список)
Укажите значение RAWTYPES или COMMENTS для включения дополнительных метаданных в ответах о таблицах. RAWTYPES предоставляет тип данных нативного уровня. COMMENTS предоставляет комментарии, связанные со столбцом или таблицей в базе данных.
Если вам не нужны дополнительные метаданные, оставьте поле пустым.
(строка)
MongoDBTargets -> (список)
Указывает цели Amazon DocumentDB или MongoDB.
(структура)
Указывает хранилище Amazon DocumentDB или MongoDB для сканирования.
Имя подключения -> (строка)
Путь -> (строка)
ScanAll -> (булево)
Указывает, следует ли сканировать все записи или брать выборку строк из таблицы. Сканирование всех записей может занять много времени, когда таблица не является таблицей с высокой пропускной способностью.
Значение true означает сканирование всех записей, а значение false означает выборку записей. Если значение не указано, оно по умолчанию равно true.
DynamoDBTargets -> (список)
Указывает цели Amazon DynamoDB.
(структура)
Указывает таблицу Amazon DynamoDB для сканирования.
Путь -> (строка)
scanAll -> (булево)
Указывает, следует ли сканировать все записи или брать выборку строк из таблицы. Сканирование всех записей может занять много времени, когда таблица не является таблицей с высокой пропускной способностью.
Значение true означает сканирование всех записей, а значение false означает выборку записей. Если значение не указано, оно по умолчанию равно true.
scanRate -> (вещественное число)
Процент настроенных единиц пропускной способности чтения, используемых Glue сборщиком данных. Единицы пропускной способности чтения - термин, определенный DynamoDB, и представляет собой числовое значение, которое действует как ограничитель скорости для количества чтений, которые могут выполняться на данной таблице в секунду.
Допустимые значения: null или значение от 0,1 до 1,5. Значение null используется, когда пользователь не предоставляет значение, и по умолчанию составляет 0,5 от настроенной единицы пропускной способности чтения (для таблиц с выделенными ресурсами) или 0,25 от максимальной настроенной единицы пропускной способности чтения (для таблиц, использующих режим на основе спроса).
CatalogTargets -> (список)
Указывает цели Glue Data Catalog.
(структура)
Указывает цель Glue Data Catalog.
Имя базы данных -> (строка)
Таблицы -> (список)
Список таблиц, подлежащих синхронизации.
(строка)
Имя подключения -> (строка)
Catalog в сочетании с типом подключения NETWORK.EventQueueArn -> (строка)
arn:aws:sqs:region:account:sqs .DlqEventQueueArn -> (строка)
arn:aws:sqs:region:account:deadLetterQueue .DeltaTargets -> (список)
Указывает цели хранилища Delta.
(структура)
Указывает хранилище Delta для сканирования одной или нескольких таблиц Delta.
DeltaTables -> (список)
Список путей Amazon S3 к таблицам Delta.
(строка)
Имя подключения -> (строка)
WriteManifest -> (булево)
CreateNativeDeltaTable -> (булево)
IcebergTargets -> (список)
Указывает цели хранилища Apache Iceberg.
(структура)
Указывает источник данных Apache Iceberg, где таблицы Iceberg хранятся в Amazon S3.
Пути -> (список)
Один или несколько путей Amazon S3, содержащих папки метаданных Iceberg в виде s3://bucket/prefix .
(строка)
Имя подключения -> (строка)
Исключения -> (список)
Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.
(строка)
Максимальная глубина обхода -> (целое число)
HudiTargets -> (список)
Указывает цели хранилища Apache Hudi.
(структура)
Указывает источник данных Apache Hudi.
Пути -> (список)
Массив строк расположения Amazon S3 для Hudi, каждый из которых указывает корневую папку, в которой находятся файлы метаданных таблицы Hudi. Папка Hudi может располагаться в дочерней папке корневой папки.
Сборщик данных будет сканировать все папки ниже пути для папки Hudi.
(строка)
Имя подключения -> (строка)
Исключения -> (список)
Список шаблонов glob, используемых для исключения из сканирования. Для получения дополнительной информации см. Каталог таблиц с сборщиком данных.
(строка)
Максимальная глубина обхода -> (целое число)
Имя базы данных -> (строка)
Описание -> (строка)
Классификаторы -> (список)
Список строк UTF-8, которые указывают пользовательские классификаторы, связанные со сборщиком данных.
(строка)
Политика повторного сканирования -> (структура)
Политика, которая определяет, следует ли сканировать весь набор данных заново или только те папки, которые были добавлены с момента последнего запуска сборщика данных.
Поведение при повторном сканировании -> (строка)
Указывает, следует ли сканировать весь набор данных заново или только папки, добавленные с момента последнего запуска сборщика данных.
Значение CRAWL_EVERYTHING указывает на повторное сканирование всего набора данных.
Значение CRAWL_NEW_FOLDERS_ONLY указывает на сканирование только папок, добавленных с момента последнего запуска сборщика данных.
Значение CRAWL_EVENT_MODE указывает на сканирование только изменений, определенных событиями Amazon S3.
Политика изменения схемы -> (структура)
Политика, которая определяет поведение обновлений и удалений для сборщика данных.
Поведение при обновлении -> (строка)
Поведение при удалении -> (строка)
Настройка цепочки -> (структура)
Настройка, которая определяет, включена ли цепочка данных для сборщика данных.
Настройки цепочки сборщика данных -> (строка)
Указывает, включена ли цепочка данных для сборщика данных. Допустимые значения:
- ENABLE: включает цепочку данных для сборщика данных
- DISABLE: отключает цепочку данных для сборщика данных
Состояние -> (строка)
Префикс таблицы -> (строка)
Расписание -> (структура)
Для сборщиков данных по расписанию - расписание запуска сборщика данных.
Выражение расписания -> (строка)
cron выражение, используемое для указания расписания (см. Расписание по времени для заданий и сборщиков данных). Например, чтобы запустить что-то каждый день в 12:15 по UTC, вы должны указать: cron(15 12 * * ? *) .Состояние -> (строка)
Время выполнения сканирования -> (длинное число)
Время создания -> (временная метка)
Последнее обновление -> (временная метка)
Последнее сканирование -> (структура)
Статус последнего сканирования и, при необходимости, информация об ошибке, если произошла ошибка.
Status -> (строка)
ErrorMessage -> (строка)
LogGroup -> (строка)
LogStream -> (строка)
MessagePrefix -> (строка)
StartTime -> (метка времени)
Version -> (целое число)
Configuration -> (строка)
CrawlerSecurityConfiguration -> (строка)
SecurityConfiguration, которую должен использовать этот сканер.LakeFormationConfiguration -> (структура)
Указывает, должен ли сканер использовать учетные данные Lake Formation для сканера вместо учетных данных роли IAM.
UseLakeFormationCredentials -> (булево)
AccountId -> (строка)
NextToken -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.