get-crawler
Описание
Получает метаданные для указанного кроулера.
См. также: Документация API AWS
Синтаксис
get-crawler
--name <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--name (строка)
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или со значением input, выводится пример JSON-ввода, который может использоваться в качестве аргумента для --cli-input-json. Аналогично, если предоставлено значение yaml-input, выводится пример YAML-ввода, который может использоваться с --cli-input-yaml. Если предоставлено значение output, выполняется валидация входных данных команды и возвращается JSON-пример выходных данных для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включить отладочную регистрацию.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (булево)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команд.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определённый профиль из файла ключей.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/окружения.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (булево)
Не подписывать запросы. Ключи не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл сертификатов CA для использования при проверке сертификатов SSL. Переопределяет настройки конфигурации/окружения.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для использования с двоичными блоками. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить страницу cli для вывода.
--cli-auto-prompt (булево)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (булево)
Отключить автоматическую запрос параметров ввода CLI.
Вывод
Crawler -> (структура)
Метаданные указанного крэулера.
Name -> (строка)
Role -> (строка)
Targets -> (структура)
Коллекция целей для сканирования.
S3Targets -> (список)
Указывает цели Amazon Simple Storage Service (Amazon S3).
(структура)
Указывает хранилище данных в Amazon Simple Storage Service (Amazon S3).
Path -> (строка)
Exclusions -> (список)
Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.
(строка)
ConnectionName -> (строка)
SampleSize -> (целое число)
EventQueueArn -> (строка)
arn:aws:sqs:region:account:sqs .DlqEventQueueArn -> (строка)
arn:aws:sqs:region:account:deadLetterQueue .JdbcTargets -> (список)
Указывает цели JDBC.
(структура)
Указывает хранилище данных JDBC для сканирования.
ConnectionName -> (строка)
Path -> (строка)
Exclusions -> (список)
Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.
(строка)
EnableAdditionalMetadata -> (список)
Укажите значение RAWTYPES или COMMENTS для включения дополнительных метаданных в ответах о таблицах. RAWTYPES предоставляет тип данных на уровне базы данных. COMMENTS предоставляет комментарии, связанные со столбцом или таблицей в базе данных.
Если дополнительные метаданные не нужны, оставьте поле пустым.
(строка)
MongoDBTargets -> (список)
Указывает цели Amazon DocumentDB или MongoDB.
(структура)
Указывает хранилище данных Amazon DocumentDB или MongoDB для сканирования.
ConnectionName -> (строка)
Path -> (строка)
ScanAll -> (булево)
Указывает, нужно ли сканировать все записи или взять выборку из таблицы. Сканирование всех записей может занять много времени, если таблица не имеет высокой пропускной способности.
Значение true означает сканирование всех записей, а значение false — выборку записей. Если значение не указано, оно по умолчанию равно true.
DynamoDBTargets -> (список)
Указывает цели Amazon DynamoDB.
(структура)
Указывает таблицу Amazon DynamoDB для сканирования.
Path -> (строка)
scanAll -> (булево)
Указывает, нужно ли сканировать все записи или взять выборку из таблицы. Сканирование всех записей может занять много времени, если таблица не имеет высокой пропускной способности.
Значение true означает сканирование всех записей, а значение false — выборку записей. Если значение не указано, оно по умолчанию равно true.
scanRate -> (двойное)
Процент настроенных единиц пропускной способности чтения, которые будет использовать Glue крэулер. Единицы пропускной способности чтения — термин, определенный DynamoDB, и представляет собой числовое значение, которое действует как ограничитель скорости для количества чтений, которые могут выполняться для данной таблицы в секунду.
Допустимые значения — null или значение от 0,1 до 1,5. Значение null используется, когда пользователь не предоставляет значение, и по умолчанию составляет 0,5 от настроенных единиц пропускной способности чтения (для таблиц с предоставлением ресурсов) или 0,25 от максимальных настроенных единиц пропускной способности чтения (для таблиц, использующих режим on-demand).
CatalogTargets -> (список)
Указывает цели Glue Data Catalog.
(структура)
Указывает цель Glue Data Catalog.
DatabaseName -> (строка)
Tables -> (список)
Список таблиц для синхронизации.
(строка)
ConnectionName -> (строка)
Catalog в паре с типом подключения NETWORK.EventQueueArn -> (строка)
arn:aws:sqs:region:account:sqs .DlqEventQueueArn -> (строка)
arn:aws:sqs:region:account:deadLetterQueue .DeltaTargets -> (список)
Указывает цели хранилища данных Delta.
(структура)
Указывает хранилище данных Delta для сканирования одной или нескольких таблиц Delta.
DeltaTables -> (список)
Список путей Amazon S3 к таблицам Delta.
(строка)
ConnectionName -> (строка)
WriteManifest -> (булево)
CreateNativeDeltaTable -> (булево)
IcebergTargets -> (список)
Указывает цели хранилища Apache Iceberg.
(структура)
Указывает источник данных Apache Iceberg, где таблицы Iceberg хранятся в Amazon S3.
Paths -> (список)
Один или несколько путей Amazon S3, содержащих папки метаданных Iceberg в качестве s3://bucket/prefix .
(строка)
ConnectionName -> (строка)
Exclusions -> (список)
Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.
(строка)
MaximumTraversalDepth -> (целое число)
HudiTargets -> (список)
Указывает цели хранилища Apache Hudi.
(структура)
Указывает источник данных Apache Hudi.
Paths -> (список)
Массив строк расположения Amazon S3 для Hudi, каждая из которых указывает корневую папку, в которой находятся файлы метаданных для таблицы Hudi. Папка Hudi может находиться в подпапке корневой папки.
Крэулер будет сканировать все папки под путём для папки Hudi.
(строка)
ConnectionName -> (строка)
Exclusions -> (список)
Список шаблонов glob для исключения из сканирования. Дополнительная информация в разделе Каталоги таблиц с крэулером.
(строка)
MaximumTraversalDepth -> (целое число)
DatabaseName -> (строка)
Description -> (строка)
Classifiers -> (список)
Список строк UTF-8, которые указывают на настраиваемые классификаторы, связанные с крэулером.
(строка)
RecrawlPolicy -> (структура)
Политика, которая определяет, нужно ли сканировать весь набор данных или только папки, добавленные после последнего запуска крэулера.
RecrawlBehavior -> (строка)
Указывает, нужно ли сканировать весь набор данных или только папки, добавленные после последнего запуска крэулера.
Значение CRAWL_EVERYTHING указывает на сканирование всего набора данных.
Значение CRAWL_NEW_FOLDERS_ONLY указывает на сканирование только папок, добавленных после последнего запуска крэулера.
Значение CRAWL_EVENT_MODE указывает на сканирование только изменений, определённых событиями Amazon S3.
SchemaChangePolicy -> (структура)
Политика, определяющая поведение при обновлении и удалении для крэулера.
UpdateBehavior -> (строка)
DeleteBehavior -> (строка)
LineageConfiguration -> (структура)
Настройка, указывающая, включена ли функция отслеживания происхождения данных для крэулера.
CrawlerLineageSettings -> (строка)
Указывает, включено ли отслеживание происхождения данных для крэулера. Допустимые значения:
- ENABLE: включает отслеживание происхождения данных для крэулера
- DISABLE: отключает отслеживание происхождения данных для крэулера
State -> (строка)
TablePrefix -> (строка)
Schedule -> (структура)
Для расписанных крэулеров — расписание, по которому выполняется крэулер.
ScheduleExpression -> (строка)
cron выражение, используемое для задания расписания (см. Расписания по времени для задач и крэулеров). Например, для запуска каждые сутки в 12:15 UTC нужно указать: cron(15 12 * * ? *).State -> (строка)
CrawlElapsedTime -> (длинное)
CreationTime -> (временная метка)
LastUpdated -> (временная метка)
LastCrawl -> (структура)
Статус последнего сканирования и, возможно, информация об ошибке, если она произошла.
Status -> (строка)
ErrorMessage -> (строка)
LogGroup -> (строка)
LogStream -> (строка)
MessagePrefix -> (строка)
StartTime -> (временная метка)
Version -> (длинное)
Configuration -> (строка)
CrawlerSecurityConfiguration -> (строка)
SecurityConfiguration, которое будет использоваться этим ползунком.LakeFormationConfiguration -> (структура)
Указывает, должен ли ползунок использовать учетные данные Lake Formation для ползунка вместо учетных данных роли IAM.
UseLakeFormationCredentials -> (логическое значение)
AccountId -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.