Spec-Zone.ru › AWS CLI v2

[ aws . databrew ]

create-profile-job

Описание

Создает новую задачу для анализа набора данных и создания профиля данных.

См. также: Документацию API AWS

Синтаксис

  create-profile-job
--dataset-name <value>
[--encryption-key-arn <value>]
[--encryption-mode <value>]
--name <value>
[--log-subscription <value>]
[--max-capacity <value>]
[--max-retries <value>]
--output-location <value>
[--configuration <value>]
[--validation-configurations <value>]
--role-arn <value>
[--tags <value>]
[--timeout <value>]
[--job-sample <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--dataset-name (строка)

Имя набора данных, на котором должна действовать эта задача.

--encryption-key-arn (строка)

Идентификатор ресурса Amazon (ARN) ключа шифрования, используемого для защиты задачи.

--encryption-mode (строка)

Режим шифрования для задачи, который может быть одним из следующих:

  • SSE-KMS - SSE-KMS - Шифрование на стороне сервера с ключами, управляемыми KMS.
  • SSE-S3 - Шифрование на стороне сервера с ключами, управляемыми Amazon S3.

Возможные значения:

  • SSE-KMS
  • SSE-S3

--name (строка)

Имя создаваемой задачи. Допустимые символы: буквенно-цифровые (A-Z, a-z, 0-9), дефис (-), точка (.) и пробел.

--log-subscription (строка)

Включает или отключает ведение журнала Amazon CloudWatch для задачи. Если ведение журнала включено, CloudWatch записывает один поток журнала для каждого запуска задачи.

Возможные значения:

  • ENABLE
  • DISABLE

--max-capacity (целое число)

Максимальное количество узлов, которые DataBrew может использовать при обработке данных задачей.

--max-retries (целое число)

Максимальное количество попыток повторного выполнения задачи после завершения работы с ошибкой.

--output-location (структура)

Представляет расположение в Amazon S3 (имя ведра, владелец ведра и ключ объекта), где DataBrew может считывать входные данные или записывать выходные данные из задачи.

Ведро -> (строка)

Имя ведра Amazon S3.

Ключ -> (строка)

Уникальное имя объекта в ведре.

Владелец ведра -> (строка)

Идентификатор учетной записи Amazon Web Services владельца ведра.

Краткая запись:

Bucket=string,Key=string,BucketOwner=string

Синтаксис JSON:

{
  "Bucket": "string",
  "Key": "string",
  "BucketOwner": "string"
}

--configuration (структура)

Настройка для задач профилирования. Используется для выбора столбцов, выполнения оценок и переопределения параметров по умолчанию для оценок. Если настройка равна null, задача профилирования будет выполнена с настройками по умолчанию.

Настройка статистики набора данных -> (структура)

Настройка для межстолбцовых оценок. Настройка может быть использована для выбора оценок и переопределения параметров оценок. Если настройка не определена, задача профилирования выполнит все поддерживаемые межстолбцовые оценки.

Включенные статистики -> (список)

Список включенных оценок. Если список не определен, будут включены все поддерживаемые оценки.

(строка)

Переопределения -> (список)

Список переопределений для оценок.

(структура)

Переопределение конкретной оценки для задачи профилирования.

Статистика -> (строка)

Имя оценки

Параметры -> (отображение)

Отображение, содержащее переопределения параметров оценки.

ключ -> (строка)

значение -> (строка)

Столбцы профиля -> (список)

Список селекторов столбцов. Столбцы профиля могут использоваться для выбора столбцов из набора данных. Если Столбцы профиля не определены, задача профилирования будет профилировать все поддерживаемые столбцы.

(структура)

Селектор столбца из набора данных для настройки задачи профилирования. Один селектор включает либо имя столбца, либо регулярное выражение.

Регулярное выражение -> (строка)

Регулярное выражение для выбора столбца из набора данных.

Имя -> (строка)

Имя столбца из набора данных.

Настройки статистики столбцов -> (список)

Список настроек для оценок столбцов. Настройки статистики столбцов используются для выбора оценок и переопределения параметров оценок для определенных столбцов. Если Настройки статистики столбцов не определены, задача профилирования проанализирует все поддерживаемые столбцы и выполнит все поддерживаемые оценки.

(структура)

Настройка оценок столбцов для задачи профилирования. Настройка статистики столбца может использоваться для выбора оценок и переопределения параметров оценок для определенных столбцов.

Селекторы -> (список)

Список селекторов столбцов. Селекторы могут использоваться для выбора столбцов из набора данных. Если селекторы не определены, конфигурация будет применена ко всем поддерживаемым столбцам.

(структура)

Селектор столбца из набора данных для настройки задачи профилирования. Один селектор включает либо имя столбца, либо регулярное выражение.

Регулярное выражение -> (строка)

Регулярное выражение для выбора столбца из набора данных.

Имя -> (строка)

Имя столбца из набора данных.

Статистики -> (структура)

Настройка оценок. Статистики могут использоваться для выбора оценок и переопределения параметров оценок.

Включенные статистики -> (список)

Список включенных оценок. Если список не определен, будут включены все поддерживаемые оценки.

(строка)

Переопределения -> (список)

Список переопределений для оценок.

(структура)

Переопределение конкретной оценки для задачи профилирования.

Статистика -> (строка)

Имя оценки

Параметры -> (отображение)

Отображение, содержащее переопределения параметров оценки.

ключ -> (строка)

значение -> (строка)

Настройка распознавания сущностей -> (структура)

Настройка распознавания сущностей для задачи профилирования. Если не определено, распознавание сущностей отключено.

Типы сущностей -> (список)

Типы сущностей для распознавания. Могут быть любыми из следующих:

  • USA_SSN
  • EMAIL
  • USA_ITIN
  • USA_PASSPORT_NUMBER
  • PHONE_NUMBER
  • USA_DRIVING_LICENSE
  • BANK_ACCOUNT
  • CREDIT_CARD
  • IP_ADDRESS
  • MAC_ADDRESS
  • USA_DEA_NUMBER
  • USA_HCPCS_CODE
  • USA_NATIONAL_PROVIDER_IDENTIFIER
  • USA_NATIONAL_DRUG_CODE
  • USA_HEALTH_INSURANCE_CLAIM_NUMBER
  • USA_MEDICARE_BENEFICIARY_IDENTIFIER
  • USA_CPT_CODE
  • PERSON_NAME
  • DATE

Также поддерживается группа типов сущностей USA_ALL, которая включает все вышеперечисленные типы сущностей, кроме PERSON_NAME и DATE.

(строка)

Разрешенные статистики -> (список)

Настройка статистик, которые разрешено выполнять для столбцов, содержащих распознанные сущности. Если не определено, никакие статистики не будут вычисляться для столбцов, содержащих распознанные сущности.

(структура)

Настройка статистик, которые разрешено выполнять для столбцов, содержащих распознанные сущности. Если не определено, никакие статистики не будут вычисляться для столбцов, содержащих распознанные сущности.

Статистики -> (список)

Одна или несколько статистик столбцов для разрешения столбцов, содержащих распознанные сущности.

(строка)

Синтаксис JSON:

{
  "DatasetStatisticsConfiguration": {
    "IncludedStatistics": ["string", ...],
    "Overrides": [
      {
        "Statistic": "string",
        "Parameters": {"string": "string"
          ...}
      }
      ...
    ]
  },
  "ProfileColumns": [
    {
      "Regex": "string",
      "Name": "string"
    }
    ...
  ],
  "ColumnStatisticsConfigurations": [
    {
      "Selectors": [
        {
          "Regex": "string",
          "Name": "string"
        }
        ...
      ],
      "Statistics": {
        "IncludedStatistics": ["string", ...],
        "Overrides": [
          {
            "Statistic": "string",
            "Parameters": {"string": "string"
              ...}
          }
          ...
        ]
      }
    }
    ...
  ],
  "EntityDetectorConfiguration": {
    "EntityTypes": ["string", ...],
    "AllowedStatistics": [
      {
        "Statistics": ["string", ...]
      }
      ...
    ]
  }
}

--validation-configurations (список)

Список конфигураций валидации, применяемых к задаче профилирования.

(структура)

Настройка валидации качества данных. Используется для выбора наборов правил и режима валидации, которые будут использоваться в задаче профилирования. Если ValidationConfiguration равно null, задача профилирования будет выполнена без валидации качества данных.

RulesetArn -> (строка)

Идентификатор ресурса Amazon (ARN) набора правил, который будет проверяться в задаче профилирования. TargetArn выбранного набора правил должен совпадать с идентификатором ресурса Amazon (ARN) набора данных, связанного с задачей профилирования.

ValidationMode -> (строка)

Режим валидации качества данных. Режим по умолчанию — «CHECK_ALL», который проверяет все правила, определенные в выбранном наборе правил.

Краткая запись:

RulesetArn=string,ValidationMode=string ...

Синтаксис JSON:

[
  {
    "RulesetArn": "string",
    "ValidationMode": "CHECK_ALL"
  }
  ...
]

--role-arn (строка)

Идентификатор ресурса Amazon (ARN) роли Identity and Access Management (IAM), которая должна быть принята при выполнении задачи DataBrew.

--tags (отображение)

Метки метаданных, которые необходимо применить к этой задаче.

ключ -> (строка)

значение -> (строка)

Краткая запись:

KeyName1=string,KeyName2=string

Синтаксис JSON:

{"string": "string"
  ...}

--timeout (целое число)

Таймаут задачи в минутах. Задача, которая пытается выполняться дольше, чем этот таймаут, завершается со статусом TIMEOUT.

--job-sample (структура)

Настройка выборки только для задач профилирования. Определяет количество строк, на которых будет выполнена задача профилирования. Если значение JobSample не указано, будет использоваться значение по умолчанию. Значение по умолчанию — CUSTOM_ROWS для параметра mode и 20000 для параметра size.

Режим -> (строка)

Значение, которое определяет, выполняется ли задача профилирования на всем наборе данных или на заданном количестве строк. Это значение должно быть одним из следующих:

  • FULL_DATASET - Задача профилирования выполняется на всем наборе данных.
  • CUSTOM_ROWS - Задача профилирования выполняется на количестве строк, указанном в параметре Size.

Размер -> (длинное целое число)

Параметр Size требуется только в том случае, если режим CUSTOM_ROWS. Задача профилирования выполняется на указанном количестве строк. Максимальное значение для размера — Long.MAX_VALUE.

Long.MAX_VALUE = 9223372036854775807

Краткая запись:

Mode=string,Size=long

Синтаксис JSON:

{
  "Mode": "FULL_DATASET"|"CUSTOM_ROWS",
  "Size": long
}

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному в --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, поскольку строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если не указано значения или указано значение input, выводится пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, он выведет пример YAML-ввода, который можно использовать с --cli-input-yaml. Если указано значение output, он проверит входные данные команд и вернет пример JSON-вывода для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Общие параметры

--debug (boolean)

Включить отладку логгирования.

--endpoint-url (string)

Переопределить URL по умолчанию команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (boolean)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования вывода команд.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использовать конкретный профиль из файла учетных данных.

--region (string)

Регион для использования. Переопределяет настройки конфигурации/окружения.

--version (string)

Отобразить версию этого инструмента.

--color (string)

Включить/выключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (string)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/окружения.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (string)

Стиль форматирования для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде строки, закодированной в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, которое сопоставляется с двоичным блоком fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить пейджер CLI для вывода.

--cli-auto-prompt (boolean)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматическое запроса параметров ввода CLI.

Вывод

Имя -> (строка)

Имя созданной задачи.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API