create-processing-job
Описание
Создает задание обработки.
См. также: Документацию AWS API
Синтаксис
create-processing-job
[--processing-inputs <value>]
[--processing-output-config <value>]
--processing-job-name <value>
--processing-resources <value>
[--stopping-condition <value>]
--app-specification <value>
[--environment <value>]
[--network-config <value>]
--role-arn <value>
[--tags <value>]
[--experiment-config <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--processing-inputs (список)
Массив входных данных, определяющих данные для загрузки в контейнер обработки.
(структура)
Входные данные для задания обработки. Входные данные обработки должны указать ровно один тип из S3Input или DatasetDefinition.
InputName -> (строка)
AppManaged -> (булево)
True, операции с входом, такие как загрузка данных, управляются непосредственно приложением задания обработки. Когда False (по умолчанию), операции с входом управляются Amazon SageMaker.S3Input -> (структура)
Настройка для загрузки входных данных из Amazon S3 в контейнер обработки.
S3Uri -> (строка)
LocalPath -> (строка)
LocalPath — это абсолютный путь к входным данным и должен начинаться с /opt/ml/processing/. LocalPath — обязательный параметр, когда AppManaged задано как False (по умолчанию).S3DataType -> (строка)
S3Prefix или ManifestFile для типа данных. Если выбрано S3Prefix, S3Uri определяет префикс имени ключа. Amazon SageMaker использует все объекты с указанным префиксом имени ключа для задания обработки. Если выбрано ManifestFile, S3Uri определяет объект, являющийся файлом-манифестом, содержащим список ключей объектов, которые Amazon SageMaker должен использовать для задания обработки.S3InputMode -> (строка)
File или Pipe режим ввода. В режиме File Amazon SageMaker копирует данные из источника на локальный том памяти ML перед запуском вашего контейнера обработки. Это наиболее часто используемый режим ввода. В режиме Pipe Amazon SageMaker передает входные данные из источника непосредственно в ваш контейнер обработки в именованные каналы без использования тома памяти ML.S3DataDistributionType -> (строка)
FullyReplicated, или же данные из Amazon S3 совместно используются по ключу Amazon S3, загружая один фрагмент данных на каждый экземпляр обработки.S3CompressionType -> (строка)
Gzip может быть использовано только при заданном режиме Pipe в качестве S3InputMode. В режиме Pipe Amazon SageMaker передает входные данные из источника напрямую в ваш контейнер без использования тома EBS.DatasetDefinition -> (структура)
Настройка для ввода определения набора данных.
AthenaDatasetDefinition -> (структура)
Настройка для ввода определения набора данных Athena.
Catalog -> (строка)
Database -> (строка)
QueryString -> (строка)
WorkGroup -> (строка)
OutputS3Uri -> (строка)
KmsKeyId -> (строка)
OutputFormat -> (строка)
OutputCompression -> (строка)
RedshiftDatasetDefinition -> (структура)
Настройка для ввода определения набора данных Redshift.
ClusterId -> (строка)
Database -> (строка)
DbUser -> (строка)
QueryString -> (строка)
ClusterRoleArn -> (строка)
OutputS3Uri -> (строка)
KmsKeyId -> (строка)
OutputFormat -> (строка)
OutputCompression -> (строка)
LocalPath -> (строка)
LocalPath — это абсолютный путь к входным данным. Это обязательный параметр, когда AppManaged задано как False (по умолчанию).DataDistributionType -> (строка)
FullyReplicated или ShardedByS3Key (по умолчанию).InputMode -> (строка)
File или Pipe режим ввода. В режиме File (по умолчанию) Amazon SageMaker копирует данные из источника на локальные тома Amazon Elastic Block Store (Amazon EBS) перед запуском вашего алгоритма обучения. Это наиболее часто используемый режим ввода. В режиме Pipe Amazon SageMaker передает входные данные из источника непосредственно в ваш алгоритм без использования тома EBS.Синтаксис сокращенной записи:
InputName=string,AppManaged=boolean,S3Input={S3Uri=string,LocalPath=string,S3DataType=string,S3InputMode=string,S3DataDistributionType=string,S3CompressionType=string},DatasetDefinition={AthenaDatasetDefinition={Catalog=string,Database=string,QueryString=string,WorkGroup=string,OutputS3Uri=string,KmsKeyId=string,OutputFormat=string,OutputCompression=string},RedshiftDatasetDefinition={ClusterId=string,Database=string,DbUser=string,QueryString=string,ClusterRoleArn=string,OutputS3Uri=string,KmsKeyId=string,OutputFormat=string,OutputCompression=string},LocalPath=string,DataDistributionType=string,InputMode=string} ...
JSON-синтаксис:
[
{
"InputName": "string",
"AppManaged": true|false,
"S3Input": {
"S3Uri": "string",
"LocalPath": "string",
"S3DataType": "ManifestFile"|"S3Prefix",
"S3InputMode": "Pipe"|"File",
"S3DataDistributionType": "FullyReplicated"|"ShardedByS3Key",
"S3CompressionType": "None"|"Gzip"
},
"DatasetDefinition": {
"AthenaDatasetDefinition": {
"Catalog": "string",
"Database": "string",
"QueryString": "string",
"WorkGroup": "string",
"OutputS3Uri": "string",
"KmsKeyId": "string",
"OutputFormat": "PARQUET"|"ORC"|"AVRO"|"JSON"|"TEXTFILE",
"OutputCompression": "GZIP"|"SNAPPY"|"ZLIB"
},
"RedshiftDatasetDefinition": {
"ClusterId": "string",
"Database": "string",
"DbUser": "string",
"QueryString": "string",
"ClusterRoleArn": "string",
"OutputS3Uri": "string",
"KmsKeyId": "string",
"OutputFormat": "PARQUET"|"CSV",
"OutputCompression": "None"|"GZIP"|"BZIP2"|"ZSTD"|"SNAPPY"
},
"LocalPath": "string",
"DataDistributionType": "FullyReplicated"|"ShardedByS3Key",
"InputMode": "Pipe"|"File"
}
}
...
]
--processing-output-config (структура)
Настройка вывода для задания обработки.
Outputs -> (список)
Массив выходов, определяющих данные для загрузки из контейнера обработки.
(структура)
Описывает результаты задания обработки. Выходные данные обработки должны указать ровно один тип из S3Output или FeatureStoreOutput.
OutputName -> (строка)
S3Output -> (структура)
Настройка выходных данных задания обработки в Amazon S3.
S3Uri -> (строка)
LocalPath -> (строка)
LocalPath — это абсолютный путь к каталогу, содержащему выходные файлы. Этот каталог будет создан платформой и существовать при вызове точки входа вашего контейнера.S3UploadMode -> (строка)
FeatureStoreOutput -> (структура)
Настройка выходных данных задания обработки в Amazon SageMaker Feature Store. Этот тип вывода для обработки поддерживается только при заданном значении AppManaged.
FeatureGroupName -> (строка)
AppManaged -> (булево)
True, операции с выходом, такие как загрузка данных, управляются непосредственно приложением задания обработки. Когда False (по умолчанию), операции с выходом управляются Amazon SageMaker.KmsKeyId -> (строка)
KmsKeyId может быть ID ключа KMS, ARN ключа KMS или псевдонимом ключа KMS. KmsKeyId применяется ко всем выходам.JSON-синтаксис:
{
"Outputs": [
{
"OutputName": "string",
"S3Output": {
"S3Uri": "string",
"LocalPath": "string",
"S3UploadMode": "Continuous"|"EndOfJob"
},
"FeatureStoreOutput": {
"FeatureGroupName": "string"
},
"AppManaged": true|false
}
...
],
"KmsKeyId": "string"
}
--processing-job-name (строка)
--processing-resources (структура)
Идентифицирует ресурсы, вычислительные экземпляры ML и тома памяти ML, которые необходимо развернуть для задания обработки. В распределенном обучении вы указываете более одного экземпляра.
ClusterConfig -> (структура)
Настройка ресурсов в кластере, используемого для запуска задания обработки.
InstanceCount -> (целое число)
InstanceType -> (строка)
VolumeSizeInGB -> (целое число)
Размер тома памяти ML в гигабайтах, который вы хотите предоставить. Вы должны указать достаточный объем памяти ML для вашей ситуации.
Примечание
Некоторые экземпляры на основе Nitro включают локальный хранилище с фиксированным общим размером, зависящим от типа экземпляра. При использовании этих экземпляров для обработки Amazon SageMaker подключает локальное хранилище экземпляра вместо хранилища Amazon EBS gp2. Вы не можете запросить VolumeSizeInGB, превышающий общий размер локального хранилища экземпляра.
Список типов экземпляров, поддерживающих локальное хранилище экземпляров, включая общий размер на тип экземпляра, см. в разделе Объемы хранилища экземпляров.
VolumeKmsKeyId -> (строка)
Ключ Amazon Web Services Key Management Service (Amazon Web Services KMS), который Amazon SageMaker использует для шифрования данных на томе хранилища, подключенном к экземплярам вычислений ML, которые выполняют задание обработки.
Примечание
Некоторые экземпляры на основе Nitro включают локальное хранилище, зависящее от типа экземпляра. Локальные тома хранилища шифруются с помощью аппаратного модуля на экземпляре. Вы не можете запросить VolumeKmsKeyId при использовании типа экземпляра с локальным хранилищем.
Список типов экземпляров, поддерживающих локальное хранилище экземпляров, см. в разделе Объемы хранилища экземпляров.
Дополнительную информацию о шифровании локального хранилища экземпляров см. в разделе Объемы хранилища SSD-экземпляров.
Синтаксис сокращенной записи:
ClusterConfig={InstanceCount=integer,InstanceType=string,VolumeSizeInGB=integer,VolumeKmsKeyId=string}
JSON-синтаксис:
{
"ClusterConfig": {
"InstanceCount": integer,
"InstanceType": "ml.t3.medium"|"ml.t3.large"|"ml.t3.xlarge"|"ml.t3.2xlarge"|"ml.m4.xlarge"|"ml.m4.2xlarge"|"ml.m4.4xlarge"|"ml.m4.10xlarge"|"ml.m4.16xlarge"|"ml.c4.xlarge"|"ml.c4.2xlarge"|"ml.c4.4xlarge"|"ml.c4.8xlarge"|"ml.p2.xlarge"|"ml.p2.8xlarge"|"ml.p2.16xlarge"|"ml.p3.2xlarge"|"ml.p3.8xlarge"|"ml.p3.16xlarge"|"ml.c5.xlarge"|"ml.c5.2xlarge"|"ml.c5.4xlarge"|"ml.c5.9xlarge"|"ml.c5.18xlarge"|"ml.m5.large"|"ml.m5.xlarge"|"ml.m5.2xlarge"|"ml.m5.4xlarge"|"ml.m5.12xlarge"|"ml.m5.24xlarge"|"ml.r5.large"|"ml.r5.xlarge"|"ml.r5.2xlarge"|"ml.r5.4xlarge"|"ml.r5.8xlarge"|"ml.r5.12xlarge"|"ml.r5.16xlarge"|"ml.r5.24xlarge"|"ml.g4dn.xlarge"|"ml.g4dn.2xlarge"|"ml.g4dn.4xlarge"|"ml.g4dn.8xlarge"|"ml.g4dn.12xlarge"|"ml.g4dn.16xlarge"|"ml.g5.xlarge"|"ml.g5.2xlarge"|"ml.g5.4xlarge"|"ml.g5.8xlarge"|"ml.g5.16xlarge"|"ml.g5.12xlarge"|"ml.g5.24xlarge"|"ml.g5.48xlarge"|"ml.r5d.large"|"ml.r5d.xlarge"|"ml.r5d.2xlarge"|"ml.r5d.4xlarge"|"ml.r5d.8xlarge"|"ml.r5d.12xlarge"|"ml.r5d.16xlarge"|"ml.r5d.24xlarge"|"ml.g6.xlarge"|"ml.g6.2xlarge"|"ml.g6.4xlarge"|"ml.g6.8xlarge"|"ml.g6.12xlarge"|"ml.g6.16xlarge"|"ml.g6.24xlarge"|"ml.g6.48xlarge"|"ml.g6e.xlarge"|"ml.g6e.2xlarge"|"ml.g6e.4xlarge"|"ml.g6e.8xlarge"|"ml.g6e.12xlarge"|"ml.g6e.16xlarge"|"ml.g6e.24xlarge"|"ml.g6e.48xlarge"|"ml.m6i.large"|"ml.m6i.xlarge"|"ml.m6i.2xlarge"|"ml.m6i.4xlarge"|"ml.m6i.8xlarge"|"ml.m6i.12xlarge"|"ml.m6i.16xlarge"|"ml.m6i.24xlarge"|"ml.m6i.32xlarge"|"ml.c6i.xlarge"|"ml.c6i.2xlarge"|"ml.c6i.4xlarge"|"ml.c6i.8xlarge"|"ml.c6i.12xlarge"|"ml.c6i.16xlarge"|"ml.c6i.24xlarge"|"ml.c6i.32xlarge",
"VolumeSizeInGB": integer,
"VolumeKmsKeyId": "string"
}
}
--stopping-condition (структура)
Предельное время выполнения задания обработки.
MaxRuntimeInSeconds -> (целое число)
Синтаксис сокращенной записи:
MaxRuntimeInSeconds=integer
JSON-синтаксис:
{
"MaxRuntimeInSeconds": integer
}
--app-specification (структура)
Настраивает задачу обработки для запуска указанного Docker контейнера.
ImageUri -> (строка)
ContainerEntrypoint -> (список)
Точка входа для контейнера, используемого для запуска задачи обработки.
(строка)
ContainerArguments -> (список)
Аргументы для контейнера, используемого для запуска задачи обработки.
(строка)
Краткая запись:
ImageUri=string,ContainerEntrypoint=string,string,ContainerArguments=string,string
Синтаксис JSON:
{
"ImageUri": "string",
"ContainerEntrypoint": ["string", ...],
"ContainerArguments": ["string", ...]
}
--environment (карта)
Переменные среды, которые нужно установить в контейнере Docker. Поддерживается до 100 пар ключ-значение в карте.
Предупреждение
Не включайте конфиденциальную информацию, включая идентификаторы доступа к учетной записи, секреты или токены, в любые поля среды. Вы несете ответственность за любое потенциальное раскрытие, несанкционированный доступ или компрометацию ваших конфиденциальных данных, если это вызвано конфиденциальной информацией, включенной в переменную среды запроса или поля обычного текста.key -> (строка)
value -> (строка)
Краткая запись:
KeyName1=string,KeyName2=string
Синтаксис JSON:
{"string": "string"
...}
--network-config (структура)
Параметры сети для задачи обработки, такие как разрешение входящих и исходящих сетевых вызовов контейнерам обработки и подсети VPC и группы безопасности для использования для задач обработки, включенных в VPC.
EnableInterContainerTrafficEncryption -> (булево)
True для шифрования коммуникаций. Шифрование обеспечивает большую безопасность для распределенных задач обработки, но обработка может занять больше времени.EnableNetworkIsolation -> (булево)
VpcConfig -> (структура)
Указывает Amazon Virtual Private Cloud (VPC), к которому ваши задачи SageMaker, размещенные модели и вычислительные ресурсы имеют доступ. Вы можете контролировать доступ к ресурсам, настраивая VPC. Дополнительную информацию см. в разделе Наделить SageMaker доступом к ресурсам в вашем Amazon VPC.
SecurityGroupIds -> (список)
Идентификаторы групп безопасности VPC в формате sg-xxxxxxxx . Укажите группы безопасности для VPC, указанной в поле Subnets.
(строка)
Subnets -> (список)
Идентификатор подсетей в VPC, к которым вы хотите подключить свою задачу обучения или модель. Дополнительную информацию об उपलब्धности конкретных типов экземпляров см. в разделе Поддерживаемые типы экземпляров и зоны доступности.
(строка)
Краткая запись:
EnableInterContainerTrafficEncryption=boolean,EnableNetworkIsolation=boolean,VpcConfig={SecurityGroupIds=[string,string],Subnets=[string,string]}
Синтаксис JSON:
{
"EnableInterContainerTrafficEncryption": true|false,
"EnableNetworkIsolation": true|false,
"VpcConfig": {
"SecurityGroupIds": ["string", ...],
"Subnets": ["string", ...]
}
}
--role-arn (строка)
--tags (список)
(Необязательно) Массив пар ключ-значение. Дополнительную информацию см. в разделе Использование тегов распределения затрат в руководстве пользователя по управлению расходами и ценами Amazon Web Services.
Предупреждение
Не включайте конфиденциальную информацию, включая идентификаторы доступа к учетной записи, секреты или токены, в любые теги. Вы несете ответственность за любое потенциальное раскрытие, несанкционированный доступ или компрометацию ваших конфиденциальных данных, если это вызвано конфиденциальной информацией, включенной в переменную тега запроса или поля обычного текста.(структура)
Объект тега, состоящий из ключа и необязательного значения, используемый для управления метаданными для ресурсов Amazon Web Services SageMaker.
Вы можете добавлять теги к экземплярам ноутбуков, задачам обучения, задачам настройки гиперпараметров, задачам пакетного преобразования, моделям, задачам маркировки, рабочим группам, конфигурациям конечных точек и конечным точкам. Дополнительную информацию о добавлении тегов к ресурсам SageMaker см. в разделе AddTags.
Дополнительную информацию о добавлении метаданных к вашим ресурсам Amazon Web Services с помощью тегов см. в разделе Тегирование ресурсов Amazon Web Services. Советы по наилучшим методам работы с ресурсами Amazon Web Services с помощью тегов см. в разделе Практические рекомендации по тегам: реализация эффективной стратегии тегирования ресурсов Amazon Web Services.
Key -> (строка)
Value -> (строка)
Краткая запись:
Key=string,Value=string ...
Синтаксис JSON:
[
{
"Key": "string",
"Value": "string"
}
...
]
--experiment-config (структура)
Связывает задачу SageMaker как компонент испытания с экспериментом и испытанием. Указывается при вызове следующих API:
- CreateProcessingJob
- CreateTrainingJob
- CreateTransformJob
ExperimentName -> (строка)
TrialName -> (строка)
TrialComponentDisplayName -> (строка)
RunName -> (строка)
Краткая запись:
ExperimentName=string,TrialName=string,TrialComponentDisplayName=string,RunName=string
Синтаксис JSON:
{
"ExperimentName": "string",
"TrialName": "string",
"TrialComponentDisplayName": "string",
"RunName": "string"
}
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределяют значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или значение input, выводится пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, будет напечатан пример YAML-ввода, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно проверяет входные данные команд и возвращает пример JSON-вывода для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Общие параметры
--debug (булево)
Включить отладку.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (булево)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для использования при фильтрации данных ответа.
--profile (строка)
Использовать конкретный профиль из файла с данными учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- включить
- выключить
- автоматически
--no-sign-request (булево)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Набор сертификатов CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь тайм-аута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь тайм-аута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной строкой base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое сопоставляется с двоичным блоком fileb://, всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить пагинатор cli для вывода.
--cli-auto-prompt (булево)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (булево)
Отключить автоматическое запроса параметров ввода CLI.
Вывод
ProcessingJobArn -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.