Spec-Zone.ru › AWS CLI v2

[ aws . sagemaker ]

describe-algorithm

Описание

Возвращает описание указанного алгоритма в вашем аккаунте.

См. также: Документацию API AWS

Синтаксис

  describe-algorithm
--algorithm-name <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--algorithm-name (строка)

Имя алгоритма, описание которого нужно получить.

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет воспринята буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено без значения или со значением input, выводит JSON-пример входных данных, который может быть использован в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входных данных YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверяет входные данные команды и возвращает JSON-пример выходных данных для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включить отладку регистрации.

--endpoint-url (строка)

Переопределить URL по умолчанию команды на указанный URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из вашего файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/окружения.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/отключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (логическое значение)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл с сертификатами CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/окружения.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую, независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить пейджер CLI для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запросить параметры входных данных CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запрос параметров входных данных CLI.

Вывод

AlgorithmName -> (строка)

Имя описываемого алгоритма.

AlgorithmArn -> (строка)

Amazon Resource Name (ARN) алгоритма.

AlgorithmDescription -> (строка)

Краткое описание алгоритма.

CreationTime -> (временная метка)

Временная метка, указывающая время создания алгоритма.

TrainingSpecification -> (структура)

Подробная информация о запусках задач обучения этим алгоритмом.

TrainingImage -> (строка)

Путь к регистру Amazon ECR Docker-образа, содержащего алгоритм обучения.

TrainingImageDigest -> (строка)

MD5-хеш алгоритма обучения, идентифицирующий Docker-образ, используемый для обучения.

SupportedHyperParameters -> (список)

Список объектов HyperParameterSpecification, определяющих поддерживаемые гиперпараметры. Требуется, если алгоритм поддерживает автоматическую настройку моделей.

(структура)

Определяет гиперпараметр, используемый алгоритмом.

Name -> (строка)

Имя этого гиперпараметра. Имя должно быть уникальным.

Description -> (строка)

Краткое описание гиперпараметра.

Type -> (строка)

Тип этого гиперпараметра. Допустимые типы: Integer, Continuous, Categorical и FreeText.

Range -> (структура)

Диапазон допустимых значений для этого гиперпараметра.

IntegerParameterRangeSpecification -> (структура)

Объект IntegerParameterRangeSpecification, определяющий возможные значения для целочисленного гиперпараметра.

MinValue -> (строка)

Минимальное целочисленное значение.

MaxValue -> (строка)

Максимальное целочисленное значение.

ContinuousParameterRangeSpecification -> (структура)

Объект ContinuousParameterRangeSpecification, определяющий возможные значения для непрерывного гиперпараметра.

MinValue -> (строка)

Минимальное значение с плавающей точкой.

MaxValue -> (строка)

Максимальное значение с плавающей точкой.

CategoricalParameterRangeSpecification -> (структура)

Объект CategoricalParameterRangeSpecification, определяющий возможные значения для категориального гиперпараметра.

Values -> (список)

Допустимые категории для гиперпараметра.

(строка)

IsTunable -> (булево)

Указывает, можно ли настраивать этот гиперпараметр в задаче настройки гиперпараметров.

IsRequired -> (булево)

Указывает, является ли этот гиперпараметр обязательным.

DefaultValue -> (строка)

Значение по умолчанию для этого гиперпараметра. Если задано значение по умолчанию, гиперпараметр не может быть обязательным.

SupportedTrainingInstanceTypes -> (список)

Список типов экземпляров, которые может использовать этот алгоритм для обучения.

(строка)

SupportsDistributedTraining -> (булево)

Указывает, поддерживает ли алгоритм распределенное обучение. Если значение равно false, покупатели не могут запросить более одного экземпляра во время обучения.

MetricDefinitions -> (список)

Список объектов MetricDefinition, используемых для парсинга метрик, сгенерированных алгоритмом.

(структура)

Определяет метрику, которую алгоритм обучения записывает в stderr или stdout. Вы можете просмотреть эти журналы, чтобы понять, как выполняется ваша задача обучения, и проверить наличие ошибок, возникших во время обучения. SageMaker настройка гиперпараметров собирает все определенные метрики. Укажите одну из определенных метрик в качестве целевой метрики, используя параметр TuningObjective в API HyperParameterTrainingJobDefinition, чтобы оценить производительность задачи во время настройки гиперпараметров.

Name -> (строка)

Имя метрики.

Regex -> (строка)

Регулярное выражение, которое ищет вывод задачи обучения и получает значение метрики. Дополнительную информацию об использовании регулярных выражений для определения метрик см. в разделе Определение метрик и переменных среды.

TrainingChannels -> (список)

Список объектов ChannelSpecification, которые определяют источники входных данных, которые будут использоваться алгоритмом.

(структура)

Определяет именованный источник входных данных, называемый каналом, который будет использоваться алгоритмом.

Name -> (строка)

Имя канала.

Description -> (строка)

Краткое описание канала.

IsRequired -> (булево)

Указывает, требуется ли канал алгоритму.

SupportedContentTypes -> (список)

Поддерживаемые типы MIME для данных.

(строка)

SupportedCompressionTypes -> (список)

Допустимые типы сжатия, если используется сжатие данных.

(строка)

SupportedInputModes -> (список)

Допустимый режим ввода: FILE или PIPE.

В режиме FILE Amazon SageMaker копирует данные из источника входных данных на локальные тома Amazon Elastic Block Store (Amazon EBS) перед запуском алгоритма обучения. Это наиболее часто используемый режим ввода.

В режиме PIPE Amazon SageMaker передает данные входных данных из источника непосредственно в ваш алгоритм без использования тома EBS.

(строка)

Режим входных данных обучения, который поддерживает алгоритм. Дополнительную информацию о режимах ввода см. в разделе Алгоритмы.

Режим Pipe

Если алгоритм поддерживает режим Pipe, Amazon SageMaker передает данные непосредственно из Amazon S3 в контейнер.

Режим File

Если алгоритм поддерживает режим File, SageMaker загружает данные обучения из S3 в выделенный том ML и монтирует каталог в том Docker для контейнера обучения.

Вы должны выделить том ML с достаточной емкостью для размещения данных, загруженных из S3. Кроме данных обучения, том ML также хранит выходную модель. Контейнер алгоритма также использует том ML для хранения промежуточных данных, если таковые имеются.

Для распределенных алгоритмов данные обучения распределяются равномерно. Длительность обучения предсказуема, если размеры объектов входных данных примерно одинаковы. SageMaker не разбивает файлы дальше для обучения модели. Если размеры объектов различаются, обучение не будет оптимальным, так как распределение данных также будет неравномерным, когда один хост в кластере обучения перегружен, тем самым став узким местом в обучении.

Режим FastFile

Если алгоритм поддерживает режим FastFile, SageMaker передает данные непосредственно из S3 в контейнер без внесения изменений в код и предоставляет файловый доступ к данным. Пользователи могут написать свой скрипт обучения для взаимодействия с этими файлами так, как если бы они хранились на диске.

Режим FastFile лучше всего работает, когда данные считываются последовательно. Расширенные файлы манифеста не поддерживаются. Время запуска меньше, когда в предоставленном ведре S3 меньше файлов.

SupportedTuningJobObjectiveMetrics -> (список)

Список метрик, которые генерирует алгоритм и которые могут быть использованы в качестве целевой метрики в задаче настройки гиперпараметров.

(структура)

Определяет целевую метрику для задачи настройки гиперпараметров. Настройка гиперпараметров использует значение этой метрики для оценки запускаемых задач обучения и возвращает задачу обучения, которая приводит к наибольшему или наименьшему значению этой метрики в зависимости от значения, которое вы укажете для параметра Type. Если вы хотите определить пользовательскую целевую метрику, см. Определение метрик и переменных среды.

Type -> (строка)

Минимизировать или максимизировать целевую метрику.

MetricName -> (строка)

Имя метрики, используемой для целевой метрики.

AdditionalS3DataSource -> (структура)

Дополнительный источник данных, используемый во время задачи обучения.

S3DataType -> (строка)

Тип данных дополнительных данных из источника, который вы указывали для использования в инференции или обучении.

S3Uri -> (строка)

Унифицированный идентификатор ресурса (URI), используемый для идентификации дополнительных источников данных, используемых в инференции или обучении.

CompressionType -> (строка)

Тип сжатия, используемый для дополнительных данных из источника, используемых в инференции или обучении. Укажите None, если ваш дополнительный источник данных не сжат.

ETag -> (строка)

ETag, связанный с URI S3.

InferenceSpecification -> (структура)

Подробности о задачах вывода, которые выполняет алгоритм.

Контейнеры -> (список)

Путь к регистру Amazon ECR Docker-образа, содержащего код вывода.

(структура)

Описывает Docker-контейнер для пакета модели.

ContainerHostname -> (строка)

Имя хоста DNS для Docker-контейнера.

Image -> (строка)

Путь в Amazon Elastic Container Registry (Amazon ECR), где хранится код вывода.

Если вы используете собственный алгоритм вместо алгоритма, предоставляемого SageMaker, код вывода должен соответствовать требованиям SageMaker. SageMaker поддерживает оба формата путей изображений registry/repository[:tag] и registry/repository[@digest]. Дополнительную информацию см. в разделе Использование собственных алгоритмов с Amazon SageMaker.

ImageDigest -> (строка)

MD5-хеш алгоритма обучения, определяющий Docker-образ, используемый для обучения.

ModelDataUrl -> (строка)

Путь Amazon S3, где хранятся артефакты модели, полученные в результате обучения модели. Этот путь должен указывать на один gzip сжатый архив TAR (.tar.gz суффикс).

Примечание

Артефакты модели должны храниться в хранилище S3 в той же области, что и пакет модели.

ModelDataSource -> (структура)

Указывает расположение данных ML-модели для развертывания во время создания конечной точки.

S3DataSource -> (структура)

Указывает расположение данных ML-модели в S3 для развертывания.

S3Uri -> (строка)

Указывает путь S3 для данных ML-модели для развертывания.

S3DataType -> (строка)

Указывает тип данных ML-модели для развертывания.

Если вы выберете S3Prefix , S3Uri определяет префикс имени ключа. SageMaker использует все объекты, соответствующие указанному префиксу имени ключа, как часть данных ML-модели для развертывания. Действительный префикс имени ключа, определенный S3Uri, всегда заканчивается косой чертой (/).

Если вы выберете S3Object , S3Uri определяет объект, который является данными ML-модели для развертывания.

CompressionType -> (строка)

Указывает способ подготовки данных ML-модели.

Если вы выберете Gzip и выберете S3Object в качестве значения S3DataType , S3Uri определяет объект, который является gzip-сжатым архивом TAR. SageMaker попытается распаковать и разархивировать объект во время развертывания модели.

Если вы выберете None и выберете S3Object в качестве значения S3DataType , S3Uri определяет объект, представляющий не сжатую ML-модель для развертывания.

Если вы выберете None и выберете S3Prefix в качестве значения S3DataType , S3Uri определяет префикс имени ключа, под которым все объекты представляют не сжатую ML-модель для развертывания.

Если вы выберете None, тогда SageMaker будет следовать правилам ниже при создании файлов данных модели в каталоге /opt/ml/model для использования вашим кодом вывода:

  • Если вы выберете S3Object в качестве значения S3DataType , то SageMaker разделит ключ объекта S3, на который ссылается S3Uri, по косой черте (/) и использует последнюю часть в качестве имени файла, содержащего содержимое объекта S3.
  • Если вы выберете S3Prefix в качестве значения S3DataType, то для каждого объекта S3 под префиксом имени ключа, на который ссылается S3Uri, SageMaker обрезает его ключ по префиксу и использует остаток в качестве пути (относительно /opt/ml/model) файла, содержащего содержимое объекта S3. SageMaker разделит остаток по косой черте (/), используя промежуточные части в качестве имён каталогов, а последнюю часть — в качестве имени файла, содержащего содержимое объекта S3.
  • Не используйте следующие значения в качестве имён файлов или каталогов:
    • Пустая или пустая строка
    • Строка, содержащая нулевые байты
    • Строка длиной более 255 байт
    • Одиночная точка (. )
    • Двойная точка (.. )
  • Неоднозначные имена файлов приведут к ошибке развертывания модели. Например, если ваша несжатая ML-модель состоит из двух объектов S3 s3://mybucket/model/weights и s3://mybucket/model/weights/part1, и вы укажете s3://mybucket/model/ в качестве значения S3Uri и S3Prefix в качестве значения S3DataType, это приведёт к конфликту имён между /opt/ml/model/weights (обычный файл) и /opt/ml/model/weights/ (каталог).
  • Не организовывайте артефакты модели в консоли S3 с помощью папок. При создании папки в консоли S3 S3 создаёт объект размером 0 байт с ключом, установленным на имя предоставленной папки. Ключ объекта размером 0 байт заканчивается косой чертой (/), что нарушает ограничения SageMaker на имена файлов артефактов модели, что приводит к ошибке развертывания модели.

ModelAccessConfig -> (структура)

Указывает конфигурационный файл доступа к ML-модели. Вы можете явно принять лицензионное соглашение конечного пользователя модели (EULA) в ModelAccessConfig. Вы несете ответственность за ознакомление и соблюдение любых применимых лицензионных условий и убедитесь, что они приемлемы для вашего случая использования перед загрузкой или использованием модели.

AcceptEula -> (булево)

Указывает согласие с лицензионным соглашением конечного пользователя модели (EULA). Значение AcceptEula должно быть явно определено как True, чтобы принять EULA, требуемое этой моделью. Вы несете ответственность за ознакомление и соблюдение любых применимых лицензионных условий и убедитесь, что они приемлемы для вашего случая использования перед загрузкой или использованием модели.

HubAccessConfig -> (структура)

Справочная информация для доступа к хабу.

HubContentArn -> (строка)

ARN содержимого хаба, для которого разрешен доступ к развертыванию.

ManifestS3Uri -> (строка)

URI Amazon S3 файла манифеста. Файл манифеста — это CSV-файл, хранящий местоположения артефактов.

ETag -> (строка)

ETag, связанный с URI S3.

ManifestEtag -> (строка)

ETag, связанный с URI манифеста S3.

ProductId -> (строка)

Идентификатор продукта Amazon Web Services Marketplace пакета модели.

Environment -> (карта)

Переменные среды для установки в Docker-контейнере. Каждый ключ и значение в карте строк со строками Environment может иметь длину до 1024. Мы поддерживаем до 16 записей в карте.

key -> (строка)

value -> (строка)

ModelInput -> (структура)

Структура с деталями входных данных модели.

DataInputConfig -> (строка)

Объект конфигурации входных данных для модели.

Framework -> (строка)

Фреймворк машинного обучения контейнера образа пакета модели.

FrameworkVersion -> (строка)

Версия фреймворка контейнера образа пакета модели.

NearestModelName -> (строка)

Имя предварительно обученной модели, откалиброванной Amazon SageMaker Inference Recommender, соответствующей вашей модели. Список откалиброванных моделей можно получить, вызвав ListModelMetadata.

AdditionalS3DataSource -> (структура)

Дополнительный источник данных, используемый во время вывода в Docker-контейнере для пакета вашей модели.

S3DataType -> (строка)

Тип данных дополнительного источника данных, указанного для использования в выводе или обучении.

S3Uri -> (строка)

Унифицированный идентификатор ресурса (URI), используемый для определения дополнительного источника данных, используемого в выводе или обучении.

CompressionType -> (строка)

Тип сжатия, используемый для дополнительного источника данных, используемого в выводе или обучении. Укажите None, если ваш дополнительный источник данных не сжат.

ETag -> (строка)

ETag, связанный с URI S3.

ModelDataETag -> (строка)

ETag, связанный с URL данных модели.

SupportedTransformInstanceTypes -> (список)

Список типов экземпляров, на которых может быть запущена задача преобразования или на которых можно развернуть конечную точку.

Этот параметр обязателен для невёpсионных моделей и необязателен для версионных моделей.

(строка)

SupportedRealtimeInferenceInstanceTypes -> (список)

Список типов экземпляров, которые используются для генерации выводов в реальном времени.

Этот параметр обязателен для невёpсионных моделей и необязателен для версионных моделей.

(строка)

SupportedContentTypes -> (список)

Поддерживаемые MIME-типы входных данных.

(строка)

SupportedResponseMIMETypes -> (список)

Поддерживаемые MIME-типы выходных данных.

(строка)

ValidationSpecification -> (структура)

Подробности о конфигурациях для одной или нескольких задач обучения, которые SageMaker выполняет для тестирования алгоритма.

ValidationRole -> (строка)

IAM-роли, которые SageMaker использует для выполнения задач обучения.

ValidationProfiles -> (список)

Массив объектов AlgorithmValidationProfile, каждый из которых определяет задачу обучения и задачу пакетного преобразования, которые SageMaker выполняет для проверки вашего алгоритма.

(структура)

Определяет задачу обучения и задачу пакетного преобразования, которые SageMaker выполняет для проверки вашего алгоритма.

Данные, предоставленные в профиле проверки, предоставляются вашим покупателям на Amazon Web Services Marketplace.

ProfileName -> (строка)

Имя профиля для алгоритма. Имя должно иметь от 1 до 63 символов. Допустимыми символами являются a-z, A-Z, 0-9 и - (тире).

TrainingJobDefinition -> (структура)

The TrainingJobDefinition object that describes the training job that SageMaker runs to validate your algorithm.

TrainingInputMode -> (string)

The training input mode that the algorithm supports. For more information about input modes, see Algorithms .

Pipe mode

If an algorithm supports Pipe mode, Amazon SageMaker streams data directly from Amazon S3 to the container.

File mode

If an algorithm supports File mode, SageMaker downloads the training data from S3 to the provisioned ML storage volume, and mounts the directory to the Docker volume for the training container.

You must provision the ML storage volume with sufficient capacity to accommodate the data downloaded from S3. In addition to the training data, the ML storage volume also stores the output model. The algorithm container uses the ML storage volume to also store intermediate information, if any.

For distributed algorithms, training data is distributed uniformly. Your training duration is predictable if the input data objects sizes are approximately the same. SageMaker does not split the files any further for model training. If the object sizes are skewed, training won’t be optimal as the data distribution is also skewed when one host in a training cluster is overloaded, thus becoming a bottleneck in training.

FastFile mode

If an algorithm supports FastFile mode, SageMaker streams data directly from S3 to the container with no code changes, and provides file system access to the data. Users can author their training script to interact with these files as if they were stored on disk.

FastFile mode works best when the data is read sequentially. Augmented manifest files aren’t supported. The startup time is lower when there are fewer files in the S3 bucket provided.

HyperParameters -> (map)

The hyperparameters used for the training job.

key -> (string)

value -> (string)

InputDataConfig -> (list)

An array of Channel objects, each of which specifies an input source.

(structure)

A channel is a named input source that training algorithms can consume.

ChannelName -> (string)

The name of the channel.

DataSource -> (structure)

The location of the channel data.

S3DataSource -> (structure)

The S3 location of the data source that is associated with a channel.

S3DataType -> (string)

If you choose S3Prefix , S3Uri identifies a key name prefix. SageMaker uses all objects that match the specified key name prefix for model training.

If you choose ManifestFile , S3Uri identifies an object that is a manifest file containing a list of object keys that you want SageMaker to use for model training.

If you choose AugmentedManifestFile , S3Uri identifies an object that is an augmented manifest file in JSON lines format. This file contains the data you want to use for model training. AugmentedManifestFile can only be used if the Channel’s input mode is Pipe .

S3Uri -> (string)

Depending on the value specified for the S3DataType , identifies either a key name prefix or a manifest. For example:

  • A key name prefix might look like this: s3://bucketname/exampleprefix/
  • A manifest might look like this: s3://bucketname/example.manifest A manifest is an S3 object which is a JSON file consisting of an array of elements. The first element is a prefix which is followed by one or more suffixes. SageMaker appends the suffix elements to the prefix to get a full set of S3Uri . Note that the prefix must be a valid non-empty S3Uri that precludes users from specifying a manifest whose individual S3Uri is sourced from different S3 buckets. The following code example shows a valid manifest format: [ {"prefix": "s3://customer_bucket/some/prefix/"}, "relative/path/to/custdata-1", "relative/path/custdata-2", ... "relative/path/custdata-N" ] This JSON is equivalent to the following S3Uri list: s3://customer_bucket/some/prefix/relative/path/to/custdata-1 s3://customer_bucket/some/prefix/relative/path/custdata-2 ... s3://customer_bucket/some/prefix/relative/path/custdata-N The complete set of S3Uri in this manifest is the input data for the channel for this data source. The object that each S3Uri points to must be readable by the IAM role that SageMaker uses to perform tasks on your behalf.

Your input bucket must be located in same Amazon Web Services region as your training job.

S3DataDistributionType -> (string)

If you want SageMaker to replicate the entire dataset on each ML compute instance that is launched for model training, specify FullyReplicated .

If you want SageMaker to replicate a subset of data on each ML compute instance that is launched for model training, specify ShardedByS3Key . If there are n ML compute instances launched for a training job, each instance gets approximately 1/n of the number of S3 objects. In this case, model training on each machine uses only the subset of training data.

Don’t choose more ML compute instances for training than available S3 objects. If you do, some nodes won’t get any data and you will pay for nodes that aren’t getting any training data. This applies in both File and Pipe modes. Keep this in mind when developing algorithms.

In distributed training, where you use multiple ML compute EC2 instances, you might choose ShardedByS3Key . If the algorithm requires copying training data to the ML storage volume (when TrainingInputMode is set to File ), this copies 1/n of the number of objects.

AttributeNames -> (list)

A list of one or more attribute names to use that are found in a specified augmented manifest file.

(string)

InstanceGroupNames -> (list)

A list of names of instance groups that get data from the S3 data source.

(string)

ModelAccessConfig -> (structure)

The access configuration file to control access to the ML model. You can explicitly accept the model end-user license agreement (EULA) within the ModelAccessConfig .

  • If you are a Jumpstart user, see the End-user license agreements section for more details on accepting the EULA.
  • If you are an AutoML user, see the Optional Parameters section of Create an AutoML job to fine-tune text generation models using the API for details on How to set the EULA acceptance when fine-tuning a model using the AutoML API .

AcceptEula -> (boolean)

Specifies agreement to the model end-user license agreement (EULA). The AcceptEula value must be explicitly defined as True in order to accept the EULA that this model requires. You are responsible for reviewing and complying with any applicable license terms and making sure they are acceptable for your use case before downloading or using a model.

HubAccessConfig -> (structure)

The configuration for a private hub model reference that points to a SageMaker JumpStart public hub model.

HubContentArn -> (string)

The ARN of your private model hub content. This should be a ModelReference resource type that points to a SageMaker JumpStart public hub model.

FileSystemDataSource -> (structure)

The file system that is associated with a channel.

FileSystemId -> (string)

The file system id.

FileSystemAccessMode -> (string)

The access mode of the mount of the directory associated with the channel. A directory can be mounted either in ro (read-only) or rw (read-write) mode.

FileSystemType -> (string)

The file system type.

DirectoryPath -> (string)

The full path to the directory to associate with the channel.

ContentType -> (string)

The MIME type of the data.

CompressionType -> (string)

If training data is compressed, the compression type. The default value is None . CompressionType is used only in Pipe input mode. In File mode, leave this field unset or set it to None.

RecordWrapperType -> (string)

Specify RecordIO as the value when input data is in raw format but the training algorithm requires the RecordIO format. In this case, SageMaker wraps each individual S3 object in a RecordIO record. If the input data is already in RecordIO format, you don’t need to set this attribute. For more information, see Create a Dataset Using RecordIO .

In File mode, leave this field unset or set it to None.

InputMode -> (string)

(Optional) The input mode to use for the data channel in a training job. If you don’t set a value for InputMode , SageMaker uses the value set for TrainingInputMode . Use this parameter to override the TrainingInputMode setting in a AlgorithmSpecification request when you have a channel that needs a different input mode from the training job’s general setting. To download the data from Amazon Simple Storage Service (Amazon S3) to the provisioned ML storage volume, and mount the directory to a Docker volume, use File input mode. To stream data directly from Amazon S3 to the container, choose Pipe input mode.

To use a model for incremental training, choose File input model.

ShuffleConfig -> (structure)

A configuration for a shuffle option for input data in a channel. If you use S3Prefix for S3DataType , this shuffles the results of the S3 key prefix matches. If you use ManifestFile , the order of the S3 object references in the ManifestFile is shuffled. If you use AugmentedManifestFile , the order of the JSON lines in the AugmentedManifestFile is shuffled. The shuffling order is determined using the Seed value.

For Pipe input mode, shuffling is done at the start of every epoch. With large datasets this ensures that the order of the training data is different for each epoch, it helps reduce bias and possible overfitting. In a multi-node training job when ShuffleConfig is combined with S3DataDistributionType of ShardedByS3Key , the data is shuffled across nodes so that the content sent to a particular node on the first epoch might be sent to a different node on the second epoch.

Seed -> (long)

Determines the shuffling order in ShuffleConfig value.

OutputDataConfig -> (structure)

путь к ведру S3, где вы хотите сохранить артефакты модели. SageMaker создаёт подпапки для артефактов.

KmsKeyId -> (строка)

Ключ управления ключами Amazon Web Services (Amazon Web Services KMS), который SageMaker использует для шифрования артефактов модели в состоянии покоя с помощью шифрования на стороне сервера Amazon S3. KmsKeyId может иметь любой из следующих форматов:

  • // Идентификатор ключа KMS "1234abcd-12ab-34cd-56ef-1234567890ab"
  • // Amazon Resource Name (ARN) ключа KMS "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
  • // Псевдоним ключа KMS "alias/ExampleAlias"
  • // Amazon Resource Name (ARN) псевдонима ключа KMS "arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"

Если вы используете идентификатор ключа KMS или псевдоним вашего ключа KMS, роль выполнения SageMaker должна включать разрешения на вызов kms:Encrypt. Если вы не предоставите идентификатор ключа KMS, SageMaker использует по умолчанию ключ KMS для Amazon S3 для учетной записи вашей роли. Дополнительную информацию см. в разделе Ключи шифрования, управляемые KMS, в руководстве разработчика Amazon Simple Storage Service. Если выходные данные хранятся в Amazon S3 Express One Zone, они шифруются с помощью шифрования на стороне сервера с управляемыми Amazon S3 ключами (SSE-S3). Ключ KMS не поддерживается для Amazon S3 Express One Zone

Политика ключа KMS должна предоставлять разрешение IAM роли, которую вы указываете в запросах CreateTrainingJob, CreateTransformJob или CreateHyperParameterTuningJob. Дополнительную информацию см. в разделе Использование политик ключей в Amazon Web Services KMS в Руководстве разработчика Amazon Web Services Key Management Service.

S3OutputPath -> (строка)

Указывает путь S3, где вы хотите, чтобы SageMaker сохранил артефакты модели. Например, s3://bucket-name/key-name-prefix.

CompressionType -> (строка)

Тип сжатия выходных данных модели. Выберите None, чтобы получить несжатую модель, рекомендуется для больших выходных данных модели. По умолчанию используется gzip.

ResourceConfig -> (структура)

Ресурсы, включая ML вычислительные экземпляры и ML объёмы хранилища, которые будут использоваться для обучения модели.

InstanceType -> (строка)

Тип ML вычислительного экземпляра.

Примечание

Обучение SageMaker на экземплярах Amazon Elastic Compute Cloud (EC2) P4de находится в предварительной версии, начиная с 9 декабря 2022 года.

Экземпляры Amazon EC2 P4de (в настоящее время в предварительной версии) оснащены 8 NVIDIA A100 GPU с 80 ГБ высокопроизводительной оперативной памяти HBM2e GPU, что ускоряет процесс обучения ML моделей, которые необходимо обучать на больших наборах данных с данными высокого разрешения. В этой предварительной версии Amazon SageMaker поддерживает задания обучения ML на экземплярах P4de (ml.p4de.24xlarge), чтобы сократить время обучения модели. ml.p4de.24xlarge экземпляры доступны в следующих регионах Amazon Web Services.
  • США Восточный (Северная Вирджиния) (us-east-1)
  • США Западный (Орегон) (us-west-2)

Для запроса увеличения квоты и начала использования экземпляров P4de обратитесь в службу SageMaker Training через свою команду по обслуживанию аккаунта.

InstanceCount -> (целое число)

Количество ML вычислительных экземпляров для использования. Для распределённого обучения укажите значение больше 1.

VolumeSizeInGB -> (целое число)

Размер ML объёма хранилища, который вы хотите зарезервировать.

ML объёмы хранилища хранят артефакты модели и промежуточные состояния. Алгоритмы обучения также могут использовать ML объём хранилища в качестве временного пространства. Если вы хотите сохранить обучающие данные в ML объёме хранилища, выберите File в качестве TrainingInputMode в спецификации алгоритма.

При использовании ML экземпляра с NVMe SSD объёмами, SageMaker не резервирует хранилище Amazon EBS General Purpose SSD (gp2). Доступное хранилище фиксируется к объёму хранилища экземпляра типа NVMe. SageMaker настраивает пути хранилища для обучающих наборов данных, контрольных точек, артефактов модели и выходных данных, чтобы использовать весь объём хранилища экземпляра. Например, семейства ML экземпляров с NVMe хранилищем экземпляра включают ml.p4d, ml.g4dn и ml.g5.

При использовании ML экземпляра с опцией EBS-только хранилищем и без хранилища экземпляра, вы должны определить размер объёма EBS через VolumeSizeInGB в API ResourceConfig. Например, семейства ML экземпляров, использующих объёмы EBS, включают ml.c5 и ml.p2.

Для поиска типов экземпляров и их типов хранилища экземпляров и объёмов см. Типы экземпляров Amazon EC2.

Чтобы найти стандартные локальные пути, определённые платформой SageMaker для обучения, см. Amazon SageMaker Папки хранилища для обучающих данных, контрольных точек, артефактов моделей и выходных данных.

VolumeKmsKeyId -> (строка)

Ключ управления ключами Amazon Web Services KMS, который SageMaker использует для шифрования данных на объёме хранилища, подключенном к ML вычислительному экземпляру(ам), на котором выполняется задание обучения.

Примечание

Некоторые экземпляры на основе Nitro включают локальное хранилище, в зависимости от типа экземпляра. Объёмы локального хранилища шифруются с помощью аппаратного модуля на экземпляре. Вы не можете запросить VolumeKmsKeyId при использовании типа экземпляра с локальным хранилищем.

Список типов экземпляров, поддерживающих локальное хранилище экземпляра, см. в Объёмы хранилища экземпляра.

Дополнительную информацию о шифровании локального хранилища экземпляра см. в Объёмы хранилища экземпляра SSD.

VolumeKmsKeyId может быть в любом из следующих форматов:

  • // Идентификатор ключа KMS "1234abcd-12ab-34cd-56ef-1234567890ab"
  • // Amazon Resource Name (ARN) ключа KMS "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

KeepAlivePeriodInSeconds -> (целое число)

Продолжительность в секундах сохранения настроенных ресурсов в тёплом пуле для последующих заданий обучения.

InstanceGroups -> (список)

Конфигурация гетерогенного кластера в формате JSON.

(структура)

Определяет группу экземпляров для обучения гетерогенного кластера. При запросе задания обучения с помощью API CreateTrainingJob вы можете настроить несколько групп экземпляров.

InstanceType -> (строка)

Указывает тип экземпляра группы экземпляров.

InstanceCount -> (целое число)

Указывает количество экземпляров группы экземпляров.

InstanceGroupName -> (строка)

Указывает имя группы экземпляров.

TrainingPlanArn -> (строка)

Amazon Resource Name (ARN) плана обучения, который нужно использовать для этой конфигурации ресурсов.

StoppingCondition -> (структура)

Указывает ограничение на длительность работы задания обучения модели. Также указывает, как долго управляемое задание обучения Spot должно завершиться. Когда задание достигнет лимита времени, SageMaker завершает задание обучения. Используйте этот API для ограничения расходов на обучение модели.

Для остановки задания SageMaker отправляет алгоритму сигнал SIGTERM, который задерживает завершение задания на 120 секунд. Алгоритмы могут использовать это 120-секундное окно для сохранения артефактов модели.

MaxRuntimeInSeconds -> (целое число)

Максимальная продолжительность в секундах, в течение которой задание обучения или компиляции может выполняться перед остановкой.

Для заданий компиляции, если задание не завершится в течение этого времени, генерируется ошибка TimeOut. Рекомендуется начать с 900 секунд и увеличивать по мере необходимости, исходя из вашей модели.

Для всех остальных заданий, если задание не завершится в течение этого времени, SageMaker завершает задание. Когда RetryStrategy указано в запросе задания, MaxRuntimeInSeconds указывает максимальное время для всех попыток в целом, а не для каждой отдельной попытки. Значение по умолчанию составляет 1 день. Максимальное значение составляет 28 дней.

Максимальное время, которое может работать TrainingJob в общей сложности, включая любое время, затраченное на публикацию метрик или архивирование и загрузку моделей после остановки, составляет 30 дней.

MaxWaitTimeInSeconds -> (целое число)

Максимальная продолжительность в секундах, в течение которой управляемое задание обучения Spot должно завершиться. Это время ожидания зарезервированных ресурсов Spot плюс время выполнения задания. Оно должно быть равно или больше MaxRuntimeInSeconds. Если задание не завершится в течение этого времени, SageMaker завершает задание.

Когда RetryStrategy указано в запросе задания, MaxWaitTimeInSeconds указывает максимальное время для всех попыток в целом, а не для каждой отдельной попытки.

MaxPendingTimeInSeconds -> (целое число)

Максимальная продолжительность в секундах, в течение которой задание обучения или компиляции может находиться в состоянии ожидания перед остановкой.

Примечание

При работе с заданиями обучения, которые используют ресурсы из планов обучения, не все Pending состояния задания учитываются при подсчёте лимита MaxPendingTimeInSeconds. Следующие сценарии не увеличивают счётчик MaxPendingTimeInSeconds:

  • План находится в состоянии Scheduled: Задания в очереди (в состоянии Pending) до даты начала плана (ожидание запланированного времени начала)
  • Между резервациями ресурсов: Задания временно возвращены в состояние Pending между двумя периодами резервирования ресурсов
MaxPendingTimeInSeconds увеличивается только тогда, когда задания активно ожидают ресурсов в плане Active.

TransformJobDefinition -> (структура)

Объект TransformJobDefinition, описывающий задачу преобразования, которую SageMaker выполняет для проверки вашего алгоритма.

MaxConcurrentTransforms -> (целое число)

Максимальное количество параллельных запросов, которые могут быть отправлены каждому экземпляру в задаче преобразования. Значение по умолчанию — 1.

MaxPayloadInMB -> (целое число)

Максимальный размер полезной нагрузки, разрешённый в МБ. Полезная нагрузка — это часть данных записи (без метаданных).

BatchStrategy -> (строка)

Строка, определяющая количество записей, включённых в один мини-пакет.

SingleRecord означает, что используется только одна запись на мини-пакет. MultiRecord означает, что мини-пакет настроен на включение как можно большего количества записей, которые помещаются в пределы ограничения MaxPayloadInMB.

Environment -> (карта)

Переменные среды для установки в контейнере Docker. Мы поддерживаем до 16 пар ключ-значение в карте.

ключ -> (строка)

значение -> (строка)

TransformInput -> (структура)

Описание источника входных данных и способа потребления его задачей преобразования.

DataSource -> (структура)

Описывает расположение данных канала, то есть расположение входных данных в S3, которые может потреблять модель.

S3DataSource -> (структура)

Расположение данных источника в S3, связанных с каналом.

S3DataType -> (строка)

Если вы выберете S3Prefix , S3Uri идентифицирует префикс имени ключа. Amazon SageMaker использует все объекты с указанным префиксом имени ключа для пакетного преобразования.

Если вы выберете ManifestFile , S3Uri идентифицирует объект, являющийся файлом манифеста, содержащим список ключей объектов, которые вы хотите использовать для пакетного преобразования Amazon SageMaker.

Совместимые значения: ManifestFile , S3Prefix

Несовместимое значение: AugmentedManifestFile

S3Uri -> (строка)

В зависимости от значения, указанного для S3DataType , идентифицирует либо префикс имени ключа, либо манифест. Например:

  • Префикс имени ключа может выглядеть так: s3://bucketname/exampleprefix/.
  • Манифест может выглядеть так: s3://bucketname/example.manifest. Манифест — это объект S3, который представляет собой файл JSON со следующим форматом: [ {"prefix": "s3://customer_bucket/some/prefix/"}, "relative/path/to/custdata-1", "relative/path/custdata-2", ... "relative/path/custdata-N" ] Предыдущий JSON соответствует следующему S3Uris: s3://customer_bucket/some/prefix/relative/path/to/custdata-1 s3://customer_bucket/some/prefix/relative/path/custdata-2 ... s3://customer_bucket/some/prefix/relative/path/custdata-N Полный набор S3Uris в этом манифесте составляет входные данные для канала для данного источника данных. Объект, на который указывает каждый S3Uris, должен быть доступен для IAM-роли, которую Amazon SageMaker использует для выполнения задач от вашего имени.

ContentType -> (строка)

MIME-тип (мультицелевое расширение почтовой службы интернета) данных. Amazon SageMaker использует MIME-тип с каждым HTTP-запросом для передачи данных в задачу преобразования.

CompressionType -> (строка)

Если ваши данные преобразования сжаты, укажите тип сжатия. Amazon SageMaker автоматически распаковывает данные для задачи преобразования соответственно. Значение по умолчанию — None.

SplitType -> (строка)

Метод разделения файлов данных задачи преобразования на меньшие пакеты. Разделение необходимо, когда общий размер каждого объекта слишком большой, чтобы поместиться в одном запросе. Вы также можете использовать разделение данных для повышения производительности, обрабатывая несколько параллельных мини-пакетов. Значение по умолчанию для SplitType — None, что указывает на то, что файлы входных данных не разделены, а полезные нагрузки запросов содержат полное содержимое входного объекта. Установите значение этого параметра в Line, чтобы разделить записи на границах символа новой строки. SplitType также поддерживает ряд двоичных форматов данных, ориентированных на запись. В настоящее время поддерживаются следующие форматы записей:

  • RecordIO
  • TFRecord

При включённом разделении размер мини-пакета зависит от значений параметров BatchStrategy и MaxPayloadInMB. Когда значение BatchStrategy равно MultiRecord, Amazon SageMaker отправляет максимальное количество записей в каждом запросе, до предела MaxPayloadInMB. Если значение BatchStrategy равно SingleRecord, Amazon SageMaker отправляет отдельные записи в каждом запросе.

Примечание

Некоторые форматы данных представляют запись как двоичную полезную нагрузку, обернутую дополнительными байтами заполнения. При применении разделения к двоичному формату данных заполнение удаляется, если значение BatchStrategy установлено в SingleRecord. Заполнение не удаляется, если значение BatchStrategy установлено в MultiRecord.

Дополнительную информацию об RecordIO см. в документации MXNet по созданию набора данных с использованием RecordIO. Дополнительную информацию об TFRecord см. в документации TensorFlow по использованию данных TFRecord.

TransformOutput -> (структура)

Указывает расположение в Amazon S3, куда Amazon SageMaker должно сохранить результаты из задачи преобразования.

S3OutputPath -> (строка)

Путь в Amazon S3, куда вы хотите, чтобы Amazon SageMaker сохранял результаты задачи преобразования. Например, s3://bucket-name/key-name-prefix.

Для каждого объекта S3, используемого в качестве входных данных для задачи преобразования, пакетное преобразование сохраняет преобразованные данные с суффиксом `.``out`` в соответствующей подпапке в расположении в префиксе вывода. Например, для входных данных, хранящихся в s3://bucket-name/input-name-prefix/dataset01/data.csv, пакетное преобразование сохраняет преобразованные данные в s3://bucket-name/output-name-prefix/input-name-prefix/data.csv.out. Пакетное преобразование не загружает частично обработанные объекты. Для входного объекта S3, содержащего несколько записей, он создает файл `.``out`` только в том случае, если задача преобразования успешно выполняется для всего файла. При наличии нескольких объектов S3 пакетная задача преобразования обрабатывает перечисленные объекты S3 и загружает только вывод для успешно обработанных объектов. Если какой-либо объект завершится ошибкой в пакетной задаче преобразования, она помечает задачу как завершившуюся с ошибкой, чтобы вызвать проверку.

Accept -> (строка)

MIME-тип, используемый для указания выходных данных. Amazon SageMaker использует MIME-тип с каждым HTTP-запросом для передачи данных из задачи преобразования.

AssembleWith -> (строка)

Определяет, как собрать результаты задачи преобразования в один объект S3. Выберите формат, который наиболее удобен для вас. Для конкатенации результатов в двоичном формате укажите None. Для добавления символа новой строки в конце каждой преобразованной записи укажите Line.

KmsKeyId -> (строка)

Ключ Amazon Web Services Key Management Service (Amazon Web Services KMS), который Amazon SageMaker использует для шифрования артефактов модели в состоянии покоя с помощью серверного шифрования Amazon S3. KmsKeyId может быть любого из следующих форматов:

  • Идентификатор ключа: 1234abcd-12ab-34cd-56ef-1234567890ab
  • ARN ключа: arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab
  • Имя псевдонима: alias/ExampleAlias
  • ARN псевдонима: arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias

Если вы не предоставите идентификатор ключа KMS, Amazon SageMaker использует ключ KMS по умолчанию для Amazon S3 для учетной записи вашей роли. Дополнительную информацию см. в разделе KMS-управляемые ключи шифрования в руководстве разработчика Amazon Simple Storage Service.

Политика ключа KMS должна предоставить разрешение IAM-роли, которую вы указываете в запросе CreateModel. Дополнительную информацию см. в разделе Использование политик ключей в Amazon Web Services KMS в руководстве разработчика Amazon Web Services Key Management Service.

TransformResources -> (структура)

Идентифицирует ML-вычислительные экземпляры для задачи преобразования.

InstanceType -> (строка)

Тип ML-вычислительного экземпляра для задачи преобразования. Если вы используете встроенные алгоритмы для преобразования умеренно больших наборов данных, мы рекомендуем использовать типы экземпляров ml.m4.xlarge или ml.m5.large.

InstanceCount -> (целое число)

Количество ML-вычислительных экземпляров для использования в задаче преобразования. Значение по умолчанию — 1, максимальное — 100. Для распределённых задач преобразования укажите значение больше 1.

VolumeKmsKeyId -> (строка)

Ключ Amazon Web Services Key Management Service (Amazon Web Services KMS), который Amazon SageMaker использует для шифрования данных модели в объёме хранилища, подключённом к ML-вычислительному экземпляру(ам), на котором выполняется пакетная задача преобразования.

Примечание

Некоторые экземпляры Nitro включают локальное хранилище, в зависимости от типа экземпляра. Локальные объёмы хранилища шифруются с помощью аппаратного модуля на экземпляре. Вы не можете запросить VolumeKmsKeyId при использовании типа экземпляра с локальным хранилищем.

Список типов экземпляров, поддерживающих локальное хранилище экземпляров, см. в разделе Объёмы хранилища экземпляров.

Дополнительную информацию о шифровании локального хранилища экземпляров см. в разделе Объёмы хранилища экземпляров SSD.

VolumeKmsKeyId может быть любого из следующих форматов:

  • Идентификатор ключа: 1234abcd-12ab-34cd-56ef-1234567890ab
  • ARN ключа: arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab
  • Имя псевдонима: alias/ExampleAlias
  • ARN псевдонима: arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias

TransformAmiVersion -> (строка)

Указывает вариант из набора предварительно настроенных изображений Amazon Machine Image (AMI). Каждое изображение настроено Amazon Web Services с набором версий программного обеспечения и драйверов.

al2-ami-sagemaker-batch-gpu-470
  • Ускоритель: GPU

  • Версия драйвера NVIDIA: 470

    al2-ami-sagemaker-batch-gpu-535

  • Ускоритель: GPU

  • Версия драйвера NVIDIA: 535

AlgorithmStatus -> (строка)

Текущий статус алгоритма.

AlgorithmStatusDetails -> (структура)

Подробности о текущем состоянии алгоритма.

ValidationStatuses -> (список)

Статус валидации алгоритма.

(структура)

Представляет общий статус алгоритма.

Name -> (строка)

Название алгоритма, для которого сообщается общий статус.

Status -> (строка)

Текущий статус.

FailureReason -> (строка)

если общий статус Failed, причина ошибки.

ImageScanStatuses -> (список)

Статус сканирования контейнера Docker-изображения алгоритма.

(структура)

Представляет общий статус алгоритма.

Name -> (строка)

Название алгоритма, для которого сообщается общий статус.

Status -> (строка)

Текущий статус.

FailureReason -> (строка)

если общий статус Failed, причина ошибки.

ProductId -> (строка)

Идентификатор продукта алгоритма.

CertifyForMarketplace -> (логическое значение)

Сертифицирован ли алгоритм для размещения в Amazon Web Services Marketplace.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API