Spec-Zone.ru › AWS CLI v2

[ aws . sagemaker ]

describe-training-job

Описание

Возвращает информацию о задании обучения.

Некоторые атрибуты ниже отображаются только в случае успешного запуска задания обучения. Если задание обучения завершается ошибкой, TrainingJobStatus является Failed и, в зависимости от FailureReason, атрибуты, такие как TrainingStartTime, TrainingTimeInSeconds, TrainingEndTime и BillableTimeInSeconds, могут отсутствовать в ответе.

См. также: Документация AWS API

Синтаксис

  describe-training-job
--training-job-name <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--training-job-name (строка)

Имя задания обучения.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверит входные данные команды и вернет пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (булево)

Включить отладку логов.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (булево)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.

--no-paginate (булево)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из вашего файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/выключить вывод цвета.

  • вкл
  • выкл
  • авто

--no-sign-request (булево)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл сертификата CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться блокирующим образом и без таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться блокирующим образом и без таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла непосредственно, независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (булево)

Отключить кли-пагинатор для вывода.

--cli-auto-prompt (булево)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (булево)

Отключить автоматическое запросы параметров ввода CLI.

Вывод

TrainingJobName -> (строка)

Название задачи обучения модели.

TrainingJobArn -> (строка)

Amazon Resource Name (ARN) задачи обучения.

TuningJobArn -> (строка)

Amazon Resource Name (ARN) связанной задачи настройки гиперпараметров, если задача обучения была запущена задачей настройки гиперпараметров.

LabelingJobArn -> (строка)

Amazon Resource Name (ARN) задачи маркировки SageMaker Ground Truth, которая создала задачу преобразования или обучения.

AutoMLJobArn -> (строка)

Amazon Resource Name (ARN) задачи AutoML.

ModelArtifacts -> (структура)

Информация об Amazon S3 расположении, настроенном для хранения артефактов модели.

S3ModelArtifacts -> (строка)

Путь к объекту S3, содержащему артефакты модели. Например, s3://bucket-name/keynameprefix/model.tar.gz .

TrainingJobStatus -> (строка)

Статус задачи обучения.

SageMaker предоставляет следующие статусы задач обучения:

  • InProgress - Обучение в процессе.
  • Completed - Задача обучения завершена.
  • Failed - Задача обучения завершилась с ошибкой. Чтобы увидеть причину ошибки, см. поле FailureReason в ответе на вызов DescribeTrainingJobResponse.
  • Stopping - Задача обучения останавливается.
  • Stopped - Задача обучения остановлена.

Для получения более подробной информации см. SecondaryStatus .

SecondaryStatus -> (строка)

Предоставляет подробную информацию о состоянии задачи обучения. Для получения подробной информации о вторичном статусе задачи обучения см. StatusMessage в разделе SecondaryStatusTransition.

SageMaker предоставляет основные и вторичные статусы, которые применяются к каждому из них:

InProgress
  • Starting - Запуск задачи обучения.

  • Downloading - Необязательная фаза для алгоритмов, которые поддерживают File режим ввода обучения. Указывает, что данные загружаются в объемы ML-хранилища.

  • Training - Обучение в процессе.

  • Interrupted - Задача остановилась, потому что управляемые временные экземпляры были прерваны.

  • Uploading - Обучение завершено, и артефакты модели загружаются в расположение S3.

    Completed

  • Completed - Задача обучения завершена.

    Failed

  • Failed - Задача обучения завершилась с ошибкой. Причина ошибки возвращается в поле FailureReason в DescribeTrainingJobResponse .

    Stopped

  • MaxRuntimeExceeded - Задача остановилась, так как превысила максимальное время выполнения.

  • MaxWaitTimeExceeded - Задача остановилась, так как превысила максимальное время ожидания.

  • Stopped - Задача обучения остановлена.

    Stopping

  • Stopping - Остановка задачи обучения.

Предупреждение

Действительные значения для SecondaryStatus могут изменяться.

Мы больше не поддерживаем следующие вторичные статусы:

  • LaunchingMLInstances
  • PreparingTraining
  • DownloadingTrainingImage

FailureReason -> (строка)

Если задача обучения завершилась с ошибкой, причина ошибки.

HyperParameters -> (карта)

Параметры, специфичные для алгоритма.

key -> (строка)

value -> (строка)

AlgorithmSpecification -> (структура)

Информация об алгоритме, используемом для обучения, и метаданных алгоритма.

TrainingImage -> (строка)

Путь к регистру Docker образа, содержащего алгоритм обучения. Сведения о путях реестра Docker для встроенных алгоритмов SageMaker см. в разделе Docker Registry Paths and Example Code в Руководстве разработчика Amazon SageMaker. SageMaker поддерживает форматы путей изображений registry/repository[:tag] и registry/repository[@digest]. Дополнительную информацию об использовании собственного контейнера обучения см. в разделе Использование собственных алгоритмов с Amazon SageMaker.

Примечание

Вы должны указать либо имя алгоритма для параметра AlgorithmName, либо URI образа алгоритма-контейнера для параметра TrainingImage.

Дополнительную информацию см. в примечании к описанию параметра AlgorithmName.

AlgorithmName -> (строка)

Имя ресурса алгоритма, используемого для задачи обучения. Должен быть ресурсом алгоритма, который вы создали или на который подписались в Amazon Web Services Marketplace.

Примечание

Вы должны указать либо имя алгоритма для параметра AlgorithmName, либо URI образа алгоритма-контейнера для параметра TrainingImage.

Обратите внимание, что параметр AlgorithmName взаимоисключающий с параметром TrainingImage. Если вы указываете значение для параметра AlgorithmName, вы не можете указать значение для TrainingImage, и наоборот.

Если вы указываете значения для обоих параметров, задача обучения может прерваться; если вы не указываете значение ни для одного из параметров, задача обучения может выдать ошибку null.

TrainingInputMode -> (строка)

Режим ввода обучения, поддерживаемый алгоритмом. Дополнительную информацию о режимах ввода см. в разделе Алгоритмы.

Режим канала

Если алгоритм поддерживает режим Pipe, Amazon SageMaker передает данные непосредственно из Amazon S3 в контейнер.

Режим файла

Если алгоритм поддерживает режим File, SageMaker загружает обучающие данные из S3 в выделенный объем ML-хранилища и монтирует каталог в объем Docker для контейнера обучения.

Вы должны выделить объем ML-хранилища с достаточной емкостью для размещения загруженных данных из S3. В дополнение к обучающим данным объем ML-хранилища также хранит выходную модель. Контейнер алгоритма использует объем ML-хранилища для хранения промежуточной информации, если таковая имеется.

Для распределенных алгоритмов обучающие данные распределяются равномерно. Время обучения предсказуемо, если размер объектов входных данных примерно одинаков. SageMaker не разбивает файлы дальше для обучения модели. Если размеры объектов различаются, обучение не будет оптимальным, так как распределение данных также будет неравномерным, когда один хост в кластере обучения перегружен, тем самым становясь узким местом в процессе обучения.

Режим FastFile

Если алгоритм поддерживает режим FastFile, SageMaker передает данные напрямую из S3 в контейнер без внесения изменений в код и предоставляет файловый доступ к данным. Пользователи могут написать свою программу обучения, чтобы взаимодействовать с этими файлами так, как если бы они хранились на диске.

Режим FastFile лучше всего работает, когда данные читаются последовательно. Расширенные файлы-манифесты не поддерживаются. Время запуска меньше, когда в ведре S3 меньше файлов.

MetricDefinitions -> (список)

Список объектов определения метрик. Каждый объект указывает имя метрики и регулярные выражения, используемые для анализа журналов алгоритма. SageMaker публикует каждую метрику в Amazon CloudWatch.

(структура)

Определяет метрику, которую алгоритм обучения записывает в stderr или stdout. Вы можете просмотреть эти журналы, чтобы понять, как выполняется ваша задача обучения, и проверить наличие ошибок, возникших во время обучения. SageMaker настройка гиперпараметров захватывает все определенные метрики. Укажите одну из определенных метрик в качестве целевой метрики с помощью параметра TuningObjective в API HyperParameterTrainingJobDefinition, чтобы оценить производительность задачи во время настройки гиперпараметров.

Name -> (строка)

Название метрики.

Regex -> (строка)

Регулярное выражение, которое ищет выходные данные задачи обучения и получает значение метрики. Дополнительную информацию об использовании регулярных выражений для определения метрик см. в разделе Определение метрик и переменных среды.

EnableSageMakerMetricsTimeSeries -> (булево)

Чтобы генерировать и сохранять метрики временных рядов во время обучения, установите в true. По умолчанию значение false, и метрики временных рядов не генерируются, за исключением следующих случаев:

  • Вы используете один из встроенных алгоритмов SageMaker
  • Вы используете один из следующих предварительно настроенных образов SageMaker Docker:
    • Tensorflow (версия >= 1.15)
    • MXNet (версия >= 1.6)
    • PyTorch (версия >= 1.3)
  • Вы указали хотя бы одно MetricDefinition

ContainerEntrypoint -> (список)

Сценарий точки входа для контейнера Docker, используемого для выполнения задачи обучения. Этот сценарий имеет приоритет над инструкциями по обработке обучения по умолчанию. Дополнительную информацию см. в разделе Как Amazon SageMaker выполняет ваш образ обучения.

(строка)

ContainerArguments -> (список)

Аргументы для контейнера, используемого для выполнения задачи обучения. Дополнительную информацию см. в разделе Как Amazon SageMaker выполняет ваш образ обучения.

(строка)

TrainingImageConfig -> (структура)

Настройка для использования образа из частного реестра Docker для задачи обучения.

TrainingRepositoryAccessMode -> (строка)

Метод, который ваша задача обучения будет использовать для доступа к изображениям в вашем частном реестре Docker. Для доступа к изображению в частном реестре Docker установите в Vpc.

TrainingRepositoryAuthConfig -> (структура)

Объект, содержащий информацию об аутентификации для частного реестра Docker, содержащего ваши обучающие изображения.

TrainingRepositoryCredentialsProviderArn -> (строка)

Amazon Resource Name (ARN) функции Amazon Web Services Lambda, используемой для предоставления SageMaker учетных данных доступа к вашему частному реестру Docker.

RoleArn -> (строка)

Настроенная роль Amazon Web Services Identity and Access Management (IAM) для задачи обучения.

InputDataConfig -> (список)

Массив объектов Channel, описывающих каждый канал ввода данных.

(структура)

Канал — это именованный источник ввода, который могут потреблять алгоритмы обучения.

ChannelName -> (строка)

Имя канала.

DataSource -> (структура)

Расположение данных канала.

S3DataSource -> (структура)

Расположение данных источника в S3, связанного с каналом.

S3DataType -> (строка)

Если вы выберете S3Prefix, S3Uri идентифицирует префикс имени ключа. SageMaker использует все объекты, соответствующие заданному префиксу имени ключа, для обучения модели.

Если вы выберете ManifestFile, S3Uri идентифицирует объект, представляющий собой файл манифеста, содержащий список ключей объектов, которые вы хотите использовать для обучения модели SageMaker.

Если вы выберете AugmentedManifestFile, S3Uri идентифицирует объект, представляющий собой расширенный файл манифеста в формате JSON-строк. Этот файл содержит данные, которые вы хотите использовать для обучения модели. AugmentedManifestFile может использоваться только в том случае, если режим ввода канала — Pipe.

S3Uri -> (строка)

В зависимости от значения, указанного для S3DataType, идентифицирует либо префикс имени ключа, либо манифест. Например:

  • Префикс имени ключа может выглядеть так: s3://bucketname/exampleprefix/
  • Манифест может выглядеть так: s3://bucketname/example.manifest Манифест — это объект S3, являющийся JSON-файлом, состоящим из массива элементов. Первый элемент — это префикс, за которым следуют один или несколько суффиксов. SageMaker добавляет суффиксные элементы к префиксу, чтобы получить полный набор S3Uri. Обратите внимание, что префикс должен быть допустимым ненулевым S3Uri, что предотвращает пользователям от указания манифеста, в котором отдельные S3Uri берутся из разных ведер S3. Следующий пример кода показывает допустимый формат манифеста: [ {"prefix": "s3://customer_bucket/some/prefix/"}, "relative/path/to/custdata-1", "relative/path/custdata-2", ... "relative/path/custdata-N" ] Этот JSON эквивалентен следующему списку S3Uri: s3://customer_bucket/some/prefix/relative/path/to/custdata-1 s3://customer_bucket/some/prefix/relative/path/custdata-2 ... s3://customer_bucket/some/prefix/relative/path/custdata-N Полный набор S3Uri в этом манифесте представляет собой входные данные канала для этого источника данных. Объект, на который указывает каждый S3Uri, должен быть доступен для роли IAM, которую SageMaker использует для выполнения задач от вашего имени.

Ваше ведро ввода должно находиться в том же регионе Amazon Web Services, что и ваша задача обучения.

S3DataDistributionType -> (строка)

Если вы хотите, чтобы SageMaker реплицировал весь набор данных на каждом экземпляре вычислительных ресурсов ML, запущенном для обучения модели, укажите FullyReplicated.

Если вы хотите, чтобы SageMaker реплицировал подмножество данных на каждом экземпляре вычислительных ресурсов ML, запущенном для обучения модели, укажите ShardedByS3Key. Если запущено n экземпляров вычислительных ресурсов ML для задачи обучения, каждый экземпляр получает примерно 1/n от количества объектов S3. В этом случае обучение модели на каждой машине использует только подмножество обучающих данных.

Не выбирайте больше экземпляров вычислительных ресурсов ML для обучения, чем доступных объектов S3. В противном случае некоторые узлы не получат данные, и вы будете платить за узлы, не получающие обучающие данные. Это относится как к режимам «Файлы», так и «Поток». Учитывайте это при разработке алгоритмов.

В распределенном обучении, где вы используете несколько экземпляров EC2 вычислительных ресурсов ML, вы можете выбрать ShardedByS3Key. Если алгоритм требует копирования обучающих данных на том ML хранилище (когда TrainingInputMode установлено на File), это копирует 1/n от количества объектов.

AttributeNames -> (список)

Список одного или нескольких имён атрибутов, которые необходимо использовать, найденных в указанном расширенном файле манифеста.

(строка)

InstanceGroupNames -> (список)

Список имён групп экземпляров, которые получают данные из источника данных S3.

(строка)

ModelAccessConfig -> (структура)

Конфигурация доступа к файлу ML модели. Вы можете явно принять лицензионное соглашение конечного пользователя (EULA) модели в ModelAccessConfig.

  • Если вы пользователь Jumpstart, см. раздел «Лицензионные соглашения конечных пользователей» для получения дополнительной информации об акцепте EULA.
  • Если вы пользователь AutoML, см. раздел «Дополнительные параметры» в разделе «Создание задачи AutoML для дообучения моделей генерации текста с помощью API» для получения подробностей о том, как установить принятие EULA при дообучении модели с помощью API AutoML.

AcceptEula -> (булево)

Указывает на согласие с лицензионным соглашением конечного пользователя (EULA) модели. Значение AcceptEula должно быть явно определено как True, чтобы принять EULA, требуемое этой моделью. Вы несете ответственность за ознакомление с любыми применимыми лицензионными условиями и убедитесь, что они приемлемы для вашего случая использования, прежде чем загружать или использовать модель.

HubAccessConfig -> (структура)

Настройка для ссылки на модель частного хранилища, которая указывает на общедоступную модель SageMaker JumpStart.

HubContentArn -> (строка)

ARN вашего контента модели частного хранилища. Это должен быть тип ресурса ModelReference, который указывает на общедоступную модель SageMaker JumpStart.

FileSystemDataSource -> (структура)

Файловая система, связанная с каналом.

FileSystemId -> (строка)

Идентификатор файловой системы.

FileSystemAccessMode -> (строка)

Режим доступа к каталогу, связанному с каналом. Каталог может быть смонтирован в режиме ro (только чтение) или rw (чтение и запись).

FileSystemType -> (строка)

Тип файловой системы.

DirectoryPath -> (строка)

Полный путь к каталогу, который необходимо связать с каналом.

ContentType -> (строка)

Тип MIME данных.

CompressionType -> (строка)

Если обучающие данные сжаты, тип сжатия. Значение по умолчанию — None. CompressionType используется только в режиме ввода «Поток». В режиме «Файлы» оставьте это поле пустым или установите его в значение None.

RecordWrapperType -> (строка)

Установите RecordIO, когда входные данные находятся в сыром формате, но алгоритм обучения требует формата RecordIO. В этом случае SageMaker упаковывает каждый отдельный объект S3 в запись RecordIO. Если входные данные уже находятся в формате RecordIO, устанавливать этот атрибут не нужно. Для получения дополнительной информации см. Создание набора данных с помощью RecordIO.

В режиме «Файлы» оставьте это поле пустым или установите его в значение None.

InputMode -> (строка)

(Необязательно) Режим ввода для канала данных в задаче обучения. Если вы не зададите значение для InputMode, SageMaker использует значение, заданное для TrainingInputMode. Используйте этот параметр для переопределения настройки TrainingInputMode в запросе AlgorithmSpecification, когда у вас есть канал, который требует другого режима ввода, чем общий режим задачи обучения. Для загрузки данных из Amazon Simple Storage Service (Amazon S3) в выделенное хранилище ML и подключения каталога к Docker-объёму, используйте режим ввода File. Для потоковой передачи данных напрямую из Amazon S3 в контейнер выберите режим ввода Pipe.

Для использования модели для инкрементного обучения выберите режим ввода File.

ShuffleConfig -> (структура)

Конфигурация для опции перемешивания входных данных в канале. Если вы используете S3Prefix для S3DataType, это перемешивает результаты совпадений префиксов ключей S3. Если вы используете ManifestFile, порядок ссылок на объекты S3 в ManifestFile перемешивается. Если вы используете AugmentedManifestFile, порядок JSON-строк в AugmentedManifestFile перемешивается. Порядок перемешивания определяется значением Seed.

Для режима ввода «Поток» перемешивание выполняется в начале каждой эпохи. С большими наборами данных это гарантирует, что порядок обучающих данных отличается для каждой эпохи, что помогает уменьшить смещение и возможный переобучение. В многоузловой задаче обучения, когда ShuffleConfig комбинируется с S3DataDistributionType из ShardedByS3Key, данные перемешиваются между узлами, так что контент, отправленный на конкретный узел в первой эпохе, может быть отправлен на другой узел во второй эпохе.

Seed -> (целое число)

Определяет порядок перемешивания в значении ShuffleConfig.

OutputDataConfig -> (структура)

Путь S3, где хранятся артефакты модели, которые вы настроили при создании задачи. SageMaker создаёт подкаталоги для артефактов модели.

KmsKeyId -> (строка)

Ключ Amazon Web Services Key Management Service (Amazon Web Services KMS), который SageMaker использует для шифрования артефактов модели в состоянии покоя с использованием Amazon S3 шифрования на стороне сервера. KmsKeyId может иметь любой из следующих форматов:

  • // Идентификатор ключа KMS "1234abcd-12ab-34cd-56ef-1234567890ab"
  • // Amazon Resource Name (ARN) ключа KMS "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
  • // Псевдоним ключа KMS "alias/ExampleAlias"
  • // Amazon Resource Name (ARN) псевдонима ключа KMS "arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"

Если вы используете идентификатор ключа KMS или псевдоним ключа KMS, роль выполнения SageMaker должна включать разрешения на вызов kms:Encrypt. Если вы не предоставите идентификатор ключа KMS, SageMaker использует по умолчанию ключ KMS Amazon S3 для учетной записи вашей роли. Для получения дополнительной информации см. Ключи шифрования, управляемые KMS, в руководстве разработчика Amazon Simple Storage Service. Если выходные данные хранятся в Amazon S3 Express One Zone, они шифруются с помощью шифрования на стороне сервера Amazon S3 с управляемыми ключами (SSE-S3). Ключ KMS не поддерживается для Amazon S3 Express One Zone.

Политика ключа KMS должна предоставлять разрешение IAM-роли, которую вы указали в ваших запросах CreateTrainingJob, CreateTransformJob или CreateHyperParameterTuningJob. Для получения дополнительной информации см. Использование политик ключей в Amazon Web Services KMS в руководстве разработчика Amazon Web Services Key Management Service.

S3OutputPath -> (строка)

Указывает путь S3, куда вы хотите, чтобы SageMaker сохранял артефакты модели. Например, s3://bucket-name/key-name-prefix.

CompressionType -> (строка)

Тип сжатия выходных данных модели. Выберите None для вывода не сжатой модели, рекомендуется для больших выходных данных модели. По умолчанию используется gzip.

ResourceConfig -> (структура)

Ресурсы, включая экземпляры вычислительных мощностей ML и объемы хранилища ML, настроенные для обучения моделей.

InstanceType -> (строка)

Тип экземпляра вычислительных мощностей ML.

Примечание

Обучение моделей SageMaker на экземплярах Amazon Elastic Compute Cloud (EC2) P4de находится в предварительной версии, начиная с 9 декабря 2022 года.

Экземпляры Amazon EC2 P4de (в настоящее время в предварительной версии) оснащены 8 графическими процессорами NVIDIA A100 с 80 ГБ высокопроизводительной памяти HBM2e GPU, что ускоряет скорость обучения моделей ML, которые необходимо обучать на больших наборах данных с высоким разрешением. В этой предварительной версии Amazon SageMaker поддерживает задания обучения ML на экземплярах P4de (ml.p4de.24xlarge ), чтобы сократить время обучения моделей. Экземпляры ml.p4de.24xlarge доступны в следующих регионах Amazon Web Services.
  • US East (N. Virginia) (us-east-1)
  • US West (Oregon) (us-west-2)

Для запроса увеличения квоты и начала использования экземпляров P4de обратитесь в команду службы SageMaker Training через вашу команду по работе с аккаунтом.

InstanceCount -> (целое число)

Количество экземпляров вычислительных мощностей ML для использования. Для распределенного обучения укажите значение больше 1.

VolumeSizeInGB -> (целое число)

Размер тома хранилища ML, который вы хотите предоставить.

Тома хранилища ML хранят артефакты моделей и промежуточные состояния. Алгоритмы обучения также могут использовать том хранилища ML для временного хранения данных. Если вы хотите хранить данные обучения в томе хранилища ML, выберите File в качестве TrainingInputMode в спецификации алгоритма.

При использовании экземпляра ML с объемами NVMe SSD SageMaker не предоставляет хранилище Amazon EBS General Purpose SSD (gp2). Доступное хранилище фиксировано для емкости хранилища экземпляра типа NVMe. SageMaker настраивает пути хранилища для наборов данных обучения, контрольных точек, артефактов модели и вывода, чтобы использовать всю емкость хранилища экземпляра. Например, семейства экземпляров ML с хранилищем экземпляров типа NVMe включают ml.p4d , ml.g4dn и ml.g5 .

При использовании экземпляра ML с вариантом хранения только EBS и без хранения экземпляра вы должны определить размер тома EBS с помощью VolumeSizeInGB в API ResourceConfig . Например, семейства экземпляров ML, использующие объемы EBS, включают ml.c5 и ml.p2 .

Для поиска типов экземпляров и их типов хранилища экземпляров и объемов см. Amazon EC2 Instance Types.

Чтобы найти стандартные локальные пути, определенные платформой SageMaker Training, см. Amazon SageMaker Training Storage Folders for Training Datasets, Checkpoints, Model Artifacts, and Outputs.

VolumeKmsKeyId -> (строка)

Ключ KMS Amazon Web Services, который SageMaker использует для шифрования данных на томе хранилища, подключенном к экземпляру(ам) вычислительных мощностей ML, на котором выполняется задание обучения.

Примечание

Некоторые экземпляры на основе Nitro включают локальное хранилище, в зависимости от типа экземпляра. Локальные объемы хранилища шифруются с помощью аппаратного модуля на экземпляре. Вы не можете запросить VolumeKmsKeyId при использовании типа экземпляра с локальным хранилищем.

Список типов экземпляров, которые поддерживают локальное хранилище экземпляра, см. в Instance Store Volumes.

Дополнительную информацию о шифровании локального хранилища экземпляра см. в SSD Instance Store Volumes.

Ключ VolumeKmsKeyId может быть в одном из следующих форматов:

  • // Идентификатор ключа KMS "1234abcd-12ab-34cd-56ef-1234567890ab"
  • // Amazon Resource Name (ARN) ключа KMS "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

KeepAlivePeriodInSeconds -> (целое число)

Продолжительность в секундах хранения настроенных ресурсов в пуле подогрева для последующих заданий обучения.

InstanceGroups -> (список)

Настройка гетерогенного кластера в формате JSON.

(структура)

Определяет группу экземпляров для обучения гетерогенного кластера. При запросе задания обучения с помощью API CreateTrainingJob вы можете настроить несколько групп экземпляров.

InstanceType -> (строка)

Указывает тип экземпляра группы экземпляров.

InstanceCount -> (целое число)

Указывает количество экземпляров группы экземпляров.

InstanceGroupName -> (строка)

Указывает имя группы экземпляров.

TrainingPlanArn -> (строка)

Amazon Resource Name (ARN) используемого плана обучения для этой конфигурации ресурсов.

WarmPoolStatus -> (структура)

Статус пула подогрева, связанного с заданием обучения.

Status -> (строка)

Статус пула подогрева.

  • InUse : Пул подогрева используется для задания обучения.
  • Available : Пул подогрева доступен для повторного использования для соответствующего задания обучения.
  • Reused : Пул подогрева перешел к соответствующему заданию обучения для повторного использования.
  • Terminated : Пул подогрева больше недоступен. Пулы подогрева недоступны, если они были завершены пользователем, завершены для обновления патча или завершены за превышение указанного KeepAlivePeriodInSeconds .

ResourceRetainedBillableTimeInSeconds -> (целое число)

Время, подлежащее оплате, в секундах, используемое пулом подогрева. Время, подлежащее оплате, относится к абсолютному времени реальных часов.

Умножьте ResourceRetainedBillableTimeInSeconds на количество экземпляров (InstanceCount ) в вашем кластере обучения, чтобы получить общее время вычислений, за которое SageMaker выставит вам счет, если вы запустите обучение с пулом подогрева. Формула следующая: ResourceRetainedBillableTimeInSeconds * InstanceCount .

ReusedByJob -> (строка)

Имя соответствующего задания обучения, которое повторно использовало пул подогрева.

VpcConfig -> (структура)

Объект VpcConfig, который определяет VPC, к которому имеет доступ это задание обучения. Дополнительную информацию см. в Protect Training Jobs by Using an Amazon Virtual Private Cloud.

SecurityGroupIds -> (список)

Идентификаторы групп безопасности VPC в формате sg-xxxxxxxx . Укажите группы безопасности для VPC, указанного в поле Subnets .

(строка)

Subnets -> (список)

Идентификатор подсетей в VPC, к которому вы хотите подключить свое задание обучения или модель. Сведения о доступности конкретных типов экземпляров см. в Supported Instance Types and Availability Zones.

(строка)

StoppingCondition -> (структура)

Определяет ограничение по времени выполнения задания обучения модели. Также определяет время, в течение которого управляемое задание обучения Spot должно завершиться. Когда задание достигнет лимита по времени, SageMaker завершит задание обучения. Используйте этот API для ограничения затрат на обучение модели.

Для остановки задания SageMaker отправляет алгоритму сигнал SIGTERM, что откладывает завершение задания на 120 секунд. Алгоритмы могут использовать этот 120-секундный интервал для сохранения артефактов модели, чтобы результаты обучения не были потеряны.

MaxRuntimeInSeconds -> (целое число)

Максимальное время работы задания обучения или компиляции в секундах, прежде чем оно будет остановлено.

Для заданий компиляции, если задание не завершается в течение этого времени, генерируется ошибка TimeOut. Рекомендуется начать с 900 секунд и увеличивать по мере необходимости в зависимости от вашей модели.

Для всех остальных заданий, если задание не завершается в течение этого времени, SageMaker завершает задание. Если RetryStrategy указано в запросе задания, MaxRuntimeInSeconds определяет максимальное время для всех попыток в совокупности, а не для каждой отдельной попытки. Значение по умолчанию составляет 1 день. Максимальное значение составляет 28 дней.

Максимальное время работы задания TrainingJob в целом, включая время, затраченное на публикацию метрик или архивирование и загрузку моделей после его остановки, составляет 30 дней.

MaxWaitTimeInSeconds -> (целое число)

Максимальное время ожидания, в секундах, для завершения управляемого задания обучения Spot. Это время, затрачиваемое на ожидание емкости Spot плюс время выполнения задания. Оно должно быть равно или больше MaxRuntimeInSeconds . Если задание не завершается в течение этого времени, SageMaker завершает задание.

Если RetryStrategy указано в запросе задания, MaxWaitTimeInSeconds определяет максимальное время для всех попыток в совокупности, а не для каждой отдельной попытки.

MaxPendingTimeInSeconds -> (целое число)

Максимальная длительность ожидания задания обучения или компиляции в секундах, прежде чем оно будет остановлено.

Примечание

При работе с заданиями обучения, которые используют емкость из планов обучения, не все состояния заданий Pending учитываются при лимите MaxPendingTimeInSeconds . Следующие сценарии не увеличивают счетчик MaxPendingTimeInSeconds:

  • План находится в состоянии Scheduled: Задания в очереди (в состоянии Pending) до даты начала плана (ожидание запланированного времени начала)
  • Между резервациями емкости: Задания временно возвращаются в состояние Pending между двумя периодами резервирования емкости
MaxPendingTimeInSeconds увеличивается только тогда, когда задания активно ожидают емкости в плане Active.

CreationTime -> (временная метка)

Временная метка, указывающая время создания задания обучения.

TrainingStartTime -> (временная метка)

Указывает время начала задания обучения на экземплярах обучения. Вы оплачиваете за временной интервал между этим временем и значением TrainingEndTime. Время начала в CloudWatch Logs может быть позже этого времени. Разница объясняется временем загрузки данных обучения и размером контейнера обучения.

TrainingEndTime -> (временная метка)

Указывает время завершения задания обучения на экземплярах обучения. Вы оплачиваете за временной интервал между значением TrainingStartTime и этим временем. Для успешных заданий и остановленных заданий это время после загрузки артефактов модели. Для неудачных заданий это время, когда SageMaker обнаруживает ошибку задания.

LastModifiedTime -> (временная метка)

Временная метка, указывающая время последнего изменения статуса задания обучения.

SecondaryStatusTransitions -> (список)

История всех вторичных статусов, через которые прошел процесс обучения.

(структура)

Элемент массива SecondaryStatusTransitions для DescribeTrainingJob. Он предоставляет дополнительные сведения о статусе, через который прошел процесс обучения. Процесс обучения может находиться в одном из нескольких состояний, например, запуска, загрузки, обучения или загрузки. Внутри каждого состояния существует ряд промежуточных состояний. Например, в состоянии запуска SageMaker может запускать процесс обучения или запускать экземпляры ML. Эти переходные состояния называются вторичным статусом процесса.

Status -> (строка)

Содержит информацию о вторичном статусе процесса обучения.

Статус может быть одним из следующих вторичных статусов:

InProgress
  • Starting — Запуск процесса обучения.

  • Downloading — Необязательная фаза для алгоритмов, поддерживающих режим входных данных File обучения. Указывает, что данные загружаются на объемы хранилища ML.

  • Training — Обучение в процессе.

  • Uploading — Обучение завершено, и артефакты модели загружаются в расположение S3.

    Completed

  • Completed — Процесс обучения завершен.

    Failed

  • Failed — Процесс обучения завершился неудачно. Причина сбоя возвращается в поле FailureReason объекта DescribeTrainingJobResponse.

    Stopped

  • MaxRuntimeExceeded — Задание остановлено из-за превышения максимального времени выполнения.

  • Stopped — Процесс обучения остановлен.

    Stopping

  • Stopping — Остановка процесса обучения.

Мы больше не поддерживаем следующие вторичные статусы:

  • LaunchingMLInstances
  • PreparingTrainingStack
  • DownloadingTrainingImage

StartTime -> (метка времени)

Метка времени, показывающая момент перехода процесса обучения в текущее состояние вторичного статуса.

EndTime -> (метка времени)

Метка времени, показывающая момент перехода процесса обучения из данного вторичного состояния в другое вторичное состояние или завершения процесса обучения.

StatusMessage -> (строка)

Подробное описание хода выполнения в рамках вторичного статуса.

SageMaker предоставляет вторичные статусы и сообщения о статусе, которые применяются к каждому из них:

Starting
  • Запуск процесса обучения.

  • Запуск запрошенных экземпляров ML.

  • Ошибка недостаточной емкости EC2 при запуске экземпляров, попытка повторного запуска!

  • Неудачный экземпляр, заменяется новым!

  • Подготовка экземпляров для обучения.

    Training

  • Загрузка изображения обучения завершена. Обучение в процессе.

Предупреждение

Сообщения о статусе могут быть изменены. Поэтому рекомендуется не включать их в код, который программно запускает действия. Например, не используйте сообщения о статусе в операторах if.

Для получения общего представления о ходе вашего процесса обучения, просмотрите TrainingJobStatus и SecondaryStatus в DescribeTrainingJob, и StatusMessage вместе. Например, в начале процесса обучения вы можете увидеть следующее:

  • TrainingJobStatus - InProgress
  • SecondaryStatus - Training
  • StatusMessage - Загрузка изображения обучения

FinalMetricDataList -> (список)

Коллекция объектов MetricData, которые указывают имена, значения и даты/времена, которые алгоритм обучения отправил в Amazon CloudWatch.

(структура)

Имя, значение и дата/время метрики, которая была отправлена в Amazon CloudWatch.

MetricName -> (строка)

Имя метрики.

Value -> (вещественное число)

Значение метрики.

Timestamp -> (метка времени)

Дата и время, когда алгоритм отправил метрику.

EnableNetworkIsolation -> (булево)

Если вы хотите разрешить входящие или исходящие сетевые вызовы, за исключением вызовов между узлами в кластере обучения для распределенного обучения, выберите True. Если вы включите изоляцию сети для процессов обучения, настроенных на использование VPC, SageMaker загружает и загружает данные клиентов и артефакты моделей через указанную VPC, но контейнер обучения не имеет сетевого доступа.

EnableInterContainerTrafficEncryption -> (булево)

Чтобы зашифровать все коммуникации между экземплярами вычислительных ресурсов ML в распределенном обучении, выберите True. Шифрование обеспечивает большую безопасность для распределенного обучения, но обучение может занять больше времени. Время зависит от объема обмена данными между экземплярами вычислительных ресурсов, особенно если вы используете алгоритмы глубокого обучения в распределенном обучении.

EnableManagedSpotTraining -> (булево)

Булево значение, указывающее, включено ли управляемое обучение на спотовых экземплярах (True) или нет (False).

CheckpointConfig -> (структура)

Содержит информацию о месте вывода данных контрольных точек управляемого обучения на спотовых экземплярах.

S3Uri -> (строка)

Указывает путь S3, где вы хотите, чтобы SageMaker сохранял контрольные точки. Например, s3://bucket-name/key-name-prefix.

LocalPath -> (строка)

(Необязательно) Локальный каталог, в котором сохраняются контрольные точки. По умолчанию это /opt/ml/checkpoints/.

TrainingTimeInSeconds -> (целое число)

Время обучения в секундах.

BillableTimeInSeconds -> (целое число)

Время счета в секундах. Время счета относится к абсолютному времени реальных часов.

Умножьте BillableTimeInSeconds на количество экземпляров (InstanceCount) в вашем кластере обучения, чтобы получить общее время вычислений, за которое SageMaker взимает плату, если вы выполняете распределенное обучение. Формула следующая: BillableTimeInSeconds * InstanceCount.

Вы можете рассчитать экономию от использования управляемого обучения на спотовых экземплярах по формуле (1 - BillableTimeInSeconds / TrainingTimeInSeconds) * 100. Например, если BillableTimeInSeconds равно 100, а TrainingTimeInSeconds равно 500, экономия составит 80%.

DebugHookConfig -> (структура)

Конфигурационная информация для параметров фиксатора отладки Amazon SageMaker, метрик и тензорных коллекций, а также путей к хранилищу. Чтобы узнать больше о том, как настроить параметр DebugHookConfig, см. Используйте API-интерфейсы конфигурации SageMaker и Debugger для создания, обновления и отладки задачи обучения.

LocalPath -> (строка)

Путь к локальному расположению хранения метрик и тензоров. По умолчанию это /opt/ml/output/tensors/.

S3OutputPath -> (строка)

Путь к расположению хранилища Amazon S3 для метрик и тензоров.

HookParameters -> (отображение)

Конфигурационная информация для параметров фиксатора отладки Amazon SageMaker.

key -> (строка)

value -> (строка)

CollectionConfigurations -> (список)

Конфигурационная информация для коллекций тензоров Amazon SageMaker Debugger. Чтобы узнать больше о том, как настроить параметр CollectionConfiguration, см. Используйте API-интерфейсы конфигурации SageMaker и Debugger для создания, обновления и отладки задачи обучения.

(структура)

Конфигурационная информация для коллекций тензоров вывода Amazon SageMaker Debugger.

CollectionName -> (строка)

Имя коллекции тензоров. Имя должно быть уникальным относительно других имен конфигураций правил.

CollectionParameters -> (отображение)

Значения параметров для коллекции тензоров. Разрешенные параметры — "name", "include_regex", "reduction_config", "save_config", "tensor_names" и "save_histogram".

key -> (строка)

value -> (строка)

ExperimentConfig -> (структура)

Связывает задачу SageMaker в качестве компонента испытания с экспериментом и испытанием. Указывается при вызове следующих API:

  • CreateProcessingJob
  • CreateTrainingJob
  • CreateTransformJob

ExperimentName -> (строка)

Имя существующего эксперимента для связи с компонентом испытания.

TrialName -> (строка)

Имя существующего испытания для связи компонента испытания с ним. Если не указано, создается новое испытание.

TrialComponentDisplayName -> (строка)

Имя отображения компонента испытания. Если этот ключ не указан, имя отображения — это имя компонента испытания.

RunName -> (строка)

Имя экспериментального запуска для связи с компонентом испытания.

DebugRuleConfigurations -> (список)

Конфигурационная информация для правил отладки Amazon SageMaker Debugger для отладки тензоров вывода.

(структура)

Конфигурационная информация для правил отладки SageMaker Debugger. Чтобы узнать больше о том, как настроить параметр DebugRuleConfiguration, см. Используйте API-интерфейсы конфигурации SageMaker и Debugger для создания, обновления и отладки задачи обучения.

RuleConfigurationName -> (строка)

Имя конфигурации правила. Оно должно быть уникальным относительно других имен конфигураций правил.

LocalPath -> (строка)

Путь к локальному расположению хранения вывода правил. По умолчанию это /opt/ml/processing/output/rule/.

S3OutputPath -> (строка)

Путь к расположению хранилища Amazon S3 для правил.

RuleEvaluatorImage -> (строка)

Изображение Amazon Elastic Container (ECR) для управляемой оценки правила.

InstanceType -> (строка)

Тип экземпляра для развертывания пользовательского правила отладки процесса обучения.

VolumeSizeInGB -> (целое число)

Размер объема хранилища ML, подключенного к экземпляру обработки, в ГБ.

RuleParameters -> (отображение)

Конфигурация времени выполнения для контейнера правила.

key -> (строка)

value -> (строка)

TensorBoardOutputConfig -> (структура)

Настройка расположений хранения данных вывода TensorBoard Amazon SageMaker Debugger.

LocalPath -> (строка)

Путь к локальному расположению хранения вывода tensorBoard. По умолчанию это /opt/ml/output/tensorboard.

S3OutputPath -> (строка)

Путь к расположению хранилища Amazon S3 для вывода TensorBoard.

DebugRuleEvaluationStatuses -> (список)

Статус оценки правил Amazon SageMaker Debugger для отладки на задаче обучения.

(структура)

Информация о статусе оценки правила.

RuleConfigurationName -> (строка)

Имя конфигурации правила.

RuleEvaluationJobArn -> (строка)

Amazon Resource Name (ARN) задания оценки правила.

RuleEvaluationStatus -> (строка)

Статус оценки правила.

StatusDetails -> (строка)

Подробности оценки правила.

LastModifiedTime -> (отметка времени)

Отметка времени последнего изменения статуса оценки правила.

ProfilerConfig -> (структура)

Конфигурационная информация для мониторинга системы Amazon SageMaker Debugger, профилирования фреймворка и путей к хранилищу.

S3OutputPath -> (строка)

Путь к расположению Amazon S3 для хранения метрик системы и фреймворка.

ProfilingIntervalInMilliseconds -> (целое число)

Интервал времени для захвата метрик системы в миллисекундах. Доступные значения: 100, 200, 500, 1000 (1 секунда), 5000 (5 секунд) и 60000 (1 минута) миллисекунд. Значение по умолчанию - 500 миллисекунд.

ProfilingParameters -> (словарь)

Конфигурационная информация для захвата метрик фреймворка. Доступные строковые ключи для различных вариантов профилирования - DetailedProfilingConfig, PythonProfilingConfig и DataLoaderProfilingConfig. Следующие коды представляют собой структуры конфигурации для параметра ProfilingParameters. Чтобы узнать больше о том, как настроить параметр ProfilingParameters, см. Use the SageMaker and Debugger Configuration API Operations to Create, Update, and Debug Your Training Job.

key -> (строка)

value -> (строка)

DisableProfiler -> (булево)

Конфигурация для отключения функциональности мониторинга и профилирования системы Amazon SageMaker Debugger. Для отключения установить в значение True.

ProfilerRuleConfigurations -> (список)

Конфигурационная информация для правил Amazon SageMaker Debugger для профилирования метрик системы и фреймворка.

(структура)

Конфигурационная информация для правил профилирования.

RuleConfigurationName -> (строка)

Имя конфигурации правила. Оно должно быть уникальным относительно других имён конфигураций правил.

LocalPath -> (строка)

Путь к локальному расположению для вывода правил. По умолчанию /opt/ml/processing/output/rule/.

S3OutputPath -> (строка)

Путь к расположению Amazon S3 для правил.

RuleEvaluatorImage -> (строка)

Изображение Amazon Elastic Container Registry для управляемой оценки правила.

InstanceType -> (строка)

Тип экземпляра для развертывания пользовательского правила для профилирования задачи обучения.

VolumeSizeInGB -> (целое число)

Размер в ГБ объёма ML-хранилища, подключенного к экземпляру обработки.

RuleParameters -> (словарь)

Конфигурация runtime для контейнера правила.

key -> (строка)

value -> (строка)

ProfilerRuleEvaluationStatuses -> (список)

Статус оценки правил Amazon SageMaker Debugger для профилирования в задаче обучения.

(структура)

Информация о статусе оценки правила.

RuleConfigurationName -> (строка)

Имя конфигурации правила.

RuleEvaluationJobArn -> (строка)

Amazon Resource Name (ARN) задания оценки правила.

RuleEvaluationStatus -> (строка)

Статус оценки правила.

StatusDetails -> (строка)

Подробности оценки правила.

LastModifiedTime -> (отметка времени)

Отметка времени последнего изменения статуса оценки правила.

ProfilingStatus -> (строка)

Статус профилирования задачи обучения.

Environment -> (словарь)

Переменные среды для установки в контейнер Docker.

Предупреждение

Не включайте никакую конфиденциальную информацию, включая идентификаторы доступа к аккаунту, секреты или токены, в какие-либо поля среды. В рамках модели совместной ответственности вы несёте ответственность за любые потенциальные нарушения, несанкционированный доступ или компрометацию ваших конфиденциальных данных, если это вызвано конфиденциальной информацией, включенной в переменную окружения запроса или текстовые поля.

key -> (строка)

value -> (строка)

RetryStrategy -> (структура)

Количество попыток повторной обработки задачи при ошибке из-за InternalServerError.

MaximumRetryAttempts -> (целое число)

Количество попыток повторной обработки задачи. При повторной обработке задачи, её SecondaryStatus изменяется на STARTING.

RemoteDebugConfig -> (структура)

Конфигурация для удалённой отладки. Чтобы узнать больше о функциональности удалённой отладки SageMaker, см. Access a training container through Amazon Web Services Systems Manager (SSM) for remote debugging.

EnableRemoteDebug -> (булево)

Если установлено в значение True, удалённая отладка включена.

InfraCheckConfig -> (структура)

Содержит информацию о конфигурации проверки работоспособности инфраструктуры для задачи обучения.

EnableInfraCheck -> (булево)

Включает проверку работоспособности инфраструктуры.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API