[ aws . machinelearning ]
create-data-source-from-s3
Описание
Создаёт объект DataSource. Объект DataSource ссылается на данные, которые можно использовать для выполнения операций CreateMLModel, CreateEvaluation или CreateBatchPrediction.
CreateDataSourceFromS3 — асинхронная операция. В ответ на CreateDataSourceFromS3 Amazon Machine Learning (Amazon ML) немедленно возвращает результат и устанавливает статус DataSource в значение PENDING. После создания DataSource и его готовности к использованию, Amazon ML устанавливает параметр Status в значение COMPLETED. Объект DataSource в состоянии COMPLETED или PENDING можно использовать только для выполнения операций CreateMLModel, CreateEvaluation или CreateBatchPrediction.Если Amazon ML не может принять входной источник, он устанавливает параметр Status в значение FAILED и включает сообщение об ошибке в атрибут Message ответа операции GetDataSource.
Данные наблюдений, используемые в DataSource, должны быть готовы к использованию; то есть они должны иметь согласованную структуру, а пропущенные значения данных должны быть сведены к минимуму. Данные наблюдений должны храниться в одном или нескольких файлах .csv в расположении Amazon Simple Storage Service (Amazon S3) вместе со схемой, описывающей элементы данных по имени и типу. Та же схема должна использоваться для всех файлов данных, на которые ссылается DataSource.
После создания DataSource, он готов к использованию в оценках и пакетных прогнозах. Если вы планируете использовать DataSource для обучения MLModel, то DataSource также требует рецепта. Рецепт описывает, как каждая входная переменная будет использоваться при обучении MLModel. Будет ли переменная включена или исключена из обучения? Будет ли переменная модифицирована; например, будет ли она объединена с другой переменной или разбита на словосочетания? Рецепт предоставляет ответы на эти вопросы.
См. также: Документация по API AWS
Синтаксис
create-data-source-from-s3
--data-source-id <value>
[--data-source-name <value>]
--data-spec <value>
[--compute-statistics | --no-compute-statistics]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--data-source-id (строка)
DataSource.--data-source-name (строка)
DataSource.--data-spec (структура)
Спецификация данных для DataSource:
- DataLocationS3 - Расположение данных наблюдений в Amazon S3.
- DataSchemaLocationS3 - Расположение схемы в Amazon S3.
- DataSchema - Строка JSON, представляющая схему. Это не требуется, если указан параметр
DataSchemaUri. - DataRearrangement - Строка JSON, представляющая требования к разделению и перестановке для
Datasource. Пример -"{\"splitting\":{\"percentBegin\":10,\"percentEnd\":60}}"
DataLocationS3 -> (строка)
DataSource. URI указывает на файл данных или каталог или ведро Amazon Simple Storage Service (Amazon S3), содержащие файлы данных.DataRearrangement -> (строка)
Строка JSON, представляющая обработку разделения и перестановки, применяемую к DataSource. Если параметр DataRearrangement не указан, все входные данные используются для создания Datasource.
Есть несколько параметров, которые контролируют, какие данные используются для создания источника данных:
-
**
percentBegin** ИспользуйтеpercentBegin, чтобы указать начало диапазона данных, используемых для создания источника данных. Если вы не укажетеpercentBeginиpercentEnd, Amazon ML включит все данные при создании источника данных. -
**
percentEnd** ИспользуйтеpercentEnd, чтобы указать конец диапазона данных, используемых для создания источника данных. Если вы не укажетеpercentBeginиpercentEnd, Amazon ML включит все данные при создании источника данных. -
**
complement** Параметрcomplementинструктирует Amazon ML использовать данные, которые не включены в диапазонpercentBeginдоpercentEndдля создания источника данных. Параметрcomplementполезен, если вам нужно создать дополнительные источники данных для обучения и оценки. Чтобы создать дополнительные источники данных, используйте те же значения дляpercentBeginиpercentEnd, а также параметрcomplement. Например, следующие два источника данных не имеют общих данных и могут быть использованы для обучения и оценки модели. Первый источник данных содержит 25 процентов данных, а второй - 75 процентов данных. Источник данных для оценки:{"splitting":{"percentBegin":0, "percentEnd":25}}Источник данных для обучения:{"splitting":{"percentBegin":0, "percentEnd":25, "complement":"true"}} -
**
strategy** Чтобы изменить способ, которым Amazon ML разделяет данные для источника данных, используйте параметрstrategy. Значение по умолчанию для параметраstrategyравноsequential, что означает, что Amazon ML берёт все записи данных между параметрамиpercentBeginиpercentEndдля источника данных в том порядке, в котором записи появляются во входных данных. Следующие две строкиDataRearrangement— примеры последовательно упорядоченных источников данных для обучения и оценки: Источник данных для оценки:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential"}}Источник данных для обучения:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential", "complement":"true"}}Чтобы случайным образом разделить входные данные на пропорции, указанные параметрами percentBegin и percentEnd, установите параметрstrategyв значениеrandomи укажите строку, используемую в качестве значения начального числа для случайного разделения данных (например, вы можете использовать путь S3 к вашим данным в качестве строки начального числа). Если вы выбираете стратегию случайного разделения, Amazon ML присваивает каждой строке данных псевдослучайное число от 0 до 100, а затем выбирает строки, у которых присвоенное число находится междуpercentBeginиpercentEnd. Псевдослучайные числа назначаются с использованием значения входной строки начального числа и смещения байта в качестве начального числа, поэтому изменение данных приводит к другому разделению. Любой существующий порядок сохраняется. Стратегия случайного разделения гарантирует, что переменные в обучающих и оценочных данных распределяются аналогично. Она полезна в тех случаях, когда входные данные могут иметь неявный порядок сортировки, что в противном случае приведет к созданию источников данных для обучения и оценки, содержащих несовпадающие записи данных. Следующие двеDataRearrangementстроки являются примерами не последовательно упорядоченных источников данных для обучения и оценки: Источник данных для оценки:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv"}}Источник данных для обучения:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv", "complement":"true"}}
DataSchema -> (строка)
Строка JSON, представляющая схему для Amazon S3 DataSource. DataSchema определяет структуру данных наблюдений в файлах данных, на которые ссылается DataSource.
Вы должны указать либо DataSchema, либо DataSchemaLocationS3.
Определите вашу DataSchema в виде ряда пар ключ-значение. attributes и excludedVariableNames имеют массив пар ключ-значение для своего значения. Используйте следующий формат для определения вашей DataSchema.
{ “version”: “1.0”,
“recordAnnotationFieldName”: “F1”,
“recordWeightFieldName”: “F2”,
“targetFieldName”: “F3”,
“dataFormat”: “CSV”,
“dataFileContainsHeader”: true,
“attributes”: [
{ “fieldName”: “F1”, “fieldType”: “TEXT” }, { “fieldName”: “F2”, “fieldType”: “NUMERIC” }, { “fieldName”: “F3”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F4”, “fieldType”: “NUMERIC” }, { “fieldName”: “F5”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F6”, “fieldType”: “TEXT” }, { “fieldName”: “F7”, “fieldType”: “WEIGHTED_INT_SEQUENCE” }, { “fieldName”: “F8”, “fieldType”: “WEIGHTED_STRING_SEQUENCE” } ],
“excludedVariableNames”: [ “F6” ] }
DataSchemaLocationS3 -> (строка)
DataSchema, либо DataSchemaLocationS3.Сокращенный синтаксис:
DataLocationS3=string,DataRearrangement=string,DataSchema=string,DataSchemaLocationS3=string
Синтаксис JSON:
{
"DataLocationS3": "string",
"DataRearrangement": "string",
"DataSchema": "string",
"DataSchemaLocationS3": "string"
}
--compute-statistics | --no-compute-statistics (логическое значение)
DataSource. Статистика генерируется из данных наблюдений, на которые ссылается DataSource. Amazon ML использует статистику во внутреннем процессе обучения MLModel. Этот параметр должен быть установлен в значение true, если источник данных должен использоваться для обучения MLModel.--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения перекроют значения, предоставленные JSON. Передача произвольных двоичных значений с помощью предоставленного JSON-значения невозможна, так как строка будет воспринята буквально. Этот параметр не может быть указан вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-каркас в стандартный вывод без отправки запроса API. При отсутствии значения или значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании значения yaml-input, будет выведен пример входного YAML, который можно использовать с --cli-input-yaml. При указании значения output, выполняется валидация входных данных команд и возвращается пример выходного JSON для этой команды. Сгенерированный JSON-каркас не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-каркасе.
Общие параметры
--debug (boolean)
Включить отладку.
--endpoint-url (string)
Переопределить адрес по умолчанию для команды заданным адресом.
--no-verify-ssl (boolean)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит SSL-сертификаты. Данный параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (boolean)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (string)
Стиль форматирования вывода команд.
- json
- text
- table
- yaml
- yaml-stream
--query (string)
Запрос JMESPath для фильтрации данных ответа.
--profile (string)
Использовать определённый профиль из файла аутентификации.
--region (string)
Регион для использования. Переопределяет настройки из конфигурации/окружения.
--version (string)
Отобразить версию инструмента.
--color (string)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (boolean)
Не подписывать запросы. Кредиты не будут загружены, если этот аргумент предоставлен.
--ca-bundle (string)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки из конфигурации/окружения.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (string)
Стиль форматирования для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое отображается в двоичном блоке fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла напрямую независимо от cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (boolean)
Отключить кли-пейджер для вывода.
--cli-auto-prompt (boolean)
Автоматически запросить параметры ввода CLI.
--no-cli-auto-prompt (boolean)
Отключить автоматическое запроса параметров ввода CLI.
Вывод
DataSourceId -> (string)
DataSource. Это значение должно совпадать со значением DataSourceID в запросе.
© Copyright 2025, Amazon Web Services. Created using Sphinx.