Spec-Zone.ru › AWS CLI v2

[ aws . machinelearning ]

create-data-source-from-rds

Описание

Создает объект DataSource из Amazon Relational Database Service (Amazon RDS). Объект DataSource ссылается на данные, которые могут использоваться для выполнения операций CreateMLModel, CreateEvaluation или CreateBatchPrediction.

CreateDataSourceFromRDS — асинхронная операция. В ответ на CreateDataSourceFromRDS Amazon Machine Learning (Amazon ML) сразу же возвращает значение и устанавливает статус DataSource в PENDING. После того, как DataSource создан и готов к использованию, Amazon ML устанавливает параметр Status в значение COMPLETED. Объект DataSource в состоянии COMPLETED или PENDING может использоваться только для выполнения операций >CreateMLModel, CreateEvaluation или CreateBatchPrediction.

Если Amazon ML не может принять источник данных, он устанавливает параметр Status в значение FAILED и включает сообщение об ошибке в атрибут Message ответа операции GetDataSource.

См. также: Документация AWS API

Синтаксис

  create-data-source-from-rds
--data-source-id <value>
[--data-source-name <value>]
--rds-data <value>
--role-arn <value>
[--compute-statistics | --no-compute-statistics]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--data-source-id (строка)

Предоставленный пользователем идентификатор, уникально определяющий DataSource. Обычно в качестве идентификатора источника данных используется Amazon Resource Number (ARN).

--data-source-name (строка)

Предоставленное пользователем имя или описание DataSource.

--rds-data (структура)

Спецификация данных Amazon RDS DataSource:

  • DatabaseInformation -
    • DatabaseName - Имя базы данных Amazon RDS.
    • InstanceIdentifier - Уникальный идентификатор экземпляра базы данных Amazon RDS.
  • DatabaseCredentials - Данные доступа AWS Identity and Access Management (IAM) для подключения к базе данных Amazon RDS.
  • ResourceRole - Роль (DataPipelineDefaultResourceRole), принимаемая экземпляром EC2 для выполнения задачи копирования данных из Amazon RDS в Amazon Simple Storage Service (Amazon S3). Дополнительная информация в разделе Шаблоны ролей для конвейеров данных.
  • ServiceRole - Роль (DataPipelineDefaultRole), принимаемая службой AWS Data Pipeline для мониторинга хода задачи копирования из Amazon RDS в Amazon S3. Дополнительная информация в разделе Шаблоны ролей для конвейеров данных.
  • SecurityInfo - Информация о безопасности для доступа к экземпляру RDS. Необходимо настроить соответствующие правила входящего трафика для предоставленных идентификаторов безопасности, чтобы разрешить доступ к экземпляру Amazon RDS. Для экземпляра базы данных RDS в VPC укажите пару [SubnetId, SecurityGroupIds].
  • SelectSqlQuery - Запрос для извлечения данных наблюдений для Datasource.
  • S3StagingLocation - Местоположение в Amazon S3 для временного хранения данных Amazon RDS. Данные, извлеченные из Amazon RDS с помощью SelectSqlQuery, хранятся в этом месте.
  • DataSchemaUri - Местоположение в Amazon S3 схемы данных DataSchema.
  • DataSchema - Строка JSON, представляющая схему. Не требуется, если указано DataSchemaUri.
  • DataRearrangement - Строка JSON, представляющая требования к разделению и переупорядочению Datasource. Пример - "{\"splitting\":{\"percentBegin\":10,\"percentEnd\":60}}"

DatabaseInformation -> (структура)

Описывает DatabaseName и InstanceIdentifier базы данных Amazon RDS.

InstanceIdentifier -> (строка)

Идентификатор экземпляра RDS.

DatabaseName -> (строка)

Имя базы данных, размещённой на экземпляре RDS.

SelectSqlQuery -> (строка)

Запрос для извлечения данных наблюдений для DataSource.

DatabaseCredentials -> (структура)

Данные доступа AWS Identity and Access Management (IAM) для подключения к базе данных Amazon RDS.

Username -> (строка)

Имя пользователя, которое Amazon ML будет использовать для подключения к базе данных на экземпляре Amazon RDS. У пользователя должно быть достаточно прав для выполнения запроса RDSSelectSqlQuery.

Password -> (строка)

Пароль, который Amazon ML будет использовать для подключения к базе данных на экземпляре RDS. У пользователя должно быть достаточно прав для выполнения запроса RDSSelectQuery.

S3StagingLocation -> (строка)

Местоположение в Amazon S3 для временного хранения данных Amazon RDS. Данные, извлеченные из Amazon RDS с помощью SelectSqlQuery, хранятся в этом месте.

DataRearrangement -> (строка)

Строка JSON, представляющая обработку разделения и переупорядочения для DataSource. Если параметр DataRearrangement не указан, все входные данные используются для создания Datasource.

Существует несколько параметров, которые контролируют, какие данные используются для создания источника данных:

  • **percentBegin ** Используйте percentBegin для указания начала диапазона данных, используемых для создания источника данных. Если не указать percentBegin и percentEnd, Amazon ML использует все данные при создании источника данных.
  • **percentEnd ** Используйте percentEnd для указания конца диапазона данных, используемых для создания источника данных. Если не указать percentBegin и percentEnd, Amazon ML использует все данные при создании источника данных.
  • **complement ** Параметр complement инструктирует Amazon ML использовать данные, которые не включены в диапазон от percentBegin до percentEnd для создания источника данных. Параметр complement полезен, если нужно создать дополнительные источники данных для обучения и проверки. Для создания дополнительных источников данных используйте одинаковые значения для percentBegin и percentEnd, а также параметр complement. Например, следующие два источника данных не содержат общих данных и могут быть использованы для обучения и проверки модели. Первый источник данных содержит 25 процентов данных, а второй – 75 процентов. Источник данных для проверки: {"splitting":{"percentBegin":0, "percentEnd":25}} Источник данных для обучения: {"splitting":{"percentBegin":0, "percentEnd":25, "complement":"true"}}
  • **strategy ** Для изменения способа, которым Amazon ML разделяет данные для источника данных, используйте параметр strategy. Значение по умолчанию для параметра strategy – sequential, что означает, что Amazon ML берет все записи данных между параметрами percentBegin и percentEnd для источника данных в порядке их появления во входных данных. Следующие две строки DataRearrangement – примеры последовательно упорядоченных источников данных для обучения и проверки: Источник данных для проверки: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential"}} Источник данных для обучения: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential", "complement":"true"}} Для случайного разделения входных данных в пропорциях, указанных параметрами percentBegin и percentEnd, установите параметр strategy в значение random и предоставьте строку, используемую в качестве значения начального состояния для случайного разделения данных (например, вы можете использовать путь к данным в S3 в качестве строки начального состояния). Если выбран случайный способ разделения, Amazon ML присваивает каждой строке данных псевдослучайное число от 0 до 100 и затем выбирает строки, у которых присвоенное число находится в диапазоне от percentBegin до percentEnd. Псевдослучайные числа присваиваются с использованием значения входной строки начального состояния и смещения байтов в качестве начального состояния, поэтому изменение данных приводит к другому разделению. Любой существующий порядок сохраняется. Случайный способ разделения гарантирует, что переменные в данных обучения и проверки распределены аналогично. Это полезно в тех случаях, когда входные данные могут иметь неявный порядок сортировки, что в противном случае приведет к источникам данных обучения и проверки, содержащим несовпадающие записи данных. Следующие две строки DataRearrangement – примеры источников данных для обучения и проверки, не упорядоченных последовательно: Источник данных для проверки: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv"}} Источник данных для обучения: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv", "complement":"true"}}

DataSchema -> (строка)

Строка JSON, представляющая схему для Amazon RDS DataSource. Схема определяет структуру данных наблюдения в файле(ах) данных, на которые ссылается DataSource.

Схема не требуется, если указана DataSchemaUri.

Определите схему в виде набора пар «ключ-значение». attributes и excludedVariableNames имеют массив пар «ключ-значение» в качестве значения. Используйте следующий формат для определения схемы:

{ “version”: “1.0”,

“recordAnnotationFieldName”: “F1”,

“recordWeightFieldName”: “F2”,

“targetFieldName”: “F3”,

“dataFormat”: “CSV”,

“dataFileContainsHeader”: true,

“attributes”: [

{ “fieldName”: “F1”, “fieldType”: “TEXT” }, { “fieldName”: “F2”, “fieldType”: “NUMERIC” }, { “fieldName”: “F3”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F4”, “fieldType”: “NUMERIC” }, { “fieldName”: “F5”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F6”, “fieldType”: “TEXT” }, { “fieldName”: “F7”, “fieldType”: “WEIGHTED_INT_SEQUENCE” }, { “fieldName”: “F8”, “fieldType”: “WEIGHTED_STRING_SEQUENCE” } ],

“excludedVariableNames”: [ “F6” ] }

DataSchemaUri -> (строка)

Местоположение в Amazon S3 схемы данных DataSchema.

ResourceRole -> (строка)

Роль (DataPipelineDefaultResourceRole), принимаемая экземпляром Amazon Elastic Compute Cloud (Amazon EC2) для выполнения операции копирования из Amazon RDS в Amazon S3. Дополнительная информация в разделе Шаблоны ролей для конвейеров данных.

ServiceRole -> (строка)

Роль (DataPipelineDefaultRole), принимаемая службой AWS Data Pipeline для мониторинга хода задачи копирования из Amazon RDS в Amazon S3. Дополнительная информация в разделе Шаблоны ролей для конвейеров данных.

SubnetId -> (строка)

Идентификатор подсети, используемой для доступа к экземпляру базы данных RDS в VPC. Этот атрибут используется конвейером данных для выполнения задачи копирования из Amazon RDS в Amazon S3.

SecurityGroupIds -> (список)

Идентификаторы групп безопасности, используемые для доступа к экземпляру базы данных RDS в VPC. Убедитесь, что настроены соответствующие правила входящего трафика для разрешения доступа к экземпляру базы данных RDS. Этот атрибут используется конвейером данных для выполнения операции копирования из Amazon RDS в Amazon S3.

(строка)

Краткая запись:

DatabaseInformation={InstanceIdentifier=string,DatabaseName=string},SelectSqlQuery=string,DatabaseCredentials={Username=string,Password=string},S3StagingLocation=string,DataRearrangement=string,DataSchema=string,DataSchemaUri=string,ResourceRole=string,ServiceRole=string,SubnetId=string,SecurityGroupIds=string,string

Формат JSON:

{
  "DatabaseInformation": {
    "InstanceIdentifier": "string",
    "DatabaseName": "string"
  },
  "SelectSqlQuery": "string",
  "DatabaseCredentials": {
    "Username": "string",
    "Password": "string"
  },
  "S3StagingLocation": "string",
  "DataRearrangement": "string",
  "DataSchema": "string",
  "DataSchemaUri": "string",
  "ResourceRole": "string",
  "ServiceRole": "string",
  "SubnetId": "string",
  "SecurityGroupIds": ["string", ...]
}

--role-arn (строка)

Роль, которую Amazon ML принимает от имени пользователя для создания и активации конвейера данных в учетной записи пользователя и копирования данных с помощью запроса SelectSqlQuery из Amazon RDS в Amazon S3.

--compute-statistics | --no-compute-statistics (логическое значение)

Статистика вычислений для DataSource. Статистика генерируется из данных наблюдений, на которые ссылается DataSource. Amazon ML использует статистику во время внутреннего процесса обучения MLModel. Этот параметр должен быть установлен в значение true, если источник данных должен быть использован для обучения MLModel.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставляются в командной строке, эти значения переопределяют значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или значение input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логический)

Включить отладочный вывод.

--endpoint-url (строка)

Переопределить значение URL по умолчанию команды на указанный URL.

--no-verify-ssl (логический)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (логический)

Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/отключить цветной вывод.

  • вкл
  • выкл
  • авто

--no-sign-request (логический)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию - base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для конфигурированного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логический)

Отключить вывод страницы CLI.

--cli-auto-prompt (логический)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (логический)

Отключить автоматическое запросы параметров ввода CLI.

Вывод

DataSourceId -> (строка)

Предоставленный пользователем идентификатор, уникально определяющий источник данных. Это значение должно быть идентично значению DataSourceID в запросе.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API