[ aws . machinelearning ]
create-data-source-from-rds
Описание
Создает объект DataSource из Amazon Relational Database Service (Amazon RDS). Объект DataSource ссылается на данные, которые могут использоваться для выполнения операций CreateMLModel, CreateEvaluation или CreateBatchPrediction.
CreateDataSourceFromRDS — асинхронная операция. В ответ на CreateDataSourceFromRDS Amazon Machine Learning (Amazon ML) сразу же возвращает значение и устанавливает статус DataSource в PENDING. После того, как DataSource создан и готов к использованию, Amazon ML устанавливает параметр Status в значение COMPLETED. Объект DataSource в состоянии COMPLETED или PENDING может использоваться только для выполнения операций >CreateMLModel, CreateEvaluation или CreateBatchPrediction.Если Amazon ML не может принять источник данных, он устанавливает параметр Status в значение FAILED и включает сообщение об ошибке в атрибут Message ответа операции GetDataSource.
См. также: Документация AWS API
Синтаксис
create-data-source-from-rds
--data-source-id <value>
[--data-source-name <value>]
--rds-data <value>
--role-arn <value>
[--compute-statistics | --no-compute-statistics]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--data-source-id (строка)
DataSource. Обычно в качестве идентификатора источника данных используется Amazon Resource Number (ARN).--data-source-name (строка)
DataSource.--rds-data (структура)
Спецификация данных Amazon RDS DataSource:
- DatabaseInformation -
-
DatabaseName- Имя базы данных Amazon RDS. -
InstanceIdentifier- Уникальный идентификатор экземпляра базы данных Amazon RDS.
-
- DatabaseCredentials - Данные доступа AWS Identity and Access Management (IAM) для подключения к базе данных Amazon RDS.
- ResourceRole - Роль (DataPipelineDefaultResourceRole), принимаемая экземпляром EC2 для выполнения задачи копирования данных из Amazon RDS в Amazon Simple Storage Service (Amazon S3). Дополнительная информация в разделе Шаблоны ролей для конвейеров данных.
- ServiceRole - Роль (DataPipelineDefaultRole), принимаемая службой AWS Data Pipeline для мониторинга хода задачи копирования из Amazon RDS в Amazon S3. Дополнительная информация в разделе Шаблоны ролей для конвейеров данных.
- SecurityInfo - Информация о безопасности для доступа к экземпляру RDS. Необходимо настроить соответствующие правила входящего трафика для предоставленных идентификаторов безопасности, чтобы разрешить доступ к экземпляру Amazon RDS. Для экземпляра базы данных RDS в VPC укажите пару [
SubnetId,SecurityGroupIds]. - SelectSqlQuery - Запрос для извлечения данных наблюдений для
Datasource. - S3StagingLocation - Местоположение в Amazon S3 для временного хранения данных Amazon RDS. Данные, извлеченные из Amazon RDS с помощью
SelectSqlQuery, хранятся в этом месте. - DataSchemaUri - Местоположение в Amazon S3 схемы данных
DataSchema. - DataSchema - Строка JSON, представляющая схему. Не требуется, если указано
DataSchemaUri. - DataRearrangement - Строка JSON, представляющая требования к разделению и переупорядочению
Datasource. Пример -"{\"splitting\":{\"percentBegin\":10,\"percentEnd\":60}}"
DatabaseInformation -> (структура)
Описывает DatabaseName и InstanceIdentifier базы данных Amazon RDS.
InstanceIdentifier -> (строка)
DatabaseName -> (строка)
SelectSqlQuery -> (строка)
DataSource.DatabaseCredentials -> (структура)
Данные доступа AWS Identity and Access Management (IAM) для подключения к базе данных Amazon RDS.
Username -> (строка)
RDSSelectSqlQuery.Password -> (строка)
RDSSelectQuery.S3StagingLocation -> (строка)
SelectSqlQuery, хранятся в этом месте.DataRearrangement -> (строка)
Строка JSON, представляющая обработку разделения и переупорядочения для DataSource. Если параметр DataRearrangement не указан, все входные данные используются для создания Datasource.
Существует несколько параметров, которые контролируют, какие данные используются для создания источника данных:
-
**
percentBegin** ИспользуйтеpercentBeginдля указания начала диапазона данных, используемых для создания источника данных. Если не указатьpercentBeginиpercentEnd, Amazon ML использует все данные при создании источника данных. -
**
percentEnd** ИспользуйтеpercentEndдля указания конца диапазона данных, используемых для создания источника данных. Если не указатьpercentBeginиpercentEnd, Amazon ML использует все данные при создании источника данных. -
**
complement** Параметрcomplementинструктирует Amazon ML использовать данные, которые не включены в диапазон отpercentBeginдоpercentEndдля создания источника данных. Параметрcomplementполезен, если нужно создать дополнительные источники данных для обучения и проверки. Для создания дополнительных источников данных используйте одинаковые значения дляpercentBeginиpercentEnd, а также параметрcomplement. Например, следующие два источника данных не содержат общих данных и могут быть использованы для обучения и проверки модели. Первый источник данных содержит 25 процентов данных, а второй – 75 процентов. Источник данных для проверки:{"splitting":{"percentBegin":0, "percentEnd":25}}Источник данных для обучения:{"splitting":{"percentBegin":0, "percentEnd":25, "complement":"true"}} -
**
strategy** Для изменения способа, которым Amazon ML разделяет данные для источника данных, используйте параметрstrategy. Значение по умолчанию для параметраstrategy–sequential, что означает, что Amazon ML берет все записи данных между параметрамиpercentBeginиpercentEndдля источника данных в порядке их появления во входных данных. Следующие две строкиDataRearrangement– примеры последовательно упорядоченных источников данных для обучения и проверки: Источник данных для проверки:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential"}}Источник данных для обучения:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential", "complement":"true"}}Для случайного разделения входных данных в пропорциях, указанных параметрами percentBegin и percentEnd, установите параметрstrategyв значениеrandomи предоставьте строку, используемую в качестве значения начального состояния для случайного разделения данных (например, вы можете использовать путь к данным в S3 в качестве строки начального состояния). Если выбран случайный способ разделения, Amazon ML присваивает каждой строке данных псевдослучайное число от 0 до 100 и затем выбирает строки, у которых присвоенное число находится в диапазоне отpercentBeginдоpercentEnd. Псевдослучайные числа присваиваются с использованием значения входной строки начального состояния и смещения байтов в качестве начального состояния, поэтому изменение данных приводит к другому разделению. Любой существующий порядок сохраняется. Случайный способ разделения гарантирует, что переменные в данных обучения и проверки распределены аналогично. Это полезно в тех случаях, когда входные данные могут иметь неявный порядок сортировки, что в противном случае приведет к источникам данных обучения и проверки, содержащим несовпадающие записи данных. Следующие две строкиDataRearrangement– примеры источников данных для обучения и проверки, не упорядоченных последовательно: Источник данных для проверки:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv"}}Источник данных для обучения:{"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv", "complement":"true"}}
DataSchema -> (строка)
Строка JSON, представляющая схему для Amazon RDS DataSource. Схема определяет структуру данных наблюдения в файле(ах) данных, на которые ссылается DataSource.
Схема не требуется, если указана DataSchemaUri.
Определите схему в виде набора пар «ключ-значение». attributes и excludedVariableNames имеют массив пар «ключ-значение» в качестве значения. Используйте следующий формат для определения схемы:
{ “version”: “1.0”,
“recordAnnotationFieldName”: “F1”,
“recordWeightFieldName”: “F2”,
“targetFieldName”: “F3”,
“dataFormat”: “CSV”,
“dataFileContainsHeader”: true,
“attributes”: [
{ “fieldName”: “F1”, “fieldType”: “TEXT” }, { “fieldName”: “F2”, “fieldType”: “NUMERIC” }, { “fieldName”: “F3”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F4”, “fieldType”: “NUMERIC” }, { “fieldName”: “F5”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F6”, “fieldType”: “TEXT” }, { “fieldName”: “F7”, “fieldType”: “WEIGHTED_INT_SEQUENCE” }, { “fieldName”: “F8”, “fieldType”: “WEIGHTED_STRING_SEQUENCE” } ],
“excludedVariableNames”: [ “F6” ] }
DataSchemaUri -> (строка)
DataSchema.ResourceRole -> (строка)
ServiceRole -> (строка)
SubnetId -> (строка)
SecurityGroupIds -> (список)
Идентификаторы групп безопасности, используемые для доступа к экземпляру базы данных RDS в VPC. Убедитесь, что настроены соответствующие правила входящего трафика для разрешения доступа к экземпляру базы данных RDS. Этот атрибут используется конвейером данных для выполнения операции копирования из Amazon RDS в Amazon S3.
(строка)
Краткая запись:
DatabaseInformation={InstanceIdentifier=string,DatabaseName=string},SelectSqlQuery=string,DatabaseCredentials={Username=string,Password=string},S3StagingLocation=string,DataRearrangement=string,DataSchema=string,DataSchemaUri=string,ResourceRole=string,ServiceRole=string,SubnetId=string,SecurityGroupIds=string,string
Формат JSON:
{
"DatabaseInformation": {
"InstanceIdentifier": "string",
"DatabaseName": "string"
},
"SelectSqlQuery": "string",
"DatabaseCredentials": {
"Username": "string",
"Password": "string"
},
"S3StagingLocation": "string",
"DataRearrangement": "string",
"DataSchema": "string",
"DataSchemaUri": "string",
"ResourceRole": "string",
"ServiceRole": "string",
"SubnetId": "string",
"SecurityGroupIds": ["string", ...]
}
--role-arn (строка)
SelectSqlQuery из Amazon RDS в Amazon S3.--compute-statistics | --no-compute-statistics (логическое значение)
DataSource. Статистика генерируется из данных наблюдений, на которые ссылается DataSource. Amazon ML использует статистику во время внутреннего процесса обучения MLModel. Этот параметр должен быть установлен в значение true, если источник данных должен быть использован для обучения MLModel.--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставляются в командной строке, эти значения переопределяют значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или значение input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логический)
Включить отладочный вывод.
--endpoint-url (строка)
Переопределить значение URL по умолчанию команды на указанный URL.
--no-verify-ssl (логический)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (логический)
Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/отключить цветной вывод.
- вкл
- выкл
- авто
--no-sign-request (логический)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию - base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для конфигурированного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логический)
Отключить вывод страницы CLI.
--cli-auto-prompt (логический)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (логический)
Отключить автоматическое запросы параметров ввода CLI.
Вывод
DataSourceId -> (строка)
DataSourceID в запросе.
© Copyright 2025, Amazon Web Services. Created using Sphinx.