Spec-Zone.ru › AWS CLI v2

[ aws . machinelearning ]

create-data-source-from-redshift

Описание

Создаёт DataSource из базы данных, размещённой в кластере Amazon Redshift. DataSource ссылается на данные, которые можно использовать для выполнения операций CreateMLModel , CreateEvaluation или CreateBatchPrediction.

CreateDataSourceFromRedshift — это асинхронная операция. В ответ на CreateDataSourceFromRedshift Amazon Machine Learning (Amazon ML) сразу же возвращает ответ и устанавливает статус DataSource в значение PENDING. После того, как DataSource будет создан и готов к использованию, Amazon ML установит параметр Status в значение COMPLETED. DataSource в состояниях COMPLETED или PENDING могут использоваться только для выполнения операций CreateMLModel, CreateEvaluation или CreateBatchPrediction.

Если Amazon ML не может принять источник входных данных, он устанавливает параметр Status в значение FAILED и включает сообщение об ошибке в атрибут Message ответа операции GetDataSource.

Наблюдения должны быть сохранены в базе данных, размещённой в кластере Amazon Redshift, и должны быть указаны с помощью запроса SelectSqlQuery. Amazon ML выполняет команду Unload в Amazon Redshift для переноса набора результатов запроса SelectSqlQuery в S3StagingLocation.

После создания DataSource он готов к использованию для оценок и пакетных прогнозов. Если планируется использовать DataSource для обучения MLModel, то DataSource также требует рецепта. Рецепт описывает, как каждый входной параметр будет использоваться при обучении MLModel. Будет ли переменная включена или исключена из обучения? Будет ли переменная модифицирована, например, объединена с другой переменной или разделена на сочетания слов? Рецепт содержит ответы на эти вопросы.

Изменить существующий источник данных нельзя, но можно скопировать и изменить настройки существующего источника данных Amazon Redshift, чтобы создать новый источник данных. Для этого вызовите GetDataSource для существующего источника данных и скопируйте значения в вызов CreateDataSource. Измените необходимые настройки и убедитесь, что все необходимые поля имеют соответствующие значения.

См. также: Документация API AWS

Синопсис

  create-data-source-from-redshift
--data-source-id <value>
[--data-source-name <value>]
--data-spec <value>
--role-arn <value>
[--compute-statistics | --no-compute-statistics]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--data-source-id (строка)

Указанный пользователем идентификатор, уникально определяющий DataSource .

--data-source-name (строка)

Указанное пользователем имя или описание DataSource .

--data-spec (структура)

Спецификация данных для Amazon Redshift DataSource :

  • DatabaseInformation -
    • DatabaseName - Имя базы данных Amazon Redshift.
    • ClusterIdentifier - Уникальный идентификатор кластера Amazon Redshift.
  • DatabaseCredentials - AWS Identity and Access Management (IAM) учетные данные для подключения к базе данных Amazon Redshift.
  • SelectSqlQuery - Запрос для извлечения данных наблюдений для Datasource .
  • S3StagingLocation - Расположение Amazon Simple Storage Service (Amazon S3) для подготовки данных Amazon Redshift. Данные, извлечённые из Amazon Redshift с помощью запроса SelectSqlQuery, хранятся в этом месте.
  • DataSchemaUri - Расположение в Amazon S3 DataSchema .
  • DataSchema - Строка JSON, представляющая схему. Не требуется, если указан DataSchemaUri.
  • DataRearrangement - Строка JSON, представляющая требования к разделению и перестановке DataSource . Пример - "{\"splitting\":{\"percentBegin\":10,\"percentEnd\":60}}"

DatabaseInformation -> (структура)

Описывает DatabaseName и ClusterIdentifier для Amazon Redshift DataSource .

DatabaseName -> (строка)

Имя базы данных, размещённой в кластере Amazon Redshift.

ClusterIdentifier -> (строка)

Идентификатор кластера Amazon Redshift.

SelectSqlQuery -> (строка)

Описывает SQL-запрос для выполнения на базе данных Amazon Redshift для Amazon Redshift DataSource .

DatabaseCredentials -> (структура)

Описывает AWS Identity and Access Management (IAM) учетные данные, используемые для подключения к базе данных Amazon Redshift.

Username -> (строка)

Имя пользователя, используемое Amazon Machine Learning (Amazon ML) для подключения к базе данных в кластере Amazon Redshift. Имя пользователя должно иметь достаточные разрешения для выполнения запроса RedshiftSelectSqlQuery. Имя пользователя должно быть валидным для пользователя Amazon Redshift.

Password -> (строка)

Пароль, используемый Amazon ML для подключения к базе данных в кластере Amazon Redshift. Пароль должен иметь достаточные разрешения для выполнения запроса RedshiftSelectSqlQuery. Пароль должен быть валидным для пользователя Amazon Redshift.

S3StagingLocation -> (строка)

Описывает расположение Amazon S3 для хранения результата запроса SelectSqlQuery.

DataRearrangement -> (строка)

Строка JSON, представляющая обработку разделения и перестановки, применяемую к DataSource. Если параметр DataRearrangement не предоставлен, все входные данные используются для создания Datasource.

Существует несколько параметров, контролирующих, какие данные используются для создания источника данных:

  • **percentBegin ** Используйте percentBegin для указания начала диапазона данных, используемых для создания источника данных. Если вы не включите percentBegin и percentEnd, Amazon ML включит все данные при создании источника данных.
  • **percentEnd ** Используйте percentEnd для указания конца диапазона данных, используемых для создания источника данных. Если вы не включите percentBegin и percentEnd, Amazon ML включит все данные при создании источника данных.
  • **complement ** Параметр complement инструктирует Amazon ML использовать данные, не включённые в диапазон percentBegin до percentEnd для создания источника данных. Параметр complement полезен, если необходимо создать дополнительные источники данных для обучения и оценки. Для создания дополнительного источника данных используйте те же значения для percentBegin и percentEnd, а также параметр complement. Например, следующие два источника данных не имеют общих данных и могут использоваться для обучения и оценки модели. Первый источник данных содержит 25 процентов данных, а второй — 75 процентов данных. Источник данных для оценки: {"splitting":{"percentBegin":0, "percentEnd":25}} Источник данных для обучения: {"splitting":{"percentBegin":0, "percentEnd":25, "complement":"true"}}
  • **strategy ** Чтобы изменить способ разделения данных Amazon ML для источника данных, используйте параметр strategy. Значение по умолчанию для параметра strategy — sequential, что означает, что Amazon ML берёт все записи данных между параметрами percentBegin и percentEnd для источника данных в порядке появления записей во входных данных. Следующие две DataRearrangement строки являются примерами последовательно упорядоченных источников данных для обучения и оценки: Источник данных для оценки: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential"}} Источник данных для обучения: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"sequential", "complement":"true"}} Для случайного разделения входных данных на пропорции, указанные параметрами percentBegin и percentEnd, установите параметр strategy в random и укажите строку, используемую в качестве значения семени для случайного разделения данных (например, вы можете использовать путь к данным в S3 в качестве строки семени). Если выбран стратегия случайного разделения, Amazon ML присваивает каждой строке данных псевдослучайное число от 0 до 100, а затем выбирает строки, у которых присвоенное число находится между percentBegin и percentEnd. Псевдослучайные числа присваиваются с использованием значения входной строки семени и смещения байта в качестве семени, поэтому изменение данных приводит к разному разделению. Любая существующая упорядоченность сохраняется. Стратегия случайного разделения гарантирует, что переменные в данных обучения и оценки распределены аналогично. Это полезно в тех случаях, когда входные данные могут иметь неявный порядок сортировки, что в противном случае приведёт к тому, что источники данных для обучения и оценки будут содержать несопоставимые записи данных. Следующие две DataRearrangement строки являются примерами не последовательно упорядоченных источников данных для обучения и оценки: Источник данных для оценки: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv"}} Источник данных для обучения: {"splitting":{"percentBegin":70, "percentEnd":100, "strategy":"random", "randomSeed"="s3://my_s3_path/bucket/file.csv", "complement":"true"}}

DataSchema -> (строка)

Строка JSON, представляющая схему для Amazon Redshift DataSource . DataSchema определяет структуру данных наблюдения в файле(ах) данных, на которые ссылается DataSource .

DataSchema не требуется, если указан DataSchemaUri .

Определите вашу DataSchema как ряд пар ключ-значение. attributes и excludedVariableNames имеют массив пар ключ-значение для своего значения. Используйте следующий формат для определения вашей DataSchema .

{ “version”: “1.0”,

“recordAnnotationFieldName”: “F1”,

“recordWeightFieldName”: “F2”,

“targetFieldName”: “F3”,

“dataFormat”: “CSV”,

“dataFileContainsHeader”: true,

“attributes”: [

{ “fieldName”: “F1”, “fieldType”: “TEXT” }, { “fieldName”: “F2”, “fieldType”: “NUMERIC” }, { “fieldName”: “F3”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F4”, “fieldType”: “NUMERIC” }, { “fieldName”: “F5”, “fieldType”: “CATEGORICAL” }, { “fieldName”: “F6”, “fieldType”: “TEXT” }, { “fieldName”: “F7”, “fieldType”: “WEIGHTED_INT_SEQUENCE” }, { “fieldName”: “F8”, “fieldType”: “WEIGHTED_STRING_SEQUENCE” } ],

“excludedVariableNames”: [ “F6” ] }

DataSchemaUri -> (строка)

Описывает расположение схемы для Amazon Redshift DataSource .

Сокращённый синтаксис:

DatabaseInformation={DatabaseName=string,ClusterIdentifier=string},SelectSqlQuery=string,DatabaseCredentials={Username=string,Password=string},S3StagingLocation=string,DataRearrangement=string,DataSchema=string,DataSchemaUri=string

Синтаксис JSON:

{
  "DatabaseInformation": {
    "DatabaseName": "string",
    "ClusterIdentifier": "string"
  },
  "SelectSqlQuery": "string",
  "DatabaseCredentials": {
    "Username": "string",
    "Password": "string"
  },
  "S3StagingLocation": "string",
  "DataRearrangement": "string",
  "DataSchema": "string",
  "DataSchemaUri": "string"
}

--role-arn (строка)

Полностью указанный ARN роли. Amazon ML принимает роль от имени пользователя для создания следующего:

  • Группа безопасности для разрешения Amazon ML выполнять запрос SelectSqlQuery на кластере Amazon Redshift
  • Политика ведра Amazon S3 для предоставления Amazon ML разрешений на чтение/запись в S3StagingLocation

--compute-statistics | --no-compute-statistics (булево)

Статистические данные вычислений для DataSource. Статистические данные генерируются из данных наблюдения, на которые ссылается DataSource. Amazon ML использует статистические данные внутри во время MLModel обучения. Этот параметр должен быть установлен в true, если DataSource необходимо использовать для MLModel обучения.

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения перепишут значения, предоставленные JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет воспринята буквально. Этот параметр не может быть указан вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Печатает каркас JSON в стандартный вывод без отправки запроса API. Если предоставлено без значения или со значением input, печатает пример входного JSON, который можно использовать как аргумент для --cli-input-json. Аналогично, если предоставлено yaml-input, будет напечатан пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено со значением output, проверяет входные данные команды и возвращает пример выходного JSON для данной команды. Сгенерированный каркас JSON не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном каркасе JSON.

Общие параметры

--debug (boolean)

Включить отладку.

--endpoint-url (string)

Переопределить стандартный URL команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию, AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (boolean)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использовать определенный профиль из файла учетных данных.

--region (string)

Используемый регион. Переопределяет настройки из конфигурации/среды.

--version (string)

Показать версию этого инструмента.

--color (string)

Включить/отключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (string)

Файл с корневым сертификатом для проверки SSL-сертификатов. Переопределяет настройки из конфигурации/среды.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (string)

Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 предполагает, что двоичные блоки предоставляются в виде закодированной строки base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, относящегося к двоичному блоку fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую независимо от настроек cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить пейджер CLI для вывода.

--cli-auto-prompt (boolean)

Автоматически запросить параметры входных данных CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматический запрос параметров входных данных CLI.

Вывод

DataSourceId -> (string)

Указанный пользователем идентификатор, уникально определяющий источник данных. Это значение должно быть идентично значению DataSourceID в запросе.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API