[ aws . comprehend ]
create-dataset
Описание
Создаёт набор данных для загрузки обучающих или тестовых данных для модели, связанной с флайвхилом. Дополнительную информацию о наборах данных можно найти в обзоре Flywheel в Руководстве разработчика Amazon Comprehend.
См. также: Документация API AWS
Синтаксис
create-dataset
--flywheel-arn <value>
--dataset-name <value>
[--dataset-type <value>]
[--description <value>]
--input-data-config <value>
[--client-request-token <value>]
[--tags <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--flywheel-arn (строка)
--dataset-name (строка)
--dataset-type (строка)
Тип набора данных. Вы можете указать, что данные в наборе данных предназначены для обучения модели или для тестирования модели.
Возможные значения:
TRAINTEST
--description (строка)
--input-data-config (структура)
Информация о конфигурации входных данных. Тип входных данных зависит от формата входных данных и того, предназначены ли данные для модели классификатора или модели распознавания сущностей.
AugmentedManifests -> (список)
Список файлов расширенных манифестов, которые предоставляют обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это помеченный набор данных, созданный Amazon SageMaker Ground Truth.
(структура)
Файл расширенного манифеста, предоставляющий обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это помеченный набор данных, созданный Amazon SageMaker Ground Truth.
AttributeNames -> (список)
JSON-атрибут, содержащий аннотации для ваших обучающих документов. Количество указанных имён атрибутов зависит от того, является ли ваш файл расширенного манифеста результатом выполнения одной задачи маркировки или цепочки задач маркировки.
Если ваш файл является результатом выполнения одной задачи маркировки, укажите ключ LabelAttributeName, который использовался при создании задачи в Ground Truth.
Если ваш файл является результатом выполнения цепочки задач маркировки, укажите ключ LabelAttributeName для одной или нескольких задач в цепочке. Каждый ключ LabelAttributeName предоставляет аннотации из отдельной задачи.
(строка)
S3Uri -> (строка)
AnnotationDataS3Uri -> (строка)
SourceDocumentsS3Uri -> (строка)
DocumentType -> (строка)
Тип расширенного манифеста. Если не указано, значение по умолчанию — PlainTextDocument.
PLAIN_TEXT_DOCUMENT Тип документа, представляющий любой текст Юникода, закодированный в UTF-8.DataFormat -> (строка)
COMPREHEND_CSV : Формат данных — CSV-файл с двумя столбцами, где первый столбец содержит метки, а второй — документы.
AUGMENTED_MANIFEST : Формат данных
DocumentClassifierInputDataConfig -> (структура)
Свойства входных данных для обучения модели классификатора документов.
Дополнительную информацию о формате входного файла см. в Руководстве разработчика Comprehend.
S3Uri -> (строка)
Amazon S3 URI для входных данных. Ведро S3 должно находиться в той же области, что и API-точку, к которой вы обращаетесь. URI может указывать на один входной файл или префикс для набора входных файлов.
Например, если вы используете URI S3://bucketName/prefix , если префикс представляет собой один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если префикс соответствует нескольким файлам, Amazon Comprehend использует все эти файлы в качестве входных данных.
Этот параметр требуется, если вы установили DataFormat в COMPREHEND_CSV .
LabelDelimiter -> (строка)
EntityRecognizerInputDataConfig -> (структура)
Свойства входных данных для обучения модели распознавания сущностей.
Annotations -> (структура)
Расположение в S3 аннотированных документов для вашей пользовательской модели распознавания сущностей.
S3Uri -> (строка)
Documents -> (структура)
Формат и расположение обучающих документов для вашей пользовательской модели распознавания сущностей.
S3Uri -> (строка)
InputFormat -> (строка)
EntityList -> (структура)
Расположение в S3 списка сущностей для вашей пользовательской модели распознавания сущностей.
S3Uri -> (строка)
Синтаксис JSON:
{
"AugmentedManifests": [
{
"AttributeNames": ["string", ...],
"S3Uri": "string",
"AnnotationDataS3Uri": "string",
"SourceDocumentsS3Uri": "string",
"DocumentType": "PLAIN_TEXT_DOCUMENT"|"SEMI_STRUCTURED_DOCUMENT"
}
...
],
"DataFormat": "COMPREHEND_CSV"|"AUGMENTED_MANIFEST",
"DocumentClassifierInputDataConfig": {
"S3Uri": "string",
"LabelDelimiter": "string"
},
"EntityRecognizerInputDataConfig": {
"Annotations": {
"S3Uri": "string"
},
"Documents": {
"S3Uri": "string",
"InputFormat": "ONE_DOC_PER_FILE"|"ONE_DOC_PER_LINE"
},
"EntityList": {
"S3Uri": "string"
}
}
}
--client-request-token (строка)
--tags (список)
Теги для набора данных.
(структура)
Пара ключ-значение, добавляющая метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с парой ключ-значение «Department»:«Sales» может быть добавлен к ресурсу, чтобы указать его использование конкретным отделом.
Key -> (строка)
Value -> (строка)
Сокращённый синтаксис:
Key=string,Value=string ...
Синтаксис JSON:
[
{
"Key": "string",
"Value": "string"
}
...
]
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные в JSON. Невозможно передать произвольные двоичные значения, используя значение, предоставленное в JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если не указано значение или значение input, выводит пример JSON-входных данных, которые можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, будет напечатан пример входных данных YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверяет входные данные команды и возвращает пример выходных данных JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладочную регистрацию.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (логическое значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования выходных данных команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определённый профиль из файла учетных данных.
--region (строка)
Используемая область. Переопределяет настройки конфигурации/окружения.
--version (строка)
Показать версию этого инструмента.
--color (строка)
Включить/отключить вывод цвета.
- on
- off
- auto
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.
--ca-bundle (строка)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/окружения.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться без блокировки и таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться без блокировки и таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной строки base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую независимо от настроек cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить кли-пейджер для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать параметры CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическое запросы параметров CLI.
Примеры
Примечание
Чтобы использовать следующие примеры, у вас должна быть установлена и настроена AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования, аналогичные Unix. Эти примеры потребуется адаптировать к правилам цитирования вашей оболочки. См. раздел Использование кавычек со строками в Руководстве пользователя AWS CLI.
Создание набора данных flywheel
Следующий create-dataset пример создает набор данных для flywheel. Этот набор данных будет использоваться в качестве дополнительных данных для обучения, как указано тегом --dataset-type.
aws comprehend create-dataset \
--flywheel-arn arn:aws:comprehend:us-west-2:111122223333:flywheel/flywheel-entity \
--dataset-name example-dataset \
--dataset-type "TRAIN" \
--input-data-config file://inputConfig.json
Содержимое file://inputConfig.json:
{
"DataFormat": "COMPREHEND_CSV",
"DocumentClassifierInputDataConfig": {
"S3Uri": "s3://amzn-s3-demo-bucket/training-data.csv"
}
}
Вывод:
{
"DatasetArn": "arn:aws:comprehend:us-west-2:111122223333:flywheel/flywheel-entity/dataset/example-dataset"
}
Дополнительную информацию см. в обзоре Flywheel в Руководстве разработчика Amazon Comprehend.
Вывод
DatasetArn -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.