Spec-Zone.ru › AWS CLI v2

[ aws . comprehend ]

create-entity-recognizer

Описание

Создаёт распознаватель сущностей с помощью предоставленных файлов. После отправки запроса CreateEntityRecognizer, вы можете проверить статус задания, используя API DescribeEntityRecognizer.

См. также: Документация API AWS

Синтаксис

  create-entity-recognizer
--recognizer-name <value>
[--version-name <value>]
--data-access-role-arn <value>
[--tags <value>]
--input-data-config <value>
[--client-request-token <value>]
--language-code <value>
[--volume-kms-key-id <value>]
[--vpc-config <value>]
[--model-kms-key-id <value>]
[--model-policy <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--recognizer-name (строка)

Название создаваемого распознавателя. Длина имени распознавателя может составлять максимум 256 символов. Разрешены буквенно-цифровые символы, дефисы (-) и нижние подчёркивания (_). Имя должно быть уникальным в аккаунте/регионе.

--version-name (строка)

Имя версии создаваемого распознавателя. Длина имени версии может составлять максимум 256 символов. Разрешены буквенно-цифровые символы, дефисы (-) и нижние подчёркивания (_). Имя версии должно быть уникальным среди всех моделей с таким же именем распознавателя в аккаунте/регионе.

--data-access-role-arn (строка)

Amazon Resource Name (ARN) роли IAM, предоставляющей Amazon Comprehend доступ для чтения к вашим входным данным.

--tags (список)

Теги для ассоциации с распознавателем сущностей. Тег — это пара «ключ-значение», которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с «Sales» в качестве ключа может быть добавлен к ресурсу, чтобы указать его использование отделом продаж.

(структура)

Пара «ключ-значение», которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с парой «ключ»:«значение» «Отдел»:«Продажи» может быть добавлен к ресурсу, чтобы указать его использование конкретным отделом.

Ключ -> (строка)

Первая часть пары «ключ-значение», которая образует тег, связанный с данным ресурсом. Например, если вы хотите показать, какие ресурсы используются какими отделами, вы можете использовать «Отдел» в качестве ключевой части пары, с различными возможными значениями, такими как «продажи», «юристы» и «администрация».

Значение -> (строка)

Вторая часть пары «ключ-значение», которая образует тег, связанный с данным ресурсом. Например, если вы хотите показать, какие ресурсы используются какими отделами, вы можете использовать «Отдел» в качестве начальной части (ключа) пары, со значением «продажи» для обозначения отдела продаж.

Сокращённый синтаксис:

Key=string,Value=string ...

Синтаксис JSON:

[
  {
    "Key": "string",
    "Value": "string"
  }
  ...
]

--input-data-config (структура)

Указывает формат и расположение входных данных. Ведро S3, содержащее входные данные, должно находиться в том же регионе, что и создаваемый распознаватель сущностей.

DataFormat -> (строка)

Формат данных обучения:

  • COMPREHEND_CSV : Файл CSV, дополняющий ваши обучающие документы. Файл CSV содержит информацию о пользовательских сущностях, которые будет определять ваша обученная модель. Требуемый формат файла зависит от того, предоставляете ли вы аннотации или список сущностей. Если вы используете это значение, вы должны предоставить свой файл CSV, используя параметры Annotations или EntityList. Вы должны предоставить ваши обучающие документы, используя параметр Documents.
  • AUGMENTED_MANIFEST : Меткированный набор данных, созданный Amazon SageMaker Ground Truth. Этот файл имеет формат JSON-строк. Каждая строка — это полный JSON-объект, содержащий обучающий документ и его метки. Каждая метка аннотирует именованную сущность в обучающем документе. Если вы используете это значение, вы должны предоставить параметр AugmentedManifests в своём запросе.

Если вы не укажете значение, Amazon Comprehend использует COMPREHEND_CSV по умолчанию.

EntityTypes -> (список)

Типы сущностей в помеченных обучающих данных, которые Amazon Comprehend использует для обучения пользовательского распознавателя сущностей. Любые типы сущностей, которые вы не укажете, будут проигнорированы.

Максимальное количество 25 типов сущностей может быть использовано одновременно для обучения распознавателя сущностей. Типы сущностей не должны содержать следующие недопустимые символы: n (перевод строки), \n (экранированный перевод строки), r (возврат каретки), \r (экранированный возврат каретки), t (табуляция), \t (экранированная табуляция), пробел и , (запятая).

(структура)

Тип сущности в помеченном обучающем наборе данных, который Amazon Comprehend использует для обучения пользовательского распознавателя сущностей.

Type -> (строка)

Тип сущности в помеченном обучающем наборе данных, который Amazon Comprehend использует для обучения пользовательского распознавателя сущностей.

Типы сущностей не должны содержать следующие недопустимые символы: n (перевод строки), \n (экранированный перевод строки), r (возврат каретки), \r (экранированный возврат каретки), t (табуляция), \t (экранированная табуляция) и , (запятая).

Documents -> (структура)

Расположение в S3 папки, содержащей обучающие документы для вашего пользовательского распознавателя сущностей.

Этот параметр требуется, если вы установили DataFormat в COMPREHEND_CSV .

S3Uri -> (строка)

Указывает расположение в Amazon S3, где находятся обучающие документы для распознавателя сущностей. URI должен быть в том же регионе, что и вызываемый API-точкой.

TestS3Uri -> (строка)

Указывает расположение в Amazon S3, где находятся тестовые документы для распознавателя сущностей. URI должен находиться в том же регионе Amazon Web Services, что и вызываемая API-точка.

InputFormat -> (строка)

Указывает, как текст в входном файле должен быть обработан. Это необязательно, и по умолчанию используется ONE_DOC_PER_LINE. ONE_DOC_PER_FILE — каждый файл рассматривается как отдельный документ. Используйте этот вариант при обработке больших документов, таких как газетные статьи или научные статьи. ONE_DOC_PER_LINE — каждая строка в файле рассматривается как отдельный документ. Используйте этот вариант при обработке большого количества коротких документов, таких как текстовые сообщения.

Annotations -> (структура)

Расположение в S3 файла CSV, аннотирующего ваши обучающие документы.

S3Uri -> (строка)

Указывает расположение в Amazon S3, где находятся аннотации для распознавателя сущностей. URI должен быть в том же регионе, что и вызываемая API-точка.

TestS3Uri -> (строка)

Указывает расположение в Amazon S3, где находятся тестовые аннотации для распознавателя сущностей. URI должен быть в том же регионе, что и вызываемая API-точка.

EntityList -> (структура)

Расположение в S3 файла CSV со списком сущностей для вашего пользовательского распознавателя сущностей.

S3Uri -> (строка)

Указывает расположение в Amazon S3, где находится список сущностей. URI должен быть в том же регионе, что и вызываемая API-точка.

AugmentedManifests -> (список)

Список файлов расширенных манифестов, которые предоставляют обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это помеченный набор данных, созданный Amazon SageMaker Ground Truth.

Этот параметр требуется, если вы установили DataFormat в AUGMENTED_MANIFEST .

(структура)

Файл расширенного манифеста, который предоставляет обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это помеченный набор данных, созданный Amazon SageMaker Ground Truth.

S3Uri -> (строка)

Расположение в Amazon S3 файла расширенного манифеста.

Split -> (строка)

Назначение данных, которые вы предоставили в расширенном манифесте. Вы можете использовать эти данные для обучения или тестирования. Если не указано, используется значение по умолчанию train.

TRAIN — все документы в манифесте будут использоваться для обучения. Если тестовые документы не предоставлены, Amazon Comprehend автоматически зарезервирует часть обучающих документов для тестирования.

TEST — все документы в манифесте будут использоваться для тестирования.

AttributeNames -> (список)

JSON-атрибут, содержащий аннотации для ваших обучающих документов. Количество указанных имен атрибутов зависит от того, является ли ваш файл расширенного манифеста результатом единственной работы по маркировке или цепочкой работ по маркировке.

Если ваш файл является результатом единственной работы по маркировке, укажите ключ LabelAttributeName, который использовался при создании задания в Ground Truth.

Если ваш файл является результатом цепочки работ по маркировке, укажите ключ LabelAttributeName для одной или нескольких работ в цепочке. Каждый ключ LabelAttributeName предоставляет аннотации из отдельной работы.

(строка)

AnnotationDataS3Uri -> (строка)

Префикс S3 к файлам аннотаций, которые указаны в файле расширенного манифеста.

SourceDocumentsS3Uri -> (строка)

Префикс S3 к исходным файлам (PDF), на которые ссылается файл расширенного манифеста.

DocumentType -> (строка)

Тип расширенного манифеста. PlainTextDocument или SemiStructuredDocument. Если не указано, используется значение по умолчанию PlainTextDocument.

  • PLAIN_TEXT_DOCUMENT Тип документа, представляющий любой текстовый unicode, закодированный в UTF-8.
  • SEMI_STRUCTURED_DOCUMENT Тип документа с позиционным и структурным контекстом, как PDF. Для обучения с Amazon Comprehend поддерживаются только PDF. Для вывода Amazon Comprehend поддерживает PDF, DOCX и TXT.

Синтаксис JSON:

{
  "DataFormat": "COMPREHEND_CSV"|"AUGMENTED_MANIFEST",
  "EntityTypes": [
    {
      "Type": "string"
    }
    ...
  ],
  "Documents": {
    "S3Uri": "string",
    "TestS3Uri": "string",
    "InputFormat": "ONE_DOC_PER_FILE"|"ONE_DOC_PER_LINE"
  },
  "Annotations": {
    "S3Uri": "string",
    "TestS3Uri": "string"
  },
  "EntityList": {
    "S3Uri": "string"
  },
  "AugmentedManifests": [
    {
      "S3Uri": "string",
      "Split": "TRAIN"|"TEST",
      "AttributeNames": ["string", ...],
      "AnnotationDataS3Uri": "string",
      "SourceDocumentsS3Uri": "string",
      "DocumentType": "PLAIN_TEXT_DOCUMENT"|"SEMI_STRUCTURED_DOCUMENT"
    }
    ...
  ]
}

--client-request-token (строка)

Уникальный идентификатор запроса. Если вы не установите маркер запроса клиента, Amazon Comprehend сгенерирует его.

--language-code (строка)

Вы можете указать любой из следующих языков: English (“en”), Spanish (“es”), French (“fr”), Italian (“it”), German (“de”), или Portuguese (“pt”). Если вы планируете использовать этот распознаватель сущностей с входными файлами PDF, Word или изображениями, вы должны указать английский язык. Все обучающие документы должны быть на одном языке.

Возможные значения:

  • en
  • es
  • fr
  • de
  • it
  • pt
  • ar
  • hi
  • ja
  • ko
  • zh
  • zh-TW

--volume-kms-key-id (строка)

Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на томе хранилища, подключённом к виртуальным машинам обработки аналитических задач. VolumeKmsKeyId может быть в следующих форматах:

  • ID ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Amazon Resource Name (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

--vpc-config (структура)

Параметры конфигурации для необязательной частной виртуальной частной сети (ВЧС), содержащей ресурсы, используемые для вашего распознавателя пользовательских сущностей. Дополнительную информацию см. в разделе Amazon VPC.

SecurityGroupIds -> (список)

Идентификатор группы безопасности на экземпляре вашей частной ВЧС. Группы безопасности вашей ВЧС работают как виртуальный брандмауэр для управления входящим и исходящим трафиком и обеспечивают безопасность ресурсов, к которым вы будете обращаться в ВЧС. Этот идентификатор начинается с «sg-», например: «sg-03b388029b0a285ea». Дополнительную информацию см. в разделе Группы безопасности вашей ВЧС.

(строка)

Subnets -> (список)

Идентификатор каждого подсети, используемого в вашей частной ВЧС. Эта подсеть является подмножеством диапазона адресов IPv4, используемых ВЧС, и специфична для определенной зоны доступности в регионе ВЧС. Этот идентификатор начинается с «subnet-», например: «subnet-04ccf456919e69055». Дополнительную информацию см. в разделе ВЧС и подсети.

(строка)

Сокращенная синтаксическая запись:

SecurityGroupIds=string,string,Subnets=string,string

Синтаксис JSON:

{
  "SecurityGroupIds": ["string", ...],
  "Subnets": ["string", ...]
}

--model-kms-key-id (строка)

Идентификатор ключа KMS, который Amazon Comprehend использует для шифрования обученных пользовательских моделей. ModelKmsKeyId может иметь один из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Идентификатор ресурса Amazon (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

--model-policy (строка)

Политика ресурсного уровня JSON для присоединения к вашей модели распознавателя пользовательских сущностей. Вы можете использовать эту политику для разрешения другому аккаунту Amazon Web Services импортировать вашу пользовательскую модель.

Укажите JSON в виде строки UTF-8 без разрывов строк. Для обеспечения корректного JSON для вашей политики заключайте имена и значения атрибутов в двойные кавычки. Если тело JSON также заключено в двойные кавычки, то вам необходимо экранировать двойные кавычки, которые находятся внутри политики:

"{\"attribute\": \"value\", \"attribute\": [\"value\"]}"

Чтобы избежать экранирования кавычек, вы можете использовать одинарные кавычки для заключения политики и двойные кавычки для заключения имён и значений в JSON:

'{"attribute": "value", "attribute": ["value"]}'

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному в --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, заданные в JSON. Невозможно передать произвольные двоичные значения с помощью JSON-значения, так как строка будет интерпретироваться буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если не указано значение или указано значение input, выводит пример JSON-ввода, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, выведет пример YAML-ввода, который можно использовать с --cli-input-yaml. Если указано значение output, он валидирует входные данные команд и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (булево)

Включить отладку логов.

--endpoint-url (строка)

Переопределить значение URL по умолчанию команды указанным URL.

--no-verify-ssl (булево)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого соединения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.

--no-paginate (булево)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-потоковая передача

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использование определенного профиля из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отображение версии этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • включено
  • выключено
  • автоматически

--no-sign-request (булево)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл с набором сертификатов CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения к сокету в секундах. Если значение установлено в 0, подключение к сокету будет блокирующим и не будет таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, а двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, отображающего двоичный блок fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (булево)

Отключить показ страницы для вывода.

--cli-auto-prompt (булево)

Автоматически запрашивать входные параметры CLI.

--no-cli-auto-prompt (булево)

Отключить автоматическое запроса параметров ввода CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в руководстве пользователя AWS CLI.

Если не указано иное, все примеры используют правила цитирования, аналогичные Unix. Эти примеры необходимо адаптировать к правилам цитирования вашей консоли. См. использование кавычек со строками в руководстве пользователя AWS CLI.

Для создания распознавателя пользовательских сущностей

Следующий create-entity-recognizer пример запускает процесс обучения модели распознавателя пользовательских сущностей. Этот пример использует CSV-файл, содержащий обучающие документы, raw_text.csv, и CSV-список сущностей, entity_list.csv для обучения модели. entity-list.csv содержит следующие столбцы: текст и тип.

aws comprehend create-entity-recognizer \
    --recognizer-name example-entity-recognizer
    --data-access-role-arn arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-example-role \
    --input-data-config "EntityTypes=[{Type=DEVICE}],Documents={S3Uri=s3://amzn-s3-demo-bucket/trainingdata/raw_text.csv},EntityList={S3Uri=s3://amzn-s3-demo-bucket/trainingdata/entity_list.csv}"
    --language-code en

Вывод:

{
    "EntityRecognizerArn": "arn:aws:comprehend:us-west-2:111122223333:example-entity-recognizer/entityrecognizer1"
}

Дополнительную информацию см. в разделе Распознавание пользовательских сущностей в руководстве разработчика Amazon Comprehend.

Вывод

EntityRecognizerArn -> (строка)

Amazon Resource Name (ARN), идентифицирующий распознаватель сущностей.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API