[ aws . comprehend ]
создать-классификатор-документов
Описание
Создаёт новый классификатор документов, который можно использовать для категоризации документов. Для создания классификатора необходимо предоставить набор обучающих документов, помеченных категориями, которые вы хотите использовать. Дополнительную информацию можно найти в руководстве разработчика Comprehend в разделе Обучение моделей классификаторов.
См. также: Документацию API AWS
Синтаксис
create-document-classifier
--document-classifier-name <value>
[--version-name <value>]
--data-access-role-arn <value>
[--tags <value>]
--input-data-config <value>
[--output-data-config <value>]
[--client-request-token <value>]
--language-code <value>
[--volume-kms-key-id <value>]
[--vpc-config <value>]
[--mode <value>]
[--model-kms-key-id <value>]
[--model-policy <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--document-classifier-name (строка)
--version-name (строка)
--data-access-role-arn (строка)
--tags (список)
Теги, которые следует связать с классификатором документов. Тег — это пара ключ-значение, которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с ключом «Продажи» может быть добавлен к ресурсу, чтобы указать, что он используется отделом продаж.
(структура)
Пара ключ-значение, которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с парой ключ-значение «Отдел»:«Продажи» может быть добавлен к ресурсу, чтобы указать, что он используется определённым отделом.
Ключ -> (строка)
Значение -> (строка)
Сокращённый синтаксис:
Key=string,Value=string ...
Синтаксис JSON:
[
{
"Key": "string",
"Value": "string"
}
...
]
--input-data-config (структура)
Определяет формат и расположение входных данных для задания.
DataFormat -> (строка)
Формат ваших обучающих данных:
-
COMPREHEND_CSV: Файл CSV с двумя столбцами, где метки указаны в первом столбце, а документы — во втором. Если вы используете это значение, вы должны указать параметрS3Uriв вашем запросе. -
AUGMENTED_MANIFEST: Метка данных, созданная Amazon SageMaker Ground Truth. Этот файл имеет формат JSON-строк. Каждая строка — это полный JSON-объект, содержащий обучающий документ и связанные с ним метки. Если вы используете это значение, вы должны указать параметрAugmentedManifestsв вашем запросе.
Если вы не указываете значение, Amazon Comprehend использует COMPREHEND_CSV по умолчанию.
S3Uri -> (строка)
Amazon S3 URI для входных данных. Ведро S3 должно находиться в том же регионе, что и конечная точка API, которую вы вызываете. URI может указывать на один входной файл или префикс для набора входных файлов.
Например, если вы используете URI S3://bucketName/prefix , если префикс — это один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если более одного файла начинается с префикса, Amazon Comprehend использует все их в качестве входных данных.
Этот параметр обязателен, если вы установили DataFormat в значение COMPREHEND_CSV .
TestS3Uri -> (строка)
LabelDelimiter -> (строка)
AugmentedManifests -> (список)
Список файлов расширенных манифестов, предоставляющих обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это набор меченых данных, созданный Amazon SageMaker Ground Truth.
Этот параметр обязателен, если вы установили DataFormat в значение AUGMENTED_MANIFEST .
(структура)
Файл расширенного манифеста, предоставляющий обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это набор меченых данных, созданный Amazon SageMaker Ground Truth.
S3Uri -> (строка)
Split -> (строка)
Назначение предоставленных вами данных в расширенном манифесте. Вы можете либо обучать, либо тестировать эти данные. Если вы не указываете, по умолчанию используется train.
TRAIN — все документы в манифесте будут использованы для обучения. Если тестовые документы не предоставлены, Amazon Comprehend автоматически зарезервирует часть обучающих документов для тестирования.
TEST — все документы в манифесте будут использованы для тестирования.
AttributeNames -> (список)
JSON-атрибут, содержащий аннотации для ваших обучающих документов. Количество указанных вами имён атрибутов зависит от того, является ли файл расширенного манифеста выходным результатом одного задания аннотирования или цепочки заданий аннотирования.
Если ваш файл является результатом одного задания аннотирования, укажите ключ LabelAttributeName, который использовался при создании задания в Ground Truth.
Если ваш файл является результатом цепочки заданий аннотирования, укажите ключ LabelAttributeName для одного или нескольких заданий в цепочке. Каждый ключ LabelAttributeName предоставляет аннотации из отдельных заданий.
(строка)
AnnotationDataS3Uri -> (строка)
SourceDocumentsS3Uri -> (строка)
DocumentType -> (строка)
Тип расширенного манифеста. PlainTextDocument или SemiStructuredDocument. Если вы не указываете, по умолчанию используется PlainTextDocument.
-
PLAIN_TEXT_DOCUMENTТип документа, представляющий любой текст Юникода, закодированный в UTF-8. -
SEMI_STRUCTURED_DOCUMENTТип документа с позиционным и структурным контекстом, например, PDF. Для обучения с помощью Amazon Comprehend поддерживаются только PDF-файлы. Для вывода Amazon Comprehend поддерживает PDF, DOCX и TXT.
DocumentType -> (строка)
Documents -> (структура)
Расположение S3 обучающих документов. Этот параметр обязателен для запроса на создание модели документов.
S3Uri -> (строка)
TestS3Uri -> (строка)
DocumentReaderConfig -> (структура)
Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из документов PDF и файлов изображений.
По умолчанию Amazon Comprehend выполняет следующие действия для извлечения текста из файлов в зависимости от типа входного файла:
- Файлы Word — Amazon Comprehend анализирует текст.
- Цифровые файлы PDF — Amazon Comprehend анализирует текст.
-
Файлы изображений и отсканированные PDF-файлы — Amazon Comprehend использует API Amazon Textract
DetectDocumentTextдля извлечения текста.
DocumentReaderConfig не применяется к файлам простого текста или файлам Word.Для файлов изображений и документов PDF вы можете переопределить эти стандартные действия, используя указанные ниже поля. Дополнительную информацию см. в руководстве разработчика Comprehend в разделе Настройка параметров извлечения текста.
DocumentReadAction -> (строка)
Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из файлов PDF и файлов изображений. Введите одно из следующих значений:
-
TEXTRACT_DETECT_DOCUMENT_TEXT— Amazon Comprehend использует операцию APIDetectDocumentText. -
TEXTRACT_ANALYZE_DOCUMENT— Amazon Comprehend использует операцию APIAnalyzeDocument.
DocumentReadMode -> (строка)
Определяет действия по извлечению текста для файлов PDF. Введите одно из следующих значений:
-
SERVICE_DEFAULT— используйте стандартные настройки Amazon Comprehend для файлов PDF. -
FORCE_DOCUMENT_READ_ACTION— Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех файлов PDF, включая цифровые PDF-файлы.
FeatureTypes -> (список)
Указывает тип функций Amazon Textract, которые следует применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:
-
TABLES— возвращает дополнительную информацию о любых таблицах, обнаруженных в входном документе. -
FORMS— возвращает дополнительную информацию о любых формах, обнаруженных в входном документе.
(строка)
Синтаксис JSON:
{
"DataFormat": "COMPREHEND_CSV"|"AUGMENTED_MANIFEST",
"S3Uri": "string",
"TestS3Uri": "string",
"LabelDelimiter": "string",
"AugmentedManifests": [
{
"S3Uri": "string",
"Split": "TRAIN"|"TEST",
"AttributeNames": ["string", ...],
"AnnotationDataS3Uri": "string",
"SourceDocumentsS3Uri": "string",
"DocumentType": "PLAIN_TEXT_DOCUMENT"|"SEMI_STRUCTURED_DOCUMENT"
}
...
],
"DocumentType": "PLAIN_TEXT_DOCUMENT"|"SEMI_STRUCTURED_DOCUMENT",
"Documents": {
"S3Uri": "string",
"TestS3Uri": "string"
},
"DocumentReaderConfig": {
"DocumentReadAction": "TEXTRACT_DETECT_DOCUMENT_TEXT"|"TEXTRACT_ANALYZE_DOCUMENT",
"DocumentReadMode": "SERVICE_DEFAULT"|"FORCE_DOCUMENT_READ_ACTION",
"FeatureTypes": ["TABLES"|"FORMS", ...]
}
}
--output-data-config (структура)
Указывает расположение выходных файлов из задания пользовательского классификатора. Этот параметр требуется для запроса на создание модели документов.
S3Uri -> (строка)
При использовании объекта OutputDataConfig при создании пользовательского классификатора вы указываете расположение Amazon S3, куда вы хотите записать матрицу путаницы и другие выходные файлы. URI должен находиться в том же регионе, что и вызываемая конечная точка API. Расположение используется в качестве префикса для фактического расположения этого выходного файла.
Когда задание пользовательского классификатора завершено, служба создаёт выходной файл в каталоге, специфичном для задания. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz. Это сжатый архив, содержащий матрицу путаницы.
KmsKeyId -> (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования выходных результатов задания анализа. KmsKeyId может быть одного из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab" - Псевдоним ключа KMS:
"alias/ExampleAlias" - ARN псевдонима ключа KMS:
"arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"
FlywheelStatsS3Prefix -> (строка)
Сокращённый синтаксис:
S3Uri=string,KmsKeyId=string,FlywheelStatsS3Prefix=string
Синтаксис JSON:
{
"S3Uri": "string",
"KmsKeyId": "string",
"FlywheelStatsS3Prefix": "string"
}
--client-request-token (строка)
--language-code (строка)
Язык входных документов. Вы можете указать любой из языков, поддерживаемых Amazon Comprehend. Все документы должны быть на одном языке.
Возможные значения:
enesfrdeitptarhijakozhzh-TW
--volume-kms-key-id (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на томе хранения, подключенном к экземплярам вычислительных ресурсов ML, обрабатывающим задание анализа. VolumeKmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
--vpc-config (структура)
Параметры конфигурации для необязательной частной виртуальной сети (VPC), содержащей ресурсы, используемые для вашего пользовательского классификатора. Дополнительную информацию см. в разделе Amazon VPC.
SecurityGroupIds -> (список)
Идентификатор группы безопасности на экземпляре вашей частной VPC. Группы безопасности вашей VPC работают как виртуальный брандмауэр, контролируя входящий и исходящий трафик и обеспечивают безопасность ресурсов, к которым вы будете обращаться в VPC. Этот номер идентификатора предваряется «sg-», например: «sg-03b388029b0a285ea». Дополнительную информацию см. в разделе Группы безопасности для вашей VPC.
(строка)
Subnets -> (список)
Идентификатор каждого подсети, используемой в вашей частной VPC. Эта подсеть является подмножеством диапазона адресов IPv4, используемых VPC, и специфична для определенной зоны доступности в регионе VPC. Этот номер идентификатора предваряется «subnet-», например: «subnet-04ccf456919e69055». Дополнительную информацию см. в разделе VPC и подсети.
(строка)
Сокращенная синтаксическая запись:
SecurityGroupIds=string,string,Subnets=string,string
Синтаксис JSON:
{
"SecurityGroupIds": ["string", ...],
"Subnets": ["string", ...]
}
--mode (строка)
Указывает режим обучения классификатора. Классификатор можно обучить в режиме многоклассовой (однозначной) классификации или в режиме множественной классификации. Режим многоклассовой классификации определяет один класс метки для каждого документа, а режим множественной классификации определяет одну или несколько меток класса для каждого документа. Несколько меток для одного документа разделяются разделителем. По умолчанию разделителем между метками является вертикальная черта (|).
Возможные значения:
MULTI_CLASSMULTI_LABEL
--model-kms-key-id (строка)
Идентификатор ключа KMS, который Amazon Comprehend использует для шифрования обученных пользовательских моделей. ModelKmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
--model-policy (строка)
Политика с опорой на ресурс для присоединения к вашей модели пользовательского классификатора документов. Вы можете использовать эту политику, чтобы разрешить другому аккаунту Amazon Web Services импортировать вашу пользовательскую модель.
Предоставьте свою политику в виде тела JSON, которое вы вводите в виде кодированной строки UTF-8 без переносов строк. Чтобы предоставить допустимый JSON, заключите имена и значения атрибутов в двойные кавычки. Если тело JSON также заключено в двойные кавычки, то вам необходимо экранировать двойные кавычки, которые находятся внутри политики:
"{\"attribute\": \"value\", \"attribute\": [\"value\"]}"Чтобы избежать экранирования кавычек, вы можете использовать одинарные кавычки для заключения политики и двойные кавычки для заключения имен и значений JSON:
'{"attribute": "value", "attribute": ["value"]}'--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет взята дословно. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит каркас JSON в стандартный вывод без отправки запроса API. При отсутствии значения или значении input выводит пример входного JSON, который может быть использован в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, будет выведен пример входного YAML, который может быть использован с --cli-input-yaml. Если указано значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный каркас JSON не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном каркасе JSON.
Глобальные параметры
--debug (логическое значение)
Включить отладку логирования.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с сервисами AWS. Для каждого соединения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (логическое значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI будет делать только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- включено
- выключено
- автоматически
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл с набором сертификатов CA для использования при проверке сертификатов SSL. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде строки, закодированной в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку fileb://, всегда будет обрабатываться как двоичный и будет использоваться содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для заданной настройки cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить кли-пайпер для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическое запроса параметров ввода CLI.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Подробнее см. в руководстве «Начало работы» в Руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования, похожие на Unix. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной оболочки. Подробнее см. в разделе Использование кавычек со строками в Руководстве пользователя AWS CLI.
Создание классификатора документов для категоризации документов
Следующий create-document-classifier пример запускает процесс обучения модели классификатора документов. Файл обучающих данных training.csv находится по адресу --input-data-config. training.csv представляет собой документ из двух столбцов, где метки или классификации предоставляются в первом столбце, а документы — во втором столбце.
aws comprehend create-document-classifier \
--document-classifier-name example-classifier \
--data-access-arn arn:aws:comprehend:us-west-2:111122223333:pii-entities-detection-job/123456abcdeb0e11022f22a11EXAMPLE \
--input-data-config "S3Uri=s3://amzn-s3-demo-bucket/" \
--language-code en
Вывод:
{
"DocumentClassifierArn": "arn:aws:comprehend:us-west-2:111122223333:document-classifier/example-classifier"
}
Дополнительную информацию см. в разделе «Пользовательская классификация» в Руководстве разработчика Amazon Comprehend.
Вывод
DocumentClassifierArn -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.