[ aws . comprehend ]
describe-document-classifier
Описание
Получает свойства, связанные с классификатором документов.
См. также: Документацию API AWS
Синтаксис
describe-document-classifier
--document-classifier-arn <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--document-classifier-arn (строка)
CreateDocumentClassifier операция возвращает этот идентификатор в своём ответе.--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные через JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного через JSON, так как строка будет интерпретирована буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено со значением output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладку логирования.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого соединения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (логическое значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла аутентификации.
--region (строка)
Регион для использования. Переопределяет настройки из конфигурации/окружения.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/отключить цветной вывод.
- включить
- выключить
- автоматически
--no-sign-request (логическое значение)
Не подписывать запросы. Кредиты не будут загружены, если этот параметр предоставлен.
--ca-bundle (строка)
Пакет сертификатов CA для использования при проверке сертификатов SSL. Переопределяет настройки из конфигурации/окружения.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию - base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно, независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить вывод пейджера CLI.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать параметры CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическое запросы параметров CLI.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.
Если не указано иное, во всех примерах используются правила цитирования, подобные Unix. Эти примеры потребуется адаптировать к правилам цитирования вашей терминальной среды. См. Использование кавычек со строками в Руководстве пользователя AWS CLI.
Чтобы описать классификатор документов
Следующий describe-document-classifier пример получает свойства модели классификатора пользовательских документов.
aws comprehend describe-document-classifier \
--document-classifier-arn arn:aws:comprehend:us-west-2:111122223333:document-classifier/example-classifier-1
Вывод:
{
"DocumentClassifierProperties": {
"DocumentClassifierArn": "arn:aws:comprehend:us-west-2:111122223333:document-classifier/example-classifier-1",
"LanguageCode": "en",
"Status": "TRAINED",
"SubmitTime": "2023-06-13T19:04:15.735000+00:00",
"EndTime": "2023-06-13T19:42:31.752000+00:00",
"TrainingStartTime": "2023-06-13T19:08:20.114000+00:00",
"TrainingEndTime": "2023-06-13T19:41:35.080000+00:00",
"InputDataConfig": {
"DataFormat": "COMPREHEND_CSV",
"S3Uri": "s3://amzn-s3-demo-bucket/trainingdata"
},
"OutputDataConfig": {},
"ClassifierMetadata": {
"NumberOfLabels": 3,
"NumberOfTrainedDocuments": 5016,
"NumberOfTestDocuments": 557,
"EvaluationMetrics": {
"Accuracy": 0.9856,
"Precision": 0.9919,
"Recall": 0.9459,
"F1Score": 0.9673,
"MicroPrecision": 0.9856,
"MicroRecall": 0.9856,
"MicroF1Score": 0.9856,
"HammingLoss": 0.0144
}
},
"DataAccessRoleArn": "arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-example-role",
"Mode": "MULTI_CLASS"
}
}
Дополнительную информацию см. в разделе Создание и управление пользовательскими моделями в Руководстве разработчика Amazon Comprehend.
Выходные данные
DocumentClassifierProperties -> (структура)
Объект, содержащий свойства, связанные с классификатором документов.
DocumentClassifierArn -> (строка)
LanguageCode -> (строка)
Status -> (строка)
Состояние классификатора документов. Если состояние равно TRAINED, классификатор готов к использованию. Если состояние равно TRAINED_WITH_WARNINGS, обучение классификатора завершилось успешно, но необходимо проверить предупреждения, возвращённые в ответ CreateDocumentClassifier.
Если состояние равно FAILED, можно узнать дополнительную информацию о причинах, по которым классификатор не был обучен, в поле Message.
Message -> (строка)
SubmitTime -> (метка времени)
EndTime -> (метка времени)
TrainingStartTime -> (метка времени)
TrainingEndTime -> (метка времени)
InputDataConfig -> (структура)
Конфигурация входных данных, предоставленная при создании классификатора документов для обучения.
DataFormat -> (строка)
Формат данных обучения:
-
COMPREHEND_CSV: CSV-файл с двумя колонками, где метки предоставлены в первой колонке, а документы — во второй. Если вы используете это значение, вы должны указать параметрS3Uriв запросе. -
AUGMENTED_MANIFEST: Меткированные данные, созданные Amazon SageMaker Ground Truth. Этот файл имеет формат JSON строк. Каждая строка представляет собой полный JSON-объект, содержащий обучающий документ и связанные с ним метки. Если вы используете это значение, вы должны указать параметрAugmentedManifestsв запросе.
Если вы не укажете значение, Amazon Comprehend использует COMPREHEND_CSV по умолчанию.
S3Uri -> (строка)
Amazon S3 URI для входных данных. Ведро S3 должно находиться в том же регионе, что и конечная точка API, к которой вы обращаетесь. URI может указывать на один входной файл или префикс для набора входных файлов.
Например, если вы используете URI S3://bucketName/prefix, если префикс — это один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если более одного файла начинаются с префикса, Amazon Comprehend использует все их в качестве входных данных.
Этот параметр обязателен, если вы установили DataFormat в COMPREHEND_CSV.
TestS3Uri -> (строка)
LabelDelimiter -> (строка)
AugmentedManifests -> (список)
Список файлов расширенного манифеста, предоставляющих обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это меткированные данные, созданные Amazon SageMaker Ground Truth.
Этот параметр обязателен, если вы установили DataFormat в AUGMENTED_MANIFEST.
(структура)
Файл расширенного манифеста, предоставляющий обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это меткированные данные, созданные Amazon SageMaker Ground Truth.
S3Uri -> (строка)
Split -> (строка)
Назначение предоставленных вами данных в расширенном манифесте. Вы можете использовать их для обучения или тестирования. Если вы не укажете значение, по умолчанию будет train.
TRAIN — все документы в манифесте будут использованы для обучения. Если тестовые документы не предоставлены, Amazon Comprehend автоматически зарезервирует часть обучающих документов для тестирования.
TEST — все документы в манифесте будут использованы для тестирования.
AttributeNames -> (список)
JSON-атрибут, содержащий аннотации для ваших обучающих документов. Количество указанных вами имён атрибутов зависит от того, является ли файл расширенного манифеста результатом одной задачи аннотирования или цепочки задач аннотирования.
Если файл является результатом одной задачи аннотирования, укажите ключ LabelAttributeName, использованный при создании задачи в Ground Truth.
Если файл является результатом цепочки задач аннотирования, укажите ключ LabelAttributeName для одной или нескольких задач в цепочке. Каждый ключ LabelAttributeName предоставляет аннотации из отдельной задачи.
(строка)
AnnotationDataS3Uri -> (строка)
SourceDocumentsS3Uri -> (строка)
DocumentType -> (строка)
Тип расширенного манифеста. PlainTextDocument или SemiStructuredDocument. Если вы не укажете значение, по умолчанию будет PlainTextDocument.
-
PLAIN_TEXT_DOCUMENTТип документа, представляющий любой текст Unicode, закодированный в UTF-8. -
SEMI_STRUCTURED_DOCUMENTТип документа с контекстом расположения и структуры, например, PDF. Для обучения с Amazon Comprehend поддерживаются только PDF-файлы. Для вывода Amazon Comprehend поддерживает PDF, DOCX и TXT.
DocumentType -> (строка)
Documents -> (структура)
Расположение в S3 обучающих документов. Этот параметр обязателен при запросе на создание пользовательской модели документов.
S3Uri -> (строка)
TestS3Uri -> (строка)
DocumentReaderConfig -> (структура)
Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.
По умолчанию Amazon Comprehend выполняет следующие действия для извлечения текста из файлов в зависимости от типа входного файла:
- Файлы Word — анализатор Amazon Comprehend извлекает текст.
- Цифровые PDF-файлы — анализатор Amazon Comprehend извлекает текст.
-
Файлы изображений и отсканированные PDF-файлы — Amazon Comprehend использует API Amazon Textract
DetectDocumentTextдля извлечения текста.
DocumentReaderConfig не относится к текстовым файлам или файлам Word.Для файлов изображений и PDF-документов вы можете переопределить эти стандартные действия, используя поля, перечисленные ниже. Дополнительную информацию см. в руководстве разработчика Comprehend: Настройка параметров извлечения текста.
DocumentReadAction -> (строка)
Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:
-
TEXTRACT_DETECT_DOCUMENT_TEXT— служба Amazon Comprehend использует операцию APIDetectDocumentText. -
TEXTRACT_ANALYZE_DOCUMENT— служба Amazon Comprehend использует операцию APIAnalyzeDocument.
DocumentReadMode -> (строка)
Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:
-
SERVICE_DEFAULT— использовать стандартные настройки службы Amazon Comprehend для PDF-файлов. -
FORCE_DOCUMENT_READ_ACTION— Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.
FeatureTypes -> (список)
Указывает тип функций Amazon Textract, которые следует применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:
-
TABLES— возвращает дополнительную информацию о любых обнаруженных таблицах в входном документе. -
FORMS— возвращает дополнительную информацию о любых обнаруженных формах в входном документе.
(строка)
OutputDataConfig -> (структура)
Предоставляет параметры конфигурации результатов вывода для пользовательских задач классификации.
S3Uri -> (строка)
Когда вы используете объект OutputDataConfig при создании пользовательского классификатора, вы указываете расположение в Amazon S3, куда вы хотите записать матрицу путаницы и другие выходные файлы. URI должен находиться в том же регионе, что и конечная точка API, к которой вы обращаетесь. Расположение используется в качестве префикса для фактического расположения этого выходного файла.
По завершении задачи пользовательского классификатора служба создаёт выходной файл в каталоге, специфичном для задачи. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz. Это сжатый архив, содержащий матрицу путаницы.
KmsKeyId -> (строка)
Идентификатор ключа управления ключами Amazon Web Services (KMS), который Amazon Comprehend использует для шифрования результатов вывода задачи анализа. KmsKeyId может иметь один из следующих форматов:
- ID ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab" - Псевдоним ключа KMS:
"alias/ExampleAlias" - ARN псевдонима ключа KMS:
"arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"
FlywheelStatsS3Prefix -> (строка)
ClassifierMetadata -> (структура)
Информация о классификаторе документов, включая количество документов, используемых для обучения классификатора, количество документов, используемых для тестирования классификатора, и рейтинг точности.
NumberOfLabels -> (целое число)
NumberOfTrainedDocuments -> (целое число)
NumberOfTestDocuments -> (целое число)
EvaluationMetrics -> (структура)
Описывает метрики результатов для тестовых данных, связанных с классификатором документов.
Accuracy -> (вещественное число)
Precision -> (вещественное число)
Recall -> (вещественное число)
F1Score -> (вещественное число)
Precision и Recall. F1Score — гармоническое среднее этих двух значений. Максимальное значение — 1, минимальное — 0.MicroPrecision -> (вещественное число)
MicroRecall -> (вещественное число)
MicroF1Score -> (вещественное число)
Micro Precision и Micro Recall. Micro F1Score — гармоническое среднее этих двух значений. Максимальное значение — 1, минимальное — 0.HammingLoss -> (вещественное число)
DataAccessRoleArn -> (строка)
VolumeKmsKeyId -> (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на томе хранения, подключенном к экземпляру вычислительного узла ML, который обрабатывает задание анализа. VolumeKmsKeyId может быть представлен в одном из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
VpcConfig -> (структура)
Параметры конфигурации частного виртуального частного облака (VPC), содержащего ресурсы, которые вы используете для вашего пользовательского классификатора. Для получения дополнительной информации см. Amazon VPC.
SecurityGroupIds -> (список)
Идентификатор группы безопасности на экземпляре вашего частного VPC. Группы безопасности вашего VPC работают как виртуальный брандмауэр для управления входящим и исходящим трафиком и обеспечивают безопасность для ресурсов, к которым вы будете получать доступ в VPC. Этот идентификатор предваряется «sg-», например: «sg-03b388029b0a285ea». Для получения дополнительной информации см. Группы безопасности для вашего VPC.
(строка)
Subnets -> (список)
Идентификатор каждого подсети, используемого в вашем частном VPC. Эта подсеть является подмножеством диапазона адресов IPv4, используемых VPC, и специфична для определенной зоны доступности в регионе VPC. Этот идентификатор предваряется «subnet-», например: «subnet-04ccf456919e69055». Для получения дополнительной информации см. VPC и подсети.
(строка)
Mode -> (строка)
ModelKmsKeyId -> (строка)
Идентификатор ключа KMS, который Amazon Comprehend использует для шифрования обученных пользовательских моделей. ModelKmsKeyId может быть представлен в одном из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
VersionName -> (строка)
SourceModelArn -> (строка)
FlywheelArn -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.