[ aws . comprehend ]
list-document-classifiers
Описание
Получает список созданных вами классификаторов документов.
См. также: Документацию API AWS
list-document-classifiers является постраничной операцией. Для получения всего набора результатов могут быть выполнены несколько вызовов API. Вы можете отключить постраничность, указав аргумент --no-paginate. При использовании --output text и аргумента --query в ответе с постраничностью, аргумент --query должен извлекать данные из результатов следующих выражений запроса: DocumentClassifierPropertiesList
Синтаксис
list-document-classifiers
[--filter <value>]
[--cli-input-json | --cli-input-yaml]
[--starting-token <value>]
[--page-size <value>]
[--max-items <value>]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--filter (структура)
Фильтры возвращаемые задания. Вы можете фильтровать задания по их имени, статусу или дате и времени их отправки. Вы можете установить только один фильтр за раз.
Статус -> (строка)
DocumentClassifierName -> (строка)
SubmitTimeBefore -> (метка времени)
SubmitTimeAfter -> (метка времени)
Сокращённый синтаксис:
Status=string,DocumentClassifierName=string,SubmitTimeBefore=timestamp,SubmitTimeAfter=timestamp
Синтаксис JSON:
{
"Status": "SUBMITTED"|"TRAINING"|"DELETING"|"STOP_REQUESTED"|"STOPPED"|"IN_ERROR"|"TRAINED"|"TRAINED_WITH_WARNING",
"DocumentClassifierName": "string",
"SubmitTimeBefore": timestamp,
"SubmitTimeAfter": timestamp
}
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределят значения, предоставленные через JSON. Невозможно передавать произвольные двоичные значения, используя значение, предоставленное через JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--starting-token (строка)
Токен для указания места начала постраничного вывода. Это NextToken из ранее усеченного ответа.
Примеры использования см. в разделе Постраничный вывод в Руководстве пользователя AWS Command Line Interface.
--page-size (целое число)
Размер каждой страницы для получения в вызове AWS-сервиса. Это не влияет на количество элементов, возвращаемых в выводе команды. Установка меньшего размера страницы приводит к большему количеству вызовов AWS-сервиса, извлекая меньше элементов в каждом вызове. Это может помочь предотвратить таймауты вызовов AWS-сервиса.
Примеры использования см. в разделе Постраничный вывод в Руководстве пользователя AWS Command Line Interface.
--max-items (целое число)
Общее количество элементов для возврата в выводе команды. Если общее количество доступных элементов больше, чем указанное значение, в выводе команды предоставляется NextToken. Для возобновления постраничного вывода укажите значение NextToken в аргументе starting-token последующей команды. Не используйте элемент ответа NextToken напрямую вне AWS CLI.
Примеры использования см. в разделе Постраничный вывод в Руководстве пользователя AWS Command Line Interface.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или значение input, выводит пример входного JSON, который может использоваться в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который может использоваться с --cli-input-yaml. Если предоставлено значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI и не гарантирует обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включить отладку.
--endpoint-url (строка)
Переопределить URL по умолчанию команды на указанный URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого соединения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет поведение проверки сертификатов SSL по умолчанию.
--no-paginate (булево)
Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определённый профиль из файла ключей.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- включено
- выключено
- автоматически
--no-sign-request (булево)
Не подписывать запросы. Ключи не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл с корневыми сертификатами для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться в блокирующем режиме и без таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться в блокирующем режиме и без таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить пейджер CLI для вывода.
--cli-auto-prompt (булево)
Автоматически запрашивать параметры CLI.
--no-cli-auto-prompt (булево)
Отключить автоматическое запросы параметров CLI.
Примеры
Примечание
Для использования следующих примеров вам необходимо установить и настроить AWS CLI. Более подробная информация содержится в руководстве по началу работы в Руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования Unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей оболочки. См. Использование кавычек со строками в Руководстве пользователя AWS CLI.
Для отображения списка всех классификаторов документов
Следующий list-document-classifiers пример выводит список всех обученных и обучаемых моделей классификаторов документов.
aws comprehend list-document-classifiers
Вывод:
{
"DocumentClassifierPropertiesList": [
{
"DocumentClassifierArn": "arn:aws:comprehend:us-west-2:111122223333:document-classifier/exampleclassifier1",
"LanguageCode": "en",
"Status": "TRAINED",
"SubmitTime": "2023-06-13T19:04:15.735000+00:00",
"EndTime": "2023-06-13T19:42:31.752000+00:00",
"TrainingStartTime": "2023-06-13T19:08:20.114000+00:00",
"TrainingEndTime": "2023-06-13T19:41:35.080000+00:00",
"InputDataConfig": {
"DataFormat": "COMPREHEND_CSV",
"S3Uri": "s3://amzn-s3-demo-bucket/trainingdata"
},
"OutputDataConfig": {},
"ClassifierMetadata": {
"NumberOfLabels": 3,
"NumberOfTrainedDocuments": 5016,
"NumberOfTestDocuments": 557,
"EvaluationMetrics": {
"Accuracy": 0.9856,
"Precision": 0.9919,
"Recall": 0.9459,
"F1Score": 0.9673,
"MicroPrecision": 0.9856,
"MicroRecall": 0.9856,
"MicroF1Score": 0.9856,
"HammingLoss": 0.0144
}
},
"DataAccessRoleArn": "arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-testorle",
"Mode": "MULTI_CLASS"
},
{
"DocumentClassifierArn": "arn:aws:comprehend:us-west-2:111122223333:document-classifier/exampleclassifier2",
"LanguageCode": "en",
"Status": "TRAINING",
"SubmitTime": "2023-06-13T21:20:28.690000+00:00",
"InputDataConfig": {
"DataFormat": "COMPREHEND_CSV",
"S3Uri": "s3://amzn-s3-demo-bucket/trainingdata"
},
"OutputDataConfig": {},
"DataAccessRoleArn": "arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-testorle",
"Mode": "MULTI_CLASS"
}
]
}
Дополнительную информацию см. в разделе Создание и управление пользовательскими моделями в Руководстве разработчика Amazon Comprehend.
Вывод
DocumentClassifierPropertiesList -> (список)
Список, содержащий свойства каждой выполненной задачи.
(структура)
Предоставляет информацию о классификаторе документов.
DocumentClassifierArn -> (строка)
LanguageCode -> (строка)
Status -> (строка)
Состояние классификатора документов. Если статус равен TRAINED, классификатор готов к использованию. Если статус равен TRAINED_WITH_WARNINGS, обучение классификатора прошло успешно, но следует проверить предупреждения, возвращаемые в ответе CreateDocumentClassifier.
Если статус равен FAILED, вы можете найти дополнительную информацию о причинах, по которым классификатор не был обучен, в поле Message.
Message -> (строка)
SubmitTime -> (метка времени)
EndTime -> (метка времени)
TrainingStartTime -> (метка времени)
TrainingEndTime -> (метка времени)
InputDataConfig -> (структура)
Конфигурация входных данных, предоставленная при создании классификатора документов для обучения.
DataFormat -> (строка)
Формат данных обучения:
-
COMPREHEND_CSV: CSV-файл с двумя столбцами, где метки указаны в первом столбце, а документы — во втором. Если вы используете это значение, вы должны предоставить параметрS3Uriв своем запросе. -
AUGMENTED_MANIFEST: Набор меченых данных, созданный Amazon SageMaker Ground Truth. Этот файл имеет формат JSON-строк. Каждая строка представляет собой полный JSON-объект, содержащий учебный документ и его связанные метки. Если вы используете это значение, вы должны предоставить параметрAugmentedManifestsв своем запросе.
Если вы не укажете значение, Amazon Comprehend использует COMPREHEND_CSV в качестве значения по умолчанию.
S3Uri -> (строка)
Amazon S3 URI для входных данных. Ведро S3 должно находиться в той же области, что и конечная точка API, к которой вы обращаетесь. URI может указывать на один входной файл или префикс для набора входных файлов.
Например, если вы используете URI S3://bucketName/prefix , если префикс представляет собой один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если несколько файлов начинаются с указанного префикса, Amazon Comprehend использует все из них в качестве входных данных.
Этот параметр обязателен, если вы установили DataFormat на COMPREHEND_CSV.
TestS3Uri -> (строка)
LabelDelimiter -> (строка)
AugmentedManifests -> (список)
Список файлов дополненных манифестов, которые предоставляют данные обучения для вашей пользовательской модели. Файл дополненного манифеста — это набор меченых данных, созданный Amazon SageMaker Ground Truth.
Этот параметр обязателен, если вы установили DataFormat на AUGMENTED_MANIFEST.
(структура)
Файл дополненного манифеста, который предоставляет данные обучения для вашей пользовательской модели. Файл дополненного манифеста — это набор меченых данных, созданный Amazon SageMaker Ground Truth.
S3Uri -> (строка)
Split -> (строка)
Назначение предоставленных вами данных в дополненном манифесте. Вы можете либо обучать, либо тестировать эти данные. Если вы не укажете значение, по умолчанию будет train.
TRAIN — все документы в манифесте будут использованы для обучения. Если тестовые документы не предоставлены, Amazon Comprehend автоматически зарезервирует часть учебных документов для тестирования.
TEST — все документы в манифесте будут использованы для тестирования.
AttributeNames -> (список)
JSON-атрибут, содержащий аннотации для ваших учебных документов. Количество указанных вами имен атрибутов зависит от того, является ли ваш файл дополненного манифеста результатом одной задачи маркировки или цепочки задач маркировки.
Если ваш файл является результатом одной задачи маркировки, укажите ключ LabelAttributeName, который использовался при создании задачи в Ground Truth.
Если ваш файл является результатом цепочки задач маркировки, укажите ключ LabelAttributeName для одной или нескольких задач в цепочке. Каждый ключ LabelAttributeName предоставляет аннотации из отдельной задачи.
(строка)
AnnotationDataS3Uri -> (строка)
SourceDocumentsS3Uri -> (строка)
DocumentType -> (строка)
Тип дополненного манифеста. PlainTextDocument или SemiStructuredDocument. Если вы не укажете значение, по умолчанию будет PlainTextDocument.
-
PLAIN_TEXT_DOCUMENTТип документа, представляющий любой текст Юникода, закодированный в UTF-8. -
SEMI_STRUCTURED_DOCUMENTТип документа с контекстом расположения и структуры, например, PDF. Для обучения с Amazon Comprehend поддерживаются только PDF-файлы. Для вывода Amazon Comprehend поддерживает PDF, DOCX и TXT.
DocumentType -> (строка)
Documents -> (структура)
Расположение S3 учебных документов. Этот параметр обязателен при запросе на создание нативной модели документов.
S3Uri -> (строка)
TestS3Uri -> (строка)
DocumentReaderConfig -> (структура)
Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.
По умолчанию Amazon Comprehend выполняет следующие действия по извлечению текста из файлов, в зависимости от типа входного файла:
- Файлы Word — Amazon Comprehend парсер извлекает текст.
- Цифровые PDF-файлы — Amazon Comprehend парсер извлекает текст.
-
Файлы изображений и отсканированные PDF-файлы — Amazon Comprehend использует API Amazon Textract
DetectDocumentTextдля извлечения текста.
DocumentReaderConfig не применяется к текстовым файлам или файлам Word.Для файлов изображений и PDF-документов вы можете переопределить эти стандартные действия, используя указанные ниже поля. Дополнительную информацию см. в разделе Настройка параметров извлечения текста в руководстве разработчика Comprehend.
DocumentReadAction -> (строка)
Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:
-
TEXTRACT_DETECT_DOCUMENT_TEXT— Сервис Amazon Comprehend использует операцию APIDetectDocumentText. -
TEXTRACT_ANALYZE_DOCUMENT— Сервис Amazon Comprehend использует операцию APIAnalyzeDocument.
DocumentReadMode -> (строка)
Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:
-
SERVICE_DEFAULT— использовать стандартные настройки Amazon Comprehend для PDF-файлов. -
FORCE_DOCUMENT_READ_ACTION— Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.
FeatureTypes -> (список)
Указывает тип функций Amazon Textract, которые нужно применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:
-
TABLES— возвращает дополнительную информацию о любых таблицах, обнаруженных в входном документе. -
FORMS— возвращает дополнительную информацию о любых формах, обнаруженных в входном документе.
(строка)
OutputDataConfig -> (структура)
Предоставляет параметры конфигурации выходных результатов для задач пользовательского классификатора.
S3Uri -> (строка)
При использовании объекта OutputDataConfig при создании пользовательского классификатора вы указываете расположение Amazon S3, куда хотите записать матрицу ошибок и другие выходные файлы. URI должен находиться в той же области, что и конечная точка API, к которой вы обращаетесь. Расположение используется в качестве префикса для фактического расположения этого выходного файла.
После завершения задачи пользовательского классификатора служба создает выходной файл в каталоге, специфичном для задачи. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz . Это сжатый архив, содержащий матрицу ошибок.
KmsKeyId -> (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования выходных результатов задачи анализа. KmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Идентификатор Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab" - Псевдоним ключа KMS:
"alias/ExampleAlias" - ARN псевдонима ключа KMS:
"arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"
FlywheelStatsS3Prefix -> (строка)
ClassifierMetadata -> (структура)
Информация о классификаторе документов, включая количество документов, использованных для обучения классификатора, количество документов, использованных для тестирования, и рейтинг точности.
NumberOfLabels -> (целое число)
NumberOfTrainedDocuments -> (целое число)
NumberOfTestDocuments -> (целое число)
EvaluationMetrics -> (структура)
Описывает метрики результатов для тестовых данных, связанных с классификатором документов.
Accuracy -> (вещественное число)
Precision -> (вещественное число)
Recall -> (вещественное число)
F1Score -> (вещественное число)
Precision и Recall. F1Score представляет собой гармоническое среднее этих двух значений. Максимальное значение - 1, минимальное - 0.MicroPrecision -> (вещественное число)
MicroRecall -> (вещественное число)
MicroF1Score -> (вещественное число)
Micro Precision и Micro Recall. Micro F1Score представляет собой гармоническое среднее этих двух значений. Максимальное значение - 1, минимальное - 0.HammingLoss -> (вещественное число)
DataAccessRoleArn -> (строка)
VolumeKmsKeyId -> (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на объеме хранилища, подключенном к экземплярам вычислительных ресурсов ML, обрабатывающим задачу анализа. VolumeKmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
VpcConfig -> (структура)
Параметры конфигурации для частного виртуального частного облака (VPC), содержащего ресурсы, которые вы используете для своего пользовательского классификатора. Дополнительную информацию см. в Amazon VPC.
SecurityGroupIds -> (список)
Идентификатор группы безопасности на экземпляре вашего частного VPC. Группы безопасности в вашем VPC служат виртуальным брандмауэром для управления входящим и исходящим трафиком и обеспечивают безопасность ресурсов, к которым вы будете обращаться в VPC. Этот идентификатор предваряется «sg-», например: «sg-03b388029b0a285ea». Дополнительную информацию см. в Группах безопасности для вашего VPC.
(строка)
Subnets -> (список)
Идентификатор каждого подсети, используемого в вашем частном VPC. Эта подсеть является подмножеством диапазона адресов IPv4, используемых VPC, и специфична для определенной зоны доступности в регионе VPC. Этот идентификатор предваряется «subnet-», например: «subnet-04ccf456919e69055». Дополнительную информацию см. в VPC и подсетях.
(строка)
Mode -> (строка)
ModelKmsKeyId -> (строка)
Идентификатор ключа KMS, который Amazon Comprehend использует для шифрования обученных пользовательских моделей. ModelKmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
VersionName -> (строка)
SourceModelArn -> (строка)
FlywheelArn -> (строка)
NextToken -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.