Spec-Zone.ru › AWS CLI v2

[ aws . comprehend ]

describe-document-classifier

Описание

Получает свойства, связанные с классификатором документов.

См. также: Документацию API AWS

Синтаксис

  describe-document-classifier
--document-classifier-arn <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--document-classifier-arn (строка)

Amazon Resource Name (ARN), определяющий классификатор документов. CreateDocumentClassifier операция возвращает этот идентификатор в своём ответе.

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные через JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного через JSON, так как строка будет интерпретирована буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено со значением output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включить отладку логирования.

--endpoint-url (строка)

Переопределить URL по умолчанию команды заданным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого соединения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из файла аутентификации.

--region (строка)

Регион для использования. Переопределяет настройки из конфигурации/окружения.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/отключить цветной вывод.

  • включить
  • выключить
  • автоматически

--no-sign-request (логическое значение)

Не подписывать запросы. Кредиты не будут загружены, если этот параметр предоставлен.

--ca-bundle (строка)

Пакет сертификатов CA для использования при проверке сертификатов SSL. Переопределяет настройки из конфигурации/окружения.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию - 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию - base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно, независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить вывод пейджера CLI.

--cli-auto-prompt (логическое значение)

Автоматически запрашивать параметры CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запросы параметров CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.

Если не указано иное, во всех примерах используются правила цитирования, подобные Unix. Эти примеры потребуется адаптировать к правилам цитирования вашей терминальной среды. См. Использование кавычек со строками в Руководстве пользователя AWS CLI.

Чтобы описать классификатор документов

Следующий describe-document-classifier пример получает свойства модели классификатора пользовательских документов.

aws comprehend describe-document-classifier \
    --document-classifier-arn arn:aws:comprehend:us-west-2:111122223333:document-classifier/example-classifier-1

Вывод:

{
    "DocumentClassifierProperties": {
        "DocumentClassifierArn": "arn:aws:comprehend:us-west-2:111122223333:document-classifier/example-classifier-1",
        "LanguageCode": "en",
        "Status": "TRAINED",
        "SubmitTime": "2023-06-13T19:04:15.735000+00:00",
        "EndTime": "2023-06-13T19:42:31.752000+00:00",
        "TrainingStartTime": "2023-06-13T19:08:20.114000+00:00",
        "TrainingEndTime": "2023-06-13T19:41:35.080000+00:00",
        "InputDataConfig": {
            "DataFormat": "COMPREHEND_CSV",
            "S3Uri": "s3://amzn-s3-demo-bucket/trainingdata"
        },
        "OutputDataConfig": {},
        "ClassifierMetadata": {
            "NumberOfLabels": 3,
            "NumberOfTrainedDocuments": 5016,
            "NumberOfTestDocuments": 557,
            "EvaluationMetrics": {
                "Accuracy": 0.9856,
                "Precision": 0.9919,
                "Recall": 0.9459,
                "F1Score": 0.9673,
                "MicroPrecision": 0.9856,
                "MicroRecall": 0.9856,
                "MicroF1Score": 0.9856,
                "HammingLoss": 0.0144
            }
        },
        "DataAccessRoleArn": "arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-example-role",
        "Mode": "MULTI_CLASS"
    }
}

Дополнительную информацию см. в разделе Создание и управление пользовательскими моделями в Руководстве разработчика Amazon Comprehend.

Выходные данные

DocumentClassifierProperties -> (структура)

Объект, содержащий свойства, связанные с классификатором документов.

DocumentClassifierArn -> (строка)

Идентификатор Amazon Resource Name (ARN) классификатора документов.

LanguageCode -> (строка)

Код языка документов, на которых был обучен классификатор.

Status -> (строка)

Состояние классификатора документов. Если состояние равно TRAINED, классификатор готов к использованию. Если состояние равно TRAINED_WITH_WARNINGS, обучение классификатора завершилось успешно, но необходимо проверить предупреждения, возвращённые в ответ CreateDocumentClassifier.

Если состояние равно FAILED, можно узнать дополнительную информацию о причинах, по которым классификатор не был обучен, в поле Message.

Message -> (строка)

Дополнительная информация о состоянии классификатора.

SubmitTime -> (метка времени)

Время отправки классификатора документов на обучение.

EndTime -> (метка времени)

Время завершения обучения классификатора документов.

TrainingStartTime -> (метка времени)

Указывает время начала обучения классификаторов документов. Вы оплачиваете интервал времени между этим временем и значением TrainingEndTime.

TrainingEndTime -> (метка времени)

Время завершения обучения классификатора документов. Указывает время окончания обучения классификаторов документов. Вы оплачиваете интервал времени между этим временем и значением TrainingStartTime.

InputDataConfig -> (структура)

Конфигурация входных данных, предоставленная при создании классификатора документов для обучения.

DataFormat -> (строка)

Формат данных обучения:

  • COMPREHEND_CSV : CSV-файл с двумя колонками, где метки предоставлены в первой колонке, а документы — во второй. Если вы используете это значение, вы должны указать параметр S3Uri в запросе.
  • AUGMENTED_MANIFEST : Меткированные данные, созданные Amazon SageMaker Ground Truth. Этот файл имеет формат JSON строк. Каждая строка представляет собой полный JSON-объект, содержащий обучающий документ и связанные с ним метки. Если вы используете это значение, вы должны указать параметр AugmentedManifests в запросе.

Если вы не укажете значение, Amazon Comprehend использует COMPREHEND_CSV по умолчанию.

S3Uri -> (строка)

Amazon S3 URI для входных данных. Ведро S3 должно находиться в том же регионе, что и конечная точка API, к которой вы обращаетесь. URI может указывать на один входной файл или префикс для набора входных файлов.

Например, если вы используете URI S3://bucketName/prefix, если префикс — это один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если более одного файла начинаются с префикса, Amazon Comprehend использует все их в качестве входных данных.

Этот параметр обязателен, если вы установили DataFormat в COMPREHEND_CSV.

TestS3Uri -> (строка)

Указывает расположение в Amazon S3, содержащее тестовые аннотации для классификатора документов. URI должен находиться в том же регионе Amazon Web Services, что и конечная точка API, к которой вы обращаетесь.

LabelDelimiter -> (строка)

Указывает разделитель, используемый для разделения каждой метки при обучении многомерного классификатора. По умолчанию разделитель между метками — это символ «|» (пайп). Вы можете использовать другой символ в качестве разделителя (если это разрешённый символ), указав его в параметре Разделитель для меток. Если обучающие документы используют разделитель, отличный от стандартного или указанного вами, метки в этой строке будут объединены в одну уникальную метку, например, LABELLABELLABEL.

AugmentedManifests -> (список)

Список файлов расширенного манифеста, предоставляющих обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это меткированные данные, созданные Amazon SageMaker Ground Truth.

Этот параметр обязателен, если вы установили DataFormat в AUGMENTED_MANIFEST.

(структура)

Файл расширенного манифеста, предоставляющий обучающие данные для вашей пользовательской модели. Файл расширенного манифеста — это меткированные данные, созданные Amazon SageMaker Ground Truth.

S3Uri -> (строка)

Расположение в Amazon S3 файла расширенного манифеста.

Split -> (строка)

Назначение предоставленных вами данных в расширенном манифесте. Вы можете использовать их для обучения или тестирования. Если вы не укажете значение, по умолчанию будет train.

TRAIN — все документы в манифесте будут использованы для обучения. Если тестовые документы не предоставлены, Amazon Comprehend автоматически зарезервирует часть обучающих документов для тестирования.

TEST — все документы в манифесте будут использованы для тестирования.

AttributeNames -> (список)

JSON-атрибут, содержащий аннотации для ваших обучающих документов. Количество указанных вами имён атрибутов зависит от того, является ли файл расширенного манифеста результатом одной задачи аннотирования или цепочки задач аннотирования.

Если файл является результатом одной задачи аннотирования, укажите ключ LabelAttributeName, использованный при создании задачи в Ground Truth.

Если файл является результатом цепочки задач аннотирования, укажите ключ LabelAttributeName для одной или нескольких задач в цепочке. Каждый ключ LabelAttributeName предоставляет аннотации из отдельной задачи.

(строка)

AnnotationDataS3Uri -> (строка)

Префикс в S3 к файлам аннотаций, на которые ссылается файл расширенного манифеста.

SourceDocumentsS3Uri -> (строка)

Префикс в S3 к исходным файлам (PDF), на которые ссылается файл расширенного манифеста.

DocumentType -> (строка)

Тип расширенного манифеста. PlainTextDocument или SemiStructuredDocument. Если вы не укажете значение, по умолчанию будет PlainTextDocument.

  • PLAIN_TEXT_DOCUMENT Тип документа, представляющий любой текст Unicode, закодированный в UTF-8.
  • SEMI_STRUCTURED_DOCUMENT Тип документа с контекстом расположения и структуры, например, PDF. Для обучения с Amazon Comprehend поддерживаются только PDF-файлы. Для вывода Amazon Comprehend поддерживает PDF, DOCX и TXT.

DocumentType -> (строка)

Тип входных документов для обучения модели. Предоставьте текстовые документы для создания текстовой модели и предоставьте полуструктурированные документы для создания собственной модели документов.

Documents -> (структура)

Расположение в S3 обучающих документов. Этот параметр обязателен при запросе на создание пользовательской модели документов.

S3Uri -> (строка)

Расположение URI в S3 обучающих документов, указанных в CSV-файле S3Uri.

TestS3Uri -> (строка)

Расположение URI в S3 тестовых документов, включённых в CSV-файл TestS3Uri. Это поле необязательно, если вы не указали тестовый CSV-файл.

DocumentReaderConfig -> (структура)

Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.

По умолчанию Amazon Comprehend выполняет следующие действия для извлечения текста из файлов в зависимости от типа входного файла:

  • Файлы Word — анализатор Amazon Comprehend извлекает текст.
  • Цифровые PDF-файлы — анализатор Amazon Comprehend извлекает текст.
  • Файлы изображений и отсканированные PDF-файлы — Amazon Comprehend использует API Amazon Textract DetectDocumentText для извлечения текста.
DocumentReaderConfig не относится к текстовым файлам или файлам Word.

Для файлов изображений и PDF-документов вы можете переопределить эти стандартные действия, используя поля, перечисленные ниже. Дополнительную информацию см. в руководстве разработчика Comprehend: Настройка параметров извлечения текста.

DocumentReadAction -> (строка)

Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:

  • TEXTRACT_DETECT_DOCUMENT_TEXT — служба Amazon Comprehend использует операцию API DetectDocumentText.
  • TEXTRACT_ANALYZE_DOCUMENT — служба Amazon Comprehend использует операцию API AnalyzeDocument.

DocumentReadMode -> (строка)

Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:

  • SERVICE_DEFAULT — использовать стандартные настройки службы Amazon Comprehend для PDF-файлов.
  • FORCE_DOCUMENT_READ_ACTION — Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.

FeatureTypes -> (список)

Указывает тип функций Amazon Textract, которые следует применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:

  • TABLES — возвращает дополнительную информацию о любых обнаруженных таблицах в входном документе.
  • FORMS — возвращает дополнительную информацию о любых обнаруженных формах в входном документе.

(строка)

TABLES или FORMS

OutputDataConfig -> (структура)

Предоставляет параметры конфигурации результатов вывода для пользовательских задач классификации.

S3Uri -> (строка)

Когда вы используете объект OutputDataConfig при создании пользовательского классификатора, вы указываете расположение в Amazon S3, куда вы хотите записать матрицу путаницы и другие выходные файлы. URI должен находиться в том же регионе, что и конечная точка API, к которой вы обращаетесь. Расположение используется в качестве префикса для фактического расположения этого выходного файла.

По завершении задачи пользовательского классификатора служба создаёт выходной файл в каталоге, специфичном для задачи. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz. Это сжатый архив, содержащий матрицу путаницы.

KmsKeyId -> (строка)

Идентификатор ключа управления ключами Amazon Web Services (KMS), который Amazon Comprehend использует для шифрования результатов вывода задачи анализа. KmsKeyId может иметь один из следующих форматов:

  • ID ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Amazon Resource Name (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
  • Псевдоним ключа KMS: "alias/ExampleAlias"
  • ARN псевдонима ключа KMS: "arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"

FlywheelStatsS3Prefix -> (строка)

Префикс Amazon S3 для расположения данных озера данных статистики flywheel.

ClassifierMetadata -> (структура)

Информация о классификаторе документов, включая количество документов, используемых для обучения классификатора, количество документов, используемых для тестирования классификатора, и рейтинг точности.

NumberOfLabels -> (целое число)

Количество меток в входных данных.

NumberOfTrainedDocuments -> (целое число)

Количество документов во входных данных, которые были использованы для обучения классификатора. Обычно это составляет от 80 до 90 процентов от входных документов.

NumberOfTestDocuments -> (целое число)

Количество документов во входных данных, которые были использованы для тестирования классификатора. Обычно это составляет от 10 до 20 процентов от входных документов, до 10 000 документов.

EvaluationMetrics -> (структура)

Описывает метрики результатов для тестовых данных, связанных с классификатором документов.

Accuracy -> (вещественное число)

Доля меток, которые были верно распознаны. Она вычисляется путем деления количества меток в тестовых документах, которые были верно распознаны, на общее количество меток в тестовых документах.

Precision -> (вещественное число)

Метрика полезности результатов классификатора в тестовых данных. Высокая точность означает, что классификатор возвращает значительно больше релевантных результатов, чем нерелевантных.

Recall -> (вещественное число)

Метрика полноты результатов классификатора для тестовых данных. Высокий показатель полноты означает, что классификатор возвращает большинство релевантных результатов.

F1Score -> (вещественное число)

Метрика точности результатов классификатора для тестовых данных. Она выводится из значений Precision и Recall. F1Score — гармоническое среднее этих двух значений. Максимальное значение — 1, минимальное — 0.

MicroPrecision -> (вещественное число)

Метрика полезности результатов распознавания в тестовых данных. Высокая точность означает, что распознаватель возвращает значительно больше релевантных результатов, чем нерелевантных. В отличие от метрики Точности, которая получается путем усреднения точности всех доступных меток, эта метрика основана на общем результате всех значений точности, сложенных вместе.

MicroRecall -> (вещественное число)

Метрика полноты результатов классификатора для тестовых данных. Высокий показатель полноты означает, что классификатор возвращает большинство релевантных результатов. В частности, это указывает на то, сколько правильных категорий в тексте может предсказать модель. Это процент правильных категорий в тексте, которые могут быть найдены. Вместо усреднения значений полноты всех меток (как в метрике Полнота), микро-полнота основана на общем результате всех значений полноты, сложенных вместе.

MicroF1Score -> (вещественное число)

Метрика точности результатов классификатора для тестовых данных. Она представляет собой комбинацию значений Micro Precision и Micro Recall. Micro F1Score — гармоническое среднее этих двух значений. Максимальное значение — 1, минимальное — 0.

HammingLoss -> (вещественное число)

Указывает на долю меток, которые были неправильно предсказаны. Также рассматривается как доля неправильных меток по отношению к общему количеству меток. Чем значение ближе к нулю, тем лучше.

DataAccessRoleArn -> (строка)

Amazon Resource Name (ARN) роли IAM, которая предоставляет Amazon Comprehend доступ для чтения к вашим входным данным.

VolumeKmsKeyId -> (строка)

Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на томе хранения, подключенном к экземпляру вычислительного узла ML, который обрабатывает задание анализа. VolumeKmsKeyId может быть представлен в одном из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Amazon Resource Name (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

VpcConfig -> (структура)

Параметры конфигурации частного виртуального частного облака (VPC), содержащего ресурсы, которые вы используете для вашего пользовательского классификатора. Для получения дополнительной информации см. Amazon VPC.

SecurityGroupIds -> (список)

Идентификатор группы безопасности на экземпляре вашего частного VPC. Группы безопасности вашего VPC работают как виртуальный брандмауэр для управления входящим и исходящим трафиком и обеспечивают безопасность для ресурсов, к которым вы будете получать доступ в VPC. Этот идентификатор предваряется «sg-», например: «sg-03b388029b0a285ea». Для получения дополнительной информации см. Группы безопасности для вашего VPC.

(строка)

Subnets -> (список)

Идентификатор каждого подсети, используемого в вашем частном VPC. Эта подсеть является подмножеством диапазона адресов IPv4, используемых VPC, и специфична для определенной зоны доступности в регионе VPC. Этот идентификатор предваряется «subnet-», например: «subnet-04ccf456919e69055». Для получения дополнительной информации см. VPC и подсети.

(строка)

Mode -> (строка)

Указывает режим, в котором был обучен конкретный классификатор. Это также указывает формат входных документов и формат матрицы ошибок. Каждый классификатор может быть обучен только в одном режиме, и этот режим не может быть изменен после обучения классификатора.

ModelKmsKeyId -> (строка)

Идентификатор ключа KMS, который Amazon Comprehend использует для шифрования обученных пользовательских моделей. ModelKmsKeyId может быть представлен в одном из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Amazon Resource Name (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

VersionName -> (строка)

Имя версии, которое вы присвоили классификатору документов.

SourceModelArn -> (строка)

Amazon Resource Name (ARN) исходной модели. Эта модель была импортирована из другого аккаунта Amazon Web Services для создания модели классификатора документов в вашем аккаунте Amazon Web Services.

FlywheelArn -> (строка)

Amazon Resource Number (ARN) колесика

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API