[ aws . comprehend ]
classify-document
Описание
Создаёт запрос на классификацию одного документа в реальном времени. ClassifyDocument поддерживает следующие типы моделей:
- Пользовательский классификатор — настраиваемая модель, которую вы создали и обучили. В качестве входных данных можно предоставить обычный текст, одностраничный документ (PDF, Word или изображение) или вывод API Amazon Textract. Дополнительную информацию см. в разделе Пользовательская классификация в руководстве разработчика Amazon Comprehend.
- Классификатор безопасности подсказок — Amazon Comprehend предоставляет предварительно обученную модель для классификации входных подсказок для приложений с генеративным ИИ. В качестве входных данных используется английский обычный текст. Для классификации безопасности подсказок ответ включает только поле
Classes. Дополнительную информацию о классификаторах безопасности подсказок см. в разделе Классификация безопасности подсказок в руководстве разработчика Amazon Comprehend.
Если система обнаруживает ошибки при обработке страницы во входном документе, ответ API включает поле Errors, которое описывает эти ошибки.
Если система обнаруживает ошибку уровня документа во входном документе, API возвращает ошибочный ответ InvalidRequestException. Подробности об этом исключении см. в руководстве разработчика Comprehend в разделе Ошибки в полуструктурированных документах.
См. также: Документация API AWS
Синтаксис
classify-document
[--text <value>]
--endpoint-arn <value>
[--bytes <value>]
[--document-reader-config <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--text (строка)
Bytes.--endpoint-arn (строка)
Amazon Resource Number (ARN) конечной точки.
Для классификации безопасности подсказок Amazon Comprehend предоставляет ARN конечной точки. Дополнительную информацию о классификаторах безопасности подсказок см. в разделе Классификация безопасности подсказок в руководстве разработчика Amazon Comprehend.
Для пользовательской классификации вы создаёте конечную точку для вашей настраиваемой модели. Дополнительную информацию см. в разделе Использование конечных точек Amazon Comprehend.
--bytes (бинарный массив)
Используйте параметр Bytes для ввода текстового, PDF, Word или графического файла.
При классификации документа с помощью настраиваемой модели вы также можете использовать параметр Bytes для ввода файла вывода Amazon Textract DetectDocumentText или AnalyzeDocument.
Для классификации документа с помощью классификатора безопасности подсказок используйте параметр Text для ввода.
Предоставьте входной документ как последовательность байтов, закодированных в формате base64. Если ваш код использует SDK Amazon Web Services для классификации документов, SDK может кодировать байты документа для вас.
Максимальная длина этого поля зависит от типа входного документа. Подробности см. в руководстве разработчика Comprehend в разделе Входные данные для анализа в реальном времени настраиваемых моделей.
Если вы используете параметр Bytes, не используйте параметр Text.
--document-reader-config (структура)
Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.
DocumentReadAction -> (строка)
Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:
-
TEXTRACT_DETECT_DOCUMENT_TEXT- Сервис Amazon Comprehend использует операцию APIDetectDocumentText. -
TEXTRACT_ANALYZE_DOCUMENT- Сервис Amazon Comprehend использует операцию APIAnalyzeDocument.
DocumentReadMode -> (строка)
Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:
-
SERVICE_DEFAULT- используйте стандартные настройки сервиса Amazon Comprehend для PDF-файлов. -
FORCE_DOCUMENT_READ_ACTION- Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.
FeatureTypes -> (список)
Указывает тип функций Amazon Textract, которые нужно применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT как действие чтения, вы должны указать одно или оба из следующих значений:
-
TABLES- Возвращает дополнительную информацию о любых таблицах, обнаруженных в входном документе. -
FORMS- Возвращает дополнительную информацию о любых формах, обнаруженных в входном документе.
(строка)
Сокращённый синтаксис:
DocumentReadAction=string,DocumentReadMode=string,FeatureTypes=string,string
Синтаксис JSON:
{
"DocumentReadAction": "TEXTRACT_DETECT_DOCUMENT_TEXT"|"TEXTRACT_ANALYZE_DOCUMENT",
"DocumentReadMode": "SERVICE_DEFAULT"|"FORCE_DOCUMENT_READ_ACTION",
"FeatureTypes": ["TABLES"|"FORMS", ...]
}
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные бинарные значения с помощью значения, предоставленного в JSON, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверит входные данные команды и вернёт пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево значение)
Включить отладку логов.
--endpoint-url (строка)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (булево значение)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого подключения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (булево значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- text
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определённый профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/отключить цветной вывод.
- вкл
- выкл
- авто
--no-sign-request (булево значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл с сертификатом CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения к сокету в секундах. Если значение установлено в 0, подключение к сокету будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для бинарных блоков. По умолчанию используется формат base64. Формат base64 предполагает, что бинарные блоки предоставляются как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и бинарные значения должны передаваться буквально. При предоставлении содержимого из файла, которое соответствует бинарному блоку, fileb:// всегда будет обрабатываться как бинарный и будет использовать содержимое файла напрямую независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для заданного формата cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево значение)
Отключить страницу для вывода.
--cli-auto-prompt (булево значение)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (булево значение)
Отключить автоматическое запроса параметров ввода CLI.
Примеры
Примечание
Чтобы использовать следующие примеры, вы должны установить и настроить AWS CLI. Дополнительную информацию см. в руководстве пользователя AWS CLI в разделе «Начало работы».
Если не указано иное, во всех примерах используются правила кавычек Unix-подобных систем. Эти примеры необходимо адаптировать к правилам кавычек вашей оболочки. Подробности см. в руководстве пользователя AWS CLI в разделе «Использование кавычек со строками».
Для классификации документа с помощью конечной точки, специфичной для модели
В следующем classify-document примере классифицируется документ с помощью конечной точки настраиваемой модели. В данном примере модель была обучена на наборе данных, содержащем сообщения SMS, помеченные как спам или не спам («ham»).
aws comprehend classify-document \
--endpoint-arn arn:aws:comprehend:us-west-2:111122223333:document-classifier-endpoint/example-classifier-endpoint \
--text "CONGRATULATIONS! TXT 1235550100 to win $5000"
Вывод:
{
"Classes": [
{
"Name": "spam",
"Score": 0.9998599290847778
},
{
"Name": "ham",
"Score": 0.00014001205272506922
}
]
}
Дополнительную информацию см. в разделе «Пользовательская классификация» в руководстве разработчика Amazon Comprehend.
Вывод
Классы -> (список)
Классы, используемые документом, который анализируется. Они используются для моделей, обученных в многоклассовом режиме. Отдельные классы взаимно исключают друг друга, и ожидается, что каждый документ будет иметь только один назначенный класс. Например, животное может быть собакой или котом, но не тем и другим одновременно.
Для классификации запросов на безопасность ответ включает только два класса (SAFE_PROMPT и UNSAFE_PROMPT), а также оценку уверенности для каждого класса. Диапазон значений оценки — от нуля до единицы, где единица — максимальная уверенность.
(структура)
Указывает класс, который классифицирует анализируемый документ
Имя -> (строка)
Оценка -> (число с плавающей точкой)
Страница -> (целое число)
Byte.Метки -> (список)
Метки, используемые в анализируемом документе. Они используются для моделей с несколькими метками. Отдельные метки представляют собой различные категории, связанные каким-либо образом и не являющиеся взаимоисключающими. Например, фильм может быть только боевиком, или он может быть боевиком, научно-фантастическим фильмом и комедией одновременно.
(структура)
Указывает одну или несколько меток, которые классифицируют анализируемый документ.
Имя -> (строка)
Оценка -> (число с плавающей точкой)
Страница -> (целое число)
Byte.DocumentMetadata -> (структура)
Информация об извлечении данных из документа. Это поле присутствует в ответе только в том случае, если ваш запрос включает параметр Byte.
Страницы -> (целое число)
ExtractedCharacters -> (список)
Список страниц в документе с количеством извлеченных символов с каждой страницы.
(структура)
Массив количества символов, извлеченных с каждой страницы.
Страница -> (целое число)
Количество -> (целое число)
DocumentType -> (список)
Тип документа для каждой страницы входного документа. Это поле присутствует в ответе только в том случае, если ваш запрос включает параметр Byte.
(структура)
Тип документа для каждой страницы в документе.
Страница -> (целое число)
Тип -> (строка)
Ошибки -> (список)
Ошибки на уровне страницы, обнаруженные системой при обработке входного документа. Поле пустое, если система не обнаружила ошибок.
(структура)
Извлечение текста обнаружило одну или несколько ошибок на уровне страницы в входном документе.
ErrorCode содержит одно из следующих значений:
- TEXTRACT_BAD_PAGE — Amazon Textract не может прочитать страницу. Дополнительную информацию о ограничениях страниц в Amazon Textract см. в разделе «Квоты страниц в Amazon Textract».
- TEXTRACT_PROVISIONED_THROUGHPUT_EXCEEDED — Количество запросов превысило ваш лимит пропускной способности. Дополнительную информацию о квотах пропускной способности в Amazon Textract см. в разделе «Стандартные квоты в Amazon Textract».
- PAGE_CHARACTERS_EXCEEDED — Слишком много текстовых символов на странице (максимум 10 000 символов).
- PAGE_SIZE_EXCEEDED — Максимальный размер страницы составляет 10 МБ.
- INTERNAL_SERVER_ERROR — Запрос столкнулся с проблемой службы. Попробуйте выполнить запрос API снова.
Страница -> (целое число)
Код ошибки -> (строка)
Сообщение об ошибке -> (строка)
Предупреждения -> (список)
Предупреждения, обнаруженные при обработке входного документа. Ответ включает предупреждение, если существует несоответствие между типом входного документа и типом модели, связанной с указанным вами конечным пунктом. Ответ также может включать предупреждения для отдельных страниц с несоответствием.
Поле пустое, если система не сгенерировала предупреждений.
(структура)
Система определила одно из следующих предупреждений при обработке входного документа:
- Документ для классификации — обычный текст, но классификатор — модель для нативного документа.
- Документ для классификации — полуструктурированный, но классификатор — модель для обычного текста.
Страница -> (целое число)
Код предупреждения -> (строка)
Сообщение о предупреждении -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.