[ aws . comprehend ]
start-document-classification-job
Описание
Запускает асинхронную задачу классификации документов с использованием пользовательской модели классификации. Используйте операцию DescribeDocumentClassificationJob для отслеживания прогресса задачи.
См. также: Документация API AWS
Синтаксис
start-document-classification-job
[--job-name <value>]
[--document-classifier-arn <value>]
--input-data-config <value>
--output-data-config <value>
--data-access-role-arn <value>
[--client-request-token <value>]
[--volume-kms-key-id <value>]
[--vpc-config <value>]
[--tags <value>]
[--flywheel-arn <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--job-name (строка)
--document-classifier-arn (строка)
--input-data-config (структура)
Указывает формат и расположение входных данных для задачи.
S3Uri -> (строка)
Amazon S3 URI для входных данных. URI должен находиться в той же области, что и конечная точка API, к которой вы обращаетесь. URI может указывать на один входной файл или префикс для набора файлов данных.
Например, если вы используете URI S3://bucketName/prefix , если префикс — это один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если более одного файла начинается с префикса, Amazon Comprehend использует все эти файлы в качестве входных данных.
InputFormat -> (строка)
Указывает, как текст в входном файле должен быть обработан:
-
ONE_DOC_PER_FILE— каждый файл рассматривается как отдельный документ. Используйте этот параметр при обработке больших документов, таких как статьи газет или научные статьи. -
ONE_DOC_PER_LINE— каждая строка в файле рассматривается как отдельный документ. Используйте этот параметр при обработке большого количества коротких документов, таких как текстовые сообщения.
DocumentReaderConfig -> (структура)
Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.
DocumentReadAction -> (строка)
Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:
-
TEXTRACT_DETECT_DOCUMENT_TEXT— Amazon Comprehend сервис использует операцию APIDetectDocumentText. -
TEXTRACT_ANALYZE_DOCUMENT— Amazon Comprehend сервис использует операцию APIAnalyzeDocument.
DocumentReadMode -> (строка)
Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:
-
SERVICE_DEFAULT— использовать стандартные настройки Amazon Comprehend для PDF-файлов. -
FORCE_DOCUMENT_READ_ACTION— Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.
FeatureTypes -> (список)
Указывает тип функций Amazon Textract, которые необходимо применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:
-
TABLES— возвращает дополнительную информацию о любых таблицах, обнаруженных в документе. -
FORMS— возвращает дополнительную информацию о любых формах, обнаруженных в документе.
(строка)
Сокращенный синтаксис:
S3Uri=string,InputFormat=string,DocumentReaderConfig={DocumentReadAction=string,DocumentReadMode=string,FeatureTypes=[string,string]}
Синтаксис JSON:
{
"S3Uri": "string",
"InputFormat": "ONE_DOC_PER_FILE"|"ONE_DOC_PER_LINE",
"DocumentReaderConfig": {
"DocumentReadAction": "TEXTRACT_DETECT_DOCUMENT_TEXT"|"TEXTRACT_ANALYZE_DOCUMENT",
"DocumentReadMode": "SERVICE_DEFAULT"|"FORCE_DOCUMENT_READ_ACTION",
"FeatureTypes": ["TABLES"|"FORMS", ...]
}
}
--output-data-config (структура)
Указывает, куда отправлять выходные файлы.
S3Uri -> (строка)
Когда вы используете объект OutputDataConfig с асинхронными операциями, вы указываете расположение Amazon S3, куда хотите записать выходные данные. URI должен находиться в той же области, что и конечная точка API, к которой вы обращаетесь. Расположение используется в качестве префикса для фактического расположения выходного файла.
Когда задача обнаружения тем завершена, служба создает выходной файл в каталоге, специфичном для задачи. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz. Это сжатый архив, содержащий результат операции.
Для задачи обнаружения сущностей PII выходной файл — это обычный текст, а не сжатый архив. Имя выходного файла такое же, как у входного файла, с добавленным .out в конце.
KmsKeyId -> (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования выходных результатов из задачи анализа. Укажите ID ключа симметричного ключа, так как ассиметричный ключ не может использоваться для загрузки данных в S3.
KmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab" - Алиас ключа KMS:
"alias/ExampleAlias" - ARN алиаса ключа KMS:
"arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"
Сокращенный синтаксис:
S3Uri=string,KmsKeyId=string
Синтаксис JSON:
{
"S3Uri": "string",
"KmsKeyId": "string"
}
--data-access-role-arn (строка)
--client-request-token (строка)
--volume-kms-key-id (строка)
Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на томе хранилища, подключенном к виртуальной машине ML, обрабатывающей задачу анализа. VolumeKmsKeyId может иметь один из следующих форматов:
- Идентификатор ключа KMS:
"1234abcd-12ab-34cd-56ef-1234567890ab" - Amazon Resource Name (ARN) ключа KMS:
"arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
--vpc-config (структура)
Параметры конфигурации для необязательного частного Virtual Private Cloud (VPC), содержащего ресурсы, которые вы используете для задачи классификации документов. Дополнительную информацию см. в Amazon VPC.
SecurityGroupIds -> (список)
Номер ID группы безопасности на экземпляре вашего частного VPC. Группы безопасности в вашем VPC действуют как виртуальный брандмауэр, контролирующий входящий и исходящий трафик и обеспечивают безопасность ресурсов, к которым вы будете обращаться в VPC. Этот номер ID предваряется «sg-», например: «sg-03b388029b0a285ea». Дополнительную информацию см. в Группы безопасности для вашего VPC.
(строка)
Subnets -> (список)
Идентификатор каждого подсети, используемой в вашем частном VPC. Эта подсеть является подмножеством диапазона IPv4-адресов, используемых VPC, и специфична для определенной зоны доступности в области VPC. Этот номер ID предваряется «subnet-», например: «subnet-04ccf456919e69055». Дополнительную информацию см. в VPC и Подсети.
(строка)
Сокращенный синтаксис:
SecurityGroupIds=string,string,Subnets=string,string
Синтаксис JSON:
{
"SecurityGroupIds": ["string", ...],
"Subnets": ["string", ...]
}
--tags (список)
Теги, которые необходимо связать с задачей классификации документов. Тег — это пара ключ-значение, которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с ключом «Sales» может быть добавлен к ресурсу, чтобы указать его использование отделом продаж.
(структура)
Пара ключ-значение, добавляющая метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с парой ключ-значение «Department»:«Sales» может быть добавлен к ресурсу, чтобы указать его использование конкретным отделом.
Key -> (строка)
Value -> (строка)
Сокращенный синтаксис:
Key=string,Value=string ...
Синтаксис JSON:
[
{
"Key": "string",
"Value": "string"
}
...
]
--flywheel-arn (строка)
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет взята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит каркас JSON в стандартный вывод без отправки запроса API. Если указано без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если указано yaml-input, оно выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, оно валидирует входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный каркас JSON не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном каркасе JSON.
Глобальные параметры
--debug (boolean)
Включить отладовую запись журнала.
--endpoint-url (string)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (boolean)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (boolean)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (string)
Стиль форматирования вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (string)
Запрос JMESPath для фильтрации данных ответа.
--profile (string)
Использовать определённый профиль из файла параметров.
--region (string)
Регион для использования. Переопределяет настройки конфигурации/окружения.
--version (string)
Отобразить версию этого инструмента.
--color (string)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (boolean)
Не подписывать запросы. Учётные данные не будут загружены, если этот аргумент указан.
--ca-bundle (string)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/окружения.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (string)
Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла непосредственно, независимо от настроек cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (boolean)
Отключить кли-пейджер для вывода.
--cli-auto-prompt (boolean)
Автоматически запросить параметры ввода CLI.
--no-cli-auto-prompt (boolean)
Отключить автоматический запрос параметров ввода CLI.
Примеры
Примечание
Для использования следующих примеров, необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования Unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной среды. См. Использование кавычек со строками в Руководстве пользователя AWS CLI.
Запуск задания классификации документов
Следующий start-document-classification-job пример запускает задание классификации документов с пользовательской моделью для всех файлов по адресу, указанному тегом --input-data-config. В этом примере входной S3-bucket содержит SampleSMStext1.txt, SampleSMStext2.txt и SampleSMStext3.txt. Модель была предварительно обучена на классификации документов как спам/не спам, или «ham», SMS-сообщений. По завершении задания output.tar.gz помещается в место, указанное тегом --output-data-config. output.tar.gz содержит predictions.jsonl, которое перечисляет классификацию каждого документа. JSON-вывод выводится на одной строке на файл, но здесь отформатирован для читаемости.
aws comprehend start-document-classification-job \
--job-name exampleclassificationjob \
--input-data-config "S3Uri=s3://amzn-s3-demo-bucket-INPUT/jobdata/" \
--output-data-config "S3Uri=s3://amzn-s3-demo-destination-bucket/testfolder/" \
--data-access-role-arn arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-example-role \
--document-classifier-arn arn:aws:comprehend:us-west-2:111122223333:document-classifier/mymodel/version/12
Содержимое SampleSMStext1.txt:
"CONGRATULATIONS! TXT 2155550100 to win $5000"
Содержимое SampleSMStext2.txt:
"Hi, when do you want me to pick you up from practice?"
Содержимое SampleSMStext3.txt:
"Plz send bank account # to 2155550100 to claim prize!!"
Вывод:
{
"JobId": "e758dd56b824aa717ceab551fEXAMPLE",
"JobArn": "arn:aws:comprehend:us-west-2:111122223333:document-classification-job/e758dd56b824aa717ceab551fEXAMPLE",
"JobStatus": "SUBMITTED"
}
Содержимое predictions.jsonl:
{"File": "SampleSMSText1.txt", "Line": "0", "Classes": [{"Name": "spam", "Score": 0.9999}, {"Name": "ham", "Score": 0.0001}]}
{"File": "SampleSMStext2.txt", "Line": "0", "Classes": [{"Name": "ham", "Score": 0.9994}, {"Name": "spam", "Score": 0.0006}]}
{"File": "SampleSMSText3.txt", "Line": "0", "Classes": [{"Name": "spam", "Score": 0.9999}, {"Name": "ham", "Score": 0.0001}]}
Для получения дополнительной информации см. раздел Пользовательская классификация в Руководстве разработчика Amazon Comprehend.
Вывод
JobId -> (строка)
DescribeDocumentClassificationJob.JobArn -> (строка)
Amazon Resource Name (ARN) задания классификации документов. Это уникальный, полностью квалифицированный идентификатор задания. Он включает в себя учётную запись Amazon Web Services, регион Amazon Web Services и идентификатор задания. Формат ARN следующий:
arn:<partition>:comprehend:<region>:<account-id>:document-classification-job/<job-id>Вот пример ARN задания:
arn:aws:comprehend:us-west-2:111122223333:document-classification-job/1234abcd12ab34cd56ef1234567890abJobStatus -> (строка)
Статус задания:
- SUBMITTED - Задание получено и помещено в очередь на обработку.
- IN_PROGRESS - Amazon Comprehend обрабатывает задание.
- COMPLETED - Задание успешно выполнено, и выходные данные доступны.
- FAILED - Задание не завершено. Для получения подробностей используйте операцию
DescribeDocumentClassificationJob. - STOP_REQUESTED - Amazon Comprehend получил запрос на остановку задания и обрабатывает запрос.
- STOPPED - Задание было успешно остановлено без завершения.
DocumentClassifierArn -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.