Spec-Zone.ru › AWS CLI v2

[ aws . comprehend ]

start-topics-detection-job

Описание

Запускает асинхронную задачу обнаружения тем. Используйте операцию DescribeTopicDetectionJob для отслеживания статуса задачи.

См. также: Документация AWS API

Синтаксис

  start-topics-detection-job
--input-data-config <value>
--output-data-config <value>
--data-access-role-arn <value>
[--job-name <value>]
[--number-of-topics <value>]
[--client-request-token <value>]
[--volume-kms-key-id <value>]
[--vpc-config <value>]
[--tags <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--input-data-config (структура)

Указывает формат и расположение входных данных для задачи.

S3Uri -> (строка)

Amazon S3 URI для входных данных. URI должен быть в том же регионе, что и конечная точка API, к которой вы обращаетесь. URI может указывать на один входной файл или префикс для набора файлов данных.

Например, если вы используете URI S3://bucketName/prefix , если префикс — это один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если более одного файла начинаются с префикса, Amazon Comprehend использует все их в качестве входных данных.

InputFormat -> (строка)

Указывает, как текст в входном файле должен обрабатываться:

  • ONE_DOC_PER_FILE — каждый файл считается отдельным документом. Используйте этот параметр при обработке больших документов, таких как статьи газет или научные статьи.
  • ONE_DOC_PER_LINE — каждая строка в файле считается отдельным документом. Используйте этот параметр при обработке многих коротких документов, таких как текстовые сообщения.

DocumentReaderConfig -> (структура)

Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.

DocumentReadAction -> (строка)

Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:

  • TEXTRACT_DETECT_DOCUMENT_TEXT — служба Amazon Comprehend использует операцию API DetectDocumentText.
  • TEXTRACT_ANALYZE_DOCUMENT — служба Amazon Comprehend использует операцию API AnalyzeDocument.

DocumentReadMode -> (строка)

Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:

  • SERVICE_DEFAULT — использовать стандартные настройки Amazon Comprehend для PDF-файлов.
  • FORCE_DOCUMENT_READ_ACTION — Amazon Comprehend использует API Textract, указанный параметром DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.

FeatureTypes -> (список)

Указывает тип функций Amazon Textract, которые нужно применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:

  • TABLES — возвращает дополнительную информацию о любых таблицах, обнаруженных в входном документе.
  • FORMS — возвращает дополнительную информацию о любых формах, обнаруженных в входном документе.

(строка)

TABLES или FORMS

Упрощенный синтаксис:

S3Uri=string,InputFormat=string,DocumentReaderConfig={DocumentReadAction=string,DocumentReadMode=string,FeatureTypes=[string,string]}

Синтаксис JSON:

{
  "S3Uri": "string",
  "InputFormat": "ONE_DOC_PER_FILE"|"ONE_DOC_PER_LINE",
  "DocumentReaderConfig": {
    "DocumentReadAction": "TEXTRACT_DETECT_DOCUMENT_TEXT"|"TEXTRACT_ANALYZE_DOCUMENT",
    "DocumentReadMode": "SERVICE_DEFAULT"|"FORCE_DOCUMENT_READ_ACTION",
    "FeatureTypes": ["TABLES"|"FORMS", ...]
  }
}

--output-data-config (структура)

Указывает, куда следует отправлять выходные файлы. Выходные данные — это сжатый архив с двумя файлами, topic-terms.csv, который перечисляет термины, связанные с каждой темой, и doc-topics.csv, который перечисляет документы, связанные с каждой темой.

S3Uri -> (строка)

При использовании объекта OutputDataConfig с асинхронными операциями вы указываете расположение в Amazon S3, куда хотите записать выходные данные. URI должен быть в том же регионе, что и конечная точка API, к которой вы обращаетесь. Расположение используется в качестве префикса для фактического расположения выходного файла.

После завершения задачи обнаружения тем служба создаёт выходной файл в каталоге, специфичном для задачи. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz. Это сжатый архив, содержащий результаты операции.

Для задачи обнаружения сущностей PII выходной файл является текстовым, а не сжатым архивом. Имя выходного файла совпадает с именем входного файла, с добавленным .out в конце.

KmsKeyId -> (строка)

Идентификатор ключа службы управления ключами Amazon Web Services (KMS), который Amazon Comprehend использует для шифрования выходных результатов из задачи анализа. Укажите идентификатор симметричного ключа, поскольку вы не можете использовать асимметричный ключ для загрузки данных в S3.

KmsKeyId может иметь один из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Amazon Resource Name (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
  • Псевдоним ключа KMS: "alias/ExampleAlias"
  • ARN псевдонима ключа KMS: "arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"

Упрощенный синтаксис:

S3Uri=string,KmsKeyId=string

Синтаксис JSON:

{
  "S3Uri": "string",
  "KmsKeyId": "string"
}

--data-access-role-arn (строка)

Amazon Resource Name (ARN) роли IAM, предоставляющей Amazon Comprehend доступ для чтения к вашим входным данным. Дополнительная информация — в разделе Основы управления правами доступа.

--job-name (строка)

Идентификатор задачи.

--number-of-topics (целое число)

Количество тем для обнаружения.

--client-request-token (строка)

Уникальный идентификатор запроса. Если вы не задаёте client request token, Amazon Comprehend сгенерирует его.

--volume-kms-key-id (строка)

Идентификатор ключа службы управления ключами Amazon Web Services (KMS), который Amazon Comprehend использует для шифрования данных на объёме хранилища, подключённом к экземпляру(ам) вычислительной машины ML, обрабатывающей задачу анализа. VolumeKmsKeyId может иметь один из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • Amazon Resource Name (ARN) ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

--vpc-config (структура)

Параметры конфигурации для необязательной частной виртуальной сети VPC, содержащей ресурсы, используемые для задачи обнаружения тем. Дополнительную информацию см. в разделе Amazon VPC.

SecurityGroupIds -> (список)

Идентификатор группы безопасности на экземпляре вашей частной VPC. Группы безопасности в вашей VPC работают как виртуальный брандмауэр для управления входящим и исходящим трафиком и обеспечивают безопасность ресурсов, к которым вы будете обращаться в VPC. Этот идентификатор числа начинается с «sg-», например: «sg-03b388029b0a285ea». Для получения дополнительной информации см. Группы безопасности для вашей VPC.

(строка)

Subnets -> (список)

Идентификатор каждого подсети, используемого в вашей частной VPC. Эта подсеть — это подмножество диапазона адресов IPv4, используемых VPC, и конкретна для данной зоны доступности в регионе VPC. Этот идентификатор числа начинается с «subnet-», например: «subnet-04ccf456919e69055». Для получения дополнительной информации см. VPC и подсети.

(строка)

Упрощенный синтаксис:

SecurityGroupIds=string,string,Subnets=string,string

Синтаксис JSON:

{
  "SecurityGroupIds": ["string", ...],
  "Subnets": ["string", ...]
}

--tags (список)

Теги для добавления к задаче обнаружения тем. Тег — это пара «ключ-значение», которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с «Продажи» в качестве ключа может быть добавлен к ресурсу, чтобы указать его использование отделом продаж.

(структура)

Пара «ключ-значение», которая добавляет метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с парой «Ключ»:«Продажи» может быть добавлен к ресурсу, чтобы указать его использование конкретным отделом.

Key -> (строка)

Начальная часть пары «ключ-значение», которая образует тег, связанный с данным ресурсом. Например, если вы хотите показать, какие ресурсы используются какими отделами, вы можете использовать «Отдел» в качестве начальной части пары, со множеством возможных значений, таких как «продажи», «право», и «администрирование».

Value -> (строка)

Вторая часть пары «ключ-значение», которая образует тег, связанный с данным ресурсом. Например, если вы хотите показать, какие ресурсы используются какими отделами, вы можете использовать «Отдел» в качестве начальной части пары, со значением «продажи», чтобы указать отдел продаж.

Упрощенный синтаксис:

Key=string,Value=string ...

Синтаксис JSON:

[
  {
    "Key": "string",
    "Value": "string"
  }
  ...
]

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения из JSON. Невозможно передавать произвольные двоичные значения с помощью JSON-предоставленного значения, так как строка будет взята буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, оно выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно валидирует входные данные команд и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Общие параметры

--debug (boolean)

Включить отладовую запись в журнал.

--endpoint-url (string)

Переопределить стандартный URL команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит SSL-сертификаты. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (boolean)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использовать определённый профиль из файла учетных данных.

--region (string)

Регион для использования. Переопределяет настройки из конфигурации/среды.

--version (string)

Отобразить версию этого инструмента.

--color (string)

Включить/выключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (string)

Файл сертификатов доверенных центров сертификации для проверки SSL-сертификатов. Переопределяет настройки из конфигурации/среды.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (string)

Стиль форматирования, используемый для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI версии 1, а двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичный, и будут использоваться содержимое файла напрямую, независимо от настройки cli-binary-format. При использовании file:// содержимое файла необходимо правильно отформатировать для конфигурируемого cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить вывод страницы CLI.

--cli-auto-prompt (boolean)

Автоматически запросить параметры ввода CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматическое запроса параметров ввода CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Подробнее см. руководство по началу работы в Руководстве пользователя AWS CLI.

Если не указано иное, все примеры используют правила цитирования Unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной оболочки. См. Использование кавычек со строками в Руководстве пользователя AWS CLI.

Запуск анализа задания обнаружения тем

Следующий start-topics-detection-job пример запускает асинхронное задание обнаружения тем для всех файлов, расположенных по адресу, указанному тегом --input-data-config. По завершении задания папка, output, размещается в местоположении, указанном тегом --ouput-data-config. output содержит topic-terms.csv и doc-topics.csv. Первый выходной файл, topic-terms.csv, представляет список тем в коллекции. Для каждой темы в список по умолчанию включаются наиболее важные термины по теме в соответствии с их весом. Второй файл, doc-topics.csv, отображает документы, связанные с темой, и долю документа, относящуюся к теме.

aws comprehend start-topics-detection-job \
    --job-name example_topics_detection_job \
    --language-code en \
    --input-data-config "S3Uri=s3://amzn-s3-demo-bucket/" \
    --output-data-config "S3Uri=s3://amzn-s3-demo-destination-bucket/testfolder/" \
    --data-access-role-arn arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-example-role \
    --language-code en

Вывод:

{
    "JobId": "123456abcdeb0e11022f22a11EXAMPLE",
    "JobArn": "arn:aws:comprehend:us-west-2:111122223333:key-phrases-detection-job/123456abcdeb0e11022f22a11EXAMPLE",
    "JobStatus": "SUBMITTED"
}

Дополнительную информацию см. в разделе Моделирование тем в Руководстве разработчика Amazon Comprehend.

Вывод

JobId -> (строка)

Идентификатор, сгенерированный для задания. Чтобы получить статус задания, используйте этот идентификатор с операцией DescribeTopicDetectionJob.

JobArn -> (строка)

Amazon Resource Name (ARN) задания обнаружения тем. Это уникальный, полностью квалифицированный идентификатор задания. Он включает учетную запись Amazon Web Services, регион Amazon Web Services и идентификатор задания. Формат ARN следующий:

arn:<partition>:comprehend:<region>:<account-id>:topics-detection-job/<job-id>

Пример ARN задания:

arn:aws:comprehend:us-west-2:111122223333:document-classification-job/1234abcd12ab34cd56ef1234567890ab

JobStatus -> (строка)

Статус задания:

  • SUBMITTED - Задание принято и находится в очереди на обработку.
  • IN_PROGRESS - Amazon Comprehend обрабатывает задание.
  • COMPLETED - Задание успешно завершено, и вывод доступен.
  • FAILED - Задание не завершено. Для получения подробностей используйте операцию DescribeTopicDetectionJob.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API