Spec-Zone.ru › AWS CLI v2

[ aws . comprehend ]

start-key-phrases-detection-job

Описание

Запускает асинхронную задачу обнаружения ключевых фраз для набора документов. Используйте данную операцию для отслеживания статуса задачи.

См. также: Документация API AWS

Синтаксис

  start-key-phrases-detection-job
--input-data-config <value>
--output-data-config <value>
--data-access-role-arn <value>
[--job-name <value>]
--language-code <value>
[--client-request-token <value>]
[--volume-kms-key-id <value>]
[--vpc-config <value>]
[--tags <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--input-data-config (структура)

Указывает формат и расположение входных данных для задачи.

S3Uri -> (строка)

Amazon S3 URI для входных данных. URI должен находиться в том же регионе, что и вызываемый API-точке доступа. URI может указывать на один входной файл или префикс для набора файлов данных.

Например, если вы используете URI S3://bucketName/prefix , если префикс — это один файл, Amazon Comprehend использует этот файл в качестве входных данных. Если префикс соответствует нескольким файлам, Amazon Comprehend использует все файлы, начинающиеся с этого префикса.

InputFormat -> (строка)

Указывает, как текст в входном файле должен обрабатываться:

  • ONE_DOC_PER_FILE - Каждый файл рассматривается как отдельный документ. Используйте этот параметр при обработке больших документов, таких как статьи газет или научные статьи.
  • ONE_DOC_PER_LINE - Каждая строка в файле рассматривается как отдельный документ. Используйте этот параметр при обработке большого числа коротких документов, таких как текстовые сообщения.

DocumentReaderConfig -> (структура)

Предоставляет параметры конфигурации для переопределения стандартных действий по извлечению текста из PDF-документов и файлов изображений.

DocumentReadAction -> (строка)

Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из файлов PDF и файлов изображений. Введите одно из следующих значений:

  • TEXTRACT_DETECT_DOCUMENT_TEXT - Сервис Amazon Comprehend использует операцию API DetectDocumentText.
  • TEXTRACT_ANALYZE_DOCUMENT - Сервис Amazon Comprehend использует операцию API AnalyzeDocument.

DocumentReadMode -> (строка)

Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:

  • SERVICE_DEFAULT - использовать стандартные настройки Amazon Comprehend для PDF-файлов.
  • FORCE_DOCUMENT_READ_ACTION - Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.

FeatureTypes -> (список)

Указывает тип функций Amazon Textract, которые необходимо применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:

  • TABLES - Возвращает дополнительную информацию о любых обнаруженных таблицах в входном документе.
  • FORMS - Возвращает дополнительную информацию о любых обнаруженных формах в входном документе.

(строка)

TABLES или FORMS

Сокращенный синтаксис:

S3Uri=string,InputFormat=string,DocumentReaderConfig={DocumentReadAction=string,DocumentReadMode=string,FeatureTypes=[string,string]}

Синтаксис JSON:

{
  "S3Uri": "string",
  "InputFormat": "ONE_DOC_PER_FILE"|"ONE_DOC_PER_LINE",
  "DocumentReaderConfig": {
    "DocumentReadAction": "TEXTRACT_DETECT_DOCUMENT_TEXT"|"TEXTRACT_ANALYZE_DOCUMENT",
    "DocumentReadMode": "SERVICE_DEFAULT"|"FORCE_DOCUMENT_READ_ACTION",
    "FeatureTypes": ["TABLES"|"FORMS", ...]
  }
}

--output-data-config (структура)

Указывает, куда отправлять выходные файлы.

S3Uri -> (строка)

При использовании объекта OutputDataConfig с асинхронными операциями вы указываете расположение Amazon S3, куда хотите записать выходные данные. URI должен находиться в том же регионе, что и вызываемый API-точке доступа. Расположение используется в качестве префикса для фактического расположения выходного файла.

По завершении задачи обнаружения темы служба создает выходной файл в каталоге, специфичном для задачи. Поле S3Uri содержит расположение выходного файла, называемого output.tar.gz . Это сжатый архив, содержащий результаты операции.

Для задачи обнаружения сущностей PII выходной файл является текстовым, а не сжатым архивом. Имя выходного файла такое же, как имя входного файла, с добавленным .out в конце.

KmsKeyId -> (строка)

Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования выходных результатов работы анализа. Укажите идентификатор симметричного ключа, так как асимметричный ключ нельзя использовать для загрузки данных в S3.

KmsKeyId может иметь один из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • ARN ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"
  • Псевдоним ключа KMS: "alias/ExampleAlias"
  • ARN псевдонима ключа KMS: "arn:aws:kms:us-west-2:111122223333:alias/ExampleAlias"

Сокращенный синтаксис:

S3Uri=string,KmsKeyId=string

Синтаксис JSON:

{
  "S3Uri": "string",
  "KmsKeyId": "string"
}

--data-access-role-arn (строка)

Amazon Resource Name (ARN) роли IAM, которая предоставляет Amazon Comprehend доступ для чтения к вашим входным данным. Дополнительную информацию см. в разделе Права доступа на основе ролей.

--job-name (строка)

Идентификатор задачи.

--language-code (строка)

Язык входных документов. Вы можете указать любой из основных языков, поддерживаемых Amazon Comprehend. Все документы должны быть на одном языке.

Возможные значения:

  • en
  • es
  • fr
  • de
  • it
  • pt
  • ar
  • hi
  • ja
  • ko
  • zh
  • zh-TW

--client-request-token (строка)

Уникальный идентификатор запроса. Если вы не зададите маркер запроса клиента, Amazon Comprehend сгенерирует его.

--volume-kms-key-id (строка)

Идентификатор ключа Amazon Web Services Key Management Service (KMS), который Amazon Comprehend использует для шифрования данных на томе хранения, подключенном к виртуальной машине ML, обрабатывающей задачу анализа. VolumeKmsKeyId может иметь один из следующих форматов:

  • Идентификатор ключа KMS: "1234abcd-12ab-34cd-56ef-1234567890ab"
  • ARN ключа KMS: "arn:aws:kms:us-west-2:111122223333:key/1234abcd-12ab-34cd-56ef-1234567890ab"

--vpc-config (структура)

Параметры конфигурации для необязательной частной виртуальной сети VPC, содержащей ресурсы, которые вы используете для задачи обнаружения ключевых фраз. Дополнительную информацию см. в разделе Amazon VPC.

SecurityGroupIds -> (список)

Номер ID группы безопасности на экземпляре вашей частной VPC. Группы безопасности вашей VPC служат виртуальным брандмауэром для управления входящим и исходящим трафиком и обеспечивают безопасность ресурсов, к которым вы будете получать доступ в VPC. Этот номер ID предваряется «sg-», например: «sg-03b388029b0a285ea». Дополнительную информацию см. в разделе Группы безопасности для вашей VPC.

(строка)

Subnets -> (список)

ID каждого подсети, используемой в вашей частной VPC. Эта подсеть является подмножеством диапазона адресов IPv4, используемых VPC, и относится к определенной доступной зоне в регионе VPC. Этот номер ID предваряется «subnet-», например: «subnet-04ccf456919e69055». Дополнительную информацию см. в разделе VPC и подсети.

(строка)

Сокращенный синтаксис:

SecurityGroupIds=string,string,Subnets=string,string

Синтаксис JSON:

{
  "SecurityGroupIds": ["string", ...],
  "Subnets": ["string", ...]
}

--tags (список)

Теги, которые необходимо добавить к задаче обнаружения ключевых фраз. Тег — это пара «ключ-значение», добавляющая метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с «Sales» в качестве ключа может быть добавлен к ресурсу для указания его использования отделом продаж.

(структура)

Пара «ключ-значение», добавляющая метаданные к ресурсу, используемому Amazon Comprehend. Например, тег с парой «ключ-значение» «Department»:’Sales’ может быть добавлен к ресурсу для указания его использования определенным отделом.

Key -> (строка)

Начальная часть пары «ключ-значение», образующей тег, связанный с данным ресурсом. Например, если вы хотите показать, какие ресурсы используются какими отделами, вы можете использовать «Department» в качестве начальной (ключевой) части пары, с различными возможными значениями, такими как «sales», «legal» и «administration».

Value -> (строка)

Вторая часть пары «ключ-значение», образующей тег, связанный с данным ресурсом. Например, если вы хотите показать, какие ресурсы используются какими отделами, вы можете использовать «Department» в качестве начальной (ключевой) части пары, а в качестве значения — «sales» для указания отдела продаж.

Сокращенный синтаксис:

Key=string,Value=string ...

Синтаксис JSON:

[
  {
    "Key": "string",
    "Value": "string"
  }
  ...
]

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка следует формату, указанному в --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет принята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение null или строка input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено значение yaml-input, выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверит входные данные команд и вернёт пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Общие параметры

--debug (boolean)

Включить отладочную регистрацию.

--endpoint-url (string)

Переопределить URL по умолчанию команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение по умолчанию проверки SSL-сертификатов.

--no-paginate (boolean)

Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использовать определенный профиль из файла учетных данных.

--region (string)

Регион для использования. Переопределяет параметры конфигурации/среды.

--version (string)

Отобразить версию этого инструмента.

--color (string)

Включить/выключить вывод в цвете.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (string)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет блокирующим и не будет иметь таймаут. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет блокирующим и не будет иметь таймаут. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (string)

Стиль форматирования для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной строки base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить пейджер CLI для вывода.

--cli-auto-prompt (boolean)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматическое запросы параметров ввода CLI.

Примеры

Примечание

Чтобы использовать следующие примеры, необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.

Если не указано иное, все примеры используют правила цитирования, характерные для Unix. Эти примеры необходимо адаптировать к правилам цитирования вашей оболочки. Дополнительную информацию см. в разделе «Использование кавычек со строками» в Руководстве пользователя AWS CLI.

Запуск задания обнаружения ключевых фраз

Следующий start-key-phrases-detection-job пример запускает асинхронное задание обнаружения ключевых фраз для всех файлов, расположенных по адресу, указанному тегом --input-data-config. В ведре S3 в этом примере содержатся файлы Sampletext1.txt, Sampletext2.txt и Sampletext3.txt. После завершения задания папка output размещается в месте, указанном тегом --output-data-config. Папка содержит файл output.txt, который содержит все обнаруженные ключевые фразы в каждом текстовом файле и оценку доверия предварительно обученной модели для каждого прогноза. Вывод в формате Json выводится по одной строке на каждый файл, но здесь отформатирован для лучшей читаемости.

aws comprehend start-key-phrases-detection-job \
    --job-name keyphrasesanalysistest1 \
    --language-code en \
    --input-data-config "S3Uri=s3://amzn-s3-demo-bucket/" \
    --output-data-config "S3Uri=s3://amzn-s3-demo-destination-bucket/testfolder/" \
    --data-access-role-arn "arn:aws:iam::111122223333:role/service-role/AmazonComprehendServiceRole-example-role" \
    --language-code en

Содержимое Sampletext1.txt:

"Hello Zhang Wei, I am John. Your AnyCompany Financial Services, LLC credit card account 1111-XXXX-1111-XXXX has a minimum payment of $24.53 that is due by July 31st."

Содержимое Sampletext2.txt:

"Dear Max, based on your autopay settings for your account Internet.org account, we will withdraw your payment on the due date from your bank account number XXXXXX1111 with the routing number XXXXX0000. "

Содержимое Sampletext3.txt:

"Jane, please submit any customer feedback from this weekend to Sunshine Spa, 123 Main St, Anywhere and send comments to Alice at AnySpa@example.com."

Вывод:

{
    "JobId": "123456abcdeb0e11022f22a11EXAMPLE",
    "JobArn": "arn:aws:comprehend:us-west-2:111122223333:key-phrases-detection-job/123456abcdeb0e11022f22a11EXAMPLE",
    "JobStatus": "SUBMITTED"
}

Содержимое output.txt с отступами строк для лучшей читаемости:

{
    "File": "SampleText1.txt",
    "KeyPhrases": [
        {
        "BeginOffset": 6,
        "EndOffset": 15,
        "Score": 0.9748965572679326,
        "Text": "Zhang Wei"
        },
        {
        "BeginOffset": 22,
        "EndOffset": 26,
        "Score": 0.9997344722354619,
        "Text": "John"
        },
        {
        "BeginOffset": 28,
        "EndOffset": 62,
        "Score": 0.9843791074032948,
        "Text": "Your AnyCompany Financial Services"
        },
        {
        "BeginOffset": 64,
        "EndOffset": 107,
        "Score": 0.8976122401721824,
        "Text": "LLC credit card account 1111-XXXX-1111-XXXX"
        },
        {
        "BeginOffset": 112,
        "EndOffset": 129,
        "Score": 0.9999612982629748,
        "Text": "a minimum payment"
        },
        {
        "BeginOffset": 133,
        "EndOffset": 139,
        "Score": 0.99975728947036,
        "Text": "$24.53"
        },
        {
        "BeginOffset": 155,
        "EndOffset": 164,
        "Score": 0.9940866241449973,
        "Text": "July 31st"
        }
    ],
    "Line": 0
    }
    {
    "File": "SampleText2.txt",
    "KeyPhrases": [
        {
        "BeginOffset": 0,
        "EndOffset": 8,
        "Score": 0.9974021100118472,
        "Text": "Dear Max"
        },
        {
        "BeginOffset": 19,
        "EndOffset": 40,
        "Score": 0.9961120519515884,
        "Text": "your autopay settings"
        },
        {
        "BeginOffset": 45,
        "EndOffset": 78,
        "Score": 0.9980620070116009,
        "Text": "your account Internet.org account"
        },
        {
        "BeginOffset": 97,
        "EndOffset": 109,
        "Score": 0.999919660140754,
        "Text": "your payment"
        },
        {
        "BeginOffset": 113,
        "EndOffset": 125,
        "Score": 0.9998370719754205,
        "Text": "the due date"
        },
        {
        "BeginOffset": 131,
        "EndOffset": 166,
        "Score": 0.9955068678502509,
        "Text": "your bank account number XXXXXX1111"
        },
        {
        "BeginOffset": 172,
        "EndOffset": 200,
        "Score": 0.8653433315829526,
        "Text": "the routing number XXXXX0000"
        }
    ],
    "Line": 0
    }
    {
    "File": "SampleText3.txt",
    "KeyPhrases": [
        {
        "BeginOffset": 0,
        "EndOffset": 4,
        "Score": 0.9142947833681668,
        "Text": "Jane"
        },
        {
        "BeginOffset": 20,
        "EndOffset": 41,
        "Score": 0.9984325676596763,
        "Text": "any customer feedback"
        },
        {
        "BeginOffset": 47,
        "EndOffset": 59,
        "Score": 0.9998782448150636,
        "Text": "this weekend"
        },
        {
        "BeginOffset": 63,
        "EndOffset": 75,
        "Score": 0.99866741830757,
        "Text": "Sunshine Spa"
        },
        {
        "BeginOffset": 77,
        "EndOffset": 88,
        "Score": 0.9695803485466054,
        "Text": "123 Main St"
        },
        {
        "BeginOffset": 108,
        "EndOffset": 116,
        "Score": 0.9997065928550928,
        "Text": "comments"
        },
        {
        "BeginOffset": 120,
        "EndOffset": 125,
        "Score": 0.9993466833825161,
        "Text": "Alice"
        },
        {
        "BeginOffset": 129,
        "EndOffset": 144,
        "Score": 0.9654563612885667,
        "Text": "AnySpa@example.com"
        }
    ],
    "Line": 0
}

Для получения дополнительной информации см. Асинхронный анализ для Amazon Comprehend Insights в Руководстве разработчика Amazon Comprehend.

Вывод

JobId -> (string)

Идентификатор, сгенерированный для задания. Для получения статуса задания используйте этот идентификатор с операцией.

JobArn -> (string)

Amazon Resource Name (ARN) задания обнаружения ключевых фраз. Это уникальный, полностью квалифицированный идентификатор задания. Он включает учетную запись Amazon Web Services, регион Amazon Web Services и идентификатор задания. Формат ARN следующий:

arn:<partition>:comprehend:<region>:<account-id>:key-phrases-detection-job/<job-id>

Следующий пример ARN задания:

arn:aws:comprehend:us-west-2:111122223333:key-phrases-detection-job/1234abcd12ab34cd56ef1234567890ab

JobStatus -> (string)

Статус задания.

  • SUBMITTED - Задание принято и помещено в очередь на обработку.
  • IN_PROGRESS - Amazon Comprehend обрабатывает задание.
  • COMPLETED - Задание успешно завершено, и вывод доступен.
  • FAILED - Задание не завершилось. Для получения подробностей используйте операцию.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

END_OF_DOCUMENT_MARKER

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API