Spec-Zone.ru › AWS CLI v2

[ aws . textract ]

start-document-analysis

Описание

Запускает асинхронный анализ входного документа на предмет взаимосвязей между обнаруженными элементами, такими как пары «ключ-значение», таблицы и элементы выбора.

StartDocumentAnalysis может анализировать текст в документах форматов JPEG, PNG, TIFF и PDF. Документы хранятся в ведре Amazon S3. Используйте DocumentLocation для указания имени ведра и имени файла документа.

StartDocumentAnalysis возвращает идентификатор задания (JobId ), который используется для получения результатов операции. По завершении анализа текста Amazon Textract публикует статус завершения в тему Amazon Simple Notification Service (Amazon SNS), которую вы указываете в NotificationChannel. Чтобы получить результаты операции анализа текста, сначала проверьте, что значение статуса, опубликованное в тему Amazon SNS, равно SUCCEEDED. В этом случае вызовите GetDocumentAnalysis и передайте идентификатор задания (JobId) из первоначального вызова в StartDocumentAnalysis.

Для получения дополнительной информации см. Анализ текстовой информации документов.

См. также: Документация API AWS

Синтаксис

  start-document-analysis
--document-location <value>
--feature-types <value>
[--client-request-token <value>]
[--job-tag <value>]
[--notification-channel <value>]
[--output-config <value>]
[--kms-key-id <value>]
[--queries-config <value>]
[--adapters-config <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--document-location (структура)

Расположение обрабатываемого документа.

S3Object -> (структура)

Ведро Amazon S3, содержащее входной документ.

Bucket -> (строка)

Имя ведра S3. Обратите внимание, что символ # недопустим в имени файла.

Name -> (строка)

Имя файла входного документа. Синхронные операции могут использовать файлы изображений в формате JPEG или PNG. Асинхронные операции также поддерживают файлы форматов PDF и TIFF.

Version -> (строка)

Если в ведре включена версия, вы можете указать версию объекта.

Сокращенный синтаксис:

S3Object={Bucket=string,Name=string,Version=string}

Синтаксис JSON:

{
  "S3Object": {
    "Bucket": "string",
    "Name": "string",
    "Version": "string"
  }
}

--feature-types (список)

Список типов анализа, которые нужно выполнить. Добавьте TABLES, чтобы получить информацию о таблицах, обнаруженных в входном документе. Добавьте FORMS, чтобы получить обнаруженные данные формы. Чтобы выполнить оба типа анализа, добавьте TABLES и FORMS в FeatureTypes. Все строки и слова, обнаруженные в документе, включены в ответ (включая текст, не относящийся к значению FeatureTypes).

(строка)

Синтаксис:

"string" "string" ...

Where valid values are:
  TABLES
  FORMS
  QUERIES
  SIGNATURES
  LAYOUT

--client-request-token (строка)

Идентификатор, используемый для идентификации запроса запуска. Если вы используете один и тот же токен с несколькими запросами StartDocumentAnalysis, возвращается тот же идентификатор JobId. Используйте ClientRequestToken для предотвращения случайного запуска одного и того же задания более одного раза. Подробнее см. Вызов асинхронных операций Amazon Textract.

--job-tag (строка)

Идентификатор, который вы указываете и который включен в уведомление о завершении, опубликованное в тему Amazon SNS. Например, вы можете использовать JobTag для идентификации типа документа, которому соответствует уведомление о завершении (например, налоговая форма или квитанция).

--notification-channel (структура)

ARN темы Amazon SNS, в которую Amazon Textract должен публиковать статус завершения операции.

SNSTopicArn -> (строка)

Тема Amazon SNS, в которую Amazon Textract публикует статус завершения.

RoleArn -> (строка)

Идентификатор ресурса Amazon Resource Name (ARN) роли IAM, предоставляющей Amazon Textract разрешения на публикацию в тему Amazon SNS.

Сокращенный синтаксис:

SNSTopicArn=string,RoleArn=string

Синтаксис JSON:

{
  "SNSTopicArn": "string",
  "RoleArn": "string"
}

--output-config (структура)

Устанавливает, будет ли вывод направлен в ведро, определенное клиентом. По умолчанию Amazon Textract сохранит результаты во внутренней системе для доступа через операцию GetDocumentAnalysis.

S3Bucket -> (строка)

Имя ведра, куда будет направлен вывод.

S3Prefix -> (строка)

Префикс имени ключа объекта, в который будет сохранен вывод. Когда не задано, префикс будет «textract_output».

Сокращенный синтаксис:

S3Bucket=string,S3Prefix=string

Синтаксис JSON:

{
  "S3Bucket": "string",
  "S3Prefix": "string"
}

--kms-key-id (строка)

Ключ KMS, используемый для шифрования результатов вывода. Он может быть в формате идентификатора ключа или псевдонима ключа. При указании ключа KMS ключ KMS будет использоваться для шифрования на стороне сервера объектов в ведре клиента. Когда этот параметр не задан, результат будет зашифрован на стороне сервера с использованием SSE-S3.

--queries-config (структура)

Queries -> (список)

(структура)

Каждый запрос содержит вопрос, который вы хотите задать в тексте, и псевдоним, который вы хотите ассоциировать.

Text -> (строка)

Вопрос, который Amazon Textract применит к документу. Пример: «Какой SSN клиента?»

Alias -> (строка)

Псевдоним, прикрепленный к запросу для удобства поиска.

Pages -> (список)

Pages — это параметр, введенный пользователем для указания страниц, к которым применяется запрос. Ниже приведены правила использования этого параметра.

  • Если страница не указана, по умолчанию она устанавливается в ["1"].
  • В строке параметра разрешены следующие символы: 0 1 2 3 4 5 6 7 8 9 - *. Пробелы не разрешены.
  • При использовании * для указания всех страниц он должен быть единственным элементом в списке.
  • Можно использовать интервалы страниц, например [“1-3”, “1-1”, “4-*”]. Где * обозначает последнюю страницу документа.
  • Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.

(строка)

Синтаксис JSON:

{
  "Queries": [
    {
      "Text": "string",
      "Alias": "string",
      "Pages": ["string", ...]
    }
    ...
  ]
}

--adapters-config (структура)

Указывает адаптер, который будет использоваться при анализе документа.

Adapters -> (список)

Список адаптеров, которые будут использоваться при анализе указанного документа.

(структура)

Адаптер, выбранный для использования при анализе документов. Содержит идентификатор адаптера и номер версии. Содержит информацию о выбранных страницах для анализа при асинхронном анализе документов.

AdapterId -> (строка)

Уникальный идентификатор ресурса адаптера.

Pages -> (список)

Pages — это параметр, введенный пользователем для указания страниц, к которым применяется адаптер. Ниже приведены правила использования этого параметра.

  • Если страница не указана, по умолчанию она устанавливается в ["1"].
  • В строке параметра разрешены следующие символы: 0 1 2 3 4 5 6 7 8 9 - *. Пробелы не разрешены.
  • При использовании * для указания всех страниц он должен быть единственным элементом в списке.
  • Можно использовать интервалы страниц, например ["1-3", "1-1", "4-*"]. Где * обозначает последнюю страницу документа.
  • Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.

(строка)

Version -> (строка)

Строка, идентифицирующая версию адаптера.

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному в --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет воспринята буквально. Этот параметр не может быть указан вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Печатает JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или значении input печатает пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании yaml-input он напечатает пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.

Общие параметры

--debug (boolean)

Включить отладку.

--endpoint-url (string)

Переопределить стандартный URL команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (boolean)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования вывода команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использование конкретного профиля из файла учетных данных.

--region (string)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (string)

Отображение версии этого инструмента.

--color (string)

Включение/выключение цветного вывода.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (string)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет выполняться без блокировки и таймаута. Значение по умолчанию - 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет выполняться без блокировки и таймаута. Значение по умолчанию - 60 секунд.

--cli-binary-format (string)

Стиль форматирования двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как закодированная строка base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку fileb:// всегда будет обрабатываться как двоичное и будет использоваться содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для заданного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить вывод страницы CLI.

--cli-auto-prompt (boolean)

Автоматически запрашивать параметры входных данных CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматическое запросы параметров входных данных CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Подробнее см. руководство по началу работы в руководстве пользователя AWS CLI.

Если не указано иное, все примеры используют правила цитирования, характерные для Unix-систем. Эти примеры необходимо адаптировать к правилам цитирования вашей оболочки. Смотрите раздел Использование кавычек со строками в руководстве пользователя AWS CLI.

Для начала анализа текста в многостраничном документе

Следующий start-document-analysis пример демонстрирует, как начать асинхронный анализ текста в многостраничном документе.

Linux/macOS:

aws textract start-document-analysis \
    --document-location '{"S3Object":{"Bucket":"bucket","Name":"document"}}' \
    --feature-types '["TABLES","FORMS"]' \
    --notification-channel "SNSTopicArn=arn:snsTopic,RoleArn=roleArn"

Windows:

aws textract start-document-analysis \
    --document-location "{\"S3Object\":{\"Bucket\":\"bucket\",\"Name\":\"document\"}}" \
    --feature-types "[\"TABLES\", \"FORMS\"]" \
    --region region-name \
    --notification-channel "SNSTopicArn=arn:snsTopic,RoleArn=roleArn"

Вывод:

{
    "JobId": "df7cf32ebbd2a5de113535fcf4d921926a701b09b4e7d089f3aebadb41e0712b"
}

Дополнительную информацию см. в разделе Обнаружение и анализ текста в многостраничных документах в руководстве разработчика Amazon Textract

Вывод

JobId -> (строка)

Идентификатор задачи обнаружения текста в документе. Используйте JobId для идентификации задачи в последующем вызове GetDocumentAnalysis . Значение JobId действителен только 7 дней.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API