start-document-analysis
Описание
Запускает асинхронный анализ входного документа на предмет взаимосвязей между обнаруженными элементами, такими как пары «ключ-значение», таблицы и элементы выбора.
StartDocumentAnalysis может анализировать текст в документах форматов JPEG, PNG, TIFF и PDF. Документы хранятся в ведре Amazon S3. Используйте DocumentLocation для указания имени ведра и имени файла документа.
StartDocumentAnalysis возвращает идентификатор задания (JobId ), который используется для получения результатов операции. По завершении анализа текста Amazon Textract публикует статус завершения в тему Amazon Simple Notification Service (Amazon SNS), которую вы указываете в NotificationChannel. Чтобы получить результаты операции анализа текста, сначала проверьте, что значение статуса, опубликованное в тему Amazon SNS, равно SUCCEEDED. В этом случае вызовите GetDocumentAnalysis и передайте идентификатор задания (JobId) из первоначального вызова в StartDocumentAnalysis.
Для получения дополнительной информации см. Анализ текстовой информации документов.
См. также: Документация API AWS
Синтаксис
start-document-analysis
--document-location <value>
--feature-types <value>
[--client-request-token <value>]
[--job-tag <value>]
[--notification-channel <value>]
[--output-config <value>]
[--kms-key-id <value>]
[--queries-config <value>]
[--adapters-config <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--document-location (структура)
Расположение обрабатываемого документа.
S3Object -> (структура)
Ведро Amazon S3, содержащее входной документ.
Bucket -> (строка)
Name -> (строка)
Version -> (строка)
Сокращенный синтаксис:
S3Object={Bucket=string,Name=string,Version=string}
Синтаксис JSON:
{
"S3Object": {
"Bucket": "string",
"Name": "string",
"Version": "string"
}
}
--feature-types (список)
Список типов анализа, которые нужно выполнить. Добавьте TABLES, чтобы получить информацию о таблицах, обнаруженных в входном документе. Добавьте FORMS, чтобы получить обнаруженные данные формы. Чтобы выполнить оба типа анализа, добавьте TABLES и FORMS в FeatureTypes. Все строки и слова, обнаруженные в документе, включены в ответ (включая текст, не относящийся к значению FeatureTypes).
(строка)
Синтаксис:
"string" "string" ...
Where valid values are:
TABLES
FORMS
QUERIES
SIGNATURES
LAYOUT
--client-request-token (строка)
StartDocumentAnalysis, возвращается тот же идентификатор JobId. Используйте ClientRequestToken для предотвращения случайного запуска одного и того же задания более одного раза. Подробнее см. Вызов асинхронных операций Amazon Textract.--job-tag (строка)
JobTag для идентификации типа документа, которому соответствует уведомление о завершении (например, налоговая форма или квитанция).--notification-channel (структура)
ARN темы Amazon SNS, в которую Amazon Textract должен публиковать статус завершения операции.
SNSTopicArn -> (строка)
RoleArn -> (строка)
Сокращенный синтаксис:
SNSTopicArn=string,RoleArn=string
Синтаксис JSON:
{
"SNSTopicArn": "string",
"RoleArn": "string"
}
--output-config (структура)
Устанавливает, будет ли вывод направлен в ведро, определенное клиентом. По умолчанию Amazon Textract сохранит результаты во внутренней системе для доступа через операцию GetDocumentAnalysis.
S3Bucket -> (строка)
S3Prefix -> (строка)
Сокращенный синтаксис:
S3Bucket=string,S3Prefix=string
Синтаксис JSON:
{
"S3Bucket": "string",
"S3Prefix": "string"
}
--kms-key-id (строка)
--queries-config (структура)
Queries -> (список)
(структура)
Каждый запрос содержит вопрос, который вы хотите задать в тексте, и псевдоним, который вы хотите ассоциировать.
Text -> (строка)
Alias -> (строка)
Pages -> (список)
Pages — это параметр, введенный пользователем для указания страниц, к которым применяется запрос. Ниже приведены правила использования этого параметра.
- Если страница не указана, по умолчанию она устанавливается в
["1"]. - В строке параметра разрешены следующие символы:
0 1 2 3 4 5 6 7 8 9 - *. Пробелы не разрешены. - При использовании * для указания всех страниц он должен быть единственным элементом в списке.
- Можно использовать интервалы страниц, например
[“1-3”, “1-1”, “4-*”]. Где*обозначает последнюю страницу документа. - Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.
(строка)
Синтаксис JSON:
{
"Queries": [
{
"Text": "string",
"Alias": "string",
"Pages": ["string", ...]
}
...
]
}
--adapters-config (структура)
Указывает адаптер, который будет использоваться при анализе документа.
Adapters -> (список)
Список адаптеров, которые будут использоваться при анализе указанного документа.
(структура)
Адаптер, выбранный для использования при анализе документов. Содержит идентификатор адаптера и номер версии. Содержит информацию о выбранных страницах для анализа при асинхронном анализе документов.
AdapterId -> (строка)
Pages -> (список)
Pages — это параметр, введенный пользователем для указания страниц, к которым применяется адаптер. Ниже приведены правила использования этого параметра.
- Если страница не указана, по умолчанию она устанавливается в
["1"]. - В строке параметра разрешены следующие символы:
0 1 2 3 4 5 6 7 8 9 - *. Пробелы не разрешены. - При использовании * для указания всех страниц он должен быть единственным элементом в списке.
- Можно использовать интервалы страниц, например
["1-3", "1-1", "4-*"]. Где*обозначает последнюю страницу документа. - Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.
(строка)
Version -> (строка)
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному в --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет воспринята буквально. Этот параметр не может быть указан вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Печатает JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или значении input печатает пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при указании yaml-input он напечатает пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантии обратной совместимости в сгенерированном JSON-скелете.
Общие параметры
--debug (boolean)
Включить отладку.
--endpoint-url (string)
Переопределить стандартный URL команды заданным URL.
--no-verify-ssl (boolean)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.
--no-paginate (boolean)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (string)
Стиль форматирования вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (string)
Запрос JMESPath для фильтрации данных ответа.
--profile (string)
Использование конкретного профиля из файла учетных данных.
--region (string)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (string)
Отображение версии этого инструмента.
--color (string)
Включение/выключение цветного вывода.
- on
- off
- auto
--no-sign-request (boolean)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (string)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет выполняться без блокировки и таймаута. Значение по умолчанию - 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет выполняться без блокировки и таймаута. Значение по умолчанию - 60 секунд.
--cli-binary-format (string)
Стиль форматирования двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как закодированная строка base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку fileb:// всегда будет обрабатываться как двоичное и будет использоваться содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для заданного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (boolean)
Отключить вывод страницы CLI.
--cli-auto-prompt (boolean)
Автоматически запрашивать параметры входных данных CLI.
--no-cli-auto-prompt (boolean)
Отключить автоматическое запросы параметров входных данных CLI.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Подробнее см. руководство по началу работы в руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования, характерные для Unix-систем. Эти примеры необходимо адаптировать к правилам цитирования вашей оболочки. Смотрите раздел Использование кавычек со строками в руководстве пользователя AWS CLI.
Для начала анализа текста в многостраничном документе
Следующий start-document-analysis пример демонстрирует, как начать асинхронный анализ текста в многостраничном документе.
Linux/macOS:
aws textract start-document-analysis \
--document-location '{"S3Object":{"Bucket":"bucket","Name":"document"}}' \
--feature-types '["TABLES","FORMS"]' \
--notification-channel "SNSTopicArn=arn:snsTopic,RoleArn=roleArn"
Windows:
aws textract start-document-analysis \
--document-location "{\"S3Object\":{\"Bucket\":\"bucket\",\"Name\":\"document\"}}" \
--feature-types "[\"TABLES\", \"FORMS\"]" \
--region region-name \
--notification-channel "SNSTopicArn=arn:snsTopic,RoleArn=roleArn"
Вывод:
{
"JobId": "df7cf32ebbd2a5de113535fcf4d921926a701b09b4e7d089f3aebadb41e0712b"
}
Дополнительную информацию см. в разделе Обнаружение и анализ текста в многостраничных документах в руководстве разработчика Amazon Textract
Вывод
JobId -> (строка)
JobId для идентификации задачи в последующем вызове GetDocumentAnalysis . Значение JobId действителен только 7 дней.
© Copyright 2025, Amazon Web Services. Created using Sphinx.