get-document-analysis
Описание
Получает результаты асинхронной операции Amazon Textract по анализу текста в документе.
Вы запускаете асинхронный анализ текста, вызывая StartDocumentAnalysis, который возвращает идентификатор задания (JobId). Когда операция анализа текста завершается, Amazon Textract публикует состояние завершения в тему Amazon Simple Notification Service (Amazon SNS), зарегистрированную в исходном вызове StartDocumentAnalysis. Чтобы получить результаты операции распознавания текста, сначала проверьте, что значение статуса, опубликованное в тему Amazon SNS, равно SUCCEEDED. В этом случае вызовите GetDocumentAnalysis и передайте идентификатор задания (JobId) из исходного вызова StartDocumentAnalysis.
GetDocumentAnalysis возвращает массив объектов Block. Возвращается следующая информация:- Данные формы (парные ключи-значения). Связанная информация возвращается в двух объектах Block, каждый из которых имеет тип
KEY_VALUE_SET: объект KEYBlockи объект VALUEBlock. Например, Имя: Ана Сильва Каролина содержит ключ и значение. Имя: - это ключ. Ана Сильва Каролина - это значение. - Данные таблиц и ячеек таблиц. Объект TABLE
Blockсодержит информацию о распознанной таблице. Объект CELLBlockвозвращается для каждой ячейки в таблице. - Строки и слова текста. Объект LINE
Blockсодержит один или несколько объектов WORDBlock. Возвращаются все строки и слова, обнаруженные в документе (включая текст, не имеющий отношения к значению параметраStartDocumentAnalysisFeatureTypes). - Запрос. Объект блока QUERY содержит текст запроса, псевдоним и ссылку на связанный объект блока результатов запроса.
- Результаты запроса. Объект блока QUERY_RESULT содержит ответ на запрос и идентификатор, который связывает его с заданным запросом. Этот блок также содержит оценку уверенности.
Примечание
При обработке документа с запросами следите за выводомINVALID_REQUEST_PARAMETERS. Это указывает на то, что предел запросов на страницу превышен или что операция пытается запросить страницу документа, которой не существует.Элементы выбора, такие как флажки и переключатели (кнопки радио), могут быть обнаружены в данных формы и таблицах. Объект SELECTION_ELEMENT Block содержит информацию об элементе выбора, включая состояние выбора.
Используйте параметр MaxResults, чтобы ограничить количество возвращаемых блоков. Если результатов больше, чем указано в MaxResults, значение NextToken в ответе операции содержит маркер пагинации для получения следующего набора результатов. Чтобы получить следующую страницу результатов, вызовите GetDocumentAnalysis и заполните параметр запроса NextToken значением маркера, возвращённым предыдущим вызовом GetDocumentAnalysis.
Дополнительную информацию см. в разделе Анализ текста документа.
См. также: Документация API AWS
Синтаксис
get-document-analysis
--job-id <value>
[--max-results <value>]
[--next-token <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--job-id (строка)
JobId возвращается из StartDocumentAnalysis. Значение JobId действительны только в течение 7 дней.--max-results (целое число)
--next-token (строка)
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределят значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или значение input, выводит JSON-входной пример, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, будет напечатан образец YAML-входных данных, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно проверяет входные данные команды и возвращает JSON-пример выходных данных для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включить отладку логгирования.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого подключения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.
--no-paginate (булево)
Отключить автоматическую пагинацию. Если автоматическая пагинация отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла параметров.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (булево)
Не подписывать запросы. Данные учетных данных не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл сертификатов CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию - base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде base64-кодированной строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить пейджер cli для вывода.
--cli-auto-prompt (булево)
Автоматически запрашивать входные параметры CLI.
--no-cli-auto-prompt (булево)
Отключить автоматическое запроса входных параметров CLI.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в Руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования, похожие на unix-подобные. Эти примеры нужно будет адаптировать к правилам цитирования вашей оболочки. См. использование кавычек со строками в Руководстве пользователя AWS CLI.
Для получения результатов асинхронного анализа текста многостраничного документа
Следующий get-document-analysis пример показывает, как получить результаты асинхронного анализа текста многостраничного документа.
aws textract get-document-analysis \
--job-id df7cf32ebbd2a5de113535fcf4d921926a701b09b4e7d089f3aebadb41e0712b \
--max-results 1000
Вывод:
{
"Blocks": [
{
"Geometry": {
"BoundingBox": {
"Width": 1.0,
"Top": 0.0,
"Left": 0.0,
"Height": 1.0
},
"Polygon": [
{
"Y": 0.0,
"X": 0.0
},
{
"Y": 0.0,
"X": 1.0
},
{
"Y": 1.0,
"X": 1.0
},
{
"Y": 1.0,
"X": 0.0
}
]
},
"Relationships": [
{
"Type": "CHILD",
"Ids": [
"75966e64-81c2-4540-9649-d66ec341cd8f",
"bb099c24-8282-464c-a179-8a9fa0a057f0",
"5ebf522d-f9e4-4dc7-bfae-a288dc094595"
]
}
],
"BlockType": "PAGE",
"Id": "247c28ee-b63d-4aeb-9af0-5f7ea8ba109e",
"Page": 1
}
],
"NextToken": "cY1W3eTFvoB0cH7YrKVudI4Gb0H8J0xAYLo8xI/JunCIPWCthaKQ+07n/ElyutsSy0+1VOImoTRmP1zw4P0RFtaeV9Bzhnfedpx1YqwB4xaGDA==",
"DocumentMetadata": {
"Pages": 1
},
"JobStatus": "SUCCEEDED"
}
Дополнительную информацию см. в разделе Обнаружение и анализ текста в многостраничных документах в Руководстве разработчика Amazon Textract
Вывод
DocumentMetadata -> (структура)
Информация о документе, обработанном Amazon Textract. DocumentMetadata возвращается на каждой странице ответа с пагинацией от операции Amazon Textract с видео.
Pages -> (целое число)
JobStatus -> (строка)
NextToken -> (строка)
Blocks -> (список)
Результаты операции анализа текста.
(структура)
Block представляет элементы, распознанные в документе в группе пикселей, близких друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При обнаружении текста в документах (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о распознанных полях, таблицах и элементах выбора в документе.
Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block содержит весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.
Дополнительную информацию см. в разделе Как работает Amazon Textract .
BlockType -> (строка)
Тип распознанного элемента текста. В операциях распознавания текста возвращаются следующие типы:
-
PAGE - Содержит список объектов LINE
Block, обнаруженных на странице документа. - WORD - Слово, обнаруженное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, не разделенные пробелами.
- LINE - Строка табулированных, смежных слов, обнаруженных на странице документа.
В операциях анализа текста возвращаются следующие типы:
-
PAGE - Содержит список дочерних объектов
Block, обнаруженных на странице документа. -
KEY_VALUE_SET - Хранит объекты KEY и VALUE
Blockдля связанного текста, обнаруженного на странице документа. Используйте полеEntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEYBlockили объектом VALUEBlock. - WORD - Слово, обнаруженное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, не разделенные пробелами.
- LINE - Строка табулированных, смежных слов, обнаруженных на странице документа.
- TABLE - Таблица, обнаруженная на странице документа. Таблица — это информация, основанная на сетке, с двумя или более строками или столбцами, с размахом ячеек по одной строке и одному столбцу.
- TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей или вставлен в первую строку таблицы.
- TABLE_FOOTER - Подвал, связанный с таблицей. Подвал обычно представляет собой строку или строки текста под таблицей или вставлен в последнюю строку таблицы.
- CELL - Ячейка в обнаруженной таблице. Ячейка — родитель блока, содержащего текст в ячейке.
-
MERGED_CELL - Ячейка в таблице, содержимое которой охватывает более одной строки или столбца. Массив
Relationshipsдля этой ячейки содержит данные из отдельных ячеек. -
SELECTION_ELEMENT - Элемент выбора, такой как кнопка выбора (кнопка радио) или флажок, обнаруженный на странице документа. Используйте значение
SelectionStatus, чтобы определить состояние элемента выбора. - SIGNATURE - Местоположение и оценка уверенности в подписи, обнаруженной на странице документа. Может быть возвращена как часть пары ключ-значение или обнаруженной ячейки.
- QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, связывающий его с ответом.
- QUERY_RESULT - Ответ на вопрос, заданный во время вызова AnalyzeDocument. Имеет псевдоним и идентификатор для удобства поиска в ответе. Также содержит местоположение и оценку уверенности.
Следующие BlockTypes возвращаются только для Amazon Textract Layout.
-
LAYOUT_TITLE- Основной заголовок документа. -
LAYOUT_HEADER- Текст, расположенный в верхнем отступе документа. -
LAYOUT_FOOTER- Текст, расположенный в нижнем отступе документа. -
LAYOUT_SECTION_HEADER- Заголовки разделов внутри документа. -
LAYOUT_PAGE_NUMBER- Номер страницы документа. -
LAYOUT_LIST- Любая информация, сгруппированная в виде списка. -
LAYOUT_FIGURE- Указывает местоположение изображения в документе. -
LAYOUT_TABLE- Указывает местоположение таблицы в документе. -
LAYOUT_KEY_VALUE- Указывает местоположение ключевых значений формы в документе. -
LAYOUT_TEXT- Текст, который обычно присутствует как часть абзацев в документах.
Confidence -> (вещественное число)
Text -> (строка)
TextType -> (строка)
RowIndex -> (целое число)
RowIndex не возвращается операциями DetectDocumentText и GetDocumentTextDetection.ColumnIndex -> (целое число)
ColumnIndex не возвращается операциями DetectDocumentText и GetDocumentTextDetection.RowSpan -> (целое число)
RowSpan не возвращается операциями DetectDocumentText и GetDocumentTextDetection.ColumnSpan -> (целое число)
ColumnSpan не возвращается операциями DetectDocumentText и GetDocumentTextDetection.Geometry -> (структура)
Местоположение распознанного текста на изображении. Оно включает в себя выровненную по осям грубую рамку вокруг текста и более тонкую многоугольную форму для более точной пространственной информации.
BoundingBox -> (структура)
Выровненное по осям грубое представление расположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри рамки — более подробный многоугольник вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается операцией DetectDocumentText . Polygon представляет собой детальный многоугольник вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Id -> (строка)
Relationships -> (список)
Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, блок LINE содержит тип отношения CHILD со блоками WORD, которые составляют строку текста. В списке нет объектов Relationship для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.
(структура)
Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке, Relationships. Дополнительную информацию см. в разделе Блок.
Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.
Type -> (строка)
Тип отношения между блоками в массиве ID и текущим блоком. Следующий список описывает типы отношений, которые могут быть возвращены.
- VALUE - Список, содержащий ID блока VALUE, который связан с KEY пары ключ-значение.
- CHILD - Список ID, идентифицирующих блоки, обнаруженные внутри текущего блока. Например, блоки WORD имеют отношение CHILD к типу блока LINE.
- MERGED_CELL - Список ID, идентифицирующих каждый из блоков типа MERGED_CELL в таблице.
- ANSWER - Список, содержащий ID блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
- TABLE - Список ID, идентифицирующих связанные блоки типа TABLE.
- TABLE_TITLE - Список, содержащий ID блока типа TABLE_TITLE в таблице.
- TABLE_FOOTER - Список ID, идентифицирующих блоки типа TABLE_FOOTER в таблице.
Ids -> (список)
Массив ID связанных блоков. Тип отношения можно получить из элемента Type.
(строка)
EntityTypes -> (список)
Тип сущности.
Следующие типы сущностей могут быть возвращены анализом форм:
- KEY - Идентификатор поля в документе.
- VALUE - Текст поля.
Следующие типы сущностей могут быть возвращены анализом таблиц:
- COLUMN_HEADER - Идентифицирует ячейку, которая является заголовком столбца.
- TABLE_TITLE - Идентифицирует ячейку, которая является заголовком таблицы.
- TABLE_SECTION_TITLE - Идентифицирует ячейку, которая является заголовком раздела в таблице. Заголовок раздела обычно представляет собой ячейку, которая охватывает всю строку над разделом.
- TABLE_FOOTER - Идентифицирует ячейку, которая является подвалом таблицы.
- TABLE_SUMMARY - Идентифицирует ячейку сводки таблицы. Ячейка сводки может быть строкой таблицы или дополнительной, меньшей таблицей, которая содержит сводную информацию для другой таблицы.
- STRUCTURED_TABLE - Идентифицирует таблицу со столбцами заголовков, где содержимое каждой строки соответствует заголовкам.
- SEMI_STRUCTURED_TABLE - Идентифицирует несгруппированную таблицу.
EntityTypes не возвращается операциями DetectDocumentText и GetDocumentTextDetection.(строка)
SelectionStatus -> (строка)
Page -> (целое число)
Page возвращается синхронными и асинхронными операциями. Значения страниц, большие 1, возвращаются только для многостраничных документов в формате PDF или TIFF. Сканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для отсканированных изображений значение Page всегда равно 1.Запрос -> (структура)
Текст -> (строка)
Псевдоним -> (строка)
Страницы -> (список)
Параметр Страницы позволяет пользователю указать, к каким страницам применить запрос. Ниже приведен список правил использования этого параметра.
- Если страница не указана, она устанавливается по умолчанию в
["1"]. - В строке параметра разрешены следующие символы:
0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются. - При использовании * для указания всех страниц, это должен быть единственный элемент в списке.
- Можно использовать интервалы страниц, такие как
[“1-3”, “1-1”, “4-*”]. Где*обозначает последнюю страницу документа. - Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.
(строка)
Предупреждения -> (список)
Список предупреждений, возникших во время операции анализа документа.
(структура)
Предупреждение об ошибке, возникшей во время асинхронного анализа текста ( StartDocumentAnalysis ) или асинхронного распознавания текста документа ( StartDocumentTextDetection ).
Код ошибки -> (строка)
Страницы -> (список)
Список страниц, к которым относится предупреждение.
(целое число)
Сообщение о состоянии -> (строка)
Версия модели AnalyzeDocument -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.