get-lending-analysis
Описание
Получает результаты асинхронной операции Amazon Textract, анализирующей текст в документе о кредитовании.
Вы запускаете асинхронный анализ текста, вызвав StartLendingAnalysis, что возвращает идентификатор задачи (JobId). По завершении операции анализа текста Amazon Textract публикует состояние завершения в тему Amazon Simple Notification Service (Amazon SNS), зарегистрированную в начальном вызове StartLendingAnalysis.
Чтобы получить результаты операции анализа текста, сначала убедитесь, что значение статуса, опубликованное в тему Amazon SNS, равно SUCCEEDED. В этом случае вызовите GetLendingAnalysis и передайте идентификатор задачи (JobId) из начального вызова StartLendingAnalysis.
См. также: Документация API AWS
Синтаксис
get-lending-analysis
--job-id <value>
[--max-results <value>]
[--next-token <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--job-id (строка)
JobId возвращается из StartLendingAnalysis. Значение JobId валидно в течение 7 дней.--max-results (целое число)
--next-token (строка)
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения перепишут значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью предоставленного JSON-значения, поскольку строка будет интерпретироваться буквально. Этот параметр не может быть указан вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или при значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при значении yaml-input выводит пример входного YAML, который можно использовать с --cli-input-yaml. При значении output проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включает отладку логов.
--endpoint-url (строка)
Переопределяет URL по умолчанию команды на указанный URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого соединения SSL AWS CLI проверяет сертификаты SSL. Этот параметр переопределяет поведение по умолчанию проверки сертификатов SSL.
--no-paginate (булево)
Отключает автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования выходных данных команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использование определенного профиля из файла учетных данных.
--region (строка)
Используемый регион. Переопределяет настройки конфигурации/среды.
--version (строка)
Отображение версии этого инструмента.
--color (строка)
Включение/выключение цветного вывода.
- on
- off
- auto
--no-sign-request (булево)
Отключение подписи запросов. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл с набором сертификатов CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться без блокировки и без таймаута. Значение по умолчанию – 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться без блокировки и без таймаута. Значение по умолчанию – 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого файла, сопоставленного с двоичным блоком, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключение кли-паджера для вывода.
--cli-auto-prompt (булево)
Автоматическое запрошение входных параметров CLI.
--no-cli-auto-prompt (булево)
Отключение автоматического запроса входных параметров CLI.
Вывод
DocumentMetadata -> (структура)
Информация об входном документе.
Pages -> (целое число)
JobStatus -> (строка)
NextToken -> (строка)
Results -> (список)
Содержит информацию, возвращенную одной из операций анализа документов Amazon Textract для pinstripe.
(структура)
Содержит обнаружения для каждой проанализированной страницы через API Analyze Lending.
Page -> (целое число)
PageClassification -> (структура)
Результат классификации для данной страницы.
PageType -> (список)
Класс или тип документа, назначенный обнаруженному объекту Page. Класс или тип документа, назначенный обнаруженному объекту Page.
(структура)
Содержит информацию о предсказанных значениях, возвращенных операциями Amazon Textract, включая предсказанное значение и уверенность в предсказанном значении.
Value -> (строка)
Confidence -> (вещественное число)
PageNumber -> (список)
Номер страницы, на которой было обнаружено значение, относительно начальной позиции Amazon Textract.
(структура)
Содержит информацию о предсказанных значениях, возвращенных операциями Amazon Textract, включая предсказанное значение и уверенность в предсказанном значении.
Value -> (строка)
Confidence -> (вещественное число)
Extractions -> (список)
Массив Extraction для хранения структурированных данных. Например, нормализованные пары ключ-значение вместо исходных распознанных символов.
(структура)
Содержит информацию, извлеченную операцией анализа после использования StartLendingAnalysis.
LendingDocument -> (структура)
Содержит структурированные данные, возвращенные AnalyzeDocument для документов по кредитованию.
LendingFields -> (список)
Массив объектов LendingField.
(структура)
Содержит нормализованные пары ключ-значение, возвращенные AnalyzeDocument, включая тип документа, обнаруженный текст и геометрию.
Type -> (строка)
KeyDetection -> (структура)
Результаты, извлеченные для документа по кредитованию.
Text -> (строка)
SelectionStatus -> (строка)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Осевыровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри области обводки тонкая полигональная фигура вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются отношениями к общему размеру страницы. Например, если входной документ имеет размер 700x200, и операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полигональную фигуру вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
ValueDetections -> (список)
Массив объектов LendingDetection.
(структура)
Результаты, извлеченные для документа по кредитованию.
Text -> (строка)
SelectionStatus -> (строка)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Осевыровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри области обводки тонкая полигональная фигура вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются отношениями к общему размеру страницы. Например, если входной документ имеет размер 700x200, и операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полигональную фигуру вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
SignatureDetections -> (список)
Список подписей, обнаруженных в документе по кредитованию.
(структура)
Информация об обнаруженной подписи на странице.
Confidence -> (вещественное число)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Осевыровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри области обводки тонкая полигональная фигура вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются отношениями к общему размеру страницы. Например, если входной документ имеет размер 700x200, и операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полигональную фигуру вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.ExpenseDocument -> (структура)
Структура, содержащая всю информацию, возвращаемую AnalyzeExpense
ExpenseIndex -> (целое число)
SummaryFields -> (список)
Любая информация, найденная за пределами таблицы Amazon Textract.
(структура)
Детализация обнаруженной информации, разделенная на категории Type, LabelDetection и ValueDetection
Type -> (структура)
Подразумеваемая метка обнаруженного элемента. Присутствует вместе с LabelDetection для явных элементов.
Text -> (строка)
Confidence -> (вещественное число)
LabelDetection -> (структура)
Явно указанная метка обнаруженного элемента.
Text -> (строка)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблицы и элементы выбора.
BoundingBox -> (структура)
Осевое выравнивание грубого представления местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри ограничивающей рамки точная полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в координатах (350,50) пикселей на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой точную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в разделе Geometry в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
ValueDetection -> (структура)
Значение обнаруженного элемента. Присутствует в явных и неявных элементах.
Text -> (строка)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблицы и элементы выбора.
BoundingBox -> (структура)
Осевое выравнивание грубого представления местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри ограничивающей рамки точная полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в координатах (350,50) пикселей на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой точную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в разделе Geometry в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
PageNumber -> (целое число)
Currency -> (структура)
Показывает тип валюты, как код, так и уверенность, связанную с любой обнаруженной денежной суммой.
Code -> (строка)
Код валюты для обнаруженной валюты. Поддерживаемые коды:
- USD
- EUR
- GBP
- CAD
- INR
- JPY
- CHF
- AUD
- CNY
- BZR
- SEK
- HKD
Confidence -> (вещественное число)
GroupProperties -> (список)
Показывает, к какой группе принадлежит объект ответа, например, относится ли строка адреса к адресу поставщика или получателя.
(структура)
Показывает группу, к которой принадлежит определённый ключ. Это помогает отличить имена и адреса разных организаций, что может быть сложно определить по ответу JSON.
Types -> (список)
Указывает, является ли группа расходов именем или адресом.
(строка)
Id -> (строка)
LineItemGroups -> (список)
Информация, обнаруженная в каждой таблице документа, разделена на LineItems .
(структура)
Группа таблиц, содержащих элементы строк (LineItems), каждая таблица идентифицируется по её LineItemGroupIndex .
LineItemGroupIndex -> (целое число)
LineItems -> (список)
Разбивка информации по конкретной строке таблицы.
(структура)
Структура, содержащая информацию о различных строках, найденных в таблицах документа.
LineItemExpenseFields -> (список)
ExpenseFields, используемые для отображения информации из обнаруженных строк таблицы.
(структура)
Разбивка обнаруженной информации, разделенная на категории Тип, Обнаружение метки и Обнаружение значения
Тип -> (структура)
Подразумеваемая метка обнаруженного элемента. Присутствует наряду с LabelDetection для явных элементов.
Текст -> (строка)
Доверие -> (вещественное число)
Обнаружение метки -> (структура)
Явно указанная метка обнаруженного элемента.
Текст -> (строка)
Геометрия -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
Прямоугольник -> (структура)
Выровненное по осям грубое представление местоположения распознанного элемента на странице документа.
Ширина -> (вещественное число)
Высота -> (вещественное число)
Левый край -> (вещественное число)
Верхний край -> (вещественное число)
Многоугольник -> (список)
Внутри прямоугольника, тонко настроенный многоугольник вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются соотношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонко настроенный многоугольник вокруг обнаруженного текста. Более подробную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Доверие -> (вещественное число)
Обнаружение значения -> (структура)
Значение обнаруженного элемента. Присутствует в явных и неявных элементах.
Текст -> (строка)
Геометрия -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
Прямоугольник -> (структура)
Выровненное по осям грубое представление местоположения распознанного элемента на странице документа.
Ширина -> (вещественное число)
Высота -> (вещественное число)
Левый край -> (вещественное число)
Верхний край -> (вещественное число)
Многоугольник -> (список)
Внутри прямоугольника, тонко настроенный многоугольник вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются соотношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонко настроенный многоугольник вокруг обнаруженного текста. Более подробную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Номер страницы -> (целое число)
Валюта -> (структура)
Показ вида валюты, как код, так и доверие, связанные с любой обнаруженной денежной суммой.
Код -> (строка)
Код валюты для обнаруженной валюты. Поддерживаемые коды:
- USD
- EUR
- GBP
- CAD
- INR
- JPY
- CHF
- AUD
- CNY
- BZR
- SEK
- HKD
Доверие -> (вещественное число)
Свойства группы -> (список)
Показывает, к какой группе относится объект ответа, например, относится ли адресная строка к адресу поставщика или получателя.
(структура)
Показывает группу, к которой принадлежит определенный ключ. Это помогает различать имена и адреса разных организаций, что может быть сложно определить по ответу JSON.
Типы -> (список)
Указывает, является ли группа расходов именем или адресом.
(строка)
Идентификатор -> (строка)
Блоки -> (список)
Это объект блока, такой же, как и при выполнении DetectDocumentText на документе. Он обеспечивает распознавание текста на уровне слов.
(структура)
Block представляет элементы, распознанные в документе в группе пикселей, расположенных близко друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При распознавании текста в документах (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о распознанных полях, таблицах и элементах выбора в документе.
Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block представляет собой весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.
Дополнительную информацию см. в разделе Как работает Amazon Textract.
BlockType -> (строка)
Тип распознанного элемента текста. В операциях по распознаванию текста возвращаются следующие типы:
-
PAGE - Содержит список объектов LINE
Block, распознанных на странице документа. - WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв латинского алфавита, не разделенных пробелами.
- LINE - Строка табулированных, смежных слов, распознанных на странице документа.
В операциях анализа текста возвращаются следующие типы:
-
PAGE - Содержит список дочерних объектов
Block, распознанных на странице документа. -
KEY_VALUE_SET - Хранит объекты KEY и VALUE
Blockдля связанного текста, распознанного на странице документа. Используйте полеEntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEYBlockили объектом VALUEBlock. - WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв латинского алфавита, не разделенных пробелами.
- LINE - Строка табулированных, смежных слов, распознанных на странице документа.
- TABLE - Таблица, распознанная на странице документа. Таблица — это информация, основанная на сетке, с двумя или более строками или столбцами, со значением span ячейки по одной строке и одному столбцу.
- TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей или вставлен в первую строку таблицы.
- TABLE_FOOTER - Подвал, связанный с таблицей. Подвал обычно представляет собой строку или строки текста под таблицей или вставлен в последнюю строку таблицы.
- CELL - Ячейка в распознанной таблице. Ячейка является родителем блока, содержащего текст в ячейке.
-
MERGED_CELL - Ячейка в таблице, содержимое которой занимает более одной строки или столбца. Массив
Relationshipsдля этой ячейки содержит данные из отдельных ячеек. -
SELECTION_ELEMENT - Элемент выбора, такой как кнопка выбора (кнопка радио) или флажок, распознанный на странице документа. Используйте значение
SelectionStatus, чтобы определить состояние элемента выбора. - SIGNATURE - Местоположение и оценка уверенности подписи, распознанной на странице документа. Может возвращаться в рамках пары ключ-значение или распознанной ячейки.
- QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, привязывающий его к ответу.
- QUERY_RESULT - Ответ на вопрос, заданный во время вызова AnalyzeDocument. Имеет псевдоним и ID для удобства поиска в ответе. Также содержит местоположение и оценку уверенности.
Следующие типы BlockTypes возвращаются только для Amazon Textract Layout.
-
LAYOUT_TITLE- Основной заголовок документа. -
LAYOUT_HEADER- Текст, расположенный в верхнем поле документа. -
LAYOUT_FOOTER- Текст, расположенный в нижнем поле документа. -
LAYOUT_SECTION_HEADER- Заголовки разделов внутри документа. -
LAYOUT_PAGE_NUMBER- Номер страницы документов. -
LAYOUT_LIST- Любая информация, сгруппированная в виде списка. -
LAYOUT_FIGURE- Указывает местоположение изображения в документе. -
LAYOUT_TABLE- Указывает местоположение таблицы в документе. -
LAYOUT_KEY_VALUE- Указывает местоположение полей форм в документе. -
LAYOUT_TEXT- Текст, обычно присутствующий как часть абзацев в документах.
Confidence -> (число с плавающей точкой)
Text -> (строка)
TextType -> (строка)
RowIndex -> (целое число)
RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.ColumnIndex -> (целое число)
ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.RowSpan -> (целое число)
RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.ColumnSpan -> (целое число)
ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.Geometry -> (структура)
Местоположение распознанного текста на изображении. Включает ориентированную по осям грубую рамку, окружающую текст, и более тонкую полилинию для более точной пространственной информации.
BoundingBox -> (структура)
Ориентированная по осям грубая информация о местоположении распознанного элемента на странице документа.
Width -> (число с плавающей точкой)
Height -> (число с плавающей точкой)
Left -> (число с плавающей точкой)
Top -> (число с плавающей точкой)
Polygon -> (список)
В пределах рамки — более подробная полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Возвращаемые значения X и Y — это отношения к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой подробную полилинию вокруг распознанного текста. Дополнительную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Textract.
X -> (число с плавающей точкой)
Polygon.Y -> (число с плавающей точкой)
Polygon.Id -> (строка)
Relationships -> (список)
Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, объект блока LINE содержит тип отношения CHILD с блоками WORD, составляющими строку текста. В списке нет объектов Relationships для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.
(структура)
Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке, Relationships. Дополнительную информацию см. в разделе Блок.
Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.
Type -> (строка)
Тип отношения между блоками в массиве IDs и текущим блоком. В следующем списке описаны типы отношений, которые могут быть возвращены.
- VALUE - Список, содержащий ID блока VALUE, связанного с ключом пары ключ-значение.
- CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего объекта блока. Например, блоки WORD имеют отношение CHILD к блоку типа LINE.
- MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
- ANSWER - Список, содержащий ID блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
- TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
- TABLE_TITLE - Список, содержащий ID блока типа TABLE_TITLE в таблице.
- TABLE_FOOTER - Список идентификаторов, определяющих блоки типа TABLE_FOOTER в таблице.
Ids -> (список)
Массив идентификаторов связанных блоков. Тип отношения можно получить из элемента Type.
(строка)
EntityTypes -> (список)
Тип сущности.
Формы анализа могут вернуть следующие типы сущностей:
- KEY - Идентификатор поля в документе.
- VALUE - Текст поля.
Анализ таблиц может вернуть следующие типы сущностей:
- COLUMN_HEADER - Идентифицирует ячейку, являющуюся заголовком столбца.
- TABLE_TITLE - Идентифицирует ячейку, являющуюся заголовком таблицы.
- TABLE_SECTION_TITLE - Идентифицирует ячейку, являющуюся заголовком раздела в таблице. Заголовок раздела — это ячейка, обычно занимающая всю строку над разделом.
- TABLE_FOOTER - Идентифицирует ячейку, являющуюся подвалом таблицы.
- TABLE_SUMMARY - Идентифицирует ячейку резюме таблицы. Ячейка резюме может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
- STRUCTURED_TABLE - Идентифицирует таблицу со столбцами, где содержимое каждой строки соответствует заголовкам.
- SEMI_STRUCTURED_TABLE - Идентифицирует неструктурированную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.(строка)
SelectionStatus -> (строка)
Page -> (целое число)
Page возвращается синхронными и асинхронными операциями. Значения страниц, большие 1, возвращаются только для многостраничных документов в формате PDF или TIFF. Сканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для сканированных изображений значение Page всегда равно 1.Запрос -> (структура)
Текст -> (строка)
Псевдоним -> (строка)
Страницы -> (список)
Параметр Страницы, который пользователь вводит, чтобы указать, к каким страницам применить запрос. Ниже приведен список правил использования этого параметра.
- Если страница не указана, она устанавливается по умолчанию в значение
["1"]. - В строке параметра разрешены следующие символы:
0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются. - При использовании * для обозначения всех страниц, это должен быть единственный элемент в списке.
- Можно использовать интервалы страниц, такие как
[“1-3”, “1-1”, “4-*”]. Где*обозначает последнюю страницу документа. - Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.
(строка)
IdentityDocument -> (структура)
Структура, перечисляющая каждый обработанный документ в операции AnalyzeID.
DocumentIndex -> (целое число)
IdentityDocumentFields -> (список)
Структура, используемая для записи информации, извлеченной из документов личности. Содержит как нормализованное поле, так и значение извлеченного текста.
(структура)
Структура, содержащая как нормализованный тип извлеченной информации, так и связанный с ней текст. Они извлекаются как Type и Value соответственно.
Type -> (структура)
Используется для хранения информации, обнаруженной операцией AnalyzeID.
Text -> (строка)
NormalizedValue -> (структура)
Возвращается только для дат, возвращает тип обнаруженного значения и дату, записанную более читаемым для машины способом.
Value -> (строка)
ValueType -> (строка)
Confidence -> (вещественное число)
ValueDetection -> (структура)
Используется для хранения информации, обнаруженной операцией AnalyzeID.
Text -> (строка)
NormalizedValue -> (структура)
Возвращается только для дат, возвращает тип обнаруженного значения и дату, записанную более читаемым для машины способом.
Value -> (строка)
ValueType -> (строка)
Confidence -> (вещественное число)
Blocks -> (список)
Распознавание отдельных слов, возвращаемое распознаванием документа.
(структура)
Block представляет элементы, распознанные в документе в группе пикселей, близких друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При распознавании текста в документах (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о распознанных полях, таблицах и элементах выбора в документе.
Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block представляет собой весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.
Дополнительную информацию см. в разделе Как работает Amazon Textract.
BlockType -> (строка)
Тип распознанного элемента текста. В операциях распознавания текста возвращаются следующие типы:
-
PAGE - Содержит список объектов LINE
Block, распознанных на странице документа. - WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, которые не разделены пробелами.
- LINE - Строка табулированных, смежных слов, распознанных на странице документа.
В операциях анализа текста возвращаются следующие типы:
-
PAGE - Содержит список дочерних объектов
Block, распознанных на странице документа. -
KEY_VALUE_SET - Хранит объекты KEY и VALUE
Blockдля связанного текста, распознанного на странице документа. Используйте полеEntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEYBlockили объектом VALUEBlock. - WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, которые не разделены пробелами.
- LINE - Строка табулированных, смежных слов, распознанных на странице документа.
- TABLE - Таблица, распознанная на странице документа. Таблица — это информация на основе сетки с двумя или более строками или столбцами, с размахом ячейки по одной строке и одному столбцу.
- TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей, или встроен в первую строку таблицы.
- TABLE_FOOTER - Подвал, связанный с таблицей. Подвал обычно представляет собой строку или строки текста под таблицей или встроен в последнюю строку таблицы.
- CELL - Ячейка в распознанной таблице. Ячейка является родителем блока, содержащего текст в ячейке.
-
MERGED_CELL - Ячейка в таблице, содержимое которой охватывает более одной строки или столбца. Массив
Relationshipsдля этой ячейки содержит данные из отдельных ячеек. -
SELECTION_ELEMENT - Элемент выбора, такой как кнопка выбора (кнопка радио) или флажок, распознанный на странице документа. Используйте значение
SelectionStatus, чтобы определить состояние элемента выбора. - SIGNATURE - Позиция и оценка уверенности подписи, распознанной на странице документа. Может возвращаться как часть пары ключ-значение или распознанной ячейки.
- QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, которые привязывают его к ответу.
- QUERY_RESULT - Ответ на вопрос, заданный во время вызова analyze document. Поставляется с псевдонимом и идентификатором для удобства поиска в ответе. Также содержит положение и оценку уверенности.
Следующие BlockTypes возвращаются только для Amazon Textract Layout.
-
LAYOUT_TITLE- Основной заголовок документа. -
LAYOUT_HEADER- Текст, расположенный в верхнем отступе документа. -
LAYOUT_FOOTER- Текст, расположенный в нижнем отступе документа. -
LAYOUT_SECTION_HEADER- Заголовки разделов внутри документа. -
LAYOUT_PAGE_NUMBER- Номер страницы документов. -
LAYOUT_LIST- Любая информация, сгруппированная в виде списка. -
LAYOUT_FIGURE- Указывает расположение изображения в документе. -
LAYOUT_TABLE- Указывает расположение таблицы в документе. -
LAYOUT_KEY_VALUE- Указывает расположение значений ключей формы в документе. -
LAYOUT_TEXT- Текст, обычно присутствующий как часть абзацев в документах.
Confidence -> (число с плавающей точкой)
Text -> (строка)
TextType -> (строка)
RowIndex -> (целое число)
RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.ColumnIndex -> (целое число)
ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.RowSpan -> (целое число)
RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.ColumnSpan -> (целое число)
ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.Geometry -> (структура)
Расположение распознанного текста на изображении. В него входит выровненная по осям грубая рамка, окружающая текст, и более точная полилиния для более точной пространственной информации.
BoundingBox -> (структура)
Выровненное по осям грубое представление расположения распознанного элемента на странице документа.
Width -> (число с плавающей точкой)
Height -> (число с плавающей точкой)
Left -> (число с плавающей точкой)
Top -> (число с плавающей точкой)
Polygon -> (список)
В пределах рамки, точная полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается DetectDocumentText. Polygon представляет точную полилинию вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.
X -> (число с плавающей точкой)
Polygon.Y -> (число с плавающей точкой)
Polygon.Id -> (строка)
Relationships -> (список)
Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, объект блока LINE содержит тип отношения CHILD с блоками WORD, которые составляют строку текста. Нет объектов Relationships в списке для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.
(структура)
Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке, Relationships. Дополнительную информацию см. в разделе Блок.
Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.
Type -> (строка)
Тип отношения между блоками в массиве IDs и текущим блоком. Следующий список описывает типы отношений, которые могут быть возвращены.
- VALUE - Список, содержащий идентификатор блока VALUE, связанного с KEY пары ключ-значение.
- CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего блока. Например, блоки WORD имеют отношение CHILD к блоку LINE.
- MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
- ANSWER - Список, содержащий идентификатор блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
- TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
- TABLE_TITLE - Список, содержащий идентификатор блока типа TABLE_TITLE в таблице.
- TABLE_FOOTER - Список идентификаторов, определяющих блоки типа TABLE_FOOTER в таблице.
Ids -> (список)
Массив идентификаторов связанных блоков. Вы можете получить тип отношения из элемента Type.
(строка)
EntityTypes -> (список)
Тип сущности.
Следующие типы сущностей могут быть возвращены анализом форм:
- KEY - Идентификатор поля в документе.
- VALUE - Текст поля.
Следующие типы сущностей могут быть возвращены анализом таблиц:
- COLUMN_HEADER - Идентифицирует ячейку, которая является заголовком столбца.
- TABLE_TITLE - Идентифицирует ячейку, которая является заголовком в таблице.
- TABLE_SECTION_TITLE - Идентифицирует ячейку, которая является заголовком раздела в таблице. Заголовок раздела — это ячейка, которая обычно охватывает всю строку над разделом.
- TABLE_FOOTER - Идентифицирует ячейку, которая является подвалом таблицы.
- TABLE_SUMMARY - Идентифицирует ячейку сводки таблицы. Ячейка сводки может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
- STRUCTURED_TABLE - Идентифицирует таблицу со столбцами, где содержимое каждой строки соответствует заголовкам.
- SEMI_STRUCTURED_TABLE - Идентифицирует неструктурированную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.(строка)
SelectionStatus -> (строка)
Page -> (целое число)
Page возвращается синхронными и асинхронными операциями. Значения страниц, превышающие 1, возвращаются только для многостраничных документов в формате PDF или TIFF. Отсканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для отсканированных изображений значение Page всегда равно 1.Запрос -> (структура)
Текст -> (строка)
Псевдоним -> (строка)
Страницы -> (список)
Параметр Страницы позволяет пользователю указать, к каким страницам применить запрос. Ниже приведен список правил для использования этого параметра.
- Если страница не указана, она устанавливается по умолчанию в
["1"]. - В строке параметра разрешены следующие символы:
0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются. - При использовании * для указания всех страниц, оно должно быть единственным элементом в списке.
- Можно использовать интервалы страниц, такие как
[“1-3”, “1-1”, “4-*”]. Где*обозначает последнюю страницу документа. - Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.
(строка)
Предупреждения -> (список)
Список предупреждений, возникших во время операции анализа кредитования.
(структура)
Предупреждение об ошибке, возникшей во время асинхронного анализа текста ( StartDocumentAnalysis ) или асинхронного обнаружения текста документа ( StartDocumentTextDetection ).
Код ошибки -> (строка)
Страницы -> (список)
Список страниц, к которым относится предупреждение.
(целое число)
Сообщение о статусе -> (строка)
Версия модели AnalyzeLending -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.