Spec-Zone.ru › AWS CLI v2

[ aws . textract ]

get-lending-analysis

Описание

Получает результаты асинхронной операции Amazon Textract, анализирующей текст в документе о кредитовании.

Вы запускаете асинхронный анализ текста, вызвав StartLendingAnalysis, что возвращает идентификатор задачи (JobId). По завершении операции анализа текста Amazon Textract публикует состояние завершения в тему Amazon Simple Notification Service (Amazon SNS), зарегистрированную в начальном вызове StartLendingAnalysis.

Чтобы получить результаты операции анализа текста, сначала убедитесь, что значение статуса, опубликованное в тему Amazon SNS, равно SUCCEEDED. В этом случае вызовите GetLendingAnalysis и передайте идентификатор задачи (JobId) из начального вызова StartLendingAnalysis.

См. также: Документация API AWS

Синтаксис

  get-lending-analysis
--job-id <value>
[--max-results <value>]
[--next-token <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--job-id (строка)

Уникальный идентификатор задачи анализа кредитов или выявления текста. JobId возвращается из StartLendingAnalysis. Значение JobId валидно в течение 7 дней.

--max-results (целое число)

Максимальное количество результатов, возвращаемых за раз при постраничном запросе. Максимальное значение, которое можно указать, равно 30. Если указано значение больше 30, возвращается максимальное количество результатов – 30. Значение по умолчанию равно 30.

--next-token (строка)

Если предыдущий ответ был неполным, Amazon Textract возвращает маркер постраничной навигации в ответе. Вы можете использовать этот маркер для получения следующего набора результатов анализа кредитов.

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения перепишут значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью предоставленного JSON-значения, поскольку строка будет интерпретироваться буквально. Этот параметр не может быть указан вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или при значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при значении yaml-input выводит пример входного YAML, который можно использовать с --cli-input-yaml. При значении output проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (булево)

Включает отладку логов.

--endpoint-url (строка)

Переопределяет URL по умолчанию команды на указанный URL.

--no-verify-ssl (булево)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого соединения SSL AWS CLI проверяет сертификаты SSL. Этот параметр переопределяет поведение по умолчанию проверки сертификатов SSL.

--no-paginate (булево)

Отключает автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования выходных данных команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использование определенного профиля из файла учетных данных.

--region (строка)

Используемый регион. Переопределяет настройки конфигурации/среды.

--version (строка)

Отображение версии этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • on
  • off
  • auto

--no-sign-request (булево)

Отключение подписи запросов. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл с набором сертификатов CA для проверки сертификатов SSL. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться без блокировки и без таймаута. Значение по умолчанию – 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться без блокировки и без таймаута. Значение по умолчанию – 60 секунд.

--cli-binary-format (строка)

Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого файла, сопоставленного с двоичным блоком, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (булево)

Отключение кли-паджера для вывода.

--cli-auto-prompt (булево)

Автоматическое запрошение входных параметров CLI.

--no-cli-auto-prompt (булево)

Отключение автоматического запроса входных параметров CLI.

Вывод

DocumentMetadata -> (структура)

Информация об входном документе.

Pages -> (целое число)

Количество страниц, обнаруженных в документе.

JobStatus -> (строка)

Текущий статус задания анализа кредитования.

NextToken -> (строка)

Если ответ усечен, Amazon Textract возвращает этот маркер. Вы можете использовать этот маркер в последующем запросе для получения следующего набора результатов по кредитованию.

Results -> (список)

Содержит информацию, возвращенную одной из операций анализа документов Amazon Textract для pinstripe.

(структура)

Содержит обнаружения для каждой проанализированной страницы через API Analyze Lending.

Page -> (целое число)

Номер страницы в рамках всего отправленного набора.

PageClassification -> (структура)

Результат классификации для данной страницы.

PageType -> (список)

Класс или тип документа, назначенный обнаруженному объекту Page. Класс или тип документа, назначенный обнаруженному объекту Page.

(структура)

Содержит информацию о предсказанных значениях, возвращенных операциями Amazon Textract, включая предсказанное значение и уверенность в предсказанном значении.

Value -> (строка)

Предсказанное значение обнаруженного объекта.

Confidence -> (вещественное число)

Уверенность Amazon Textract в предсказанном значении.

PageNumber -> (список)

Номер страницы, на которой было обнаружено значение, относительно начальной позиции Amazon Textract.

(структура)

Содержит информацию о предсказанных значениях, возвращенных операциями Amazon Textract, включая предсказанное значение и уверенность в предсказанном значении.

Value -> (строка)

Предсказанное значение обнаруженного объекта.

Confidence -> (вещественное число)

Уверенность Amazon Textract в предсказанном значении.

Extractions -> (список)

Массив Extraction для хранения структурированных данных. Например, нормализованные пары ключ-значение вместо исходных распознанных символов.

(структура)

Содержит информацию, извлеченную операцией анализа после использования StartLendingAnalysis.

LendingDocument -> (структура)

Содержит структурированные данные, возвращенные AnalyzeDocument для документов по кредитованию.

LendingFields -> (список)

Массив объектов LendingField.

(структура)

Содержит нормализованные пары ключ-значение, возвращенные AnalyzeDocument, включая тип документа, обнаруженный текст и геометрию.

Type -> (строка)

Тип документа по кредитованию.

KeyDetection -> (структура)

Результаты, извлеченные для документа по кредитованию.

Text -> (строка)

Текст, извлеченный для обнаруженного значения в документе по кредитованию.

SelectionStatus -> (строка)

Статус выбора элемента выбора, такого как кнопка выбора или флажок.

Geometry -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.

BoundingBox -> (структура)

Осевыровненное грубое представление местоположения распознанного элемента на странице документа.

Width -> (вещественное число)

Ширина области обводки как отношение к общей ширине страницы документа.

Height -> (вещественное число)

Высота области обводки как отношение к общей высоте страницы документа.

Left -> (вещественное число)

Левая координата области обводки как отношение к общей ширине страницы документа.

Top -> (вещественное число)

Верхняя координата области обводки как отношение к общей высоте страницы документа.

Polygon -> (список)

Внутри области обводки тонкая полигональная фигура вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются отношениями к общему размеру страницы. Например, если входной документ имеет размер 700x200, и операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полигональную фигуру вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Confidence -> (вещественное число)

Уровень уверенности в тексте обнаруженного значения в документе по кредитованию.

ValueDetections -> (список)

Массив объектов LendingDetection.

(структура)

Результаты, извлеченные для документа по кредитованию.

Text -> (строка)

Текст, извлеченный для обнаруженного значения в документе по кредитованию.

SelectionStatus -> (строка)

Статус выбора элемента выбора, такого как кнопка выбора или флажок.

Geometry -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.

BoundingBox -> (структура)

Осевыровненное грубое представление местоположения распознанного элемента на странице документа.

Width -> (вещественное число)

Ширина области обводки как отношение к общей ширине страницы документа.

Height -> (вещественное число)

Высота области обводки как отношение к общей высоте страницы документа.

Left -> (вещественное число)

Левая координата области обводки как отношение к общей ширине страницы документа.

Top -> (вещественное число)

Верхняя координата области обводки как отношение к общей высоте страницы документа.

Polygon -> (список)

Внутри области обводки тонкая полигональная фигура вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются отношениями к общему размеру страницы. Например, если входной документ имеет размер 700x200, и операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полигональную фигуру вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Confidence -> (вещественное число)

Уровень уверенности в тексте обнаруженного значения в документе по кредитованию.

SignatureDetections -> (список)

Список подписей, обнаруженных в документе по кредитованию.

(структура)

Информация об обнаруженной подписи на странице.

Confidence -> (вещественное число)

Уверенность (от 0 до 100) в предсказанных значениях для обнаруженной подписи.

Geometry -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.

BoundingBox -> (структура)

Осевыровненное грубое представление местоположения распознанного элемента на странице документа.

Width -> (вещественное число)

Ширина области обводки как отношение к общей ширине страницы документа.

Height -> (вещественное число)

Высота области обводки как отношение к общей высоте страницы документа.

Left -> (вещественное число)

Левая координата области обводки как отношение к общей ширине страницы документа.

Top -> (вещественное число)

Верхняя координата области обводки как отношение к общей высоте страницы документа.

Polygon -> (список)

Внутри области обводки тонкая полигональная фигура вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются отношениями к общему размеру страницы. Например, если входной документ имеет размер 700x200, и операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полигональную фигуру вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

ExpenseDocument -> (структура)

Структура, содержащая всю информацию, возвращаемую AnalyzeExpense

ExpenseIndex -> (целое число)

Указывает, какой счёт или квитанцию в документе представляет информация. Первый документ будет 1, второй 2 и так далее.

SummaryFields -> (список)

Любая информация, найденная за пределами таблицы Amazon Textract.

(структура)

Детализация обнаруженной информации, разделенная на категории Type, LabelDetection и ValueDetection

Type -> (структура)

Подразумеваемая метка обнаруженного элемента. Присутствует вместе с LabelDetection для явных элементов.

Text -> (строка)

Слово или строка текста, обнаруженная Amazon Textract.

Confidence -> (вещественное число)

Уверенность в точности, в процентах.

LabelDetection -> (структура)

Явно указанная метка обнаруженного элемента.

Text -> (строка)

Слово или строка текста, распознанная Amazon Textract

Geometry -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблицы и элементы выбора.

BoundingBox -> (структура)

Осевое выравнивание грубого представления местоположения распознанного элемента на странице документа.

Width -> (вещественное число)

Ширина ограничивающей рамки как отношение к общей ширине страницы документа.

Height -> (вещественное число)

Высота ограничивающей рамки как отношение к общей высоте страницы документа.

Left -> (вещественное число)

Левая координата ограничивающей рамки как отношение к общей ширине страницы документа.

Top -> (вещественное число)

Верхняя координата ограничивающей рамки как отношение к общей высоте страницы документа.

Polygon -> (список)

Внутри ограничивающей рамки точная полилиния вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в координатах (350,50) пикселей на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой точную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в разделе Geometry в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Confidence -> (вещественное число)

Уверенность в обнаружении, в процентах

ValueDetection -> (структура)

Значение обнаруженного элемента. Присутствует в явных и неявных элементах.

Text -> (строка)

Слово или строка текста, распознанная Amazon Textract

Geometry -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблицы и элементы выбора.

BoundingBox -> (структура)

Осевое выравнивание грубого представления местоположения распознанного элемента на странице документа.

Width -> (вещественное число)

Ширина ограничивающей рамки как отношение к общей ширине страницы документа.

Height -> (вещественное число)

Высота ограничивающей рамки как отношение к общей высоте страницы документа.

Left -> (вещественное число)

Левая координата ограничивающей рамки как отношение к общей ширине страницы документа.

Top -> (вещественное число)

Верхняя координата ограничивающей рамки как отношение к общей высоте страницы документа.

Polygon -> (список)

Внутри ограничивающей рамки точная полилиния вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в координатах (350,50) пикселей на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой точную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в разделе Geometry в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Confidence -> (вещественное число)

Уверенность в обнаружении, в процентах

PageNumber -> (целое число)

Номер страницы, на которой было обнаружено значение.

Currency -> (структура)

Показывает тип валюты, как код, так и уверенность, связанную с любой обнаруженной денежной суммой.

Code -> (строка)

Код валюты для обнаруженной валюты. Поддерживаемые коды:

  • USD
  • EUR
  • GBP
  • CAD
  • INR
  • JPY
  • CHF
  • AUD
  • CNY
  • BZR
  • SEK
  • HKD

Confidence -> (вещественное число)

Процентная уверенность в обнаруженной валюте.

GroupProperties -> (список)

Показывает, к какой группе принадлежит объект ответа, например, относится ли строка адреса к адресу поставщика или получателя.

(структура)

Показывает группу, к которой принадлежит определённый ключ. Это помогает отличить имена и адреса разных организаций, что может быть сложно определить по ответу JSON.

Types -> (список)

Указывает, является ли группа расходов именем или адресом.

(строка)

Id -> (строка)

Предоставляет идентификатор группы, который будет одинаковым для каждого элемента в группе.

LineItemGroups -> (список)

Информация, обнаруженная в каждой таблице документа, разделена на LineItems .

(структура)

Группа таблиц, содержащих элементы строк (LineItems), каждая таблица идентифицируется по её LineItemGroupIndex .

LineItemGroupIndex -> (целое число)

Число, используемое для идентификации конкретной таблицы в документе. Первая встреченная таблица будет иметь LineItemGroupIndex 1, вторая 2 и т.д.

LineItems -> (список)

Разбивка информации по конкретной строке таблицы.

(структура)

Структура, содержащая информацию о различных строках, найденных в таблицах документа.

LineItemExpenseFields -> (список)

ExpenseFields, используемые для отображения информации из обнаруженных строк таблицы.

(структура)

Разбивка обнаруженной информации, разделенная на категории Тип, Обнаружение метки и Обнаружение значения

Тип -> (структура)

Подразумеваемая метка обнаруженного элемента. Присутствует наряду с LabelDetection для явных элементов.

Текст -> (строка)

Слово или строка текста, обнаруженные Amazon Textract.

Доверие -> (вещественное число)

Доверие к точности, в процентах.

Обнаружение метки -> (структура)

Явно указанная метка обнаруженного элемента.

Текст -> (строка)

Слово или строка текста, распознанные Amazon Textract

Геометрия -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.

Прямоугольник -> (структура)

Выровненное по осям грубое представление местоположения распознанного элемента на странице документа.

Ширина -> (вещественное число)

Ширина прямоугольника в соотношении с общей шириной страницы документа.

Высота -> (вещественное число)

Высота прямоугольника в соотношении с общей высотой страницы документа.

Левый край -> (вещественное число)

Координата левого края прямоугольника в соотношении с общей шириной страницы документа.

Верхний край -> (вещественное число)

Координата верхнего края прямоугольника в соотношении с общей высотой страницы документа.

Многоугольник -> (список)

Внутри прямоугольника, тонко настроенный многоугольник вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются соотношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонко настроенный многоугольник вокруг обнаруженного текста. Более подробную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Доверие -> (вещественное число)

Доверие к обнаружению, в процентах

Обнаружение значения -> (структура)

Значение обнаруженного элемента. Присутствует в явных и неявных элементах.

Текст -> (строка)

Слово или строка текста, распознанные Amazon Textract

Геометрия -> (структура)

Информация о расположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.

Прямоугольник -> (структура)

Выровненное по осям грубое представление местоположения распознанного элемента на странице документа.

Ширина -> (вещественное число)

Ширина прямоугольника в соотношении с общей шириной страницы документа.

Высота -> (вещественное число)

Высота прямоугольника в соотношении с общей высотой страницы документа.

Левый край -> (вещественное число)

Координата левого края прямоугольника в соотношении с общей шириной страницы документа.

Верхний край -> (вещественное число)

Координата верхнего края прямоугольника в соотношении с общей высотой страницы документа.

Многоугольник -> (список)

Внутри прямоугольника, тонко настроенный многоугольник вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, являются соотношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонко настроенный многоугольник вокруг обнаруженного текста. Более подробную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Номер страницы -> (целое число)

Номер страницы, на которой было обнаружено значение.

Валюта -> (структура)

Показ вида валюты, как код, так и доверие, связанные с любой обнаруженной денежной суммой.

Код -> (строка)

Код валюты для обнаруженной валюты. Поддерживаемые коды:

  • USD
  • EUR
  • GBP
  • CAD
  • INR
  • JPY
  • CHF
  • AUD
  • CNY
  • BZR
  • SEK
  • HKD

Доверие -> (вещественное число)

Процентное доверие к обнаруженной валюте.

Свойства группы -> (список)

Показывает, к какой группе относится объект ответа, например, относится ли адресная строка к адресу поставщика или получателя.

(структура)

Показывает группу, к которой принадлежит определенный ключ. Это помогает различать имена и адреса разных организаций, что может быть сложно определить по ответу JSON.

Типы -> (список)

Указывает, является ли группа расходов именем или адресом.

(строка)

Идентификатор -> (строка)

Предоставляет номер идентификатора группы, который будет одинаковым для каждого элемента в группе.

Блоки -> (список)

Это объект блока, такой же, как и при выполнении DetectDocumentText на документе. Он обеспечивает распознавание текста на уровне слов.

(структура)

Block представляет элементы, распознанные в документе в группе пикселей, расположенных близко друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При распознавании текста в документах (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о распознанных полях, таблицах и элементах выбора в документе.

Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block представляет собой весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.

Дополнительную информацию см. в разделе Как работает Amazon Textract.

BlockType -> (строка)

Тип распознанного элемента текста. В операциях по распознаванию текста возвращаются следующие типы:

  • PAGE - Содержит список объектов LINE Block, распознанных на странице документа.
  • WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв латинского алфавита, не разделенных пробелами.
  • LINE - Строка табулированных, смежных слов, распознанных на странице документа.

В операциях анализа текста возвращаются следующие типы:

  • PAGE - Содержит список дочерних объектов Block, распознанных на странице документа.
  • KEY_VALUE_SET - Хранит объекты KEY и VALUE Block для связанного текста, распознанного на странице документа. Используйте поле EntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEY Block или объектом VALUE Block.
  • WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв латинского алфавита, не разделенных пробелами.
  • LINE - Строка табулированных, смежных слов, распознанных на странице документа.
  • TABLE - Таблица, распознанная на странице документа. Таблица — это информация, основанная на сетке, с двумя или более строками или столбцами, со значением span ячейки по одной строке и одному столбцу.
  • TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей или вставлен в первую строку таблицы.
  • TABLE_FOOTER - Подвал, связанный с таблицей. Подвал обычно представляет собой строку или строки текста под таблицей или вставлен в последнюю строку таблицы.
  • CELL - Ячейка в распознанной таблице. Ячейка является родителем блока, содержащего текст в ячейке.
  • MERGED_CELL - Ячейка в таблице, содержимое которой занимает более одной строки или столбца. Массив Relationships для этой ячейки содержит данные из отдельных ячеек.
  • SELECTION_ELEMENT - Элемент выбора, такой как кнопка выбора (кнопка радио) или флажок, распознанный на странице документа. Используйте значение SelectionStatus, чтобы определить состояние элемента выбора.
  • SIGNATURE - Местоположение и оценка уверенности подписи, распознанной на странице документа. Может возвращаться в рамках пары ключ-значение или распознанной ячейки.
  • QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, привязывающий его к ответу.
  • QUERY_RESULT - Ответ на вопрос, заданный во время вызова AnalyzeDocument. Имеет псевдоним и ID для удобства поиска в ответе. Также содержит местоположение и оценку уверенности.

Следующие типы BlockTypes возвращаются только для Amazon Textract Layout.

  • LAYOUT_TITLE - Основной заголовок документа.
  • LAYOUT_HEADER - Текст, расположенный в верхнем поле документа.
  • LAYOUT_FOOTER - Текст, расположенный в нижнем поле документа.
  • LAYOUT_SECTION_HEADER - Заголовки разделов внутри документа.
  • LAYOUT_PAGE_NUMBER - Номер страницы документов.
  • LAYOUT_LIST - Любая информация, сгруппированная в виде списка.
  • LAYOUT_FIGURE - Указывает местоположение изображения в документе.
  • LAYOUT_TABLE - Указывает местоположение таблицы в документе.
  • LAYOUT_KEY_VALUE - Указывает местоположение полей форм в документе.
  • LAYOUT_TEXT - Текст, обычно присутствующий как часть абзацев в документах.

Confidence -> (число с плавающей точкой)

Оценка уверенности Amazon Textract в точности распознанного текста и точности геометрических точек вокруг распознанного текста.

Text -> (строка)

Слово или строка текста, распознанные Amazon Textract.

TextType -> (строка)

Тип текста, распознанный Amazon Textract. Можно проверить рукописный и печатный текст.

RowIndex -> (целое число)

Строка, в которой расположена ячейка таблицы. Первое положение строки — 1. RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnIndex -> (целое число)

Столбец, в котором расположена ячейка таблицы. Первое положение столбца — 1. ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

RowSpan -> (целое число)

Количество строк, занимаемых ячейкой таблицы. RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnSpan -> (целое число)

Количество столбцов, занимаемых ячейкой таблицы. ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

Geometry -> (структура)

Местоположение распознанного текста на изображении. Включает ориентированную по осям грубую рамку, окружающую текст, и более тонкую полилинию для более точной пространственной информации.

BoundingBox -> (структура)

Ориентированная по осям грубая информация о местоположении распознанного элемента на странице документа.

Width -> (число с плавающей точкой)

Ширина рамки как отношение к общей ширине страницы документа.

Height -> (число с плавающей точкой)

Высота рамки как отношение к общей высоте страницы документа.

Left -> (число с плавающей точкой)

Левая координата рамки как отношение к общей ширине страницы документа.

Top -> (число с плавающей точкой)

Верхняя координата рамки как отношение к общей высоте страницы документа.

Polygon -> (список)

В пределах рамки — более подробная полилиния вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Возвращаемые значения X и Y — это отношения к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой подробную полилинию вокруг распознанного текста. Дополнительную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Textract.

X -> (число с плавающей точкой)

Значение координаты X для точки на Polygon.

Y -> (число с плавающей точкой)

Значение координаты Y для точки на Polygon.

Id -> (строка)

Идентификатор распознанного текста. Идентификатор уникален только для одной операции.

Relationships -> (список)

Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, объект блока LINE содержит тип отношения CHILD с блоками WORD, составляющими строку текста. В списке нет объектов Relationships для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.

(структура)

Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке, Relationships. Дополнительную информацию см. в разделе Блок.

Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.

Type -> (строка)

Тип отношения между блоками в массиве IDs и текущим блоком. В следующем списке описаны типы отношений, которые могут быть возвращены.

  • VALUE - Список, содержащий ID блока VALUE, связанного с ключом пары ключ-значение.
  • CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего объекта блока. Например, блоки WORD имеют отношение CHILD к блоку типа LINE.
  • MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
  • ANSWER - Список, содержащий ID блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
  • TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
  • TABLE_TITLE - Список, содержащий ID блока типа TABLE_TITLE в таблице.
  • TABLE_FOOTER - Список идентификаторов, определяющих блоки типа TABLE_FOOTER в таблице.

Ids -> (список)

Массив идентификаторов связанных блоков. Тип отношения можно получить из элемента Type.

(строка)

EntityTypes -> (список)

Тип сущности.

Формы анализа могут вернуть следующие типы сущностей:

  • KEY - Идентификатор поля в документе.
  • VALUE - Текст поля.

Анализ таблиц может вернуть следующие типы сущностей:

  • COLUMN_HEADER - Идентифицирует ячейку, являющуюся заголовком столбца.
  • TABLE_TITLE - Идентифицирует ячейку, являющуюся заголовком таблицы.
  • TABLE_SECTION_TITLE - Идентифицирует ячейку, являющуюся заголовком раздела в таблице. Заголовок раздела — это ячейка, обычно занимающая всю строку над разделом.
  • TABLE_FOOTER - Идентифицирует ячейку, являющуюся подвалом таблицы.
  • TABLE_SUMMARY - Идентифицирует ячейку резюме таблицы. Ячейка резюме может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
  • STRUCTURED_TABLE - Идентифицирует таблицу со столбцами, где содержимое каждой строки соответствует заголовкам.
  • SEMI_STRUCTURED_TABLE - Идентифицирует неструктурированную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.

(строка)

SelectionStatus -> (строка)

Состояние выбора элемента выбора, такого как кнопка выбора или флажок.

Page -> (целое число)

Страница, на которой был обнаружен блок. Page возвращается синхронными и асинхронными операциями. Значения страниц, большие 1, возвращаются только для многостраничных документов в формате PDF или TIFF. Сканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для сканированных изображений значение Page всегда равно 1.

Запрос -> (структура)

Текст -> (строка)

Вопрос, который Amazon Textract применит к документу. Пример: «Каков SSN клиента?»

Псевдоним -> (строка)

Псевдоним, присвоенный запросу для удобства поиска.

Страницы -> (список)

Параметр Страницы, который пользователь вводит, чтобы указать, к каким страницам применить запрос. Ниже приведен список правил использования этого параметра.

  • Если страница не указана, она устанавливается по умолчанию в значение ["1"].
  • В строке параметра разрешены следующие символы: 0 1 2 3 4 5 6 7 8 9 - * . Пробелы не допускаются.
  • При использовании * для обозначения всех страниц, это должен быть единственный элемент в списке.
  • Можно использовать интервалы страниц, такие как [“1-3”, “1-1”, “4-*”]. Где * обозначает последнюю страницу документа.
  • Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.

(строка)

IdentityDocument -> (структура)

Структура, перечисляющая каждый обработанный документ в операции AnalyzeID.

DocumentIndex -> (целое число)

Указывает позицию документа в списке IdentityDocument. Первый документ обозначен как 1, второй как 2 и так далее.

IdentityDocumentFields -> (список)

Структура, используемая для записи информации, извлеченной из документов личности. Содержит как нормализованное поле, так и значение извлеченного текста.

(структура)

Структура, содержащая как нормализованный тип извлеченной информации, так и связанный с ней текст. Они извлекаются как Type и Value соответственно.

Type -> (структура)

Используется для хранения информации, обнаруженной операцией AnalyzeID.

Text -> (строка)

Текст нормализованного поля или значения, связанного с ним.

NormalizedValue -> (структура)

Возвращается только для дат, возвращает тип обнаруженного значения и дату, записанную более читаемым для машины способом.

Value -> (строка)

Значение даты, записанное как Год-Месяц-ДеньЧЧ:ММ:СС.

ValueType -> (строка)

Нормализованный тип обнаруженного значения. В данном случае, DATE.

Confidence -> (вещественное число)

Степень уверенности в обнаруженном тексте.

ValueDetection -> (структура)

Используется для хранения информации, обнаруженной операцией AnalyzeID.

Text -> (строка)

Текст нормализованного поля или значения, связанного с ним.

NormalizedValue -> (структура)

Возвращается только для дат, возвращает тип обнаруженного значения и дату, записанную более читаемым для машины способом.

Value -> (строка)

Значение даты, записанное как Год-Месяц-ДеньЧЧ:ММ:СС.

ValueType -> (строка)

Нормализованный тип обнаруженного значения. В данном случае, DATE.

Confidence -> (вещественное число)

Степень уверенности в обнаруженном тексте.

Blocks -> (список)

Распознавание отдельных слов, возвращаемое распознаванием документа.

(структура)

Block представляет элементы, распознанные в документе в группе пикселей, близких друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При распознавании текста в документах (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о распознанных полях, таблицах и элементах выбора в документе.

Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block представляет собой весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.

Дополнительную информацию см. в разделе Как работает Amazon Textract.

BlockType -> (строка)

Тип распознанного элемента текста. В операциях распознавания текста возвращаются следующие типы:

  • PAGE - Содержит список объектов LINE Block, распознанных на странице документа.
  • WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, которые не разделены пробелами.
  • LINE - Строка табулированных, смежных слов, распознанных на странице документа.

В операциях анализа текста возвращаются следующие типы:

  • PAGE - Содержит список дочерних объектов Block, распознанных на странице документа.
  • KEY_VALUE_SET - Хранит объекты KEY и VALUE Block для связанного текста, распознанного на странице документа. Используйте поле EntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEY Block или объектом VALUE Block.
  • WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, которые не разделены пробелами.
  • LINE - Строка табулированных, смежных слов, распознанных на странице документа.
  • TABLE - Таблица, распознанная на странице документа. Таблица — это информация на основе сетки с двумя или более строками или столбцами, с размахом ячейки по одной строке и одному столбцу.
  • TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей, или встроен в первую строку таблицы.
  • TABLE_FOOTER - Подвал, связанный с таблицей. Подвал обычно представляет собой строку или строки текста под таблицей или встроен в последнюю строку таблицы.
  • CELL - Ячейка в распознанной таблице. Ячейка является родителем блока, содержащего текст в ячейке.
  • MERGED_CELL - Ячейка в таблице, содержимое которой охватывает более одной строки или столбца. Массив Relationships для этой ячейки содержит данные из отдельных ячеек.
  • SELECTION_ELEMENT - Элемент выбора, такой как кнопка выбора (кнопка радио) или флажок, распознанный на странице документа. Используйте значение SelectionStatus, чтобы определить состояние элемента выбора.
  • SIGNATURE - Позиция и оценка уверенности подписи, распознанной на странице документа. Может возвращаться как часть пары ключ-значение или распознанной ячейки.
  • QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, которые привязывают его к ответу.
  • QUERY_RESULT - Ответ на вопрос, заданный во время вызова analyze document. Поставляется с псевдонимом и идентификатором для удобства поиска в ответе. Также содержит положение и оценку уверенности.

Следующие BlockTypes возвращаются только для Amazon Textract Layout.

  • LAYOUT_TITLE - Основной заголовок документа.
  • LAYOUT_HEADER - Текст, расположенный в верхнем отступе документа.
  • LAYOUT_FOOTER - Текст, расположенный в нижнем отступе документа.
  • LAYOUT_SECTION_HEADER - Заголовки разделов внутри документа.
  • LAYOUT_PAGE_NUMBER - Номер страницы документов.
  • LAYOUT_LIST - Любая информация, сгруппированная в виде списка.
  • LAYOUT_FIGURE - Указывает расположение изображения в документе.
  • LAYOUT_TABLE - Указывает расположение таблицы в документе.
  • LAYOUT_KEY_VALUE - Указывает расположение значений ключей формы в документе.
  • LAYOUT_TEXT - Текст, обычно присутствующий как часть абзацев в документах.

Confidence -> (число с плавающей точкой)

Оценка уверенности Amazon Textract в точности распознанного текста и точности геометрических точек вокруг распознанного текста.

Text -> (строка)

Слово или строка текста, распознанные Amazon Textract.

TextType -> (строка)

Вид текста, обнаруженный Amazon Textract. Может проверять рукописный и печатный текст.

RowIndex -> (целое число)

Строка, в которой находится ячейка таблицы. Первая позиция строки — 1. RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnIndex -> (целое число)

Столбец, в котором находится ячейка таблицы. Первая позиция столбца — 1. ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

RowSpan -> (целое число)

Количество строк, на которые распространяется ячейка таблицы. RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnSpan -> (целое число)

Количество столбцов, на которые распространяется ячейка таблицы. ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

Geometry -> (структура)

Расположение распознанного текста на изображении. В него входит выровненная по осям грубая рамка, окружающая текст, и более точная полилиния для более точной пространственной информации.

BoundingBox -> (структура)

Выровненное по осям грубое представление расположения распознанного элемента на странице документа.

Width -> (число с плавающей точкой)

Ширина рамки в виде отношения к общей ширине страницы документа.

Height -> (число с плавающей точкой)

Высота рамки в виде отношения к общей высоте страницы документа.

Left -> (число с плавающей точкой)

Координата слева рамки в виде отношения к общей ширине страницы документа.

Top -> (число с плавающей точкой)

Координата сверху рамки в виде отношения к общей высоте страницы документа.

Polygon -> (список)

В пределах рамки, точная полилиния вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается DetectDocumentText. Polygon представляет точную полилинию вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.

X -> (число с плавающей точкой)

Значение координаты X для точки на Polygon.

Y -> (число с плавающей точкой)

Значение координаты Y для точки на Polygon.

Id -> (строка)

Идентификатор распознанного текста. Идентификатор уникален только для одной операции.

Relationships -> (список)

Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, объект блока LINE содержит тип отношения CHILD с блоками WORD, которые составляют строку текста. Нет объектов Relationships в списке для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.

(структура)

Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке, Relationships. Дополнительную информацию см. в разделе Блок.

Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.

Type -> (строка)

Тип отношения между блоками в массиве IDs и текущим блоком. Следующий список описывает типы отношений, которые могут быть возвращены.

  • VALUE - Список, содержащий идентификатор блока VALUE, связанного с KEY пары ключ-значение.
  • CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего блока. Например, блоки WORD имеют отношение CHILD к блоку LINE.
  • MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
  • ANSWER - Список, содержащий идентификатор блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
  • TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
  • TABLE_TITLE - Список, содержащий идентификатор блока типа TABLE_TITLE в таблице.
  • TABLE_FOOTER - Список идентификаторов, определяющих блоки типа TABLE_FOOTER в таблице.

Ids -> (список)

Массив идентификаторов связанных блоков. Вы можете получить тип отношения из элемента Type.

(строка)

EntityTypes -> (список)

Тип сущности.

Следующие типы сущностей могут быть возвращены анализом форм:

  • KEY - Идентификатор поля в документе.
  • VALUE - Текст поля.

Следующие типы сущностей могут быть возвращены анализом таблиц:

  • COLUMN_HEADER - Идентифицирует ячейку, которая является заголовком столбца.
  • TABLE_TITLE - Идентифицирует ячейку, которая является заголовком в таблице.
  • TABLE_SECTION_TITLE - Идентифицирует ячейку, которая является заголовком раздела в таблице. Заголовок раздела — это ячейка, которая обычно охватывает всю строку над разделом.
  • TABLE_FOOTER - Идентифицирует ячейку, которая является подвалом таблицы.
  • TABLE_SUMMARY - Идентифицирует ячейку сводки таблицы. Ячейка сводки может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
  • STRUCTURED_TABLE - Идентифицирует таблицу со столбцами, где содержимое каждой строки соответствует заголовкам.
  • SEMI_STRUCTURED_TABLE - Идентифицирует неструктурированную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.

(строка)

SelectionStatus -> (строка)

Состояние выбора элемента выбора, такого как кнопка выбора или флажок.

Page -> (целое число)

Страница, на которой был обнаружен блок. Page возвращается синхронными и асинхронными операциями. Значения страниц, превышающие 1, возвращаются только для многостраничных документов в формате PDF или TIFF. Отсканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для отсканированных изображений значение Page всегда равно 1.

Запрос -> (структура)

Текст -> (строка)

Вопрос, который Amazon Textract применит к документу. Примером может служить «Какой ИНН у клиента?»

Псевдоним -> (строка)

Псевдоним, прикрепленный к запросу, для удобства поиска.

Страницы -> (список)

Параметр Страницы позволяет пользователю указать, к каким страницам применить запрос. Ниже приведен список правил для использования этого параметра.

  • Если страница не указана, она устанавливается по умолчанию в ["1"].
  • В строке параметра разрешены следующие символы: 0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются.
  • При использовании * для указания всех страниц, оно должно быть единственным элементом в списке.
  • Можно использовать интервалы страниц, такие как [“1-3”, “1-1”, “4-*”]. Где * обозначает последнюю страницу документа.
  • Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.

(строка)

Предупреждения -> (список)

Список предупреждений, возникших во время операции анализа кредитования.

(структура)

Предупреждение об ошибке, возникшей во время асинхронного анализа текста ( StartDocumentAnalysis ) или асинхронного обнаружения текста документа ( StartDocumentTextDetection ).

Код ошибки -> (строка)

Код ошибки предупреждения.

Страницы -> (список)

Список страниц, к которым относится предупреждение.

(целое число)

Сообщение о статусе -> (строка)

Возвращает, если работа по анализу кредитования не может быть завершена. Содержит объяснение причины возникшей ошибки.

Версия модели AnalyzeLending -> (строка)

Текущая версия модели API Analyze Lending.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API