get-expense-analysis
Описание
Получает результаты асинхронной операции Amazon Textract по анализу счетов и квитанций. Amazon Textract определяет контактную информацию, приобретённые товары и название поставщика из входных счетов и квитанций.
Вы начинаете асинхронный анализ счетов/квитанций, вызывая StartExpenseAnalysis , который возвращает идентификатор задачи (JobId ). После завершения анализа счетов/квитанций, Amazon Textract публикует статус завершения в тему Amazon Simple Notification Service (Amazon SNS). Эта тема должна быть зарегистрирована в начальном вызове StartExpenseAnalysis . Для получения результатов операции анализа счетов/квитанций, убедитесь, что значение статуса, опубликованное в теме Amazon SNS, равно SUCCEEDED . В этом случае вызовите GetExpenseAnalysis и передайте идентификатор задачи (JobId ) из начального вызова StartExpenseAnalysis .
Используйте параметр MaxResults, чтобы ограничить количество возвращаемых блоков. Если результатов больше, чем указано в MaxResults , значение NextToken в ответе операции содержит маркер постраничной навигации для получения следующего набора результатов. Чтобы получить следующую страницу результатов, вызовите GetExpenseAnalysis и заполните параметр запроса NextToken значением маркера, возвращённым предыдущим вызовом GetExpenseAnalysis .
Дополнительную информацию см. в разделе Анализ счетов и квитанций.
См. также: Документация API AWS
Синтаксис
get-expense-analysis
--job-id <value>
[--max-results <value>]
[--next-token <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--job-id (строка)
JobId возвращается из StartExpenseAnalysis . Значение JobId действительно только в течение 7 дней.--max-results (целое число)
--next-token (строка)
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON следует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения перекроют значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения, используя значение, предоставленное JSON, так как строка будет взята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или значение input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, выведет пример входного YAML, который можно использовать с --cli-input-yaml. При предоставлении значения output он валидирует входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладочную запись.
--endpoint-url (строка)
Переопределить значение URL по умолчанию команды заданным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого подключения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет поведение по умолчанию проверки сертификатов SSL.
--no-paginate (логическое значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для использования при фильтрации данных ответа.
--profile (строка)
Использование определённого профиля из файла учетных данных.
--region (строка)
Используемый регион. Перекрывает настройки конфигурации/среды.
--version (строка)
Отображение версии этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл сертификатов CA для использования при проверке сертификатов SSL. Перекрывает настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как закодированная строка base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и будет использовать содержимое файла напрямую, независимо от cli-binary-format настройки. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить постраничную навигацию cli для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запросить параметры CLI ввода.
--no-cli-auto-prompt (логическое значение)
Отключить автоматический запрос параметров ввода CLI.
Вывод
DocumentMetadata -> (структура)
Информация о документе, обработанном Amazon Textract. DocumentMetadata возвращается на каждой странице ответа при постраничном ответе от Amazon Textract.
Pages -> (целое число)
JobStatus -> (строка)
NextToken -> (строка)
ExpenseDocuments -> (список)
Расходы, обнаруженные Amazon Textract.
(структура)
Структура, содержащая всю информацию, возвращенную AnalyzeExpense
ExpenseIndex -> (целое число)
SummaryFields -> (список)
Любая информация, найденная Amazon Textract вне таблицы.
(структура)
Детализация обнаруженной информации, разделенная на категории Type, LabelDetection и ValueDetection
Type -> (структура)
Подразумеваемая метка обнаруженного элемента. Присутствует вместе с LabelDetection для явных элементов.
Text -> (строка)
Confidence -> (вещественное число)
LabelDetection -> (структура)
Явно указанная метка обнаруженного элемента.
Text -> (строка)
Geometry -> (структура)
Информация о местоположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Ось-выровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри области обводки, тонкая полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полилинию вокруг обнаруженного текста. Дополнительную информацию см. в руководстве разработчика Amazon Textract в разделе Geometry.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
ValueDetection -> (структура)
Значение обнаруженного элемента. Присутствует в явных и неявных элементах.
Text -> (строка)
Geometry -> (структура)
Информация о местоположении следующих элементов на странице документа: обнаруженная страница, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Ось-выровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри области обводки, тонкая полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонкую полилинию вокруг обнаруженного текста. Дополнительную информацию см. в руководстве разработчика Amazon Textract в разделе Geometry.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
PageNumber -> (целое число)
Currency -> (структура)
Показывает тип валюты, как код, так и уверенность, связанные с любой обнаруженной денежной суммой.
Code -> (строка)
Код валюты для обнаруженной валюты. Поддерживаемые коды:
- USD
- EUR
- GBP
- CAD
- INR
- JPY
- CHF
- AUD
- CNY
- BZR
- SEK
- HKD
Confidence -> (вещественное число)
GroupProperties -> (список)
Показывает, к какой группе относится объект ответа, например, принадлежит ли строка адреса адресу поставщика или получателя.
(структура)
Показывает группу, к которой принадлежит определенный ключ. Это помогает отличить имена и адреса разных организаций, что может быть сложно определить по JSON-ответу.
Types -> (список)
Указывает, является ли группа расходов именем или адресом.
(строка)
Id -> (строка)
LineItemGroups -> (список)
Информация, обнаруженная в каждой таблице документа, разделена на LineItems.
(структура)
Группа таблиц, содержащих LineItems, каждая таблица идентифицируется по LineItemGroupIndex таблицы.
LineItemGroupIndex -> (целое число)
LineItems -> (список)
Детализация информации по конкретной строке таблицы.
(структура)
Структура, содержащая информацию о разных строках в таблицах документа.
LineItemExpenseFields -> (список)
ExpenseFields, используемые для отображения информации из обнаруженных строк таблицы.
(структура)
Разбивка обнаруженной информации, разделенная на категории Type, LabelDetection и ValueDetection.
Type -> (структура)
Подразумеваемое метка обнаруженного элемента. Присутствует вместе с LabelDetection для явных элементов.
Text -> (строка)
Confidence -> (вещественное число)
LabelDetection -> (структура)
Явно указанная метка обнаруженного элемента.
Text -> (строка)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженные страницы, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Ось-выровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
В пределах области, тонкая полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонко детализированную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в разделе Geometry в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
ValueDetection -> (структура)
Значение обнаруженного элемента. Присутствует в явных и неявных элементах.
Text -> (строка)
Geometry -> (структура)
Информация о расположении следующих элементов на странице документа: обнаруженные страницы, текст, пары ключ-значение, таблицы, ячейки таблиц и элементы выбора.
BoundingBox -> (структура)
Ось-выровненное грубое представление местоположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
В пределах области, тонкая полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет собой тонко детализированную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в разделе Geometry в руководстве разработчика Amazon Textract.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Confidence -> (вещественное число)
PageNumber -> (целое число)
Currency -> (структура)
Показывает тип валюты, как код, так и доверие, связанные с обнаруженной денежной величиной.
Code -> (строка)
Код валюты для обнаруженной валюты. Поддерживаемые коды:
- USD
- EUR
- GBP
- CAD
- INR
- JPY
- CHF
- AUD
- CNY
- BZR
- SEK
- HKD
Confidence -> (вещественное число)
GroupProperties -> (список)
Показывает, к какой группе относится объект ответа, например, относится ли адресная строка к адресу поставщика или получателя.
(структура)
Показывается группа, к которой принадлежит определенный ключ. Это помогает различать имена и адреса разных организаций, что может быть сложно определить по ответу JSON.
Types -> (список)
Указывает, является ли группа расходов именем или адресом.
(строка)
Id -> (строка)
Blocks -> (список)
Это объект блока, такой же, как и тот, который возвращается при запуске DetectDocumentText на документе. Он обеспечивает распознавание текста на уровне слов.
(структура)
Block представляет элементы, распознанные в документе в группе пикселей, расположенных близко друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При обнаружении текста в документах (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о найденных полях, таблицах и элементах выбора в документе.
Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block представляет собой весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.
Для получения дополнительной информации см. Как работает Amazon Textract.
BlockType -> (строка)
Тип распознанного элемента текста. В операциях по обнаружению текста возвращаются следующие типы:
-
PAGE - Содержит список объектов LINE
Block, обнаруженных на странице документа. - WORD - Слово, обнаруженное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, не разделенные пробелами.
- LINE - Строка табулированных, смежных слов, обнаруженных на странице документа.
В операциях анализа текста возвращаются следующие типы:
-
PAGE - Содержит список дочерних объектов
Block, обнаруженных на странице документа. -
KEY_VALUE_SET - Хранит объекты KEY и VALUE
Blockдля связанного текста, обнаруженного на странице документа. Используйте полеEntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEYBlockили объектом VALUEBlock. - WORD - Слово, обнаруженное на странице документа. Слово — это одна или несколько букв базового латинского алфавита, не разделенные пробелами.
- LINE - Строка табулированных, смежных слов, обнаруженных на странице документа.
- TABLE - Таблица, обнаруженная на странице документа. Таблица — это информация, основанная на сетке, с двумя или более строками или столбцами, с пролетом ячейки по одной строке и одному столбцу.
- TABLE_TITLE - Заголовок таблицы. Заголовок, как правило, это строка текста над или под таблицей, или встроена в первую строку таблицы.
- TABLE_FOOTER - Подвал, связанный с таблицей. Подвал, как правило, это строка или строки текста под таблицей или встроена в последнюю строку таблицы.
- CELL - Ячейка в обнаруженной таблице. Ячейка является родителем блока, содержащего текст в ячейке.
-
MERGED_CELL - Ячейка в таблице, содержимое которой охватывает более одной строки или столбца. Массив
Relationshipsдля этой ячейки содержит данные из отдельных ячеек. -
SELECTION_ELEMENT - Элемент выбора, например, кнопка выбора (радиокнопка) или флажок, обнаруженный на странице документа. Используйте значение
SelectionStatusдля определения состояния элемента выбора. - SIGNATURE - Местоположение и оценка достоверности подписи, обнаруженной на странице документа. Может быть возвращен как часть пары ключ-значение или обнаруженной ячейки.
- QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, которые привязывают его к ответу.
- QUERY_RESULT - Ответ на вопрос, заданный во время вызова AnalyzeDocument. Имеет псевдоним и идентификатор для удобства поиска в ответе. Также содержит местоположение и оценку достоверности.
Следующие типы BlockTypes возвращаются только для Amazon Textract Layout.
-
LAYOUT_TITLE- Основной заголовок документа. -
LAYOUT_HEADER- Текст, расположенный в верхнем отступе документа. -
LAYOUT_FOOTER- Текст, расположенный в нижнем отступе документа. -
LAYOUT_SECTION_HEADER- Заголовки разделов внутри документа. -
LAYOUT_PAGE_NUMBER- Номер страницы документов. -
LAYOUT_LIST- Любая информация, сгруппированная в виде списка. -
LAYOUT_FIGURE- Указывает расположение изображения в документе. -
LAYOUT_TABLE- Указывает расположение таблицы в документе. -
LAYOUT_KEY_VALUE- Указывает расположение полей форм в документе. -
LAYOUT_TEXT- Текст, который обычно присутствует как часть абзацев в документах.
Confidence -> (вещественное число)
Text -> (строка)
TextType -> (строка)
RowIndex -> (целое число)
RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.ColumnIndex -> (целое число)
ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.RowSpan -> (целое число)
RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.ColumnSpan -> (целое число)
ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.Geometry -> (структура)
Расположение распознанного текста на изображении. Он включает осью выровненный грубый прямоугольник, который охватывает текст, и более точную полилинию для более точной пространственной информации.
BoundingBox -> (структура)
Осью выровненное грубое представление расположения распознанного элемента на странице документа.
Width -> (вещественное число)
Height -> (вещественное число)
Left -> (вещественное число)
Top -> (вещественное число)
Polygon -> (список)
Внутри прямоугольника, точная полилиния вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X=0,5 и Y=0,25, то точка расположена в пиксельной координате (350,50) на странице документа.
Массив объектов Point, Polygon, возвращается методом DetectDocumentText. Polygon представляет собой точную полилинию вокруг обнаруженного текста. Дополнительную информацию см. в руководстве разработчика Amazon Textract в разделе Геометрия.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.Id -> (строка)
Relationships -> (список)
Список объектов отношений, описывающих взаимосвязь блоков. Например, объект блока LINE содержит тип отношения CHILD с блоками WORD, которые образуют строку текста. В списке нет объектов Relationship для отношений, которые не существуют, например, когда текущий блок не имеет дочерних блоков.
(структура)
Информация о взаимосвязи блоков. Объект Block содержит 0 или более объектов Relation в списке, Relationships. Дополнительную информацию см. в разделе Блок.
Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.
Type -> (строка)
Тип отношения между блоками в массиве IDs и текущим блоком. Следующий список описывает типы отношений, которые могут быть возвращены.
- VALUE - Список, содержащий ID блока VALUE, связанного с KEY пары ключ-значение.
- CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего объекта блока. Например, блоки WORD имеют отношение CHILD к блоку типа LINE.
- MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
- ANSWER - Список, содержащий ID блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
- TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
- TABLE_TITLE - Список, содержащий идентификатор блока типа TABLE_TITLE в таблице.
- TABLE_FOOTER - Список идентификаторов, определяющих блоки типа TABLE_FOOTER в таблице.
Ids -> (список)
Массив идентификаторов связанных блоков. Тип отношения можно получить из элемента Type.
(строка)
EntityTypes -> (список)
Тип сущности.
Следующие типы сущностей могут быть возвращены анализом FORMS:
- KEY - Идентификатор поля в документе.
- VALUE - Текст поля.
Следующие типы сущностей могут быть возвращены анализом TABLES:
- COLUMN_HEADER - Идентифицирует ячейку, которая является заголовком столбца.
- TABLE_TITLE - Идентифицирует ячейку, которая является заголовком таблицы.
- TABLE_SECTION_TITLE - Идентифицирует ячейку, которая является заголовком раздела в таблице. Заголовок раздела — это ячейка, которая, как правило, занимает всю строку над разделом.
- TABLE_FOOTER - Идентифицирует ячейку, которая является подвалом таблицы.
- TABLE_SUMMARY - Идентифицирует ячейку сводки таблицы. Ячейка сводки может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
- STRUCTURED_TABLE - Идентифицирует таблицу с заголовками столбцов, где содержимое каждой строки соответствует заголовкам.
- SEMI_STRUCTURED_TABLE - Идентифицирует неструктурированную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.(строка)
SelectionStatus -> (строка)
Page -> (целое число)
Page возвращается синхронными и асинхронными операциями. Значения страниц, большие чем 1, возвращаются только для многостраничных документов в формате PDF или TIFF. Скан-изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для отсканированных изображений значение Page всегда равно 1.Запрос -> (структура)
Текст -> (строка)
Псевдоним -> (строка)
Страницы -> (список)
Параметр Страницы позволяет пользователю указать, к каким страницам применить запрос. Вот список правил использования этого параметра.
- Если страница не указана, по умолчанию она устанавливается в значение
["1"]. - В строке параметра разрешены следующие символы:
0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются. - При использовании * для указания всех страниц, это должен быть единственный элемент в списке.
- Вы можете использовать интервалы страниц, такие как
[“1-3”, “1-1”, “4-*”]. Где*обозначает последнюю страницу документа. - Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.
(строка)
Предупреждения -> (список)
Список предупреждений, возникших во время операции обнаружения текста для документа.
(структура)
Предупреждение об ошибке, произошедшей во время асинхронного анализа текста ( StartDocumentAnalysis ) или асинхронного обнаружения текста в документе ( StartDocumentTextDetection ).
Код ошибки -> (строка)
Страницы -> (список)
Список страниц, к которым относится предупреждение.
(целое число)
Сообщение о состоянии -> (строка)
AnalyzeExpenseModelVersion -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.