Spec-Zone.ru › AWS CLI v2

[ aws . textract ]

analyze-id

Описание

Анализирует документы для идентификации личности, извлекая релевантную информацию. Эта информация извлекается и возвращается как IdentityDocumentFields, что записывает как нормализованное поле, так и значение извлечённого текста. В отличие от других операций Amazon Textract, AnalyzeID не возвращает данные Geometry.

См. также: Документацию API AWS

Синтаксис

  analyze-id
--document-pages <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--document-pages (список)

Документ, передаваемый в AnalyzeID.

(структура)

Входной документ, представленный в виде байтов или объекта S3.

Вы передаёте байты изображения в операцию Amazon Textract API, используя свойство Bytes. Например, вы можете использовать свойство Bytes для передачи документа, загруженного из локальной файловой системы. Байты изображения, передаваемые через свойство Bytes, должны быть закодированы в base64. Возможно, вам не потребуется кодировать байты документа, если вы используете SDK AWS для вызова операций Amazon Textract API.

Вы передаёте изображения, хранящиеся в ведре S3, в операцию Amazon Textract API, используя свойство S3Object. Документы, хранящиеся в ведре S3, не нуждаются в кодировании в base64.

Регион AWS для ведра S3, содержащего объект S3, должен совпадать с регионом AWS, используемым для операций Amazon Textract.

Если вы используете AWS CLI для вызова операций Amazon Textract, передача байтов изображения с помощью свойства Bytes не поддерживается. Вам необходимо сначала загрузить документ в ведро Amazon S3, а затем вызвать операцию, используя свойство S3Object.

Для обработки объекта S3 Amazon Textract требуется разрешение пользователя на доступ к этому объекту.

Bytes -> (blob)

Блоб с байтами документа, закодированными в base64. Максимальный размер документа, предоставленного в блобе байтов, составляет 5 МБ. Байты документа должны быть в формате PNG или JPEG.

Если вы используете AWS SDK для вызова Amazon Textract, вам, возможно, не потребуется кодировать байты изображения в base64, передавая их с помощью поля Bytes.

S3Object -> (структура)

Идентифицирует объект S3 в качестве источника документа. Максимальный размер документа, хранящегося в ведре S3, составляет 5 МБ.

Bucket -> (строка)

Имя ведра S3. Обратите внимание, что символ # недопустим в имени файла.

Name -> (строка)

Имя файла входного документа. Синхронные операции могут использовать файлы изображений в формате JPEG или PNG. Асинхронные операции также поддерживают файлы в форматах PDF и TIFF.

Version -> (строка)

Если в ведре включена версия, вы можете указать версию объекта.

Сокращённый синтаксис:

Bytes=blob,S3Object={Bucket=string,Name=string,Version=string} ...

Синтаксис JSON:

[
  {
    "Bytes": blob,
    "S3Object": {
      "Bucket": "string",
      "Name": "string",
      "Version": "string"
    }
  }
  ...
]

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, полученные из JSON. Передача произвольных двоичных данных с использованием значения, предоставленного через JSON, невозможна, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или со значением input, выводит пример входного JSON, который можно использовать как аргумент для --cli-input-json. Аналогично, если предоставлено yaml-input, будет напечатан пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, оно проверяет входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (логическое значение)

Включение отладки логгирования.

--endpoint-url (строка)

Переопределение URL по умолчанию команды указанным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.

--no-paginate (логическое значение)

Отключение автоматической постраничной навигации. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования для вывода команды.

  • json
  • текст
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использование определенного профиля из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отображение версии этого инструмента.

--color (строка)

Включение/выключение цветного вывода.

  • включено
  • выключено
  • автоматически

--no-sign-request (логическое значение)

Отключение подписи запросов. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение равно 0, чтение сокета будет выполняться в блокирующем режиме без таймаута. Значение по умолчанию — 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение равно 0, подключение сокета будет выполняться в блокирующем режиме без таймаута. Значение по умолчанию — 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блобов. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блобы будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI версии 1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого файла, соответствующего двоичному блобу, fileb:// всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для заданного формата cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключение постраничной навигации CLI для вывода.

--cli-auto-prompt (логическое значение)

Автоматический запрос параметров CLI.

--no-cli-auto-prompt (логическое значение)

Отключение автоматического запроса параметров CLI.

Вывод

IdentityDocuments -> (список)

Список документов, обработанных AnalyzeID. Включает номер, обозначающий их место в списке, и структуру ответа для документа.

(структура)

Структура, которая перечисляет каждый обработанный документ в операции AnalyzeID.

DocumentIndex -> (целое число)

Обозначает позицию документа в списке IdentityDocument. Первый документ отмечен 1, второй 2 и так далее.

IdentityDocumentFields -> (список)

Структура, используемая для записи информации, извлечённой из документов личности. Содержит как нормализованное поле, так и значение извлечённого текста.

(структура)

Структура, содержащая нормализованный тип извлечённой информации и соответствующий текст. Они извлекаются как Type и Value соответственно.

Type -> (структура)

Используется для хранения информации, обнаруженной операцией AnalyzeID.

Text -> (строка)

Текст нормализованного поля или значения, связанного с ним.

NormalizedValue -> (структура)

Возвращается только для дат, возвращает тип обнаруженного значения и дату в более машиночитаемом формате.

Value -> (строка)

Значение даты, записанное в формате Год-Месяц-ДеньЧЧ:ММ:СС.

ValueType -> (строка)

Нормализованный тип обнаруженного значения. В данном случае DATE.

Confidence -> (вещественное число)

Оценка достоверности обнаруженного текста.

ValueDetection -> (структура)

Используется для хранения информации, обнаруженной операцией AnalyzeID.

Text -> (строка)

Текст нормализованного поля или значения, связанного с ним.

NormalizedValue -> (структура)

Возвращается только для дат, возвращает тип обнаруженного значения и дату в более машиночитаемом формате.

Value -> (строка)

Значение даты, записанное в формате Год-Месяц-ДеньЧЧ:ММ:СС.

ValueType -> (строка)

Нормализованный тип обнаруженного значения. В данном случае DATE.

Confidence -> (вещественное число)

Оценка достоверности обнаруженного текста.

Blocks -> (список)

Распознавание отдельных слов, возвращаемое детектированием документа.

(структура)

Block представляет элементы, распознанные в документе в группе пикселей, близких друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При распознавании текста документов (например, DetectDocumentText) вы получаете информацию о распознанных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о распознанных полях, таблицах и элементах выбора в документе.

Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block — это полный набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.

Дополнительную информацию см. в разделе Как работает Amazon Textract.

BlockType -> (строка)

Тип распознанного элемента текста. В операциях распознавания текста возвращаются следующие типы:

  • PAGE - Содержит список объектов LINE Block, распознанных на странице документа.
  • WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв основного латинского алфавита, не разделенных пробелами.
  • LINE - Строка табулированных, непрерывных слов, распознанных на странице документа.

В операциях анализа текста возвращаются следующие типы:

  • PAGE - Содержит список дочерних объектов Block, распознанных на странице документа.
  • KEY_VALUE_SET - Хранит объекты KEY и VALUE Block для связанного текста, распознанного на странице документа. Используйте поле EntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEY Block или объектом VALUE Block.
  • WORD - Слово, распознанное на странице документа. Слово — это одна или несколько букв основного латинского алфавита, не разделенных пробелами.
  • LINE - Строка табулированных, непрерывных слов, распознанных на странице документа.
  • TABLE - Таблица, распознанная на странице документа. Таблица — это информация, основанная на сетке, с двумя или более строками или столбцами, с пролетом ячейки по одной строке и одному столбцу.
  • TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей или вставлен в качестве первой строки таблицы.
  • TABLE_FOOTER - Подвал, связанный с таблицей. Подвал обычно представляет собой строку или строки текста под таблицей или вставлен в качестве последней строки таблицы.
  • CELL - Ячейка в распознанной таблице. Ячейка — родитель блока, содержащего текст в ячейке.
  • MERGED_CELL - Ячейка в таблице, содержимое которой охватывает более одной строки или столбца. Массив Relationships для этой ячейки содержит данные из отдельных ячеек.
  • SELECTION_ELEMENT - Элемент выбора, такой как кнопка опции (кнопка радио) или флажок, распознанный на странице документа. Используйте значение SelectionStatus, чтобы определить состояние элемента выбора.
  • SIGNATURE - Местоположение и оценка уверенности подписи, распознанной на странице документа. Может возвращаться в качестве части пары «ключ-значение» или распознанной ячейки.
  • QUERY - Вопрос, заданный при вызове AnalyzeDocument. Содержит псевдоним и идентификатор, прикрепляющий его к ответу.
  • QUERY_RESULT - Ответ на вопрос, заданный при вызове документа анализа. Имеет псевдоним и идентификатор для удобства поиска в ответе. Также содержит расположение и оценку уверенности.

Следующие типы BlockTypes возвращаются только для Amazon Textract Layout.

  • LAYOUT_TITLE - Основной заголовок документа.
  • LAYOUT_HEADER - Текст, расположенный в верхнем отступе документа.
  • LAYOUT_FOOTER - Текст, расположенный в нижнем отступе документа.
  • LAYOUT_SECTION_HEADER - Заголовки разделов в документе.
  • LAYOUT_PAGE_NUMBER - Номер страницы документов.
  • LAYOUT_LIST - Любая информация, сгруппированная в виде списка.
  • LAYOUT_FIGURE - Указывает расположение изображения в документе.
  • LAYOUT_TABLE - Указывает расположение таблицы в документе.
  • LAYOUT_KEY_VALUE - Указывает расположение ключевых значений форм в документе.
  • LAYOUT_TEXT - Текст, обычно присутствующий в виде абзацев в документах.

Confidence -> (число с плавающей точкой)

Оценка уверенности Amazon Textract в точности распознанного текста и точности геометрических точек вокруг распознанного текста.

Text -> (строка)

Слово или строка текста, распознанные Amazon Textract.

TextType -> (строка)

Вид текста, распознанный Amazon Textract. Можно проверить рукописный и печатный текст.

RowIndex -> (целое число)

Строка, в которой расположена ячейка таблицы. Номер первой строки — 1. RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnIndex -> (целое число)

Столбец, в котором расположена ячейка таблицы. Номер первого столбца — 1. ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

RowSpan -> (целое число)

Количество строк, охватываемых ячейкой таблицы. RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnSpan -> (целое число)

Количество столбцов, охватываемых ячейкой таблицы. ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

Geometry -> (структура)

Расположение распознанного текста на изображении. Он включает в себя ориентированный по осям грубый прямоугольник, окружающий текст, и полигон более мелкого масштаба для более точной пространственной информации.

BoundingBox -> (структура)

Ориентированный по осям грубый способ представления местоположения распознанного элемента на странице документа.

Width -> (число с плавающей точкой)

Ширина прямоугольника как отношение к общей ширине страницы документа.

Height -> (число с плавающей точкой)

Высота прямоугольника как отношение к общей высоте страницы документа.

Left -> (число с плавающей точкой)

Координата слева прямоугольника как отношение к общей ширине страницы документа.

Top -> (число с плавающей точкой)

Координата сверху прямоугольника как отношение к общей высоте страницы документа.

Polygon -> (список)

В пределах прямоугольника, полигон мелкого масштаба вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, которые возвращаются, являются отношениями к общему размеру страницы документа. Например, если входной документ имеет размер 700x200, а операция возвращает X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на странице документа.

Массив объектов Point, Polygon, возвращается DetectDocumentText. Polygon представляет собой полигон мелкого масштаба вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.

X -> (число с плавающей точкой)

Значение координаты X для точки на Polygon.

Y -> (число с плавающей точкой)

Значение координаты Y для точки на Polygon.

Id -> (строка)

Идентификатор распознанного текста. Идентификатор уникален только для одной операции.

Relationships -> (список)

Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, блок типа LINE содержит тип отношения CHILD со блоками WORD, составляющими строку текста. Объектов Relationships в списке нет для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.

(структура)

Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке Relationships. Дополнительную информацию см. в разделе Блок.

Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.

Type -> (строка)

Тип отношения между блоками в массиве ID и текущим блоком. В следующем списке описаны типы отношений, которые могут быть возвращены.

  • VALUE - Список, содержащий ID блока VALUE, связанного с ключом пары «ключ-значение».
  • CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего блока. Например, блоки WORD имеют отношение CHILD к блоку типа LINE.
  • MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
  • ANSWER - Список, содержащий ID блока QUERY_RESULT, связанного с соответствующим блоком QUERY.
  • TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
  • TABLE_TITLE - Список, содержащий ID блока типа TABLE_TITLE в таблице.
  • TABLE_FOOTER - Список идентификаторов, определяющих блоки типа TABLE_FOOTER в таблице.

Ids -> (список)

Массив идентификаторов связанных блоков. Вы можете получить тип отношения из элемента Type.

(строка)

EntityTypes -> (список)

Тип сущности.

Следующие типы сущностей могут быть возвращены анализом FORMS:

  • KEY - Идентификатор поля в документе.
  • VALUE - Текст поля.

Следующие типы сущностей могут быть возвращены анализом TABLES:

  • COLUMN_HEADER - Идентифицирует ячейку, которая является заголовком столбца.
  • TABLE_TITLE - Идентифицирует ячейку, которая является заголовком в таблице.
  • TABLE_SECTION_TITLE - Идентифицирует ячейку, которая является заголовком раздела в таблице. Заголовок раздела — это ячейка, которая обычно охватывает всю строку над разделом.
  • TABLE_FOOTER - Идентифицирует ячейку, которая является подвалом таблицы.
  • TABLE_SUMMARY - Идентифицирует ячейку сводки таблицы. Ячейка сводки может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
  • STRUCTURED_TABLE - Идентифицирует таблицу с заголовками столбцов, где содержимое каждой строки соответствует заголовкам.
  • SEMI_STRUCTURED_TABLE - Идентифицирует несвязанную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.

(строка)

SelectionStatus -> (строка)

Статус выбора элемента выбора, например, кнопки опции или флажка.

Page -> (целое число)

Страница, на которой был обнаружен блок. Page возвращается синхронными и асинхронными операциями. Значения страниц больше 1 возвращаются только для многостраничных документов в формате PDF или TIFF. Отсканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, считается одностраничным документом. Это означает, что для отсканированных изображений значение Page всегда равно 1.

Запрос -> (структура)

Текст -> (строка)

Вопрос, который Amazon Textract задаст документу. Например, «Какой номер социального страхования клиента?»

Псевдоним -> (строка)

Псевдоним, прикрепленный к запросу для удобства поиска.

Страницы -> (список)

Параметр Страницы позволяет пользователю указать, к каким страницам применить запрос. Ниже приведен список правил для использования этого параметра.

  • Если страница не указана, она устанавливается по умолчанию в значение ["1"].
  • В строке параметра разрешены следующие символы: 0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются.
  • При использовании * для указания всех страниц, это должен быть единственный элемент в списке.
  • Вы можете использовать интервалы страниц, такие как [“1-3”, “1-1”, “4-*”]. Где * обозначает последнюю страницу документа.
  • Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.

(строка)

DocumentMetadata -> (структура)

Информация об входном документе.

Страницы -> (целое число)

Количество страниц, обнаруженных в документе.

AnalyzeIDModelVersion -> (строка)

Версия API AnalyzeIdentity, используемая для обработки документов.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

END_OF_DOCUMENT_MARKER

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API