Spec-Zone.ru › AWS CLI v2

[ aws . textract ]

detect-document-text

Описание

Обнаруживает текст в входном документе. Amazon Textract может обнаруживать строки текста и слова, составляющие строку текста. Входной документ должен быть в одном из следующих форматов изображений: JPEG, PNG, PDF или TIFF. DetectDocumentText возвращает обнаруженный текст в массиве объектов Block.

Каждая страница документа имеет связанный Block типа PAGE. Каждый PAGE Block объект является родителем объектов LINE Block, которые представляют строки обнаруженного текста на странице. Объект LINE Block является родителем каждого слова, составляющего строку. Слова представлены объектами Block типа WORD.

DetectDocumentText — это синхронная операция. Для анализа документов асинхронно используйте StartDocumentTextDetection.

Дополнительную информацию см. в разделе Обнаружение текста в документах.

См. также: Документация API AWS

Синтаксис

  detect-document-text
--document <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--document (структура)

Входной документ в виде закодированных в base64 байтов или объекта Amazon S3. Если вы используете AWS CLI для вызова операций Amazon Textract, вы не можете передать байты изображения. Документ должен быть изображением в формате JPEG или PNG.

Если вы используете AWS SDK для вызова операций Amazon Textract, вам, возможно, не нужно кодировать байты изображения в base64, которые передаются с помощью поля Bytes.

Bytes -> (blob)

Блоб закодированных в base64 байтов документа. Максимальный размер документа, предоставленного в блобе байтов, составляет 5 МБ. Байты документа должны быть в формате PNG или JPEG.

Если вы используете AWS SDK для вызова Amazon Textract, вам, возможно, не нужно кодировать байты изображения в base64, которые передаются с помощью поля Bytes.

S3Object -> (структура)

Идентифицирует объект S3 в качестве источника документа. Максимальный размер документа, хранящегося в ведре S3, составляет 5 МБ.

Bucket -> (строка)

Имя ведра S3. Обратите внимание, что символ # недопустим в имени файла.

Name -> (строка)

Имя файла входного документа. Синхронные операции могут использовать файлы изображений в формате JPEG или PNG. Асинхронные операции также поддерживают файлы в формате PDF и TIFF.

Version -> (строка)

Если для ведра включена функция управления версиями, вы можете указать версию объекта.

Сокращенный синтаксис:

Bytes=blob,S3Object={Bucket=string,Name=string,Version=string}

Синтаксис JSON:

{
  "Bytes": blob,
  "S3Object": {
    "Bucket": "string",
    "Name": "string",
    "Version": "string"
  }
}

--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставляемому --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределят значения, полученные из JSON. Невозможно передать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет взята буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит каркас JSON в стандартный вывод без отправки запроса API. Если предоставлено значение без значения или со значением input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, оно выведет пример входного YAML, который можно использовать с --cli-input-yaml. При предоставлении значения output, оно проверит входные данные команды и вернет пример выходного JSON для этой команды. Сгенерированный каркас JSON не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном каркасе JSON.

Глобальные параметры

--debug (логическое значение)

Включить отладку.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (логическое значение)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого подключения SSL AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет поведение проверки сертификатов SSL по умолчанию.

--no-paginate (логическое значение)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI сделает только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования выходных данных команды.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет параметры конфигурации/среды.

--version (строка)

Показать версию этого инструмента.

--color (строка)

Включить/отключить цветной вывод.

  • on
  • off
  • auto

--no-sign-request (логическое значение)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.

--ca-bundle (строка)

Файл с сертификатом CA для проверки сертификатов SSL. Переопределяет параметры конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, используемый для двоичных блобов. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блобы будут предоставлены как закодированная строка base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны быть переданы буквально. При предоставлении содержимого из файла, сопоставляемого с двоичным блобом fileb://, всегда будет обрабатываться как двоичный и будет использовать содержимое файла напрямую независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного параметра cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (логическое значение)

Отключить пагинатор cli для вывода.

--cli-auto-prompt (логическое значение)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (логическое значение)

Отключить автоматическое запросы параметров ввода CLI.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы в справочном руководстве AWS CLI.

Если не указано иное, все примеры используют правила цитирования, похожие на unix-подобные. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной оболочки. См. Использование кавычек со строками в справочном руководстве AWS CLI.

Для обнаружения текста в документе

Следующее detect-document-text Следующий пример демонстрирует, как обнаружить текст в документе.

Linux/macOS:

aws textract detect-document-text \
    --document '{"S3Object":{"Bucket":"bucket","Name":"document"}}'

Windows:

aws textract detect-document-text \
    --document "{\"S3Object\":{\"Bucket\":\"bucket\",\"Name\":\"document\"}}" \
    --region region-name

Вывод:

{
    "Blocks": [
        {
            "Geometry": {
                "BoundingBox": {
                    "Width": 1.0,
                    "Top": 0.0,
                    "Left": 0.0,
                    "Height": 1.0
                },
                "Polygon": [
                    {
                        "Y": 0.0,
                        "X": 0.0
                    },
                    {
                        "Y": 0.0,
                        "X": 1.0
                    },
                    {
                        "Y": 1.0,
                        "X": 1.0
                    },
                    {
                        "Y": 1.0,
                        "X": 0.0
                    }
                ]
            },
            "Relationships": [
                {
                    "Type": "CHILD",
                    "Ids": [
                        "896a9f10-9e70-4412-81ce-49ead73ed881",
                        "0da18623-dc4c-463d-a3d1-9ac050e9e720",
                        "167338d7-d38c-4760-91f1-79a8ec457bb2"
                    ]
                }
            ],
            "BlockType": "PAGE",
            "Id": "21f0535e-60d5-4bc7-adf2-c05dd851fa25"
        },
        {
            "Relationships": [
                {
                    "Type": "CHILD",
                    "Ids": [
                        "62490c26-37ea-49fa-8034-7a9ff9369c9c",
                        "1e4f3f21-05bd-4da9-ba10-15d01e66604c"
                    ]
                }
            ],
            "Confidence": 89.11581420898438,
            "Geometry": {
                "BoundingBox": {
                    "Width": 0.33642634749412537,
                    "Top": 0.17169663310050964,
                    "Left": 0.13885067403316498,
                    "Height": 0.49159330129623413
                },
                "Polygon": [
                    {
                        "Y": 0.17169663310050964,
                        "X": 0.13885067403316498
                    },
                    {
                        "Y": 0.17169663310050964,
                        "X": 0.47527703642845154
                    },
                    {
                        "Y": 0.6632899641990662,
                        "X": 0.47527703642845154
                    },
                    {
                        "Y": 0.6632899641990662,
                        "X": 0.13885067403316498
                    }
                ]
            },
            "Text": "He llo,",
            "BlockType": "LINE",
            "Id": "896a9f10-9e70-4412-81ce-49ead73ed881"
        },
        {
            "Relationships": [
                {
                    "Type": "CHILD",
                    "Ids": [
                        "19b28058-9516-4352-b929-64d7cef29daf"
                    ]
                }
            ],
            "Confidence": 85.5694351196289,
            "Geometry": {
                "BoundingBox": {
                    "Width": 0.33182239532470703,
                    "Top": 0.23131252825260162,
                    "Left": 0.5091826915740967,
                    "Height": 0.3766750991344452
                },
                "Polygon": [
                    {
                        "Y": 0.23131252825260162,
                        "X": 0.5091826915740967
                    },
                    {
                        "Y": 0.23131252825260162,
                        "X": 0.8410050868988037
                    },
                    {
                        "Y": 0.607987642288208,
                        "X": 0.8410050868988037
                    },
                    {
                        "Y": 0.607987642288208,
                        "X": 0.5091826915740967
                    }
                ]
            },
            "Text": "worlc",
            "BlockType": "LINE",
            "Id": "0da18623-dc4c-463d-a3d1-9ac050e9e720"
        }
    ],
    "DocumentMetadata": {
        "Pages": 1
    }
}

Дополнительную информацию см. в разделе Обнаружение текста документа с помощью Amazon Textract в Руководстве разработчика Amazon Textract

Вывод

DocumentMetadata -> (структура)

Метаданные о документе. Содержит количество страниц, обнаруженных в документе.

Pages -> (целое число)

Количество страниц, обнаруженных в документе.

Blocks -> (список)

Массив объектов Block, содержащих текст, обнаруженный в документе.

(структура)

Объект Block представляет элементы, распознанные в документе в группе пикселей, близких друг к другу. Информация, возвращаемая в объекте Block, зависит от типа операции. При обнаружении текста в документах (например, DetectDocumentText) вы получаете информацию о найденных словах и строках текста. При анализе текста (например, AnalyzeDocument) вы также можете получить информацию о найденных полях, таблицах и элементах выбора в документе.

Массив объектов Block возвращается как синхронными, так и асинхронными операциями. В синхронных операциях, таких как DetectDocumentText, массив объектов Block содержит весь набор результатов. В асинхронных операциях, таких как GetDocumentAnalysis, массив возвращается в одном или нескольких ответах.

Дополнительную информацию см. в разделе Как работает Amazon Textract.

BlockType -> (строка)

Тип распознанного элемента текста. В операциях обнаружения текста возвращаются следующие типы:

  • PAGE - Содержит список объектов LINE Block, обнаруженных на странице документа.
  • WORD - Обнаруженное слово на странице документа. Слово — это одна или несколько букв базовой латинской письменности ISO, которые не разделены пробелами.
  • LINE - Строка табулированных, непрерывных слов, обнаруженных на странице документа.

В операциях анализа текста возвращаются следующие типы:

  • PAGE - Содержит список дочерних объектов Block, обнаруженных на странице документа.
  • KEY_VALUE_SET - Хранит объекты KEY и VALUE Block для связанного текста, обнаруженного на странице документа. Используйте поле EntityType, чтобы определить, является ли объект KEY_VALUE_SET объектом KEY Block или объектом VALUE Block.
  • WORD - Обнаруженное слово на странице документа. Слово — это одна или несколько букв базовой латинской письменности ISO, которые не разделены пробелами.
  • LINE - Строка табулированных, непрерывных слов, обнаруженных на странице документа.
  • TABLE - Таблица, обнаруженная на странице документа. Таблица — это информация на основе сетки с двумя или более строками или столбцами, с размахом ячейки по одной строке и одному столбцу.
  • TABLE_TITLE - Заголовок таблицы. Заголовок обычно представляет собой строку текста над или под таблицей или вставлен в первую строку таблицы.
  • TABLE_FOOTER - Подпись, связанная с таблицей. Подпись обычно представляет собой строку или строки текста под таблицей или вставлена в последнюю строку таблицы.
  • CELL - Ячейка в обнаруженной таблице. Ячейка является родителем блока, содержащего текст в ячейке.
  • MERGED_CELL - Ячейка в таблице, содержимое которой охватывает более одной строки или столбца. Массив Relationships для этой ячейки содержит данные из отдельных ячеек.
  • SELECTION_ELEMENT - Элемент выбора, такой как кнопка выбора (радиокнопка) или флажок, обнаруженный на странице документа. Используйте значение SelectionStatus для определения состояния элемента выбора.
  • SIGNATURE - Местоположение и оценка уверенности подписи, обнаруженной на странице документа. Может возвращаться как часть пары ключ-значение или обнаруженной ячейки.
  • QUERY - Вопрос, заданный во время вызова AnalyzeDocument. Содержит псевдоним и идентификатор, связывающий его с ответом.
  • QUERY_RESULT - Ответ на вопрос, заданный во время вызова analyze document. Имеет псевдоним и идентификатор для удобства поиска в ответе. Также содержит местоположение и оценку уверенности.

Следующие типы BlockTypes возвращаются только для Amazon Textract Layout.

  • LAYOUT_TITLE - Основной заголовок документа.
  • LAYOUT_HEADER - Текст, расположенный в верхнем отступе документа.
  • LAYOUT_FOOTER - Текст, расположенный в нижнем отступе документа.
  • LAYOUT_SECTION_HEADER - Заголовки разделов в документе.
  • LAYOUT_PAGE_NUMBER - Номер страницы документов.
  • LAYOUT_LIST - Любая информация, сгруппированная в виде списка.
  • LAYOUT_FIGURE - Указывает местоположение изображения в документе.
  • LAYOUT_TABLE - Указывает местоположение таблицы в документе.
  • LAYOUT_KEY_VALUE - Указывает местоположение значений ключей формы в документе.
  • LAYOUT_TEXT - Текст, который обычно присутствует в качестве части абзацев в документах.

Confidence -> (вещественное число)

Оценка уверенности Amazon Textract в точности распознанного текста и точности геометрических точек вокруг распознанного текста.

Text -> (строка)

Слово или строка текста, распознанные Amazon Textract.

TextType -> (строка)

Тип текста, обнаруженный Amazon Textract. Можно проверить рукописный и печатный текст.

RowIndex -> (целое число)

Строка, в которой расположена ячейка таблицы. Позиция первой строки — 1. RowIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnIndex -> (целое число)

Столбец, в котором расположена ячейка таблицы. Позиция первого столбца — 1. ColumnIndex не возвращается DetectDocumentText и GetDocumentTextDetection.

RowSpan -> (целое число)

Количество строк, охватываемых ячейкой таблицы. RowSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

ColumnSpan -> (целое число)

Количество столбцов, охватываемых ячейкой таблицы. ColumnSpan не возвращается DetectDocumentText и GetDocumentTextDetection.

Geometry -> (структура)

Расположение распознанного текста на изображении. Он включает осью-выровненный грубый прямоугольник, который окружает текст, и более точную полилинию для более точной пространственной информации.

BoundingBox -> (структура)

Осью-выровненное грубое представление расположения распознанного элемента на странице документа.

Width -> (вещественное число)

Ширина прямоугольника в качестве отношения к общей ширине страницы документа.

Height -> (вещественное число)

Высота прямоугольника в качестве отношения к общей высоте страницы документа.

Left -> (вещественное число)

Левая координата прямоугольника как отношение к общей ширине страницы документа.

Top -> (вещественное число)

Верхняя координата прямоугольника как отношение к общей высоте страницы документа.

Polygon -> (список)

Внутри прямоугольника, детальная полилиния вокруг распознанного элемента.

(структура)

Координаты X и Y точки на странице документа. Значения X и Y, возвращаемые, представляют собой отношения к общему размеру страницы документа. Например, если входной документ имеет размер 700 x 200, а операция возвращает X = 0,5 и Y = 0,25, то точка расположена в пиксельной координате (350, 50) на странице документа.

Массив объектов Point, Polygon, возвращается функцией DetectDocumentText. Polygon представляет детальную полилинию вокруг распознанного текста. Дополнительную информацию см. в разделе Геометрия в руководстве разработчика Amazon Textract.

X -> (вещественное число)

Значение координаты X для точки на Polygon.

Y -> (вещественное число)

Значение координаты Y для точки на Polygon.

Id -> (строка)

Идентификатор распознанного текста. Идентификатор уникален только для одной операции.

Relationships -> (список)

Список объектов отношений, описывающих, как блоки связаны друг с другом. Например, блок LINE содержит тип отношения CHILD со блоками WORD, составляющими строку текста. В списке нет объектов Relationships для отношений, которые не существуют, например, когда у текущего блока нет дочерних блоков.

(структура)

Информация о том, как блоки связаны друг с другом. Объект Block содержит 0 или более объектов Relation в списке Relationships. Дополнительную информацию см. в разделе Блок.

Элемент Type предоставляет тип отношения для всех блоков в массиве IDs.

Type -> (строка)

Тип отношения между блоками в массиве ID и текущим блоком. Следующий список описывает типы отношений, которые могут быть возвращены.

  • VALUE - Список, содержащий идентификатор блока VALUE, связанного с ключом пары ключ-значение.
  • CHILD - Список идентификаторов, определяющих блоки, найденные внутри текущего объекта блока. Например, блоки WORD имеют отношение CHILD к типу блока LINE.
  • MERGED_CELL - Список идентификаторов, определяющих каждый из блоков типа MERGED_CELL в таблице.
  • ANSWER - Список, содержащий идентификатор блока QUERY_RESULT, связанный с соответствующим блоком QUERY.
  • TABLE - Список идентификаторов, определяющих связанные блоки типа TABLE.
  • TABLE_TITLE - Список, содержащий идентификатор типа блока TABLE_TITLE в таблице.
  • TABLE_FOOTER - Список идентификаторов, определяющих типы блоков TABLE_FOOTER в таблице.

Ids -> (список)

Массив идентификаторов связанных блоков. Тип отношения можно получить из элемента Type.

(строка)

EntityTypes -> (список)

Тип сущности.

Следующие типы сущностей могут быть возвращены анализом FORMS:

  • KEY - Идентификатор поля в документе.
  • VALUE - Текст поля.

Следующие типы сущностей могут быть возвращены анализом TABLES:

  • COLUMN_HEADER - Определяет ячейку, которая является заголовком столбца.
  • TABLE_TITLE - Определяет ячейку, которая является заголовком в таблице.
  • TABLE_SECTION_TITLE - Определяет ячейку, которая является заголовком раздела в таблице. Заголовок раздела — это ячейка, которая обычно занимает всю строку над разделом.
  • TABLE_FOOTER - Определяет ячейку, которая является подписью таблицы.
  • TABLE_SUMMARY - Определяет сводную ячейку таблицы. Сводная ячейка может быть строкой таблицы или дополнительной, меньшей таблицей, содержащей сводную информацию для другой таблицы.
  • STRUCTURED_TABLE - Определяет таблицу с заголовками столбцов, где содержимое каждой строки соответствует заголовкам.
  • SEMI_STRUCTURED_TABLE - Определяет неструктурированную таблицу.
EntityTypes не возвращается DetectDocumentText и GetDocumentTextDetection.

(строка)

SelectionStatus -> (строка)

Состояние выбора элемента выбора, такого как кнопка выбора или флажок.

Page -> (целое число)

Страница, на которой был обнаружен блок. Page возвращается синхронными и асинхронными операциями. Значения страниц, большие чем 1, возвращаются только для документов с несколькими страницами в формате PDF или TIFF. Сканированное изображение (JPEG/PNG), предоставленное асинхронной операции, даже если оно содержит несколько страниц документа, рассматривается как одностраничный документ. Это означает, что для сканированных изображений значение Page всегда равно 1.

Query -> (структура)

Text -> (строка)

Вопрос, который Amazon Textract применит к документу. Например, «Какой номер социального страхования клиента?»

Alias -> (строка)

Псевдоним, прикреплённый к запросу, для удобства поиска.

Pages -> (список)

Параметр Pages позволяет пользователю указать, к каким страницам применить запрос. Ниже приведён список правил использования этого параметра.

  • Если страница не указана, по умолчанию она устанавливается в значение ["1"].
  • В строке параметра допускаются следующие символы: 0 1 2 3 4 5 6 7 8 9 - *. Пробелы не допускаются.
  • При использовании * для обозначения всех страниц, это должен быть единственный элемент в списке.
  • Можно использовать интервалы страниц, такие как [“1-3”, “1-1”, “4-*”]. Где * обозначает последнюю страницу документа.
  • Указанные страницы должны быть больше 0 и меньше или равны количеству страниц в документе.

(строка)

DetectDocumentTextModelVersion -> (строка)

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API