[ aws . rekognition ]
detect-text
Описание
Обнаруживает текст на входящем изображении и преобразует его в машиночитаемый текст.
Передайте входящее изображение в виде закодированных в base64 байтов изображения или ссылку на изображение в ведре Amazon S3. Если вы используете AWS CLI для вызова операций Amazon Rekognition, вы должны передать ссылку на изображение в ведре Amazon S3. Для AWS CLI передача байтов изображения не поддерживается. Изображение должно быть в формате .png или .jpeg.
Операция DetectText возвращает текст в массиве элементов TextDetection, TextDetections. Каждый TextDetection элемент предоставляет информацию об одном слове или строке текста, обнаруженных на изображении.
Слово — это одна или несколько букв сценария, которые не разделены пробелами. DetectText может обнаружить до 100 слов на изображении.
Строка — это строка равноотстоящих слов. Строка не обязательно должна быть полным предложением. Например, номер водительского удостоверения обнаруживается как строка. Строка заканчивается, когда после неё нет выровненного текста. Также строка заканчивается, когда есть большой пробел между словами по отношению к длине слов. Это означает, что в зависимости от пробела между словами, Amazon Rekognition может обнаружить несколько строк в тексте, выровненном в одном направлении. Точки не обозначают конец строки. Если предложение охватывает несколько строк, операция DetectText возвращает несколько строк.
Чтобы определить, является ли элемент TextDetection строкой текста или словом, используйте объект TextDetection поле Type.
Для обнаружения текст должен быть ориентирован в пределах +/- 90 градусов от горизонтальной оси.
Дополнительную информацию см. в руководстве разработчика Amazon Rekognition по обнаружению текста.
См. также: Документация API AWS
Синтаксис
detect-text
[--image <value>]
[--filters <value>]
[--image-bytes <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--image (структура)
Входное изображение в виде закодированных в base64 байтов или объекта Amazon S3. Если вы используете AWS CLI для вызова операций Amazon Rekognition, вы не можете передавать байты изображения.
Если вы используете AWS SDK для вызова операций Amazon Rekognition, вам может не потребоваться кодировать байты изображения в base64, передаваемые с помощью поля Bytes. Дополнительную информацию см. в руководстве разработчика Amazon Rekognition по изображениям.
Чтобы указать локальный файл, используйте --image-bytes вместо этого.
Байты -> (блок данных)
DetectCustomLabels, составляет 4 МБ.S3Object -> (структура)
Идентифицирует объект S3 как источник изображения.
Bucket -> (строка)
Name -> (строка)
Version -> (строка)
Сокращенный синтаксис:
Bytes=blob,S3Object={Bucket=string,Name=string,Version=string}
Синтаксис JSON:
{
"Bytes": blob,
"S3Object": {
"Bucket": "string",
"Name": "string",
"Version": "string"
}
}
--filters (структура)
Дополнительные параметры, которые позволяют задать критерии, которым должен соответствовать текст, чтобы быть включенным в ответ.
WordFilter -> (структура)
Набор параметров, которые позволяют фильтровать определенные результаты из возвращаемых результатов.
MinConfidence -> (число с плавающей точкой)
MinBoundingBoxHeight -> (число с плавающей точкой)
MinBoundingBoxWidth -> (число с плавающей точкой)
RegionsOfInterest -> (список)
Фильтр, фокусирующийся на определенной области изображения. Использует объект BoundingBox для задания области изображения.
(структура)
Указывает местоположение внутри кадра, которое Rekognition проверяет на объекты, представляющие интерес, такие как текст, метки или лица. Использует BoundingBox или Polygon для задания области экрана.
Слово, лицо или метка включаются в область, если они более чем наполовину находятся в этой области. Если есть более одной области, слово, лицо или метка сравниваются со всеми областями экрана. Любой объект, представляющий интерес, который более чем наполовину находится в области, сохраняется в результатах.
BoundingBox -> (структура)
Прямоугольник, представляющий область интереса на экране.
Width -> (число с плавающей точкой)
Height -> (число с плавающей точкой)
Left -> (число с плавающей точкой)
Top -> (число с плавающей точкой)
Polygon -> (список)
Указывает фигуру, состоящую из до 10 объектов Point для определения области интереса.
(структура)
Координаты X и Y точки на изображении или кадре видео. Значения X и Y являются отношениями к общему размеру изображения или разрешению видео. Например, если размер входного изображения 700x200, а значения X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на изображении.
Массив объектов Point образует Polygon. Polygon возвращается DetectText и DetectCustomLabels Polygon представляет собой детальный многоугольник вокруг обнаруженного элемента. Дополнительную информацию см. в руководстве разработчика Amazon Rekognition по геометрии.
X -> (число с плавающей точкой)
Polygon.Y -> (число с плавающей точкой)
Polygon.Синтаксис JSON:
{
"WordFilter": {
"MinConfidence": float,
"MinBoundingBoxHeight": float,
"MinBoundingBoxWidth": float
},
"RegionsOfInterest": [
{
"BoundingBox": {
"Width": float,
"Height": float,
"Left": float,
"Top": float
},
"Polygon": [
{
"X": float,
"Y": float
}
...
]
}
...
]
}
--image-bytes (блок данных)
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределят значения, предоставленные JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного JSON, так как строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или со значением input, выводит JSON-пример входных данных, который может использоваться в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, будет выведен пример входных данных YAML, который может использоваться с --cli-input-yaml. Если предоставлено значение output, оно проверяет входные данные команд и возвращает JSON-пример выходных данных для данной команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включить отладку регистрации.
--endpoint-url (строка)
Переопределить стандартный URL команды на предоставленный URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (булево)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команд.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/окружения.
--version (строка)
Показать версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- вкл
- выкл
- авто
--no-sign-request (булево)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл сертификата CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/окружения.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, используемый для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, отображающего двоичный блок, fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла непосредственно независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить кли-паджинатор для вывода.
--cli-auto-prompt (булево)
Автоматически запросить параметры входных данных CLI.
--no-cli-auto-prompt (булево)
Отключить автоматический запрос параметров входных данных CLI.
Примеры
Примечание
Чтобы использовать следующие примеры, необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы с AWS CLI.
Если не указано иное, все примеры используют правила цитирования для unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной оболочки. См. использование кавычек со строками в руководстве пользователя AWS CLI.
Обнаружение текста на изображении
Следующая команда detect-text обнаруживает текст на указанном изображении.
aws rekognition detect-text \
--image '{"S3Object":{"Bucket":"MyImageS3Bucket","Name":"ExamplePicture.jpg"}}'
Вывод:
{
"TextDetections": [
{
"Geometry": {
"BoundingBox": {
"Width": 0.24624845385551453,
"Top": 0.28288066387176514,
"Left": 0.391388863325119,
"Height": 0.022687450051307678
},
"Polygon": [
{
"Y": 0.28288066387176514,
"X": 0.391388863325119
},
{
"Y": 0.2826388478279114,
"X": 0.6376373171806335
},
{
"Y": 0.30532628297805786,
"X": 0.637677013874054
},
{
"Y": 0.305568128824234,
"X": 0.39142853021621704
}
]
},
"Confidence": 94.35709381103516,
"DetectedText": "ESTD 1882",
"Type": "LINE",
"Id": 0
},
{
"Geometry": {
"BoundingBox": {
"Width": 0.33933889865875244,
"Top": 0.32603850960731506,
"Left": 0.34534579515457153,
"Height": 0.07126858830451965
},
"Polygon": [
{
"Y": 0.32603850960731506,
"X": 0.34534579515457153
},
{
"Y": 0.32633158564567566,
"X": 0.684684693813324
},
{
"Y": 0.3976001739501953,
"X": 0.684575080871582
},
{
"Y": 0.3973070979118347,
"X": 0.345236212015152
}
]
},
"Confidence": 99.95779418945312,
"DetectedText": "BRAINS",
"Type": "LINE",
"Id": 1
},
{
"Confidence": 97.22098541259766,
"Geometry": {
"BoundingBox": {
"Width": 0.061079490929841995,
"Top": 0.2843210697174072,
"Left": 0.391391396522522,
"Height": 0.021029088646173477
},
"Polygon": [
{
"Y": 0.2843210697174072,
"X": 0.391391396522522
},
{
"Y": 0.2828207015991211,
"X": 0.4524524509906769
},
{
"Y": 0.3038259446620941,
"X": 0.4534534513950348
},
{
"Y": 0.30532634258270264,
"X": 0.3923923969268799
}
]
},
"DetectedText": "ESTD",
"ParentId": 0,
"Type": "WORD",
"Id": 2
},
{
"Confidence": 91.49320983886719,
"Geometry": {
"BoundingBox": {
"Width": 0.07007007300853729,
"Top": 0.2828207015991211,
"Left": 0.5675675868988037,
"Height": 0.02250562608242035
},
"Polygon": [
{
"Y": 0.2828207015991211,
"X": 0.5675675868988037
},
{
"Y": 0.2828207015991211,
"X": 0.6376376152038574
},
{
"Y": 0.30532634258270264,
"X": 0.6376376152038574
},
{
"Y": 0.30532634258270264,
"X": 0.5675675868988037
}
]
},
"DetectedText": "1882",
"ParentId": 0,
"Type": "WORD",
"Id": 3
},
{
"Confidence": 99.95779418945312,
"Geometry": {
"BoundingBox": {
"Width": 0.33933934569358826,
"Top": 0.32633158564567566,
"Left": 0.3453453481197357,
"Height": 0.07127484679222107
},
"Polygon": [
{
"Y": 0.32633158564567566,
"X": 0.3453453481197357
},
{
"Y": 0.32633158564567566,
"X": 0.684684693813324
},
{
"Y": 0.39759939908981323,
"X": 0.6836836934089661
},
{
"Y": 0.39684921503067017,
"X": 0.3453453481197357
}
]
},
"DetectedText": "BRAINS",
"ParentId": 1,
"Type": "WORD",
"Id": 4
}
]
}
Вывод
TextDetections -> (список)
Массив текста, обнаруженного на входном изображении.
(структура)
Информация о слове или строке текста, обнаруженном методом DetectText.
Поле DetectedText содержит текст, обнаруженный Amazon Rekognition на изображении.
Каждое слово и строка имеют идентификатор (Id). Каждое слово принадлежит строке и имеет родительский идентификатор (ParentId), который идентифицирует строку текста, в которой появляется слово. Слово Id также является индексом для слова в строке слов.
Дополнительную информацию см. в руководстве разработчика Amazon Rekognition по обнаружению текста.
DetectedText -> (строка)
Тип -> (строка)
Id -> (целое число)
DetectText.ParentId -> (целое число)
ID. Если тип обнаруженного текста - LINE, значение ParentId равно Null.Confidence -> (вещественное число)
Geometry -> (структура)
Расположение обнаруженного текста на изображении. Включает ось, выровненную грубую границу, окружающую текст, и полигон для более точной пространственной информации.
BoundingBox -> (структура)
Ось, выровненное грубое представление расположения обнаруженного элемента на изображении.
Ширина -> (вещественное число)
Высота -> (вещественное число)
Левый край -> (вещественное число)
Верхний край -> (вещественное число)
Polygon -> (список)
Внутри ограничивающей рамки, тонко настроенный полигон вокруг обнаруженного элемента.
(структура)
Координаты X и Y точки на изображении или кадре видео. Значения X и Y являются отношениями к общему размеру изображения или разрешению видео. Например, если входное изображение имеет размер 700x200, и значения равны X=0,5 и Y=0,25, то точка находится в пиксельной координате (350,50) на изображении.
Массив объектов Point образует Polygon. Polygon возвращается методами DetectText и DetectCustomLabels Polygon представляет собой тонко настроенный полигон вокруг обнаруженного элемента. Дополнительную информацию см. в разделе «Геометрия» в руководстве разработчика Amazon Rekognition.
X -> (вещественное число)
Polygon.Y -> (вещественное число)
Polygon.TextModelVersion -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.