[ aws . comprehend ]
detect-entities
Описание
Обнаруживает именованные сущности в входном тексте при использовании предварительно обученной модели. Обнаруживает пользовательские сущности, если у вас есть модель распознавания пользовательских сущностей.
При обнаружении именованных сущностей с помощью предварительно обученной модели используйте обычный текст в качестве входных данных. Дополнительную информацию об именованных сущностях см. в разделе «Сущности» в руководстве разработчика Comprehend.
При использовании модели распознавания пользовательских сущностей вы можете ввести обычный текст или загрузить документ входных данных на одной странице (текст, PDF, Word или изображение).
Если система обнаруживает ошибки при обработке страницы в документе входных данных, ответ API включает запись в Errors для каждой ошибки.
Если система обнаруживает ошибку уровня документа в документе входных данных, API возвращает ошибку InvalidRequestException. Подробную информацию об этой ошибке см. в разделе «Ошибки в полуструктурированных документах» в руководстве разработчика Comprehend.
См. также: Документацию API AWS
Синтаксис
detect-entities
[--text <value>]
[--language-code <value>]
[--endpoint-arn <value>]
[--bytes <value>]
[--document-reader-config <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--text (строка)
Bytes.--language-code (строка)
Язык входных документов. Вы можете указать любой из основных языков, поддерживаемых Amazon Comprehend. Если ваш запрос включает конечную точку для модели распознавания пользовательских сущностей, Amazon Comprehend использует язык вашей пользовательской модели и игнорирует любой код языка, который вы указываете здесь.
Все входные документы должны быть на одном языке.
Возможные значения:
enesfrdeitptarhijakozhzh-TW
--endpoint-arn (строка)
Идентификатор ресурса Amazon для конечной точки, связанной с моделью распознавания пользовательских сущностей. Укажите конечную точку, если вы хотите обнаруживать сущности, используя собственную пользовательскую модель вместо модели по умолчанию, используемой Amazon Comprehend.
Если вы указываете конечную точку, Amazon Comprehend использует язык вашей пользовательской модели и игнорирует любой код языка, который вы предоставляете в запросе.
Дополнительную информацию о конечных точках см. в разделе Управление конечными точками.
--bytes (бинарные данные)
Это поле применяется только при использовании модели распознавания пользовательских сущностей, обученной с аннотациями PDF. В других случаях введите входной текст в поле Text.
Используйте параметр Bytes для ввода файла текста, PDF, Word или изображения. Использование текстового файла в параметре Bytes эквивалентно использованию параметра Text (поле Entities в ответе идентично).
Вы также можете использовать параметр Bytes для ввода файла вывода Amazon Textract DetectDocumentText или AnalyzeDocument.
Предоставьте входной документ как последовательность байтов, закодированных в base64. Если ваш код использует SDK Amazon Web Services для обнаружения сущностей, SDK может закодировать байты файла документа для вас.
Максимальная длина этого поля зависит от типа входного документа. Подробности см. в руководстве разработчика Comprehend в разделе Входные данные для анализа в реальном времени пользовательских данных.
Если вы используете параметр Bytes, не используйте параметр Text.
--document-reader-config (структура)
Предоставляет параметры конфигурации для переопределения действий по умолчанию для извлечения текста из PDF-документов и файлов изображений.
DocumentReadAction -> (строка)
Это поле определяет операцию API Amazon Textract, которую Amazon Comprehend использует для извлечения текста из PDF-файлов и файлов изображений. Введите одно из следующих значений:
-
TEXTRACT_DETECT_DOCUMENT_TEXT- Сервис Amazon Comprehend использует операцию APIDetectDocumentText. -
TEXTRACT_ANALYZE_DOCUMENT- Сервис Amazon Comprehend использует операцию APIAnalyzeDocument.
DocumentReadMode -> (строка)
Определяет действия по извлечению текста для PDF-файлов. Введите одно из следующих значений:
-
SERVICE_DEFAULT- используйте значения по умолчанию сервиса Amazon Comprehend для PDF-файлов. -
FORCE_DOCUMENT_READ_ACTION- Amazon Comprehend использует API Textract, указанный в DocumentReadAction, для всех PDF-файлов, включая цифровые PDF-файлы.
FeatureTypes -> (список)
Указывает тип функций Amazon Textract, которые нужно применить. Если вы выбрали TEXTRACT_ANALYZE_DOCUMENT в качестве действия чтения, вы должны указать одно или оба из следующих значений:
-
TABLES- Возвращает дополнительную информацию о любых таблицах, обнаруженных в документе входных данных. -
FORMS- Возвращает дополнительную информацию о любых формах, обнаруженных в документе входных данных.
(строка)
Укороченный синтаксис:
DocumentReadAction=string,DocumentReadMode=string,FeatureTypes=string,string
Синтаксис JSON:
{
"DocumentReadAction": "TEXTRACT_DETECT_DOCUMENT_TEXT"|"TEXTRACT_ANALYZE_DOCUMENT",
"DocumentReadMode": "SERVICE_DEFAULT"|"FORCE_DOCUMENT_READ_ACTION",
"FeatureTypes": ["TABLES"|"FORMS", ...]
}
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставленному --generate-cli-skeleton. Если другие аргументы предоставлены в командной строке, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные бинарные значения с помощью значения, предоставленного в JSON, так как строка будет взята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса в API. Если предоставлено значение по умолчанию или input, выводится пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, будет выведен пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он проверяет входные данные команд и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не является стабильным между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладку регистрации.
--endpoint-url (строка)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит SSL-сертификаты. Этот параметр переопределяет поведение проверки SSL-сертификатов по умолчанию.
--no-paginate (логическое значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования для вывода команды.
- json
- text
- table
- yaml
- yaml-stream
--query (строка)
Запрос JMESPath для использования при фильтрации данных ответа.
--profile (строка)
Использовать определённый профиль из файла с вашими учетными данными.
--region (строка)
Использовать указанный регион. Переопределяет настройки конфигурации/окружения.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить цветной вывод.
- on
- off
- auto
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл с пакетом сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/окружения.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, который будет использоваться для бинарных блобов. Формат по умолчанию — base64. Формат base64 ожидает, что бинарные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и бинарные значения должны быть переданы буквально. При предоставлении содержимого из файла, отображающего бинарный блок, fileb:// всегда будет обрабатываться как бинарный и использовать содержимое файла непосредственно независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить пагинатор CLI для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать параметры входных данных CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическое запросы параметров входных данных CLI.
Примеры
Примечание
Для использования следующих примеров вам необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы с AWS CLI в руководстве пользователя AWS CLI.
Если не указано иное, все примеры имеют правила цитирования, характерные для Unix. Эти примеры необходимо адаптировать к правилам цитирования вашей оболочки терминала. См. использование кавычек со строками в руководстве пользователя AWS CLI.
Для обнаружения именованных сущностей в входном тексте
Следующий пример detect-entities анализирует входной текст и возвращает именованные сущности. Баллы уверенности предварительно обученной модели также выводятся для каждого предсказания.
aws comprehend detect-entities \
--language-code en \
--text "Hello Zhang Wei, I am John. Your AnyCompany Financial Services, LLC credit card \
account 1111-XXXX-1111-XXXX has a minimum payment of $24.53 that is due by July 31st. Based on your autopay settings, \
we will withdraw your payment on the due date from your bank account number XXXXXX1111 with the routing number XXXXX0000. \
Customer feedback for Sunshine Spa, 123 Main St, Anywhere. Send comments to Alice at AnySpa@example.com."
Вывод:
{
"Entities": [
{
"Score": 0.9994556307792664,
"Type": "PERSON",
"Text": "Zhang Wei",
"BeginOffset": 6,
"EndOffset": 15
},
{
"Score": 0.9981022477149963,
"Type": "PERSON",
"Text": "John",
"BeginOffset": 22,
"EndOffset": 26
},
{
"Score": 0.9986887574195862,
"Type": "ORGANIZATION",
"Text": "AnyCompany Financial Services, LLC",
"BeginOffset": 33,
"EndOffset": 67
},
{
"Score": 0.9959119558334351,
"Type": "OTHER",
"Text": "1111-XXXX-1111-XXXX",
"BeginOffset": 88,
"EndOffset": 107
},
{
"Score": 0.9708039164543152,
"Type": "QUANTITY",
"Text": ".53",
"BeginOffset": 133,
"EndOffset": 136
},
{
"Score": 0.9987268447875977,
"Type": "DATE",
"Text": "July 31st",
"BeginOffset": 152,
"EndOffset": 161
},
{
"Score": 0.9858865737915039,
"Type": "OTHER",
"Text": "XXXXXX1111",
"BeginOffset": 271,
"EndOffset": 281
},
{
"Score": 0.9700471758842468,
"Type": "OTHER",
"Text": "XXXXX0000",
"BeginOffset": 306,
"EndOffset": 315
},
{
"Score": 0.9591118693351746,
"Type": "ORGANIZATION",
"Text": "Sunshine Spa",
"BeginOffset": 340,
"EndOffset": 352
},
{
"Score": 0.9797496795654297,
"Type": "LOCATION",
"Text": "123 Main St",
"BeginOffset": 354,
"EndOffset": 365
},
{
"Score": 0.994929313659668,
"Type": "PERSON",
"Text": "Alice",
"BeginOffset": 394,
"EndOffset": 399
},
{
"Score": 0.9949769377708435,
"Type": "OTHER",
"Text": "AnySpa@example.com",
"BeginOffset": 403,
"EndOffset": 418
}
]
}
Дополнительную информацию см. в разделе «Сущности» в руководстве разработчика Amazon Comprehend.
Вывод
Сущности -> (список)
Коллекция сущностей, идентифицированных в входном тексте. Для каждой сущности ответ содержит текст сущности, тип сущности, начальную и конечную позиции текста сущности в исходном тексте и уровень уверенности Amazon Comprehend в обнаружении.
Если ваш запрос использует пользовательскую модель распознавания сущностей, Amazon Comprehend обнаруживает сущности, которые модель обучена распознавать. В противном случае она обнаруживает стандартные типы сущностей. Список стандартных типов сущностей см. в руководстве разработчика Comprehend в разделе «Сущности».
(структура)
Предоставляет информацию о сущности.
Степень уверенности -> (вещественное число)
Тип -> (строка)
Тип сущности. Для обнаружения сущностей с помощью встроенной модели это поле содержит один из стандартных типов сущностей, перечисленных ниже.
Для пользовательского обнаружения сущностей это поле содержит один из типов сущностей, которые вы указали при обучении вашей пользовательской модели.
Текст -> (строка)
Начальный смещение -> (целое число)
Смещение от начала исходного текста до первого символа сущности (нумерация с нуля).
Это поле пусто для нетекстовых входных данных.
Конечное смещение -> (целое число)
Смещение от начала исходного текста до последнего символа сущности (нумерация с нуля).
Это поле пусто для нетекстовых входных данных.
Ссылки на блоки -> (список)
Ссылка на каждый блок для данной сущности. Это поле пусто для входных данных в формате простого текста.
(структура)
Ссылка на блок.
Идентификатор блока -> (строка)
Начальное смещение -> (целое число)
Конечное смещение -> (целое число)
Дочерние блоки -> (список)
Список дочерних блоков внутри этого блока.
(структура)
Вложенный блок внутри блока.
Идентификатор дочернего блока -> (строка)
Начальное смещение -> (целое число)
Конечное смещение -> (целое число)
Метаданные документа -> (структура)
Информация о документе, полученная во время извлечения текста. Это поле присутствует в ответе только если в вашем запросе использовался параметр Byte.
Страницы -> (целое число)
Извлеченные символы -> (список)
Список страниц в документе с количеством извлеченных символов с каждой страницы.
(структура)
Массив количества извлеченных символов с каждой страницы.
Номер страницы -> (целое число)
Количество -> (целое число)
Тип документа -> (список)
Тип документа для каждой страницы в входном документе. Это поле присутствует в ответе только если в вашем запросе использовался параметр Byte.
(структура)
Тип документа для каждой страницы в документе.
Номер страницы -> (целое число)
Тип -> (строка)
Блоки -> (список)
Информация о каждом текстовом блоке в входном документе. Блоки вложены. Блок страницы содержит блок для каждой строки текста, который содержит блок для каждого слова.
Block содержимое для входного документа в формате «Слово» не включает поле Geometry.
Поле Block не присутствует в ответе для входных данных в формате простого текста.
(структура)
Информация о каждом слове или строке текста в входном документе.
Дополнительную информацию см. в разделе «Блок» в справке по API Amazon Textract.
Идентификатор -> (строка)
Тип блока -> (строка)
Блок представляет строку текста или одно слово.
- СЛОВО - слово, обнаруженное на странице документа. Слово состоит из одного или нескольких символов базовой латинской письменности, не разделенных пробелами.
- СТРОКА - строка табулированных, смежных слов, обнаруженных на странице документа
Текст -> (строка)
Номер страницы -> (целое число)
Геометрия -> (структура)
Координаты прямоугольника или многоугольника, содержащего текст.
Прямоугольник -> (структура)
Осесимметричное грубое представление расположения распознанного элемента на странице документа.
Высота -> (вещественное число)
Левый край -> (вещественное число)
Верхний край -> (вещественное число)
Ширина -> (вещественное число)
Многоугольник -> (список)
Внутри прямоугольника, более подробный многоугольник вокруг распознанного элемента.
(структура)
Координаты X и Y точки на странице документа.
Дополнительную информацию см. в разделе «Точка» в справке по API Amazon Textract.
X -> (вещественное число)
Y -> (вещественное число)
Связи -> (список)
Список дочерних блоков текущего блока. Например, объект СТРОКА имеет дочерние блоки для каждого блока СЛОВО, являющегося частью строки текста.
(структура)
Список дочерних блоков для текущего блока.
Идентификаторы -> (список)
Идентификаторы дочерних блоков.
(строка)
Тип -> (строка)
Ошибки -> (список)
Ошибки на уровне страницы, обнаруженные системой при обработке входного документа. Поле пусто, если системой не было обнаружено ошибок.
(структура)
При извлечении текста система обнаружила одну или несколько ошибок на уровне страницы в входном документе.
Поле ErrorCode содержит одно из следующих значений:
- TEXTRACT_BAD_PAGE - Amazon Textract не может прочитать страницу. Дополнительную информацию о ограничениях по страницам в Amazon Textract см. в разделе «Лимиты на страницы в Amazon Textract».
- TEXTRACT_PROVISIONED_THROUGHPUT_EXCEEDED - Количество запросов превысило ваш лимит пропускной способности. Дополнительную информацию о ограничениях пропускной способности в Amazon Textract см. в разделе «Значения по умолчанию для лимитов в Amazon Textract».
- PAGE_CHARACTERS_EXCEEDED - Слишком много символов на странице (максимум 10 000 символов).
- PAGE_SIZE_EXCEEDED - Максимальный размер страницы составляет 10 МБ.
- INTERNAL_SERVER_ERROR - Запрос столкнулся с проблемой сервера. Повторите запрос API.
Номер страницы -> (целое число)
Код ошибки -> (строка)
Сообщение об ошибке -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.