[ aws . comprehend ]
batch-detect-syntax
Описание
Проверяет текст пакета документов на синтаксис и часть речи слов в документе и возвращает информацию о них. Дополнительную информацию см. в разделе Синтаксис в руководстве разработчика Comprehend.
См. также: Документация API AWS
Синтаксис
batch-detect-syntax
--text-list <value>
--language-code <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--text-list (список)
Список, содержащий текст входных документов в кодировке UTF-8. Список может содержать не более 25 документов. Максимальный размер каждого документа составляет 5 КБ.
(строка)
Синтаксис:
"string" "string" ...
--language-code (строка)
Язык входных документов. Вы можете указать любой из следующих языков, поддерживаемых Amazon Comprehend: немецкий («de»), английский («en»), испанский («es»), французский («fr»), итальянский («it») или португальский («pt»). Все документы должны быть на одном языке.
Возможные значения:
enesfrdeitpt
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставленному --generate-cli-skeleton. Если другие аргументы указаны в командной строке, эти значения переопределят значения, предоставленные через JSON. Передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, невозможно, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод, не отправляя запрос к API. При отсутствии значения или при значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при значении yaml-input выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверит входные данные команды и вернет пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (булево)
Включить отладку.
--endpoint-url (строка)
Переопределить URL по умолчанию команды указанным URL.
--no-verify-ssl (булево)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (булево)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования выходных данных команды.
- json
- text
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию этого инструмента.
--color (строка)
Включить/выключить вывод цвета.
- вкл
- выкл
- авто
--no-sign-request (булево)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.
--ca-bundle (строка)
Файл с набором сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь тайм-аута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь тайм-аута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, который будет использоваться для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет рассматриваться как двоичный и будет использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (булево)
Отключить пейджер командной строки для вывода.
--cli-auto-prompt (булево)
Автоматически запрашивать параметры ввода командной строки.
--no-cli-auto-prompt (булево)
Отключить автоматическое запросы параметров ввода командной строки.
Примеры
Примечание
Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы с AWS CLI в руководстве пользователя AWS CLI.
Если не указано иное, все примеры используют правила цитирования Unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной программы. См. Раздел Использование кавычек со строками в руководстве пользователя AWS CLI.
Для проверки синтаксиса и частей речи слов в нескольких текстах входных данных
Следующий пример batch-detect-syntax анализирует синтаксис нескольких текстов входных данных и возвращает различные части речи. Оценка достоверности предварительно обученной модели также выводится для каждого прогноза.
aws comprehend batch-detect-syntax \
--text-list "It is a beautiful day." "Can you please pass the salt?" "Please pay the bill before the 31st." \
--language-code en
Вывод:
{
"ResultList": [
{
"Index": 0,
"SyntaxTokens": [
{
"TokenId": 1,
"Text": "It",
"BeginOffset": 0,
"EndOffset": 2,
"PartOfSpeech": {
"Tag": "PRON",
"Score": 0.9999740719795227
}
},
{
"TokenId": 2,
"Text": "is",
"BeginOffset": 3,
"EndOffset": 5,
"PartOfSpeech": {
"Tag": "VERB",
"Score": 0.999937117099762
}
},
{
"TokenId": 3,
"Text": "a",
"BeginOffset": 6,
"EndOffset": 7,
"PartOfSpeech": {
"Tag": "DET",
"Score": 0.9999926686286926
}
},
{
"TokenId": 4,
"Text": "beautiful",
"BeginOffset": 8,
"EndOffset": 17,
"PartOfSpeech": {
"Tag": "ADJ",
"Score": 0.9987891912460327
}
},
{
"TokenId": 5,
"Text": "day",
"BeginOffset": 18,
"EndOffset": 21,
"PartOfSpeech": {
"Tag": "NOUN",
"Score": 0.9999778866767883
}
},
{
"TokenId": 6,
"Text": ".",
"BeginOffset": 21,
"EndOffset": 22,
"PartOfSpeech": {
"Tag": "PUNCT",
"Score": 0.9999974966049194
}
}
]
},
{
"Index": 1,
"SyntaxTokens": [
{
"TokenId": 1,
"Text": "Can",
"BeginOffset": 0,
"EndOffset": 3,
"PartOfSpeech": {
"Tag": "AUX",
"Score": 0.9999770522117615
}
},
{
"TokenId": 2,
"Text": "you",
"BeginOffset": 4,
"EndOffset": 7,
"PartOfSpeech": {
"Tag": "PRON",
"Score": 0.9999986886978149
}
},
{
"TokenId": 3,
"Text": "please",
"BeginOffset": 8,
"EndOffset": 14,
"PartOfSpeech": {
"Tag": "INTJ",
"Score": 0.9681622385978699
}
},
{
"TokenId": 4,
"Text": "pass",
"BeginOffset": 15,
"EndOffset": 19,
"PartOfSpeech": {
"Tag": "VERB",
"Score": 0.9999874830245972
}
},
{
"TokenId": 5,
"Text": "the",
"BeginOffset": 20,
"EndOffset": 23,
"PartOfSpeech": {
"Tag": "DET",
"Score": 0.9999827146530151
}
},
{
"TokenId": 6,
"Text": "salt",
"BeginOffset": 24,
"EndOffset": 28,
"PartOfSpeech": {
"Tag": "NOUN",
"Score": 0.9995040893554688
}
},
{
"TokenId": 7,
"Text": "?",
"BeginOffset": 28,
"EndOffset": 29,
"PartOfSpeech": {
"Tag": "PUNCT",
"Score": 0.999998152256012
}
}
]
},
{
"Index": 2,
"SyntaxTokens": [
{
"TokenId": 1,
"Text": "Please",
"BeginOffset": 0,
"EndOffset": 6,
"PartOfSpeech": {
"Tag": "INTJ",
"Score": 0.9997857809066772
}
},
{
"TokenId": 2,
"Text": "pay",
"BeginOffset": 7,
"EndOffset": 10,
"PartOfSpeech": {
"Tag": "VERB",
"Score": 0.9999252557754517
}
},
{
"TokenId": 3,
"Text": "the",
"BeginOffset": 11,
"EndOffset": 14,
"PartOfSpeech": {
"Tag": "DET",
"Score": 0.9999842643737793
}
},
{
"TokenId": 4,
"Text": "bill",
"BeginOffset": 15,
"EndOffset": 19,
"PartOfSpeech": {
"Tag": "NOUN",
"Score": 0.9999588131904602
}
},
{
"TokenId": 5,
"Text": "before",
"BeginOffset": 20,
"EndOffset": 26,
"PartOfSpeech": {
"Tag": "ADP",
"Score": 0.9958304762840271
}
},
{
"TokenId": 6,
"Text": "the",
"BeginOffset": 27,
"EndOffset": 30,
"PartOfSpeech": {
"Tag": "DET",
"Score": 0.9999947547912598
}
},
{
"TokenId": 7,
"Text": "31st",
"BeginOffset": 31,
"EndOffset": 35,
"PartOfSpeech": {
"Tag": "NOUN",
"Score": 0.9924124479293823
}
},
{
"TokenId": 8,
"Text": ".",
"BeginOffset": 35,
"EndOffset": 36,
"PartOfSpeech": {
"Tag": "PUNCT",
"Score": 0.9999955892562866
}
}
]
}
],
"ErrorList": []
}
Дополнительную информацию см. в разделе Анализ синтаксиса в руководстве разработчика Amazon Comprehend.
Вывод
ResultList -> (список)
Список объектов, содержащих результаты операции. Результаты отсортированы в порядке возрастания поля Index и соответствуют порядку документов в списке входных данных. Если все документы содержат ошибку, то ResultList пуст.
(структура)
Результат вызова операции. Операция возвращает один объект, который успешно обработан операцией.
Index -> (целое число)
SyntaxTokens -> (список)
Синтаксические токены слов в документе, по одному токену на каждое слово.
(структура)
Представляет слово в тексте входных данных, которое было распознано и которому была назначена часть речи. Для каждого слова в исходном тексте есть одна запись синтаксического токена.
TokenId -> (целое число)
Text -> (строка)
BeginOffset -> (целое число)
EndOffset -> (целое число)
PartOfSpeech -> (структура)
Предоставляет метку части речи и уровень уверенности Amazon Comprehend в правильности идентификации части речи. Дополнительную информацию см. в разделе Синтаксис в руководстве разработчика Comprehend.
Tag -> (строка)
Score -> (вещественное число)
ErrorList -> (список)
Список, содержащий по одному объекту для каждого документа, который содержал ошибку. Результаты отсортированы в порядке возрастания поля Index и соответствуют порядку документов в списке входных данных. Если ошибок в пакете нет, то ErrorList пуст.
(структура)
Описание ошибки, произошедшей при обработке документа в пакете. Операция возвращает один объект BatchItemError для каждого документа, который содержал ошибку.
Index -> (целое число)
ErrorCode -> (строка)
ErrorMessage -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.