Spec-Zone.ru › AWS CLI v2

[ aws . comprehend ]

batch-detect-syntax

Описание

Проверяет текст пакета документов на синтаксис и часть речи слов в документе и возвращает информацию о них. Дополнительную информацию см. в разделе Синтаксис в руководстве разработчика Comprehend.

См. также: Документация API AWS

Синтаксис

  batch-detect-syntax
--text-list <value>
--language-code <value>
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--text-list (список)

Список, содержащий текст входных документов в кодировке UTF-8. Список может содержать не более 25 документов. Максимальный размер каждого документа составляет 5 КБ.

(строка)

Синтаксис:

"string" "string" ...

--language-code (строка)

Язык входных документов. Вы можете указать любой из следующих языков, поддерживаемых Amazon Comprehend: немецкий («de»), английский («en»), испанский («es»), французский («fr»), итальянский («it») или португальский («pt»). Все документы должны быть на одном языке.

Возможные значения:

  • en
  • es
  • fr
  • de
  • it
  • pt

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной строки JSON. Строка JSON соответствует формату, предоставленному --generate-cli-skeleton. Если другие аргументы указаны в командной строке, эти значения переопределят значения, предоставленные через JSON. Передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, невозможно, так как строка будет интерпретироваться буквально. Это не может быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод, не отправляя запрос к API. При отсутствии значения или при значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при значении yaml-input выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если указано значение output, он проверит входные данные команды и вернет пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Глобальные параметры

--debug (булево)

Включить отладку.

--endpoint-url (строка)

Переопределить URL по умолчанию команды указанным URL.

--no-verify-ssl (булево)

По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.

--no-paginate (булево)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (строка)

Стиль форматирования выходных данных команды.

  • json
  • text
  • таблица
  • yaml
  • yaml-поток

--query (строка)

Запрос JMESPath для фильтрации данных ответа.

--profile (строка)

Использовать определенный профиль из файла учетных данных.

--region (строка)

Регион для использования. Переопределяет настройки конфигурации/среды.

--version (строка)

Отобразить версию этого инструмента.

--color (строка)

Включить/выключить вывод цвета.

  • вкл
  • выкл
  • авто

--no-sign-request (булево)

Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент указан.

--ca-bundle (строка)

Файл с набором сертификатов CA для проверки SSL-сертификатов. Переопределяет настройки конфигурации/среды.

--cli-read-timeout (целое число)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь тайм-аута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (целое число)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь тайм-аута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (строка)

Стиль форматирования, который будет использоваться для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены как строка, закодированная в base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, которое соответствует двоичному блоку, fileb:// всегда будет рассматриваться как двоичный и будет использовать содержимое файла непосредственно независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (булево)

Отключить пейджер командной строки для вывода.

--cli-auto-prompt (булево)

Автоматически запрашивать параметры ввода командной строки.

--no-cli-auto-prompt (булево)

Отключить автоматическое запросы параметров ввода командной строки.

Примеры

Примечание

Для использования следующих примеров необходимо установить и настроить AWS CLI. Дополнительную информацию см. в руководстве по началу работы с AWS CLI в руководстве пользователя AWS CLI.

Если не указано иное, все примеры используют правила цитирования Unix-подобных систем. Эти примеры необходимо адаптировать к правилам цитирования вашей терминальной программы. См. Раздел Использование кавычек со строками в руководстве пользователя AWS CLI.

Для проверки синтаксиса и частей речи слов в нескольких текстах входных данных

Следующий пример batch-detect-syntax анализирует синтаксис нескольких текстов входных данных и возвращает различные части речи. Оценка достоверности предварительно обученной модели также выводится для каждого прогноза.

aws comprehend batch-detect-syntax \
    --text-list "It is a beautiful day." "Can you please pass the salt?" "Please pay the bill before the 31st." \
    --language-code en

Вывод:

{
    "ResultList": [
        {
            "Index": 0,
            "SyntaxTokens": [
                {
                    "TokenId": 1,
                    "Text": "It",
                    "BeginOffset": 0,
                    "EndOffset": 2,
                    "PartOfSpeech": {
                        "Tag": "PRON",
                        "Score": 0.9999740719795227
                    }
                },
                {
                    "TokenId": 2,
                    "Text": "is",
                    "BeginOffset": 3,
                    "EndOffset": 5,
                    "PartOfSpeech": {
                        "Tag": "VERB",
                        "Score": 0.999937117099762
                    }
                },
                {
                    "TokenId": 3,
                    "Text": "a",
                    "BeginOffset": 6,
                    "EndOffset": 7,
                    "PartOfSpeech": {
                        "Tag": "DET",
                        "Score": 0.9999926686286926
                    }
                },
                {
                    "TokenId": 4,
                    "Text": "beautiful",
                    "BeginOffset": 8,
                    "EndOffset": 17,
                    "PartOfSpeech": {
                        "Tag": "ADJ",
                        "Score": 0.9987891912460327
                    }
                },
                {
                    "TokenId": 5,
                    "Text": "day",
                    "BeginOffset": 18,
                    "EndOffset": 21,
                    "PartOfSpeech": {
                        "Tag": "NOUN",
                        "Score": 0.9999778866767883
                    }
                },
                {
                    "TokenId": 6,
                    "Text": ".",
                    "BeginOffset": 21,
                    "EndOffset": 22,
                    "PartOfSpeech": {
                        "Tag": "PUNCT",
                        "Score": 0.9999974966049194
                    }
                }
            ]
        },
        {
            "Index": 1,
            "SyntaxTokens": [
                {
                    "TokenId": 1,
                    "Text": "Can",
                    "BeginOffset": 0,
                    "EndOffset": 3,
                    "PartOfSpeech": {
                        "Tag": "AUX",
                        "Score": 0.9999770522117615
                    }
                },
                {
                    "TokenId": 2,
                    "Text": "you",
                    "BeginOffset": 4,
                    "EndOffset": 7,
                    "PartOfSpeech": {
                        "Tag": "PRON",
                        "Score": 0.9999986886978149
                    }
                },
                {
                    "TokenId": 3,
                    "Text": "please",
                    "BeginOffset": 8,
                    "EndOffset": 14,
                    "PartOfSpeech": {
                        "Tag": "INTJ",
                        "Score": 0.9681622385978699
                    }
                },
                {
                    "TokenId": 4,
                    "Text": "pass",
                    "BeginOffset": 15,
                    "EndOffset": 19,
                    "PartOfSpeech": {
                        "Tag": "VERB",
                        "Score": 0.9999874830245972
                    }
                },
                {
                    "TokenId": 5,
                    "Text": "the",
                    "BeginOffset": 20,
                    "EndOffset": 23,
                    "PartOfSpeech": {
                        "Tag": "DET",
                        "Score": 0.9999827146530151
                    }
                },
                {
                    "TokenId": 6,
                    "Text": "salt",
                    "BeginOffset": 24,
                    "EndOffset": 28,
                    "PartOfSpeech": {
                        "Tag": "NOUN",
                        "Score": 0.9995040893554688
                    }
                },
                {
                    "TokenId": 7,
                    "Text": "?",
                    "BeginOffset": 28,
                    "EndOffset": 29,
                    "PartOfSpeech": {
                        "Tag": "PUNCT",
                        "Score": 0.999998152256012
                    }
                }
            ]
        },
        {
            "Index": 2,
            "SyntaxTokens": [
                {
                    "TokenId": 1,
                    "Text": "Please",
                    "BeginOffset": 0,
                    "EndOffset": 6,
                    "PartOfSpeech": {
                        "Tag": "INTJ",
                        "Score": 0.9997857809066772
                    }
                },
                {
                    "TokenId": 2,
                    "Text": "pay",
                    "BeginOffset": 7,
                    "EndOffset": 10,
                    "PartOfSpeech": {
                        "Tag": "VERB",
                        "Score": 0.9999252557754517
                    }
                },
                {
                    "TokenId": 3,
                    "Text": "the",
                    "BeginOffset": 11,
                    "EndOffset": 14,
                    "PartOfSpeech": {
                        "Tag": "DET",
                        "Score": 0.9999842643737793
                    }
                },
                {
                    "TokenId": 4,
                    "Text": "bill",
                    "BeginOffset": 15,
                    "EndOffset": 19,
                    "PartOfSpeech": {
                        "Tag": "NOUN",
                        "Score": 0.9999588131904602
                    }
                },
                {
                    "TokenId": 5,
                    "Text": "before",
                    "BeginOffset": 20,
                    "EndOffset": 26,
                    "PartOfSpeech": {
                        "Tag": "ADP",
                        "Score": 0.9958304762840271
                    }
                },
                {
                    "TokenId": 6,
                    "Text": "the",
                    "BeginOffset": 27,
                    "EndOffset": 30,
                    "PartOfSpeech": {
                        "Tag": "DET",
                        "Score": 0.9999947547912598
                    }
                },
                {
                    "TokenId": 7,
                    "Text": "31st",
                    "BeginOffset": 31,
                    "EndOffset": 35,
                    "PartOfSpeech": {
                        "Tag": "NOUN",
                        "Score": 0.9924124479293823
                    }
                },
                {
                    "TokenId": 8,
                    "Text": ".",
                    "BeginOffset": 35,
                    "EndOffset": 36,
                    "PartOfSpeech": {
                        "Tag": "PUNCT",
                        "Score": 0.9999955892562866
                    }
                }
            ]
        }
    ],
    "ErrorList": []
}

Дополнительную информацию см. в разделе Анализ синтаксиса в руководстве разработчика Amazon Comprehend.

Вывод

ResultList -> (список)

Список объектов, содержащих результаты операции. Результаты отсортированы в порядке возрастания поля Index и соответствуют порядку документов в списке входных данных. Если все документы содержат ошибку, то ResultList пуст.

(структура)

Результат вызова операции. Операция возвращает один объект, который успешно обработан операцией.

Index -> (целое число)

Индекс документа в списке входных данных (нумерация с 0).

SyntaxTokens -> (список)

Синтаксические токены слов в документе, по одному токену на каждое слово.

(структура)

Представляет слово в тексте входных данных, которое было распознано и которому была назначена часть речи. Для каждого слова в исходном тексте есть одна запись синтаксического токена.

TokenId -> (целое число)

Уникальный идентификатор токена.

Text -> (строка)

Слово, распознанное в исходном тексте.

BeginOffset -> (целое число)

Смещение от начала исходного текста до первого символа слова (нумерация с 0).

EndOffset -> (целое число)

Смещение от начала исходного текста до последнего символа слова (нумерация с 0).

PartOfSpeech -> (структура)

Предоставляет метку части речи и уровень уверенности Amazon Comprehend в правильности идентификации части речи. Дополнительную информацию см. в разделе Синтаксис в руководстве разработчика Comprehend.

Tag -> (строка)

Идентификатор части речи, которую представляет токен.

Score -> (вещественное число)

Уверенность Amazon Comprehend в правильности идентификации части речи.

ErrorList -> (список)

Список, содержащий по одному объекту для каждого документа, который содержал ошибку. Результаты отсортированы в порядке возрастания поля Index и соответствуют порядку документов в списке входных данных. Если ошибок в пакете нет, то ErrorList пуст.

(структура)

Описание ошибки, произошедшей при обработке документа в пакете. Операция возвращает один объект BatchItemError для каждого документа, который содержал ошибку.

Index -> (целое число)

Индекс документа в списке входных данных (нумерация с 0).

ErrorCode -> (строка)

Числовой код ошибки.

ErrorMessage -> (строка)

Текстовое описание ошибки.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API