Spec-Zone.ru › AWS CLI v2

[ aws . kendra ]

batch-put-document

Описание

Добавляет один или несколько документов в индекс.

API BatchPutDocument позволяет вам импортировать встроенные документы или набор документов, хранящихся в ведре Amazon S3. Используйте эту API для импорта текстовых и неструктурированных текстов в индекс, добавления пользовательских атрибутов к документам и прикрепления списка управления доступом к документам, добавленным в индекс.

Документы индексируются асинхронно. Вы можете отслеживать процесс пакетной обработки с помощью Amazon Web Services CloudWatch. Любые сообщения об ошибках, связанные с обработкой пакета, отправляются в ваш журнал Amazon Web Services CloudWatch. Вы также можете использовать API BatchGetDocumentStatus для мониторинга процесса индексации ваших документов.

Пример импорта встроенных документов с использованием Python и Java SDK см. в разделе Добавление файлов непосредственно в индекс.

См. также: Документация API AWS

Синтаксис

  batch-put-document
--index-id <value>
[--role-arn <value>]
--documents <value>
[--custom-document-enrichment-configuration <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]

Параметры

--index-id (строка)

Идентификатор индекса, в который нужно добавить документы. Вам необходимо сначала создать индекс с помощью API CreateIndex.

--role-arn (строка)

Amazon Resource Name (ARN) роли IAM с разрешением на доступ к вашему ведру S3. Дополнительную информацию см. в разделе Роли доступа IAM для Amazon Kendra.

--documents (список)

Один или несколько документов для добавления в индекс.

Документы имеют следующие ограничения по размеру файла.

  • 50 МБ общий размер для любого файла
  • 5 МБ извлеченного текста для любого файла

Дополнительную информацию см. в разделе Квоты.

(структура)

Документ в индексе.

Id -> (строка)

Идентификатор документа в индексе.

Обратите внимание, что каждый идентификатор документа должен быть уникальным для каждого индекса. Вы не можете создать источник данных для индексации ваших документов с их уникальными идентификаторами и затем использовать API BatchPutDocument для индексации тех же документов, или наоборот. Вы можете удалить источник данных и затем использовать API BatchPutDocument для индексации тех же документов, или наоборот.

Title -> (строка)

Название документа.

Blob -> (байты)

Содержимое документа.

Документы, передаваемые в параметр Blob, должны быть закодированы в base64. Возможно, ваш код не потребует кодирования байтов файла документа, если вы используете SDK Amazon Web Services для вызова API Amazon Kendra. Если вы напрямую вызываете конечную точку Amazon Kendra с помощью REST, вы должны закодировать содержимое в base64 перед отправкой.

S3Path -> (структура)

Информация, необходимая для поиска определенного файла в ведре Amazon S3.

Bucket -> (строка)

Имя ведра S3, содержащего файл.

Key -> (строка)

Имя файла.

Attributes -> (список)

Пользовательские атрибуты, применяемые к документу. Используйте пользовательские атрибуты для предоставления дополнительной информации для поиска, для предоставления аспектов для уточнения поиска и для предоставления дополнительной информации в ответе запроса.

Например, ‘DataSourceId’ и ‘DataSourceSyncJobId’ — это пользовательские атрибуты, которые предоставляют информацию о синхронизации документов, выполняемых в источнике данных. Обратите внимание, что ‘DataSourceSyncJobId’ может быть необязательным пользовательским атрибутом, так как Amazon Kendra будет использовать идентификатор выполняемой задачи синхронизации.

(структура)

Атрибут или поле метаданных документа. Для создания пользовательских атрибутов документов см. Пользовательские атрибуты.

Key -> (строка)

Идентификатор атрибута.

Value -> (структура)

Значение атрибута.

StringValue -> (строка)

Строка, например, «отдел».

StringListValue -> (список)

Список строк. Максимальная длина или количество строк по умолчанию составляет 10.

(строка)

LongValue -> (целое число)

Целое число типа long.

DateValue -> (метка времени)

Дата, выраженная в формате ISO 8601.

Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по центральноевропейскому времени.

AccessControlList -> (список)

Информация о принципах (пользователях и/или группах) и о том, к каким документам они должны иметь доступ. Это полезно для фильтрации контекста пользователя, где результаты поиска фильтруются на основе доступа пользователя или его группы к документам.

(структура)

Предоставляет информацию о пользователе и группе для фильтрации контекста пользователя.

Name -> (строка)

Имя пользователя или группы.

Type -> (строка)

Тип принципа.

Access -> (строка)

Разрешить или запретить доступ к документу для принципа.

DataSourceId -> (строка)

Идентификатор источника данных, к документам из которого должен иметь доступ принцип.

HierarchicalAccessControlList -> (список)

Список списков принципов, определяющих иерархию, к которой пользователи должны иметь доступ к документам.

(структура)

Информация для определения иерархии, к которой пользователи должны иметь доступ к документам.

PrincipalList -> (список)

Список списков принципов, определяющих иерархию, к которой пользователи должны иметь доступ к документам. Каждый иерархический список указывает, имеет ли каждый пользователь или группа разрешение или запрет на доступ к каждому документу.

(структура)

Предоставляет информацию о пользователе и группе для фильтрации контекста пользователя.

Name -> (строка)

Имя пользователя или группы.

Type -> (строка)

Тип принципа.

Access -> (строка)

Разрешить или запретить доступ к документу для принципа.

DataSourceId -> (строка)

Идентификатор источника данных, к документам из которого должен иметь доступ принцип.

ContentType -> (строка)

Тип файла документа в поле Blob.

Если вы хотите индексировать фрагменты или подмножества HTML-документов вместо всего HTML-документа, вы должны добавить открывающие и закрывающие теги HTML (<HTML>content</HTML> ) вокруг содержимого.

AccessControlConfigurationId -> (строка)

Идентификатор конфигурации управления доступом, которую вы хотите применить к документу.

Синтаксис JSON:

[
  {
    "Id": "string",
    "Title": "string",
    "Blob": blob,
    "S3Path": {
      "Bucket": "string",
      "Key": "string"
    },
    "Attributes": [
      {
        "Key": "string",
        "Value": {
          "StringValue": "string",
          "StringListValue": ["string", ...],
          "LongValue": long,
          "DateValue": timestamp
        }
      }
      ...
    ],
    "AccessControlList": [
      {
        "Name": "string",
        "Type": "USER"|"GROUP",
        "Access": "ALLOW"|"DENY",
        "DataSourceId": "string"
      }
      ...
    ],
    "HierarchicalAccessControlList": [
      {
        "PrincipalList": [
          {
            "Name": "string",
            "Type": "USER"|"GROUP",
            "Access": "ALLOW"|"DENY",
            "DataSourceId": "string"
          }
          ...
        ]
      }
      ...
    ],
    "ContentType": "PDF"|"HTML"|"MS_WORD"|"PLAIN_TEXT"|"PPT"|"RTF"|"XML"|"XSLT"|"MS_EXCEL"|"CSV"|"JSON"|"MD",
    "AccessControlConfigurationId": "string"
  }
  ...
]

--custom-document-enrichment-configuration (структура)

Информация о конфигурации для изменения метаданных и содержимого документа во время процесса загрузки документа при использовании API BatchPutDocument.

Дополнительную информацию о том, как создавать, изменять и удалять метаданные документов или вносить другие изменения в содержимое при загрузке документов в Amazon Kendra, см. в разделе Настройка метаданных документов во время процесса загрузки.

InlineConfigurations -> (список)

Информация о конфигурации для изменения атрибутов или полей метаданных и содержимого документов при загрузке в Amazon Kendra.

(структура)

Предоставляет информацию о конфигурации для применения базовой логики изменения метаданных и содержимого документов при загрузке в Amazon Kendra. Для применения расширенной логики, выходящей за рамки базовой логики, см. HookConfiguration.

Дополнительную информацию см. в разделе Настройка метаданных документов во время процесса загрузки.

Condition -> (структура)

Настройка условия, используемого для целевого атрибута документа или поля метаданных при загрузке документов в Amazon Kendra.

ConditionDocumentAttributeKey -> (строка)

Идентификатор атрибута документа, используемого для условия.

Например, «Source_URI» может быть идентификатором атрибута или поля метаданных, содержащего URI источника, связанные с документами.

В настоящее время Amazon Kendra не поддерживает _document_body в качестве ключа атрибута, используемого для условия.

Operator -> (строка)

Оператор условия.

Например, вы можете использовать «Contains» для частичного совпадения строки.

ConditionOnValue -> (структура)

Значение, используемое оператором.

Например, вы можете указать значение «financial» для строк в поле «Source_URI», которые частично совпадают или содержат это значение.

StringValue -> (строка)

Строка, например, "department".

StringListValue -> (список)

Список строк. Максимальная длина или количество строк по умолчанию равно 10.

(строка)

LongValue -> (целое число)

Целое значение.

DateValue -> (отметка времени)

Дата, выраженная в формате ISO 8601.

Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.

Target -> (структура)

Настройка целевого атрибута документа или поля метаданных при загрузке документов в Amazon Kendra. Вы также можете указать значение.

TargetDocumentAttributeKey -> (строка)

Идентификатор целевого атрибута документа или поля метаданных.

Например, «Department» может быть идентификатором целевого атрибута или поля метаданных, содержащего имена отделов, связанные с документами.

TargetDocumentAttributeValueDeletion -> (логическое значение)

TRUE для удаления существующего целевого значения для указанного ключа целевого атрибута. Вы не можете создать целевое значение и установить его в TRUE. Чтобы создать целевое значение (TargetDocumentAttributeValue), установите это значение в FALSE.

TargetDocumentAttributeValue -> (структура)

Целевое значение, которое вы хотите создать для целевого атрибута.

Например, «Finance» может быть целевым значением для целевого ключа атрибута «Department».

StringValue -> (строка)

Строка, например, "department".

StringListValue -> (список)

Список строк. Максимальная длина или количество строк по умолчанию равно 10.

(строка)

LongValue -> (целое число)

Целое значение.

DateValue -> (отметка времени)

Дата, выраженная в формате ISO 8601.

Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.

DocumentContentDeletion -> (логическое значение)

TRUE для удаления содержимого, если условие, используемое для целевого атрибута, выполняется.

PreExtractionHookConfiguration -> (структура)

Информация о конфигурации для вызова функции Lambda в Lambda для исходных или необработанных документов перед извлечением метаданных и текста. Вы можете использовать функцию Lambda для применения расширенной логики создания, изменения или удаления метаданных и содержимого документов. Дополнительную информацию см. в разделе Расширенная обработка данных.

InvocationCondition -> (структура)

Условие, используемое для вызова функции Lambda.

Например, вы можете указать условие, при котором, если есть пустые значения даты и времени, Amazon Kendra должен вызвать функцию, которая вставит текущую дату и время.

ConditionDocumentAttributeKey -> (строка)

Идентификатор атрибута документа, используемого для условия.

Например, «Source_URI» может быть идентификатором атрибута или поля метаданных, содержащего URI источника, связанные с документами.

В настоящее время Amazon Kendra не поддерживает _document_body в качестве ключа атрибута, используемого для условия.

Operator -> (строка)

Оператор условия.

Например, вы можете использовать «Contains» для частичного совпадения строки.

ConditionOnValue -> (структура)

Значение, используемое оператором.

Например, вы можете указать значение «financial» для строк в поле «Source_URI», которые частично совпадают или содержат это значение.

StringValue -> (строка)

Строка, например, "department".

StringListValue -> (список)

Список строк. Максимальная длина или количество строк по умолчанию равно 10.

(строка)

LongValue -> (целое число)

Целое значение.

DateValue -> (отметка времени)

Дата, выраженная в формате ISO 8601.

Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.

LambdaArn -> (строка)

Идентификатор ресурса Amazon (ARN) роли IAM с разрешениями для запуска функции Lambda во время загрузки. Дополнительную информацию см. в разделе Роли IAM для Amazon Kendra.

S3Bucket -> (строка)

Хранит исходные, необработанные документы или структурированные, распарсенные документы до и после их изменения. Дополнительную информацию см. в разделе Договор данных для функций Lambda.

PostExtractionHookConfiguration -> (структура)

Информация о конфигурации для вызова функции Lambda в Lambda для структурированных документов с извлеченными метаданными и текстом. Вы можете использовать функцию Lambda для применения расширенной логики создания, изменения или удаления метаданных и содержимого документов. Дополнительную информацию см. в разделе Расширенная обработка данных.

InvocationCondition -> (структура)

Условие, используемое для вызова функции Lambda.

Например, вы можете указать условие, при котором, если есть пустые значения даты и времени, Amazon Kendra должен вызвать функцию, которая вставит текущую дату и время.

ConditionDocumentAttributeKey -> (строка)

Идентификатор атрибута документа, используемого для условия.

Например, «Source_URI» может быть идентификатором атрибута или поля метаданных, содержащего URI источника, связанные с документами.

В настоящее время Amazon Kendra не поддерживает _document_body в качестве ключа атрибута, используемого для условия.

Operator -> (строка)

Оператор условия.

Например, вы можете использовать «Contains» для частичного совпадения строки.

ConditionOnValue -> (структура)

Значение, используемое оператором.

Например, вы можете указать значение «financial» для строк в поле «Source_URI», которые частично совпадают или содержат это значение.

StringValue -> (строка)

Строка, например, "department".

StringListValue -> (список)

Список строк. Максимальная длина или количество строк по умолчанию равно 10.

(строка)

LongValue -> (целое число)

Целое значение.

DateValue -> (отметка времени)

Дата, выраженная в формате ISO 8601.

Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.

LambdaArn -> (строка)

Идентификатор ресурса Amazon (ARN) роли IAM с разрешениями для запуска функции Lambda во время загрузки. Дополнительную информацию см. в разделе Роли IAM для Amazon Kendra.

S3Bucket -> (строка)

Хранит исходные, необработанные документы или структурированные, распарсенные документы до и после их изменения. Дополнительную информацию см. в разделе Договор данных для функций Lambda.

RoleArn -> (строка)

Идентификатор ресурса Amazon (ARN) роли IAM с разрешениями для запуска PreExtractionHookConfiguration и PostExtractionHookConfiguration для изменения метаданных и содержимого документов во время процесса загрузки документов. Дополнительную информацию см. в разделе Роли IAM для Amazon Kendra.

Синтаксис JSON:

{
  "InlineConfigurations": [
    {
      "Condition": {
        "ConditionDocumentAttributeKey": "string",
        "Operator": "GreaterThan"|"GreaterThanOrEquals"|"LessThan"|"LessThanOrEquals"|"Equals"|"NotEquals"|"Contains"|"NotContains"|"Exists"|"NotExists"|"BeginsWith",
        "ConditionOnValue": {
          "StringValue": "string",
          "StringListValue": ["string", ...],
          "LongValue": long,
          "DateValue": timestamp
        }
      },
      "Target": {
        "TargetDocumentAttributeKey": "string",
        "TargetDocumentAttributeValueDeletion": true|false,
        "TargetDocumentAttributeValue": {
          "StringValue": "string",
          "StringListValue": ["string", ...],
          "LongValue": long,
          "DateValue": timestamp
        }
      },
      "DocumentContentDeletion": true|false
    }
    ...
  ],
  "PreExtractionHookConfiguration": {
    "InvocationCondition": {
      "ConditionDocumentAttributeKey": "string",
      "Operator": "GreaterThan"|"GreaterThanOrEquals"|"LessThan"|"LessThanOrEquals"|"Equals"|"NotEquals"|"Contains"|"NotContains"|"Exists"|"NotExists"|"BeginsWith",
      "ConditionOnValue": {
        "StringValue": "string",
        "StringListValue": ["string", ...],
        "LongValue": long,
        "DateValue": timestamp
      }
    },
    "LambdaArn": "string",
    "S3Bucket": "string"
  },
  "PostExtractionHookConfiguration": {
    "InvocationCondition": {
      "ConditionDocumentAttributeKey": "string",
      "Operator": "GreaterThan"|"GreaterThanOrEquals"|"LessThan"|"LessThanOrEquals"|"Equals"|"NotEquals"|"Contains"|"NotContains"|"Exists"|"NotExists"|"BeginsWith",
      "ConditionOnValue": {
        "StringValue": "string",
        "StringListValue": ["string", ...],
        "LongValue": long,
        "DateValue": timestamp
      }
    },
    "LambdaArn": "string",
    "S3Bucket": "string"
  },
  "RoleArn": "string"
}

--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные в JSON. Передача произвольных двоичных значений с помощью значения, предоставленного в JSON, невозможна, так как строка будет воспринята буквально. Это может не быть указано вместе с --cli-input-yaml.

--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при предоставлении yaml-input выводит пример входного YAML, который можно использовать с --cli-input-yaml. При предоставлении значения output он проверяет входные данные команд и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.

Общие параметры

--debug (boolean)

Включить отладку протоколирования.

--endpoint-url (string)

Переопределить стандартный URL команды заданным URL.

--no-verify-ssl (boolean)

По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.

--no-paginate (boolean)

Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.

--output (string)

Стиль форматирования вывода команд.

  • json
  • text
  • table
  • yaml
  • yaml-stream

--query (string)

Запрос JMESPath для фильтрации данных ответа.

--profile (string)

Использование определенного профиля из файла учетных данных.

--region (string)

Регион для использования. Переопределяет параметры конфигурации/среды.

--version (string)

Отображение версии этого инструмента.

--color (string)

Включение/выключение цветного вывода.

  • on
  • off
  • auto

--no-sign-request (boolean)

Не подписывать запросы. Учетные данные не будут загружаться, если этот параметр указан.

--ca-bundle (string)

Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.

--cli-read-timeout (int)

Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-connect-timeout (int)

Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.

--cli-binary-format (string)

Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной строки base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI версии 1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно независимо от cli-binary-format настройки. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.

  • base64
  • raw-in-base64-out

--no-cli-pager (boolean)

Отключить вывод пейджера CLI.

--cli-auto-prompt (boolean)

Автоматически запрашивать параметры ввода CLI.

--no-cli-auto-prompt (boolean)

Отключить автоматическое запросы параметров ввода CLI.

Вывод

FailedDocuments -> (список)

Список документов, которые не были добавлены в индекс, потому что документ не прошёл проверку. Каждый документ содержит сообщение об ошибке, указывающее причину, по которой документ не был добавлен в индекс.

Если при добавлении документа в индекс произошла ошибка, об этом сообщается в журнале Amazon Web Services CloudWatch. Дополнительную информацию см. в разделе Мониторинг Amazon Kendra с помощью журналов Amazon CloudWatch.

(структура)

Предоставляет информацию о документе, который не удалось индексировать.

Id -> (строка)

Идентификатор документа.

DataSourceId -> (строка)

Идентификатор соединителя источника данных, к которому относится неудачный документ.

ErrorCode -> (строка)

Тип ошибки, из-за которой документ не был индексирован.

ErrorMessage -> (строка)

Описание причины, по которой документ не удалось индексировать.

© Copyright 2025, Amazon Web Services. Created using Sphinx.

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API