batch-put-document
Описание
Добавляет один или несколько документов в индекс.
API BatchPutDocument позволяет вам импортировать встроенные документы или набор документов, хранящихся в ведре Amazon S3. Используйте эту API для импорта текстовых и неструктурированных текстов в индекс, добавления пользовательских атрибутов к документам и прикрепления списка управления доступом к документам, добавленным в индекс.
Документы индексируются асинхронно. Вы можете отслеживать процесс пакетной обработки с помощью Amazon Web Services CloudWatch. Любые сообщения об ошибках, связанные с обработкой пакета, отправляются в ваш журнал Amazon Web Services CloudWatch. Вы также можете использовать API BatchGetDocumentStatus для мониторинга процесса индексации ваших документов.
Пример импорта встроенных документов с использованием Python и Java SDK см. в разделе Добавление файлов непосредственно в индекс.
См. также: Документация API AWS
Синтаксис
batch-put-document
--index-id <value>
[--role-arn <value>]
--documents <value>
[--custom-document-enrichment-configuration <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--index-id (строка)
CreateIndex.--role-arn (строка)
--documents (список)
Один или несколько документов для добавления в индекс.
Документы имеют следующие ограничения по размеру файла.
- 50 МБ общий размер для любого файла
- 5 МБ извлеченного текста для любого файла
Дополнительную информацию см. в разделе Квоты.
(структура)
Документ в индексе.
Id -> (строка)
Идентификатор документа в индексе.
Обратите внимание, что каждый идентификатор документа должен быть уникальным для каждого индекса. Вы не можете создать источник данных для индексации ваших документов с их уникальными идентификаторами и затем использовать API BatchPutDocument для индексации тех же документов, или наоборот. Вы можете удалить источник данных и затем использовать API BatchPutDocument для индексации тех же документов, или наоборот.
Title -> (строка)
Blob -> (байты)
Содержимое документа.
Документы, передаваемые в параметр Blob, должны быть закодированы в base64. Возможно, ваш код не потребует кодирования байтов файла документа, если вы используете SDK Amazon Web Services для вызова API Amazon Kendra. Если вы напрямую вызываете конечную точку Amazon Kendra с помощью REST, вы должны закодировать содержимое в base64 перед отправкой.
S3Path -> (структура)
Информация, необходимая для поиска определенного файла в ведре Amazon S3.
Bucket -> (строка)
Key -> (строка)
Attributes -> (список)
Пользовательские атрибуты, применяемые к документу. Используйте пользовательские атрибуты для предоставления дополнительной информации для поиска, для предоставления аспектов для уточнения поиска и для предоставления дополнительной информации в ответе запроса.
Например, ‘DataSourceId’ и ‘DataSourceSyncJobId’ — это пользовательские атрибуты, которые предоставляют информацию о синхронизации документов, выполняемых в источнике данных. Обратите внимание, что ‘DataSourceSyncJobId’ может быть необязательным пользовательским атрибутом, так как Amazon Kendra будет использовать идентификатор выполняемой задачи синхронизации.
(структура)
Атрибут или поле метаданных документа. Для создания пользовательских атрибутов документов см. Пользовательские атрибуты.
Key -> (строка)
Value -> (структура)
Значение атрибута.
StringValue -> (строка)
StringListValue -> (список)
Список строк. Максимальная длина или количество строк по умолчанию составляет 10.
(строка)
LongValue -> (целое число)
DateValue -> (метка времени)
Дата, выраженная в формате ISO 8601.
Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по центральноевропейскому времени.
AccessControlList -> (список)
Информация о принципах (пользователях и/или группах) и о том, к каким документам они должны иметь доступ. Это полезно для фильтрации контекста пользователя, где результаты поиска фильтруются на основе доступа пользователя или его группы к документам.
(структура)
Предоставляет информацию о пользователе и группе для фильтрации контекста пользователя.
Name -> (строка)
Type -> (строка)
Access -> (строка)
DataSourceId -> (строка)
HierarchicalAccessControlList -> (список)
Список списков принципов, определяющих иерархию, к которой пользователи должны иметь доступ к документам.
(структура)
Информация для определения иерархии, к которой пользователи должны иметь доступ к документам.
PrincipalList -> (список)
Список списков принципов, определяющих иерархию, к которой пользователи должны иметь доступ к документам. Каждый иерархический список указывает, имеет ли каждый пользователь или группа разрешение или запрет на доступ к каждому документу.
(структура)
Предоставляет информацию о пользователе и группе для фильтрации контекста пользователя.
Name -> (строка)
Type -> (строка)
Access -> (строка)
DataSourceId -> (строка)
ContentType -> (строка)
Тип файла документа в поле Blob.
Если вы хотите индексировать фрагменты или подмножества HTML-документов вместо всего HTML-документа, вы должны добавить открывающие и закрывающие теги HTML (<HTML>content</HTML> ) вокруг содержимого.
AccessControlConfigurationId -> (строка)
Синтаксис JSON:
[
{
"Id": "string",
"Title": "string",
"Blob": blob,
"S3Path": {
"Bucket": "string",
"Key": "string"
},
"Attributes": [
{
"Key": "string",
"Value": {
"StringValue": "string",
"StringListValue": ["string", ...],
"LongValue": long,
"DateValue": timestamp
}
}
...
],
"AccessControlList": [
{
"Name": "string",
"Type": "USER"|"GROUP",
"Access": "ALLOW"|"DENY",
"DataSourceId": "string"
}
...
],
"HierarchicalAccessControlList": [
{
"PrincipalList": [
{
"Name": "string",
"Type": "USER"|"GROUP",
"Access": "ALLOW"|"DENY",
"DataSourceId": "string"
}
...
]
}
...
],
"ContentType": "PDF"|"HTML"|"MS_WORD"|"PLAIN_TEXT"|"PPT"|"RTF"|"XML"|"XSLT"|"MS_EXCEL"|"CSV"|"JSON"|"MD",
"AccessControlConfigurationId": "string"
}
...
]
--custom-document-enrichment-configuration (структура)
Информация о конфигурации для изменения метаданных и содержимого документа во время процесса загрузки документа при использовании API BatchPutDocument.
Дополнительную информацию о том, как создавать, изменять и удалять метаданные документов или вносить другие изменения в содержимое при загрузке документов в Amazon Kendra, см. в разделе Настройка метаданных документов во время процесса загрузки.
InlineConfigurations -> (список)
Информация о конфигурации для изменения атрибутов или полей метаданных и содержимого документов при загрузке в Amazon Kendra.
(структура)
Предоставляет информацию о конфигурации для применения базовой логики изменения метаданных и содержимого документов при загрузке в Amazon Kendra. Для применения расширенной логики, выходящей за рамки базовой логики, см. HookConfiguration.
Дополнительную информацию см. в разделе Настройка метаданных документов во время процесса загрузки.
Condition -> (структура)
Настройка условия, используемого для целевого атрибута документа или поля метаданных при загрузке документов в Amazon Kendra.
ConditionDocumentAttributeKey -> (строка)
Идентификатор атрибута документа, используемого для условия.
Например, «Source_URI» может быть идентификатором атрибута или поля метаданных, содержащего URI источника, связанные с документами.
В настоящее время Amazon Kendra не поддерживает _document_body в качестве ключа атрибута, используемого для условия.
Operator -> (строка)
Оператор условия.
Например, вы можете использовать «Contains» для частичного совпадения строки.
ConditionOnValue -> (структура)
Значение, используемое оператором.
Например, вы можете указать значение «financial» для строк в поле «Source_URI», которые частично совпадают или содержат это значение.
StringValue -> (строка)
StringListValue -> (список)
Список строк. Максимальная длина или количество строк по умолчанию равно 10.
(строка)
LongValue -> (целое число)
DateValue -> (отметка времени)
Дата, выраженная в формате ISO 8601.
Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.
Target -> (структура)
Настройка целевого атрибута документа или поля метаданных при загрузке документов в Amazon Kendra. Вы также можете указать значение.
TargetDocumentAttributeKey -> (строка)
Идентификатор целевого атрибута документа или поля метаданных.
Например, «Department» может быть идентификатором целевого атрибута или поля метаданных, содержащего имена отделов, связанные с документами.
TargetDocumentAttributeValueDeletion -> (логическое значение)
TRUE для удаления существующего целевого значения для указанного ключа целевого атрибута. Вы не можете создать целевое значение и установить его в TRUE. Чтобы создать целевое значение (TargetDocumentAttributeValue), установите это значение в FALSE.TargetDocumentAttributeValue -> (структура)
Целевое значение, которое вы хотите создать для целевого атрибута.
Например, «Finance» может быть целевым значением для целевого ключа атрибута «Department».
StringValue -> (строка)
StringListValue -> (список)
Список строк. Максимальная длина или количество строк по умолчанию равно 10.
(строка)
LongValue -> (целое число)
DateValue -> (отметка времени)
Дата, выраженная в формате ISO 8601.
Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.
DocumentContentDeletion -> (логическое значение)
TRUE для удаления содержимого, если условие, используемое для целевого атрибута, выполняется.PreExtractionHookConfiguration -> (структура)
Информация о конфигурации для вызова функции Lambda в Lambda для исходных или необработанных документов перед извлечением метаданных и текста. Вы можете использовать функцию Lambda для применения расширенной логики создания, изменения или удаления метаданных и содержимого документов. Дополнительную информацию см. в разделе Расширенная обработка данных.
InvocationCondition -> (структура)
Условие, используемое для вызова функции Lambda.
Например, вы можете указать условие, при котором, если есть пустые значения даты и времени, Amazon Kendra должен вызвать функцию, которая вставит текущую дату и время.
ConditionDocumentAttributeKey -> (строка)
Идентификатор атрибута документа, используемого для условия.
Например, «Source_URI» может быть идентификатором атрибута или поля метаданных, содержащего URI источника, связанные с документами.
В настоящее время Amazon Kendra не поддерживает _document_body в качестве ключа атрибута, используемого для условия.
Operator -> (строка)
Оператор условия.
Например, вы можете использовать «Contains» для частичного совпадения строки.
ConditionOnValue -> (структура)
Значение, используемое оператором.
Например, вы можете указать значение «financial» для строк в поле «Source_URI», которые частично совпадают или содержат это значение.
StringValue -> (строка)
StringListValue -> (список)
Список строк. Максимальная длина или количество строк по умолчанию равно 10.
(строка)
LongValue -> (целое число)
DateValue -> (отметка времени)
Дата, выраженная в формате ISO 8601.
Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.
LambdaArn -> (строка)
S3Bucket -> (строка)
PostExtractionHookConfiguration -> (структура)
Информация о конфигурации для вызова функции Lambda в Lambda для структурированных документов с извлеченными метаданными и текстом. Вы можете использовать функцию Lambda для применения расширенной логики создания, изменения или удаления метаданных и содержимого документов. Дополнительную информацию см. в разделе Расширенная обработка данных.
InvocationCondition -> (структура)
Условие, используемое для вызова функции Lambda.
Например, вы можете указать условие, при котором, если есть пустые значения даты и времени, Amazon Kendra должен вызвать функцию, которая вставит текущую дату и время.
ConditionDocumentAttributeKey -> (строка)
Идентификатор атрибута документа, используемого для условия.
Например, «Source_URI» может быть идентификатором атрибута или поля метаданных, содержащего URI источника, связанные с документами.
В настоящее время Amazon Kendra не поддерживает _document_body в качестве ключа атрибута, используемого для условия.
Operator -> (строка)
Оператор условия.
Например, вы можете использовать «Contains» для частичного совпадения строки.
ConditionOnValue -> (структура)
Значение, используемое оператором.
Например, вы можете указать значение «financial» для строк в поле «Source_URI», которые частично совпадают или содержат это значение.
StringValue -> (строка)
StringListValue -> (список)
Список строк. Максимальная длина или количество строк по умолчанию равно 10.
(строка)
LongValue -> (целое число)
DateValue -> (отметка времени)
Дата, выраженная в формате ISO 8601.
Важно включить часовой пояс в формате даты и времени ISO 8601. Например, 2012-03-25T12:30:10+01:00 — это формат даты и времени ISO 8601 для 25 марта 2012 года в 12:30 (плюс 10 секунд) по Центральноевропейскому времени.
LambdaArn -> (строка)
S3Bucket -> (строка)
RoleArn -> (строка)
PreExtractionHookConfiguration и PostExtractionHookConfiguration для изменения метаданных и содержимого документов во время процесса загрузки документов. Дополнительную информацию см. в разделе Роли IAM для Amazon Kendra.Синтаксис JSON:
{
"InlineConfigurations": [
{
"Condition": {
"ConditionDocumentAttributeKey": "string",
"Operator": "GreaterThan"|"GreaterThanOrEquals"|"LessThan"|"LessThanOrEquals"|"Equals"|"NotEquals"|"Contains"|"NotContains"|"Exists"|"NotExists"|"BeginsWith",
"ConditionOnValue": {
"StringValue": "string",
"StringListValue": ["string", ...],
"LongValue": long,
"DateValue": timestamp
}
},
"Target": {
"TargetDocumentAttributeKey": "string",
"TargetDocumentAttributeValueDeletion": true|false,
"TargetDocumentAttributeValue": {
"StringValue": "string",
"StringListValue": ["string", ...],
"LongValue": long,
"DateValue": timestamp
}
},
"DocumentContentDeletion": true|false
}
...
],
"PreExtractionHookConfiguration": {
"InvocationCondition": {
"ConditionDocumentAttributeKey": "string",
"Operator": "GreaterThan"|"GreaterThanOrEquals"|"LessThan"|"LessThanOrEquals"|"Equals"|"NotEquals"|"Contains"|"NotContains"|"Exists"|"NotExists"|"BeginsWith",
"ConditionOnValue": {
"StringValue": "string",
"StringListValue": ["string", ...],
"LongValue": long,
"DateValue": timestamp
}
},
"LambdaArn": "string",
"S3Bucket": "string"
},
"PostExtractionHookConfiguration": {
"InvocationCondition": {
"ConditionDocumentAttributeKey": "string",
"Operator": "GreaterThan"|"GreaterThanOrEquals"|"LessThan"|"LessThanOrEquals"|"Equals"|"NotEquals"|"Contains"|"NotContains"|"Exists"|"NotExists"|"BeginsWith",
"ConditionOnValue": {
"StringValue": "string",
"StringListValue": ["string", ...],
"LongValue": long,
"DateValue": timestamp
}
},
"LambdaArn": "string",
"S3Bucket": "string"
},
"RoleArn": "string"
}
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка соответствует формату, предоставленному --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные в JSON. Передача произвольных двоичных значений с помощью значения, предоставленного в JSON, невозможна, так как строка будет воспринята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса API. При отсутствии значения или значении input выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, при предоставлении yaml-input выводит пример входного YAML, который можно использовать с --cli-input-yaml. При предоставлении значения output он проверяет входные данные команд и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет не стабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Общие параметры
--debug (boolean)
Включить отладку протоколирования.
--endpoint-url (string)
Переопределить стандартный URL команды заданным URL.
--no-verify-ssl (boolean)
По умолчанию AWS CLI использует SSL при взаимодействии с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.
--no-paginate (boolean)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (string)
Стиль форматирования вывода команд.
- json
- text
- table
- yaml
- yaml-stream
--query (string)
Запрос JMESPath для фильтрации данных ответа.
--profile (string)
Использование определенного профиля из файла учетных данных.
--region (string)
Регион для использования. Переопределяет параметры конфигурации/среды.
--version (string)
Отображение версии этого инструмента.
--color (string)
Включение/выключение цветного вывода.
- on
- off
- auto
--no-sign-request (boolean)
Не подписывать запросы. Учетные данные не будут загружаться, если этот параметр указан.
--ca-bundle (string)
Файл сертификатов CA для проверки SSL-сертификатов. Переопределяет параметры конфигурации/среды.
--cli-read-timeout (int)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (int)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (string)
Стиль форматирования для двоичных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной строки base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI версии 1, и двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего двоичному блоку, fileb:// всегда будет обрабатываться как двоичное и использовать содержимое файла непосредственно независимо от cli-binary-format настройки. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (boolean)
Отключить вывод пейджера CLI.
--cli-auto-prompt (boolean)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (boolean)
Отключить автоматическое запросы параметров ввода CLI.
Вывод
FailedDocuments -> (список)
Список документов, которые не были добавлены в индекс, потому что документ не прошёл проверку. Каждый документ содержит сообщение об ошибке, указывающее причину, по которой документ не был добавлен в индекс.
Если при добавлении документа в индекс произошла ошибка, об этом сообщается в журнале Amazon Web Services CloudWatch. Дополнительную информацию см. в разделе Мониторинг Amazon Kendra с помощью журналов Amazon CloudWatch.
(структура)
Предоставляет информацию о документе, который не удалось индексировать.
Id -> (строка)
DataSourceId -> (строка)
ErrorCode -> (строка)
ErrorMessage -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.