[ aws . bedrock-agent ]
обновить-источник-данных
Описание
Обновляет конфигурации для подключения к источнику данных.
Предупреждение
Вы не можете изменитьchunkingConfiguration после создания подключения к источнику данных. Укажите существующее значение chunkingConfiguration .См. также: Документацию API AWS
Синтаксис
update-data-source
[--data-deletion-policy <value>]
--data-source-configuration <value>
--data-source-id <value>
[--description <value>]
--knowledge-base-id <value>
--name <value>
[--server-side-encryption-configuration <value>]
[--vector-ingestion-configuration <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--data-deletion-policy (строка)
Политика удаления данных для источника данных, который вы хотите обновить.
Возможные значения:
RETAINDELETE
--data-source-configuration (структура)
Конфигурация подключения к источнику данных, которую вы хотите обновить.
confluenceConfiguration -> (структура)
Информация о конфигурации для подключения к Confluence в качестве источника данных.
Примечание
Подключение к источнику данных Confluence находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Конфигурация содержимого Confluence. Например, настройка определённых типов содержимого Confluence.
filterConfiguration -> (структура)
Конфигурация фильтрации содержимого Confluence. Например, настройка шаблонов регулярных выражений для включения или исключения определённого содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определённых объектов или типов содержимого источника данных.
filters -> (список)
Настройка конкретных фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать или включать определённое содержимое.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать или включать определённое содержимое.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключающих регулярных выражений для исключения определённых типов объектов, соответствующих шаблону. Если вы задаёте включение и исключение фильтра/шаблона, и оба совпадают с документом, исключающий фильтр имеет приоритет и документ не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включающих регулярных выражений для включения определённых типов объектов, соответствующих шаблону. Если вы задаёте включение и исключение фильтра/шаблона, и оба совпадают с документом, исключающий фильтр имеет приоритет и документ не сканируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применить для фильтрации содержимого.sourceConfiguration -> (структура)
Информация о конечной точке подключения к вашему источнику данных Confluence.
authType -> (строка)
credentialsSecretArn -> (строка)
hostType -> (строка)
hostUrl -> (строка)
s3Configuration -> (структура)
Информация о конфигурации для подключения к Amazon S3 в качестве источника данных.
bucketArn -> (строка)
bucketOwnerAccountId -> (строка)
inclusionPrefixes -> (список)
Список префиксов S3 для включения определённых файлов или содержимого. Для получения дополнительной информации см. Организация объектов с использованием префиксов.
(строка)
salesforceConfiguration -> (структура)
Информация о конфигурации для подключения к Salesforce в качестве источника данных.
Примечание
Подключение к источнику данных Salesforce находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Конфигурация содержимого Salesforce. Например, настройка определённых типов содержимого Salesforce.
filterConfiguration -> (структура)
Конфигурация фильтрации содержимого Salesforce. Например, настройка шаблонов регулярных выражений для включения или исключения определённого содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определённых объектов или типов содержимого источника данных.
filters -> (список)
Настройка конкретных фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать или включать определённое содержимое.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать или включать определённое содержимое.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключающих регулярных выражений для исключения определённых типов объектов, соответствующих шаблону. Если вы задаёте включение и исключение фильтра/шаблона, и оба совпадают с документом, исключающий фильтр имеет приоритет и документ не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включающих регулярных выражений для включения определённых типов объектов, соответствующих шаблону. Если вы задаёте включение и исключение фильтра/шаблона, и оба совпадают с документом, исключающий фильтр имеет приоритет и документ не сканируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применить для фильтрации содержимого.sourceConfiguration -> (структура)
Информация о конечной точке подключения к вашему источнику данных Salesforce.
authType -> (строка)
credentialsSecretArn -> (строка)
hostUrl -> (строка)
sharePointConfiguration -> (структура)
Информация о конфигурации для подключения к SharePoint в качестве источника данных.
Примечание
Подключение к источнику данных SharePoint находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Конфигурация содержимого SharePoint. Например, настройка определённых типов содержимого SharePoint.
filterConfiguration -> (структура)
Конфигурация фильтрации содержимого SharePoint. Например, настройка шаблонов регулярных выражений для включения или исключения определённого содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определённых объектов или типов содержимого источника данных.
filters -> (список)
Настройка конкретных фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать или включать определённое содержимое.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать или включать определённое содержимое.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключающих регулярных выражений для исключения определённых типов объектов, соответствующих шаблону. Если вы задаёте включение и исключение фильтра/шаблона, и оба совпадают с документом, исключающий фильтр имеет приоритет и документ не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включающих регулярных выражений для включения определённых типов объектов, соответствующих шаблону. Если вы задаёте включение и исключение фильтра/шаблона, и оба совпадают с документом, исключающий фильтр имеет приоритет и документ не сканируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применить для фильтрации содержимого.sourceConfiguration -> (структура)
Информация о конечной точке подключения к вашему источнику данных SharePoint.
authType -> (строка)
credentialsSecretArn -> (строка)
domain -> (строка)
hostType -> (строка)
siteUrls -> (список)
Список одного или нескольких URL-адресов сайтов SharePoint.
(строка)
tenantId -> (строка)
type -> (строка)
webConfiguration -> (структура)
Настройка веб-адресов для сканирования в качестве источника данных. Вы должны иметь разрешение на сканирование этих адресов.
Примечание
Сканирование веб-адресов в качестве источника данных находится в стадии предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Подробная информация о настройке веб-сканера для веб-источника данных.
crawlerLimits -> (структура)
Настройка ограничений сканирования для веб-адресов.
maxPages -> (целое число)
rateLimit -> (целое число)
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключений с использованием регулярных выражений для исключения определенных URL-адресов. Если вы укажете включения и исключения и оба соответствуют URL-адресу, приоритет имеет фильтр исключения, и содержимое веб-страницы URL-адреса не будет сканировано.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения с использованием регулярных выражений для включения определенных URL-адресов. Если вы укажете включения и исключения и оба соответствуют URL-адресу, приоритет имеет фильтр исключения, и содержимое веб-страницы URL-адреса не будет сканировано.
(строка)
scope -> (строка)
Область сканирования для ваших URL-адресов.
Вы можете выбрать сканирование только веб-страниц, принадлежащих одному хосту или доменному имени. Например, только веб-страницы, содержащие исходный URL-адрес “https://docs.aws.amazon.com/bedrock/latest/userguide/” и не другие домены. Вы можете включить поддомены помимо хоста или доменного имени. Например, веб-страницы, содержащие “aws.amazon.com”, могут также включать поддомен “docs.aws.amazon.com”.
userAgent -> (строка)
userAgentHeader -> (строка)
bedrockbot , UUID и суффикса пользовательского агента вашего сканера (если он предоставлен). По умолчанию он установлен на bedrockbot_UUID . Вы можете дополнить bedrockbot_UUID пользовательским суффиксом, чтобы разрешить доступ конкретного пользовательского агента к вашим исходным URL-адресам.sourceConfiguration -> (структура)
Подробная информация о настройках источника для веб-источника данных.
urlConfiguration -> (структура)
Настройка URL-адреса(ов).
seedUrls -> (список)
Один или несколько исходных или начальных URL-адресов.
(структура)
Исходный или начальный URL-адрес. Вы должны иметь разрешение на сканирование этого адреса.
url -> (строка)
Синтаксис JSON:
{
"confluenceConfiguration": {
"crawlerConfiguration": {
"filterConfiguration": {
"patternObjectFilter": {
"filters": [
{
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"objectType": "string"
}
...
]
},
"type": "PATTERN"
}
},
"sourceConfiguration": {
"authType": "BASIC"|"OAUTH2_CLIENT_CREDENTIALS",
"credentialsSecretArn": "string",
"hostType": "SAAS",
"hostUrl": "string"
}
},
"s3Configuration": {
"bucketArn": "string",
"bucketOwnerAccountId": "string",
"inclusionPrefixes": ["string", ...]
},
"salesforceConfiguration": {
"crawlerConfiguration": {
"filterConfiguration": {
"patternObjectFilter": {
"filters": [
{
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"objectType": "string"
}
...
]
},
"type": "PATTERN"
}
},
"sourceConfiguration": {
"authType": "OAUTH2_CLIENT_CREDENTIALS",
"credentialsSecretArn": "string",
"hostUrl": "string"
}
},
"sharePointConfiguration": {
"crawlerConfiguration": {
"filterConfiguration": {
"patternObjectFilter": {
"filters": [
{
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"objectType": "string"
}
...
]
},
"type": "PATTERN"
}
},
"sourceConfiguration": {
"authType": "OAUTH2_CLIENT_CREDENTIALS"|"OAUTH2_SHAREPOINT_APP_ONLY_CLIENT_CREDENTIALS",
"credentialsSecretArn": "string",
"domain": "string",
"hostType": "ONLINE",
"siteUrls": ["string", ...],
"tenantId": "string"
}
},
"type": "S3"|"WEB"|"CONFLUENCE"|"SALESFORCE"|"SHAREPOINT"|"CUSTOM"|"REDSHIFT_METADATA",
"webConfiguration": {
"crawlerConfiguration": {
"crawlerLimits": {
"maxPages": integer,
"rateLimit": integer
},
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"scope": "HOST_ONLY"|"SUBDOMAINS",
"userAgent": "string",
"userAgentHeader": "string"
},
"sourceConfiguration": {
"urlConfiguration": {
"seedUrls": [
{
"url": "string"
}
...
]
}
}
}
}
--data-source-id (строка)
--description (строка)
--knowledge-base-id (строка)
--name (строка)
--server-side-encryption-configuration (структура)
Содержит подробности о шифровании данных источника на стороне сервера.
kmsKeyArn -> (строка)
Сокращенный синтаксис:
kmsKeyArn=string
Синтаксис JSON:
{
"kmsKeyArn": "string"
}
--vector-ingestion-configuration (структура)
Содержит подробности о том, как загружать документы в источник данных.
chunkingConfiguration -> (структура)
Подробности о том, как разбивать документы в источнике данных на части. Часть — это фрагмент из источника данных, который возвращается при запросе к базе знаний, к которой он относится.
chunkingStrategy -> (строка)
База знаний может разбивать ваши исходные данные на части. Часть — это фрагмент из источника данных, который возвращается при запросе к базе знаний, к которой он относится. У вас есть следующие варианты для разбиения данных на части. Если вы выберите NONE, то, возможно, вам потребуется предварительно обработать файлы, разделив их таким образом, чтобы каждый файл соответствовал одной части.
-
FIXED_SIZE— Amazon Bedrock разбивает ваши исходные данные на части приблизительно заданного вами размера в полеfixedSizeChunkingConfiguration. -
HIERARCHICAL— Разделение документов на слои частей, где первый слой содержит большие части, а второй слой содержит меньшие части, полученные из первого слоя. -
SEMANTIC— Разделение документов на части на основе групп сходного контента, полученного с помощью обработки естественного языка. -
NONE— Amazon Bedrock обрабатывает каждый файл как одну часть. Если вы выберете этот вариант, вам, возможно, потребуется предварительно обработать документы, разделив их на отдельные файлы.
fixedSizeChunkingConfiguration -> (структура)
Настройки для фиксированного разбиения на части. Если вы установили chunkingStrategy как NONE, этот параметр нужно исключить.
maxTokens -> (целое число)
overlapPercentage -> (целое число)
hierarchicalChunkingConfiguration -> (структура)
Настройки для иерархического разбиения документов на части для источника данных. Иерархическое разбиение на части разбивает документы на слои частей, где первый слой содержит большие части, а второй слой содержит меньшие части, полученные из первого слоя.
levelConfigurations -> (список)
Настройки токенов для каждого слоя.
(структура)
Настройки токенов для слоя в конфигурации иерархического разбиения на части.
maxTokens -> (целое число)
overlapTokens -> (целое число)
semanticChunkingConfiguration -> (структура)
Настройки для семантического разбиения документов на части для источника данных. Семантическое разбиение на части разбивает документ на меньшие документы на основе групп сходного контента, полученного из текста с помощью обработки естественного языка.
breakpointPercentileThreshold -> (целое число)
bufferSize -> (целое число)
maxTokens -> (целое число)
contextEnrichmentConfiguration -> (структура)
Конфигурация обогащения контекста, используемая для загрузки данных в векторное хранилище.
bedrockFoundationModelConfiguration -> (структура)
Конфигурация модели Amazon Bedrock, используемой для обогащения контекста.
enrichmentStrategyConfiguration -> (структура)
Стратегия обогащения, используемая для предоставления дополнительного контекста. Например, Neptune GraphRAG использует модели Amazon Bedrock для извлечения сущностей из частей.
method -> (строка)
modelArn -> (строка)
type -> (строка)
customTransformationConfiguration -> (структура)
Пользовательский преобразователь документов для обработанных документов источника данных.
intermediateStorage -> (структура)
Путь к ведру S3 для входных и выходных объектов.
s3Location -> (структура)
Путь к ведру S3.
uri -> (строка)
s3://my-bucket/chunk-processor/.transformations -> (список)
Функция Lambda, которая обрабатывает документы.
(структура)
Пользовательский этап обработки документов, перемещающихся по конвейеру загрузки источника данных. Для обработки документов после их преобразования в части установите шаг для применения к POST_CHUNKING.
stepToApply -> (строка)
transformationFunction -> (структура)
Функция Lambda, которая обрабатывает документы.
transformationLambdaConfiguration -> (структура)
Функция Lambda.
lambdaArn -> (строка)
parsingConfiguration -> (структура)
Настройки для парсера, который используется для разбора документов в вашем источнике данных. Если вы исключите этот параметр, будет использоваться парсер по умолчанию.
bedrockDataAutomationConfiguration -> (структура)
Если вы укажете BEDROCK_DATA_AUTOMATION в качестве стратегии разбора для загрузки вашего источника данных, используйте этот объект для изменения настроек, используя парсер Amazon Bedrock Data Automation.
parsingModality -> (строка)
bedrockFoundationModelConfiguration -> (структура)
Если вы укажете BEDROCK_FOUNDATION_MODEL в качестве стратегии разбора для загрузки вашего источника данных, используйте этот объект для изменения настроек, используя модель оснований для разбора документов.
modelArn -> (строка)
parsingModality -> (строка)
parsingPrompt -> (структура)
Инструкции по интерпретации содержимого документа.
parsingPromptText -> (строка)
parsingStrategy -> (строка)
Синтаксис JSON:
{
"chunkingConfiguration": {
"chunkingStrategy": "FIXED_SIZE"|"NONE"|"HIERARCHICAL"|"SEMANTIC",
"fixedSizeChunkingConfiguration": {
"maxTokens": integer,
"overlapPercentage": integer
},
"hierarchicalChunkingConfiguration": {
"levelConfigurations": [
{
"maxTokens": integer
}
...
],
"overlapTokens": integer
},
"semanticChunkingConfiguration": {
"breakpointPercentileThreshold": integer,
"bufferSize": integer,
"maxTokens": integer
}
},
"contextEnrichmentConfiguration": {
"bedrockFoundationModelConfiguration": {
"enrichmentStrategyConfiguration": {
"method": "CHUNK_ENTITY_EXTRACTION"
},
"modelArn": "string"
},
"type": "BEDROCK_FOUNDATION_MODEL"
},
"customTransformationConfiguration": {
"intermediateStorage": {
"s3Location": {
"uri": "string"
}
},
"transformations": [
{
"stepToApply": "POST_CHUNKING",
"transformationFunction": {
"transformationLambdaConfiguration": {
"lambdaArn": "string"
}
}
}
...
]
},
"parsingConfiguration": {
"bedrockDataAutomationConfiguration": {
"parsingModality": "MULTIMODAL"
},
"bedrockFoundationModelConfiguration": {
"modelArn": "string",
"parsingModality": "MULTIMODAL",
"parsingPrompt": {
"parsingPromptText": "string"
}
},
"parsingStrategy": "BEDROCK_FOUNDATION_MODEL"|"BEDROCK_DATA_AUTOMATION"
}
}
--cli-input-json | --cli-input-yaml (строка) Считывает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному в --generate-cli-skeleton. Если на командной строке предоставлены другие аргументы, эти значения переопределяют значения, указанные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, поскольку строка будет воспринята буквально. Это не может быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или значение input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он валидирует входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Общие параметры
--debug (логическое значение)
Включить отладочную запись в журнал.
--endpoint-url (строка)
Переопределить URL по умолчанию команды заданным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI проверит сертификаты SSL. Этот параметр переопределяет стандартное поведение проверки сертификатов SSL.
--no-paginate (логическое значение)
Отключить автоматическую постраничность. Если автоматическая постраничность отключена, AWS CLI сделает только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла учетных данных.
--region (строка)
Регион для использования. Переопределяет параметры конфигурации/среды.
--version (строка)
Показать версию этого инструмента.
--color (строка)
Включить/отключить цветной вывод.
- включить
- выключить
- автоматически
--no-sign-request (логическое значение)
Не подписывать запросы. Учетные данные не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Файл с набором сертификатов CA для проверки сертификатов SSL. Переопределяет параметры конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения сокета в секундах. Если значение установлено в 0, подключение сокета будет блокирующим и не будет иметь таймаута. Значение по умолчанию — 60 секунд.
--cli-binary-format (строка)
Стиль форматирования для бинарных блоков. По умолчанию используется формат base64. Формат base64 ожидает, что бинарные блоки будут предоставлены в виде закодированной строки base64. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, и бинарные значения должны передаваться буквально. При предоставлении содержимого из файла, соответствующего бинарному блоку, fileb:// всегда будет обрабатываться как бинарный и будет использовать содержимое файла непосредственно независимо от параметра cli-binary-format. При использовании file:// содержимое файла должно быть правильно отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить утилиту постраничного просмотра cli для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать параметры ввода CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическую запрос параметров ввода CLI.
Вывод
dataSource -> (структура)
Содержит подробную информацию о источнике данных.
createdAt -> (временная метка)
dataDeletionPolicy -> (строка)
dataSourceConfiguration -> (структура)
Настройка подключения к источнику данных.
confluenceConfiguration -> (структура)
Настройка подключения к Confluence в качестве источника данных.
Примечание
Подключение к источнику данных Confluence находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Настройка содержимого Confluence. Например, настройка определенных типов содержимого Confluence.
filterConfiguration -> (структура)
Настройка фильтрации содержимого Confluence. Например, настройка шаблонов регулярных выражений для включения или исключения определенного содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определенных объектов или типов содержимого источника данных.
filters -> (список)
Настройка определенных фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать или включать определенное содержимое.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать или включать определенное содержимое.
exclusionFilters -> (список)
Список одного или нескольких шаблонов регулярных выражений для исключения определенных типов объектов, соответствующих шаблону. Если вы указали фильтр включения и исключения/шаблон, и оба соответствуют документу, фильтр исключения имеет приоритет, и документ не индексируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов регулярных выражений для включения определенных типов объектов, соответствующих шаблону. Если вы указали фильтр включения и исключения/шаблон, и оба соответствуют документу, фильтр исключения имеет приоритет, и документ не индексируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применить для фильтрации содержимого.sourceConfiguration -> (структура)
Информация об конечной точке подключения к вашему источнику данных Confluence.
authType -> (строка)
credentialsSecretArn -> (строка)
hostType -> (строка)
hostUrl -> (строка)
s3Configuration -> (структура)
Настройка подключения к Amazon S3 в качестве источника данных.
bucketArn -> (строка)
bucketOwnerAccountId -> (строка)
inclusionPrefixes -> (список)
Список префиксов S3 для включения определенных файлов или содержимого. Дополнительную информацию см. в разделе Организация объектов с использованием префиксов.
(строка)
salesforceConfiguration -> (структура)
Настройка подключения к Salesforce в качестве источника данных.
Примечание
Подключение к источнику данных Salesforce находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Настройка содержимого Salesforce. Например, настройка определенных типов содержимого Salesforce.
filterConfiguration -> (структура)
Настройка фильтрации содержимого Salesforce. Например, настройка шаблонов регулярных выражений для включения или исключения определенного содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определенных объектов или типов содержимого источника данных.
filters -> (список)
Настройка определенных фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать или включать определенное содержимое.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать или включать определенное содержимое.
exclusionFilters -> (список)
Список одного или нескольких шаблонов регулярных выражений для исключения определенных типов объектов, соответствующих шаблону. Если вы указали фильтр включения и исключения/шаблон, и оба соответствуют документу, фильтр исключения имеет приоритет, и документ не индексируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов регулярных выражений для включения определенных типов объектов, соответствующих шаблону. Если вы указали фильтр включения и исключения/шаблон, и оба соответствуют документу, фильтр исключения имеет приоритет, и документ не индексируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применить для фильтрации содержимого.sourceConfiguration -> (структура)
Информация об конечной точке подключения к вашему источнику данных Salesforce.
authType -> (строка)
credentialsSecretArn -> (строка)
hostUrl -> (строка)
sharePointConfiguration -> (структура)
Настройка подключения к SharePoint в качестве источника данных.
Примечание
Подключение к источнику данных SharePoint находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Настройка содержимого SharePoint. Например, настройка определенных типов содержимого SharePoint.
filterConfiguration -> (структура)
Настройка фильтрации содержимого SharePoint. Например, настройка шаблонов регулярных выражений для включения или исключения определенного содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определенных объектов или типов содержимого источника данных.
filters -> (список)
Настройка определенных фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать или включать определенное содержимое.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать или включать определенное содержимое.
exclusionFilters -> (список)
Список одного или нескольких шаблонов регулярных выражений для исключения определенных типов объектов, соответствующих шаблону. Если вы указали фильтр включения и исключения/шаблон, и оба соответствуют документу, фильтр исключения имеет приоритет, и документ не индексируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов регулярных выражений для включения определенных типов объектов, соответствующих шаблону. Если вы указали фильтр включения и исключения/шаблон, и оба соответствуют документу, фильтр исключения имеет приоритет, и документ не индексируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применить для фильтрации содержимого.sourceConfiguration -> (структура)
Информация об конечной точке подключения к вашему источнику данных SharePoint.
authType -> (строка)
credentialsSecretArn -> (строка)
domain -> (строка)
hostType -> (строка)
siteUrls -> (список)
Список одного или нескольких URL-адресов сайтов SharePoint.
(строка)
tenantId -> (строка)
type -> (строка)
webConfiguration -> (структура)
Конфигурация веб-ссылок для сканирования вашего источника данных. Вы должны быть авторизованы для сканирования этих ссылок.
Примечание
Сканирование веб-ссылок в качестве источника данных находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Подробности конфигурации веб-сканера для веб-источника данных.
crawlerLimits -> (структура)
Конфигурация ограничений сканирования для веб-ссылок.
maxPages -> (целое число)
rateLimit -> (целое число)
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключения с использованием регулярных выражений для исключения определённых ссылок. Если вы указали фильтр включения и исключения, и оба соответствуют URL-адресу, фильтр исключения имеет приоритет, и содержимое веб-страницы URL-адреса не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения с использованием регулярных выражений для включения определённых URL-адресов. Если вы указали фильтр включения и исключения, и оба соответствуют URL-адресу, фильтр исключения имеет приоритет, и содержимое веб-страницы URL-адреса не сканируется.
(строка)
scope -> (строка)
Область сканирования для ваших URL-адресов.
Вы можете выбрать сканирование только веб-страниц, принадлежащих одному хосту или основному домену. Например, только веб-страницы, содержащие исходный URL-адрес «https://docs.aws.amazon.com/bedrock/latest/userguide/» и никаких других доменов. Вы можете выбрать включение поддоменов помимо хоста или основного домена. Например, веб-страницы, содержащие «aws.amazon.com», также могут включать поддомен «docs.aws.amazon.com».
userAgent -> (строка)
userAgentHeader -> (строка)
bedrockbot , UUID и суффикса пользовательского агента для вашего сканера (если он предоставлен). По умолчанию он установлен на bedrockbot_UUID . Вы можете дополнительно добавить пользовательский суффикс к bedrockbot_UUID, чтобы разрешить доступ к вашим исходным URL-адресам только определённому пользователю агента.sourceConfiguration -> (структура)
Подробности конфигурации источника для веб-источника данных.
urlConfiguration -> (структура)
Конфигурация URL-адреса(ов).
seedUrls -> (список)
Один или несколько исходных URL-адресов (точек входа).
(структура)
Исходный URL-адрес (точка входа). Вы должны быть авторизованы для сканирования этого URL-адреса.
url -> (строка)
dataSourceId -> (строка)
description -> (строка)
failureReasons -> (список)
Подробные причины неудачного удаления источника данных.
(строка)
knowledgeBaseId -> (строка)
name -> (строка)
serverSideEncryptionConfiguration -> (структура)
Содержит сведения о конфигурации шифрования на стороне сервера.
kmsKeyArn -> (строка)
status -> (строка)
Статус источника данных. Возможные статусы:
- Доступно – источник данных создан и готов к обработке в базе знаний.
- Удаляется – источник данных удаляется.
updatedAt -> (временная метка)
vectorIngestionConfiguration -> (структура)
Содержит сведения о способе обработки документов в источнике данных.
chunkingConfiguration -> (структура)
Подробности о том, как разбивать документы на фрагменты в источнике данных. Фрагмент — это фрагмент из источника данных, возвращаемый при запросе к базе знаний, к которой он принадлежит.
chunkingStrategy -> (строка)
База знаний может разбить ваши исходные данные на фрагменты. Фрагмент — это фрагмент из источника данных, возвращаемый при запросе к базе знаний, к которой он принадлежит. У вас есть следующие варианты разбиения на фрагменты. Если вы выберете NONE, то вы можете предварительно обработать свои файлы, разделив их так, чтобы каждый файл соответствовал одному фрагменту.
-
FIXED_SIZE– Amazon Bedrock разбивает ваши исходные данные на фрагменты приблизительно заданного размера, указанного вfixedSizeChunkingConfiguration. -
HIERARCHICAL– Разделение документов на слои фрагментов, где первый слой содержит большие фрагменты, а второй слой содержит меньшие фрагменты, полученные из первого слоя. -
SEMANTIC– Разделение документов на фрагменты на основе групп схожего содержания, полученных с помощью обработки естественного языка. -
NONE– Amazon Bedrock обрабатывает каждый файл как один фрагмент. Если вы выберете этот вариант, вы можете предварительно обработать свои документы, разделив их на отдельные файлы.
fixedSizeChunkingConfiguration -> (структура)
Настройки для разбиения на фрагменты фиксированного размера. Если вы установите chunkingStrategy как NONE, исключите этот параметр.
maxTokens -> (целое число)
overlapPercentage -> (целое число)
hierarchicalChunkingConfiguration -> (структура)
Настройки для иерархического разбиения документов на фрагменты для источника данных. Иерархическое разбиение разбивает документы на слои фрагментов, где первый слой содержит большие фрагменты, а второй слой содержит меньшие фрагменты, полученные из первого слоя.
levelConfigurations -> (список)
Настройки токенов для каждого слоя.
(структура)
Настройки токенов для слоя в конфигурации иерархического разбиения на фрагменты.
maxTokens -> (целое число)
overlapTokens -> (целое число)
semanticChunkingConfiguration -> (структура)
Настройки для семантического разбиения документов на фрагменты для источника данных. Семантическое разбиение разделяет документ на меньшие документы на основе групп схожего содержания, полученных из текста с помощью обработки естественного языка.
breakpointPercentileThreshold -> (целое число)
bufferSize -> (целое число)
maxTokens -> (целое число)
contextEnrichmentConfiguration -> (структура)
Конфигурация обогащения контекста, используемая для обработки данных в хранилище векторов.
bedrockFoundationModelConfiguration -> (структура)
Конфигурация модели Amazon Bedrock, используемой для обогащения контекста.
enrichmentStrategyConfiguration -> (структура)
Стратегия обогащения, используемая для предоставления дополнительного контекста. Например, Neptune GraphRAG использует модели Amazon Bedrock для извлечения сущностей фрагментов.
method -> (строка)
modelArn -> (строка)
type -> (строка)
customTransformationConfiguration -> (структура)
Пользовательский преобразователь документов для обработанных документов источника данных.
intermediateStorage -> (структура)
Путь к ведру S3 для входных и выходных объектов.
s3Location -> (структура)
Путь к ведру S3.
uri -> (строка)
s3://my-bucket/chunk-processor/.transformations -> (список)
Функция Lambda для обработки документов.
(структура)
Пользовательский шаг обработки для документов, перемещаемых через конвейер обработки источника данных. Для обработки документов после их преобразования во фрагменты установите шаг, который необходимо применить, в POST_CHUNKING.
stepToApply -> (строка)
transformationFunction -> (структура)
Функция Lambda для обработки документов.
transformationLambdaConfiguration -> (структура)
Функция Lambda.
lambdaArn -> (строка)
parsingConfiguration -> (структура)
Настройки парсера для использования при разборе документов в вашем источнике данных. Если вы исключите этот параметр, будет использоваться парсер по умолчанию.
bedrockDataAutomationConfiguration -> (структура)
Если вы указали BEDROCK_DATA_AUTOMATION в качестве стратегии разбора для обработки вашего источника данных, используйте этот объект для изменения конфигураций, используемых для парсера Amazon Bedrock Data Automation.
parsingModality -> (строка)
bedrockFoundationModelConfiguration -> (структура)
Если вы указали BEDROCK_FOUNDATION_MODEL в качестве стратегии разбора для обработки вашего источника данных, используйте этот объект для изменения конфигураций, используемых для разбора документов с помощью модели.
modelArn -> (строка)
parsingModality -> (строка)
parsingPrompt -> (структура)
Инструкции по интерпретации содержимого документа.
parsingPromptText -> (строка)
parsingStrategy -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.