[ aws . bedrock-agent ]
create-data-source
Описание
Подключает базу знаний к источнику данных. Вы указываете конфигурацию для конкретной службы источника данных в поле dataSourceConfiguration.
Предупреждение
Вы не можете изменитьchunkingConfiguration после создания подключения к источнику данных.См. также: Документацию API AWS
Синтаксис
create-data-source
[--client-token <value>]
[--data-deletion-policy <value>]
--data-source-configuration <value>
[--description <value>]
--knowledge-base-id <value>
--name <value>
[--server-side-encryption-configuration <value>]
[--vector-ingestion-configuration <value>]
[--cli-input-json | --cli-input-yaml]
[--generate-cli-skeleton <value>]
[--debug]
[--endpoint-url <value>]
[--no-verify-ssl]
[--no-paginate]
[--output <value>]
[--query <value>]
[--profile <value>]
[--region <value>]
[--version <value>]
[--color <value>]
[--no-sign-request]
[--ca-bundle <value>]
[--cli-read-timeout <value>]
[--cli-connect-timeout <value>]
[--cli-binary-format <value>]
[--no-cli-pager]
[--cli-auto-prompt]
[--no-cli-auto-prompt]
Параметры
--client-token (строка)
--data-deletion-policy (строка)
Политика удаления данных для источника данных.
Вы можете установить политику удаления данных:
- DELETE: Удаляет все данные из вашего источника данных, преобразованные в векторные вложения при удалении базы знаний или ресурса источника данных. Обратите внимание, что сам векторный магазин не удаляется , удаляются только данные. Этот флаг игнорируется при удалении учетной записи Amazon Web Services.
- RETAIN: Сохраняет все данные из вашего источника данных, преобразованные в векторные вложения при удалении базы знаний или ресурса источника данных. Обратите внимание, что сам векторный магазин не удаляется при удалении базы знаний или ресурса источника данных.
Возможные значения:
RETAINDELETE
--data-source-configuration (структура)
Конфигурация подключения к источнику данных.
confluenceConfiguration -> (структура)
Информация о конфигурации для подключения к Confluence в качестве источника данных.
Примечание
Подключение к источнику данных Confluence находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Конфигурация контента Confluence. Например, настройка определенных типов контента Confluence.
filterConfiguration -> (структура)
Конфигурация фильтрации контента Confluence. Например, настройка шаблонов регулярных выражений для включения или исключения определенного контента.
patternObjectFilter -> (структура)
Конфигурация фильтрации определенных объектов или типов контента источника данных.
filters -> (список)
Конфигурация конкретных фильтров, применяемых к вашему контенту источника данных. Вы можете фильтровать определенный контент.
(структура)
Конкретные фильтры, применяемые к вашему контенту источника данных. Вы можете фильтровать определенный контент.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключающих регулярных выражений для исключения определенных типов объектов, соответствующих шаблону. Если вы задаете фильтр включения и исключения и оба совпадают с документом, фильтр исключения имеет приоритет, и документ не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включающих регулярных выражений для включения определенных типов объектов, соответствующих шаблону. Если вы задаете фильтр включения и исключения и оба совпадают с документом, фильтр исключения имеет приоритет, и документ не сканируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применять для фильтрации своего контента.sourceConfiguration -> (структура)
Информация об endpoint для подключения к вашему источнику данных Confluence.
authType -> (строка)
credentialsSecretArn -> (строка)
hostType -> (строка)
hostUrl -> (строка)
s3Configuration -> (структура)
Информация о конфигурации для подключения к Amazon S3 в качестве источника данных.
bucketArn -> (строка)
bucketOwnerAccountId -> (строка)
inclusionPrefixes -> (список)
Список префиксов S3 для включения определенных файлов или контента. Дополнительные сведения см. в разделе Организация объектов с помощью префиксов .
(строка)
salesforceConfiguration -> (структура)
Информация о конфигурации для подключения к Salesforce в качестве источника данных.
Примечание
Подключение к источнику данных Salesforce находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Конфигурация контента Salesforce. Например, настройка определенных типов контента Salesforce.
filterConfiguration -> (структура)
Конфигурация фильтрации контента Salesforce. Например, настройка шаблонов регулярных выражений для включения или исключения определенного контента.
patternObjectFilter -> (структура)
Конфигурация фильтрации определенных объектов или типов контента источника данных.
filters -> (список)
Конфигурация конкретных фильтров, применяемых к вашему контенту источника данных. Вы можете фильтровать определенный контент.
(структура)
Конкретные фильтры, применяемые к вашему контенту источника данных. Вы можете фильтровать определенный контент.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключающих регулярных выражений для исключения определенных типов объектов, соответствующих шаблону. Если вы задаете фильтр включения и исключения и оба совпадают с документом, фильтр исключения имеет приоритет, и документ не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включающих регулярных выражений для включения определенных типов объектов, соответствующих шаблону. Если вы задаете фильтр включения и исключения и оба совпадают с документом, фильтр исключения имеет приоритет, и документ не сканируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применять для фильтрации своего контента.sourceConfiguration -> (структура)
Информация об endpoint для подключения к вашему источнику данных Salesforce.
authType -> (строка)
credentialsSecretArn -> (строка)
hostUrl -> (строка)
sharePointConfiguration -> (структура)
Информация о конфигурации для подключения к SharePoint в качестве источника данных.
Примечание
Подключение к источнику данных SharePoint находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Конфигурация контента SharePoint. Например, настройка определенных типов контента SharePoint.
filterConfiguration -> (структура)
Конфигурация фильтрации контента SharePoint. Например, настройка шаблонов регулярных выражений для включения или исключения определенного контента.
patternObjectFilter -> (структура)
Конфигурация фильтрации определенных объектов или типов контента источника данных.
filters -> (список)
Конфигурация конкретных фильтров, применяемых к вашему контенту источника данных. Вы можете фильтровать определенный контент.
(структура)
Конкретные фильтры, применяемые к вашему контенту источника данных. Вы можете фильтровать определенный контент.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключающих регулярных выражений для исключения определенных типов объектов, соответствующих шаблону. Если вы задаете фильтр включения и исключения и оба совпадают с документом, фильтр исключения имеет приоритет, и документ не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включающих регулярных выражений для включения определенных типов объектов, соответствующих шаблону. Если вы задаете фильтр включения и исключения и оба совпадают с документом, фильтр исключения имеет приоритет, и документ не сканируется.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые вы можете применять для фильтрации своего контента.sourceConfiguration -> (структура)
Информация об endpoint для подключения к вашему источнику данных SharePoint.
authType -> (строка)
credentialsSecretArn -> (строка)
domain -> (строка)
hostType -> (строка)
siteUrls -> (список)
Список одного или нескольких URL-адресов сайтов SharePoint.
(строка)
tenantId -> (строка)
type -> (строка)
webConfiguration -> (структура)
Настройка веб-ссылок для сканирования и получения данных. Вы должны иметь разрешение на сканирование указанных ссылок.
Примечание
Сканирование веб-ссылок в качестве источника данных находится в стадии предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Подробности конфигурации веб-сканера для веб-источника данных.
crawlerLimits -> (структура)
Настройка ограничений сканирования для веб-ссылок.
maxPages -> (целое число)
rateLimit -> (целое число)
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключения с использованием регулярных выражений для исключения определенных ссылок. Если вы укажете фильтр включения и исключения, и оба соответствуют ссылке, то фильтр исключения имеет приоритет, и содержимое веб-страницы ссылки не будет сканироваться.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения с использованием регулярных выражений для включения определенных ссылок. Если вы укажете фильтр включения и исключения, и оба соответствуют ссылке, то фильтр исключения имеет приоритет, и содержимое веб-страницы ссылки не будет сканироваться.
(строка)
scope -> (строка)
Область сканирования для ваших ссылок.
Вы можете выбрать сканирование только веб-страниц, принадлежащих одному хосту или основному домену. Например, только веб-страницы, содержащие начальную ссылку "https://docs.aws.amazon.com/bedrock/latest/userguide/” и не содержащие другие домены. Вы можете включить поддомены в дополнение к хосту или основному домену. Например, веб-страницы, содержащие "aws.amazon.com", также могут включать поддомен "docs.aws.amazon.com".
userAgent -> (строка)
userAgentHeader -> (строка)
bedrockbot, UUID и суффикса пользовательского агента для вашего сканера (если он указан). По умолчанию он установлен на bedrockbot_UUID. Вы можете необязательно добавить пользовательский суффикс к bedrockbot_UUID, чтобы разрешить определенному пользовательскому агенту доступ к вашим исходным ссылкам.sourceConfiguration -> (структура)
Подробности конфигурации источника для веб-источника данных.
urlConfiguration -> (структура)
Конфигурация URL-адреса/адресов.
seedUrls -> (список)
Одна или несколько начальных или стартовых ссылок.
(структура)
Начальная или стартовая ссылка. Вы должны иметь разрешение на сканирование этой ссылки.
url -> (строка)
Синтаксис JSON:
{
"confluenceConfiguration": {
"crawlerConfiguration": {
"filterConfiguration": {
"patternObjectFilter": {
"filters": [
{
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"objectType": "string"
}
...
]
},
"type": "PATTERN"
}
},
"sourceConfiguration": {
"authType": "BASIC"|"OAUTH2_CLIENT_CREDENTIALS",
"credentialsSecretArn": "string",
"hostType": "SAAS",
"hostUrl": "string"
}
},
"s3Configuration": {
"bucketArn": "string",
"bucketOwnerAccountId": "string",
"inclusionPrefixes": ["string", ...]
},
"salesforceConfiguration": {
"crawlerConfiguration": {
"filterConfiguration": {
"patternObjectFilter": {
"filters": [
{
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"objectType": "string"
}
...
]
},
"type": "PATTERN"
}
},
"sourceConfiguration": {
"authType": "OAUTH2_CLIENT_CREDENTIALS",
"credentialsSecretArn": "string",
"hostUrl": "string"
}
},
"sharePointConfiguration": {
"crawlerConfiguration": {
"filterConfiguration": {
"patternObjectFilter": {
"filters": [
{
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"objectType": "string"
}
...
]
},
"type": "PATTERN"
}
},
"sourceConfiguration": {
"authType": "OAUTH2_CLIENT_CREDENTIALS"|"OAUTH2_SHAREPOINT_APP_ONLY_CLIENT_CREDENTIALS",
"credentialsSecretArn": "string",
"domain": "string",
"hostType": "ONLINE",
"siteUrls": ["string", ...],
"tenantId": "string"
}
},
"type": "S3"|"WEB"|"CONFLUENCE"|"SALESFORCE"|"SHAREPOINT"|"CUSTOM"|"REDSHIFT_METADATA",
"webConfiguration": {
"crawlerConfiguration": {
"crawlerLimits": {
"maxPages": integer,
"rateLimit": integer
},
"exclusionFilters": ["string", ...],
"inclusionFilters": ["string", ...],
"scope": "HOST_ONLY"|"SUBDOMAINS",
"userAgent": "string",
"userAgentHeader": "string"
},
"sourceConfiguration": {
"urlConfiguration": {
"seedUrls": [
{
"url": "string"
}
...
]
}
}
}
}
--description (строка)
--knowledge-base-id (строка)
--name (строка)
--server-side-encryption-configuration (структура)
Содержит сведения о шифровании на стороне сервера для источника данных.
kmsKeyArn -> (строка)
Упрощённый синтаксис:
kmsKeyArn=string
Синтаксис JSON:
{
"kmsKeyArn": "string"
}
--vector-ingestion-configuration (структура)
Содержит сведения о том, как загружать документы в источник данных.
chunkingConfiguration -> (структура)
Подробности о том, как разбить документы в источнике данных. Кусок — это фрагмент источника данных, который возвращается при запросе к базе знаний, к которой он принадлежит.
chunkingStrategy -> (строка)
База знаний может разделять ваши исходные данные на фрагменты. Кусок — это фрагмент источника данных, который возвращается при запросе к базе знаний, к которой он принадлежит. У вас есть следующие варианты для разделения ваших данных. Если вы выбираете NONE, то, возможно, вам нужно предварительно обработать файлы, разделив их так, чтобы каждый файл соответствовал фрагменту.
-
FIXED_SIZE— Amazon Bedrock разделяет исходные данные на фрагменты приблизительно заданного вами размера вfixedSizeChunkingConfiguration. -
HIERARCHICAL— Разделение документов на слои фрагментов, где первый слой содержит большие фрагменты, а второй слой содержит более мелкие фрагменты, полученные из первого слоя. -
SEMANTIC— Разделение документов на фрагменты на основе групп похожих фрагментов, полученных с помощью обработки естественного языка. -
NONE— Amazon Bedrock обрабатывает каждый файл как один фрагмент. Если вы выбираете этот вариант, возможно, вам потребуется предварительно обработать документы, разделив их на отдельные файлы.
fixedSizeChunkingConfiguration -> (структура)
Конфигурации для случаев, когда вы выбираете фрагментацию фиксированного размера. Если вы установили chunkingStrategy как NONE, исключите этот параметр.
maxTokens -> (целое число)
overlapPercentage -> (целое число)
hierarchicalChunkingConfiguration -> (структура)
Настройки для иерархической фрагментации документов для источника данных. Иерархическая фрагментация разбивает документы на слои фрагментов, где первый слой содержит большие фрагменты, а второй слой содержит более мелкие фрагменты, полученные из первого слоя.
levelConfigurations -> (список)
Настройки токенов для каждого слоя.
(структура)
Настройки токенов для слоя в конфигурации иерархической фрагментации.
maxTokens -> (целое число)
overlapTokens -> (целое число)
semanticChunkingConfiguration -> (структура)
Настройки для семантической фрагментации документов для источника данных. Семантическая фрагментация разбивает документ на более мелкие документы на основе групп похожих фрагментов, полученных из текста с помощью обработки естественного языка.
breakpointPercentileThreshold -> (целое число)
bufferSize -> (целое число)
maxTokens -> (целое число)
contextEnrichmentConfiguration -> (структура)
Конфигурация обогащения контекста, используемая для загрузки данных в хранилище векторов.
bedrockFoundationModelConfiguration -> (структура)
Конфигурация модели Amazon Bedrock, используемой для обогащения контекста.
enrichmentStrategyConfiguration -> (структура)
Стратегия обогащения, используемая для предоставления дополнительного контекста. Например, Neptune GraphRAG использует модели Amazon Bedrock для извлечения сущностей из фрагментов.
method -> (строка)
modelArn -> (строка)
type -> (строка)
customTransformationConfiguration -> (структура)
Пользовательский преобразователь документов для обработанных документов источника данных.
intermediateStorage -> (структура)
Путь к ведру S3 для входных и выходных объектов.
s3Location -> (структура)
Путь к ведру S3.
uri -> (строка)
s3://my-bucket/chunk-processor/.transformations -> (список)
Функция Lambda, обрабатывающая документы.
(структура)
Пользовательский этап обработки документов, проходящих через конвейер загрузки данных источника. Для обработки документов после их преобразования в фрагменты установите этап применения на POST_CHUNKING.
stepToApply -> (строка)
transformationFunction -> (структура)
Функция Lambda, обрабатывающая документы.
transformationLambdaConfiguration -> (структура)
Функция Lambda.
lambdaArn -> (строка)
parsingConfiguration -> (структура)
Конфигурации для парсера, который будет использоваться для анализа документов в вашем источнике данных. Если этот параметр исключить, будет использоваться парсер по умолчанию.
bedrockDataAutomationConfiguration -> (структура)
Если вы укажете BEDROCK_DATA_AUTOMATION в качестве стратегии разбора для загрузки вашего источника данных, используйте этот объект для изменения конфигураций использования парсера Amazon Bedrock Data Automation.
parsingModality -> (строка)
bedrockFoundationModelConfiguration -> (структура)
Если вы укажете BEDROCK_FOUNDATION_MODEL в качестве стратегии разбора для загрузки вашего источника данных, используйте этот объект для изменения конфигураций использования модели фундамента для разбора документов.
modelArn -> (строка)
parsingModality -> (строка)
parsingPrompt -> (структура)
Инструкции по интерпретации содержимого документа.
parsingPromptText -> (строка)
parsingStrategy -> (строка)
Синтаксис JSON:
{
"chunkingConfiguration": {
"chunkingStrategy": "FIXED_SIZE"|"NONE"|"HIERARCHICAL"|"SEMANTIC",
"fixedSizeChunkingConfiguration": {
"maxTokens": integer,
"overlapPercentage": integer
},
"hierarchicalChunkingConfiguration": {
"levelConfigurations": [
{
"maxTokens": integer
}
...
],
"overlapTokens": integer
},
"semanticChunkingConfiguration": {
"breakpointPercentileThreshold": integer,
"bufferSize": integer,
"maxTokens": integer
}
},
"contextEnrichmentConfiguration": {
"bedrockFoundationModelConfiguration": {
"enrichmentStrategyConfiguration": {
"method": "CHUNK_ENTITY_EXTRACTION"
},
"modelArn": "string"
},
"type": "BEDROCK_FOUNDATION_MODEL"
},
"customTransformationConfiguration": {
"intermediateStorage": {
"s3Location": {
"uri": "string"
}
},
"transformations": [
{
"stepToApply": "POST_CHUNKING",
"transformationFunction": {
"transformationLambdaConfiguration": {
"lambdaArn": "string"
}
}
}
...
]
},
"parsingConfiguration": {
"bedrockDataAutomationConfiguration": {
"parsingModality": "MULTIMODAL"
},
"bedrockFoundationModelConfiguration": {
"modelArn": "string",
"parsingModality": "MULTIMODAL",
"parsingPrompt": {
"parsingPromptText": "string"
}
},
"parsingStrategy": "BEDROCK_FOUNDATION_MODEL"|"BEDROCK_DATA_AUTOMATION"
}
}
--cli-input-json | --cli-input-yaml (строка) Читает аргументы из предоставленной JSON-строки. JSON-строка следует формату, предоставленному в --generate-cli-skeleton. Если на командной строке указаны другие аргументы, эти значения переопределят значения, предоставленные в JSON. Невозможно передавать произвольные двоичные значения с помощью значения, предоставленного в JSON, так как строка будет воспринята буквально. Это может не быть указано вместе с --cli-input-yaml.
--generate-cli-skeleton (строка) Выводит JSON-скелет в стандартный вывод без отправки запроса к API. Если предоставлено значение без значения или значение input, выводит пример входного JSON, который можно использовать в качестве аргумента для --cli-input-json. Аналогично, если предоставлено yaml-input, он выведет пример входного YAML, который можно использовать с --cli-input-yaml. Если предоставлено значение output, он валидирует входные данные команды и возвращает пример выходного JSON для этой команды. Сгенерированный JSON-скелет нестабилен между версиями AWS CLI, и нет гарантий обратной совместимости в сгенерированном JSON-скелете.
Глобальные параметры
--debug (логическое значение)
Включить отладочную запись в журнал.
--endpoint-url (строка)
Переопределить стандартный URL команды указанным URL.
--no-verify-ssl (логическое значение)
По умолчанию AWS CLI использует SSL при общении с AWS-сервисами. Для каждого SSL-соединения AWS CLI будет проверять SSL-сертификаты. Этот параметр переопределяет стандартное поведение проверки SSL-сертификатов.
--no-paginate (логическое значение)
Отключить автоматическую постраничную навигацию. Если автоматическая постраничная навигация отключена, AWS CLI выполнит только один вызов для первой страницы результатов.
--output (строка)
Стиль форматирования вывода команды.
- json
- текст
- таблица
- yaml
- yaml-поток
--query (строка)
Запрос JMESPath для использования при фильтрации данных ответа.
--profile (строка)
Использовать определенный профиль из файла аутентификационных данных.
--region (строка)
Регион для использования. Переопределяет настройки конфигурации/среды.
--version (строка)
Отобразить версию данного инструмента.
--color (строка)
Включить/отключить цветной вывод.
- включено
- выключено
- автоматически
--no-sign-request (логическое значение)
Не подписывать запросы. Кредиты не будут загружены, если этот аргумент предоставлен.
--ca-bundle (строка)
Образец сертификата CA для использования при проверке SSL-сертификатов. Переопределяет настройки конфигурации/среды.
--cli-read-timeout (целое число)
Максимальное время чтения сокета в секундах. Если значение установлено в 0, чтение сокета будет выполняться блокирующим образом без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-connect-timeout (целое число)
Максимальное время подключения к сокету в секундах. Если значение установлено в 0, подключение к сокету будет выполняться блокирующим образом без таймаута. Значение по умолчанию составляет 60 секунд.
--cli-binary-format (строка)
Стиль форматирования, который будет использоваться для двоичных блоков. Формат по умолчанию — base64. Формат base64 ожидает, что двоичные блоки будут предоставлены в виде закодированной в base64 строки. Формат raw-in-base64-out сохраняет совместимость с поведением AWS CLI V1, а двоичные значения должны передаваться буквально. При предоставлении содержимого из файла, сопоставленного с двоичным блоком, fileb:// всегда будет обрабатываться как двоичный и использовать содержимое файла напрямую независимо от настройки cli-binary-format. При использовании file:// содержимое файла должно быть должным образом отформатировано для настроенного cli-binary-format.
- base64
- raw-in-base64-out
--no-cli-pager (логическое значение)
Отключить страницу кли для вывода.
--cli-auto-prompt (логическое значение)
Автоматически запрашивать параметры входных данных CLI.
--no-cli-auto-prompt (логическое значение)
Отключить автоматическую запрос параметров входных данных CLI.
Вывод
dataSource -> (структура)
Содержит подробности о источнике данных.
createdAt -> (временная метка)
dataDeletionPolicy -> (строка)
dataSourceConfiguration -> (структура)
Настройка подключения к источнику данных.
confluenceConfiguration -> (структура)
Информация о конфигурации для подключения к Confluence в качестве источника данных.
Примечание
Подключение к источнику данных Confluence находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Настройка содержимого Confluence. Например, настройка определённых типов содержимого Confluence.
filterConfiguration -> (структура)
Настройка фильтрации содержимого Confluence. Например, настройка шаблонов регулярных выражений для включения или исключения определённого содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определённых объектов или типов содержимого источника данных.
filters -> (список)
Настройка определённых фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать содержимое, включая или исключая его.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать содержимое, включая или исключая его.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключения регулярных выражений для исключения определённых типов объектов, соответствующих шаблону. Если вы укажете фильтры включения и исключения, и оба совпадут с документом, фильтр исключения имеет приоритет, и документ не будет сканироваться.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения регулярных выражений для включения определённых типов объектов, соответствующих шаблону. Если вы укажете фильтры включения и исключения, и оба совпадут с документом, фильтр исключения имеет приоритет, и документ не будет сканироваться.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые можно применять для фильтрации содержимого.sourceConfiguration -> (структура)
Информация об конечной точке подключения к вашему источнику данных Confluence.
authType -> (строка)
credentialsSecretArn -> (строка)
hostType -> (строка)
hostUrl -> (строка)
s3Configuration -> (структура)
Информация о конфигурации для подключения к Amazon S3 в качестве источника данных.
bucketArn -> (строка)
bucketOwnerAccountId -> (строка)
inclusionPrefixes -> (список)
Список префиксов S3 для включения определённых файлов или содержимого. Дополнительную информацию см. в разделе Организация объектов с использованием префиксов.
(строка)
salesforceConfiguration -> (структура)
Информация о конфигурации для подключения к Salesforce в качестве источника данных.
Примечание
Подключение к источнику данных Salesforce находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Настройка содержимого Salesforce. Например, настройка определённых типов содержимого Salesforce.
filterConfiguration -> (структура)
Настройка фильтрации содержимого Salesforce. Например, настройка шаблонов регулярных выражений для включения или исключения определённого содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определённых объектов или типов содержимого источника данных.
filters -> (список)
Настройка определённых фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать содержимое, включая или исключая его.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать содержимое, включая или исключая его.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключения регулярных выражений для исключения определённых типов объектов, соответствующих шаблону. Если вы укажете фильтры включения и исключения, и оба совпадут с документом, фильтр исключения имеет приоритет, и документ не будет сканироваться.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения регулярных выражений для включения определённых типов объектов, соответствующих шаблону. Если вы укажете фильтры включения и исключения, и оба совпадут с документом, фильтр исключения имеет приоритет, и документ не будет сканироваться.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые можно применять для фильтрации содержимого.sourceConfiguration -> (структура)
Информация об конечной точке подключения к вашему источнику данных Salesforce.
authType -> (строка)
credentialsSecretArn -> (строка)
hostUrl -> (строка)
sharePointConfiguration -> (структура)
Информация о конфигурации для подключения к SharePoint в качестве источника данных.
Примечание
Подключение к источнику данных SharePoint находится в предварительной версии и может быть изменено.crawlerConfiguration -> (структура)
Настройка содержимого SharePoint. Например, настройка определённых типов содержимого SharePoint.
filterConfiguration -> (структура)
Настройка фильтрации содержимого SharePoint. Например, настройка шаблонов регулярных выражений для включения или исключения определённого содержимого.
patternObjectFilter -> (структура)
Настройка фильтрации определённых объектов или типов содержимого источника данных.
filters -> (список)
Настройка определённых фильтров, применяемых к содержимому вашего источника данных. Вы можете фильтровать содержимое, включая или исключая его.
(структура)
Конкретные фильтры, применяемые к содержимому вашего источника данных. Вы можете фильтровать содержимое, включая или исключая его.
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключения регулярных выражений для исключения определённых типов объектов, соответствующих шаблону. Если вы укажете фильтры включения и исключения, и оба совпадут с документом, фильтр исключения имеет приоритет, и документ не будет сканироваться.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения регулярных выражений для включения определённых типов объектов, соответствующих шаблону. Если вы укажете фильтры включения и исключения, и оба совпадут с документом, фильтр исключения имеет приоритет, и документ не будет сканироваться.
(строка)
objectType -> (строка)
type -> (строка)
PATTERN — это шаблоны регулярных выражений, которые можно применять для фильтрации содержимого.sourceConfiguration -> (структура)
Информация об конечной точке подключения к вашему источнику данных SharePoint.
authType -> (строка)
credentialsSecretArn -> (строка)
domain -> (строка)
hostType -> (строка)
siteUrls -> (список)
Список одного или нескольких URL-адресов сайтов SharePoint.
(строка)
tenantId -> (строка)
type -> (строка)
webConfiguration -> (структура)
Настройка веб-ссылок для сканирования вашего источника данных. Вы должны быть авторизованы для сканирования этих ссылок.
Примечание
Сканирование веб-ссылок в качестве источника данных находится на стадии предварительного выпуска и может быть изменено.crawlerConfiguration -> (структура)
Подробные данные о настройке веб-сканера для веб-источника данных.
crawlerLimits -> (структура)
Настройка лимитов сканирования для веб-ссылок.
maxPages -> (целое число)
rateLimit -> (целое число)
exclusionFilters -> (список)
Список одного или нескольких шаблонов исключения с использованием регулярных выражений для исключения определённых ссылок. Если вы задаёте фильтр включения и исключения, и оба соответствуют ссылке, фильтр исключения имеет приоритет, и содержимое веб-страницы данной ссылки не сканируется.
(строка)
inclusionFilters -> (список)
Список одного или нескольких шаблонов включения с использованием регулярных выражений для включения определённых ссылок. Если вы задаёте фильтр включения и исключения, и оба соответствуют ссылке, фильтр исключения имеет приоритет, и содержимое веб-страницы данной ссылки не сканируется.
(строка)
scope -> (строка)
Область сканирования для ваших ссылок.
Вы можете выбрать сканирование только веб-страниц, принадлежащих одному хосту или домену верхнего уровня. Например, только веб-страниц, содержащих исходную ссылку "https://docs.aws.amazon.com/bedrock/latest/userguide/” и никаких других доменов. Вы можете выбрать включение поддоменов помимо хоста или домена верхнего уровня. Например, веб-страницы, содержащие "aws.amazon.com", также могут включать поддомен "docs.aws.amazon.com".
userAgent -> (строка)
userAgentHeader -> (строка)
bedrockbot , UUID и суффикса пользовательского агента для вашего сканера (если он предоставлен). По умолчанию он установлен на bedrockbot_UUID. Вы можете дополнительно добавить собственный суффикс к bedrockbot_UUID, чтобы разрешить доступ конкретному пользовательскому агенту к вашим исходным ссылкам.sourceConfiguration -> (структура)
Подробные данные о настройке источника данных для веб-источника данных.
urlConfiguration -> (структура)
Настройка URL/ссылок.
seedUrls -> (список)
Одна или несколько начальных (seed) или отправных ссылок.
(структура)
Начальная (seed) или отправная ссылка. Вы должны быть авторизованы для сканирования этой ссылки.
url -> (строка)
dataSourceId -> (строка)
description -> (строка)
failureReasons -> (список)
Подробные причины сбоя при удалении источника данных.
(строка)
knowledgeBaseId -> (строка)
name -> (строка)
serverSideEncryptionConfiguration -> (структура)
Содержит информацию о настройке шифрования на стороне сервера.
kmsKeyArn -> (строка)
status -> (строка)
Статус источника данных. Возможные статусы:
- Доступен – источник данных создан и готов к обработке в базе знаний.
- Удаляется – источник данных удаляется.
updatedAt -> (метка времени)
vectorIngestionConfiguration -> (структура)
Содержит информацию о том, как обрабатывать документы в источнике данных.
chunkingConfiguration -> (структура)
Подробности о том, как разбивать документы в источнике данных на части. Часть относится к фрагменту источника данных, возвращаемому при запросе к базе знаний, к которой он относится.
chunkingStrategy -> (строка)
База знаний может разделить ваши исходные данные на части. Часть относится к фрагменту источника данных, возвращаемому при запросе к базе знаний, к которой он относится. У вас есть следующие варианты разбивки данных на части. Если вы выберите NONE, то, возможно, вам потребуется предварительно обработать файлы, разделив их так, чтобы каждый файл соответствовал части.
-
FIXED_SIZE– Amazon Bedrock разбивает ваши исходные данные на части приблизительно заданного вами размера вfixedSizeChunkingConfiguration. -
HIERARCHICAL– Разделение документов на слои частей, где первый слой содержит большие части, а второй слой содержит меньшие части, полученные из первого слоя. -
SEMANTIC– Разделение документов на части на основе групп схожего контента, полученного с помощью обработки естественного языка. -
NONE– Amazon Bedrock обрабатывает каждый файл как одну часть. Если вы выбираете этот вариант, возможно, вам потребуется предварительно обработать документы, разделив их на отдельные файлы.
fixedSizeChunkingConfiguration -> (структура)
Настройки для случаев фиксированного размера частей. Если вы установили chunkingStrategy как NONE, исключите это поле.
maxTokens -> (целое число)
overlapPercentage -> (целое число)
hierarchicalChunkingConfiguration -> (структура)
Настройки для иерархического разбиения документов на части для источника данных. Иерархическое разбиение разбивает документы на слои частей, где первый слой содержит большие части, а второй слой содержит меньшие части, полученные из первого слоя.
levelConfigurations -> (список)
Настройки токенов для каждого слоя.
(структура)
Настройки токенов для слоя в конфигурации иерархического разбиения на части.
maxTokens -> (целое число)
overlapTokens -> (целое число)
semanticChunkingConfiguration -> (структура)
Настройки для семантического разбиения документов на части для источника данных. Семантическое разбиение разбивает документ на меньшие документы на основе групп схожего контента, извлечённого из текста с помощью обработки естественного языка.
breakpointPercentileThreshold -> (целое число)
bufferSize -> (целое число)
maxTokens -> (целое число)
contextEnrichmentConfiguration -> (структура)
Конфигурация обогащения контекста, используемая для обработки данных в хранилище векторов.
bedrockFoundationModelConfiguration -> (структура)
Настройка модели основного фундамента Amazon Bedrock, используемой для обогащения контекста.
enrichmentStrategyConfiguration -> (структура)
Стратегия обогащения, используемая для предоставления дополнительного контекста. Например, Neptune GraphRAG использует модели основного фундамента Amazon Bedrock для извлечения сущностей из частей.
method -> (строка)
modelArn -> (строка)
type -> (строка)
customTransformationConfiguration -> (структура)
Настройка пользовательского преобразователя документов для документов, извлеченных из источника данных.
intermediateStorage -> (структура)
Путь к ведру S3 для входных и выходных объектов.
s3Location -> (структура)
Путь к ведру S3.
uri -> (строка)
s3://my-bucket/chunk-processor/.transformations -> (список)
Функция Lambda, обрабатывающая документы.
(структура)
Пользовательский этап обработки документов, перемещаемых по конвейеру обработки данных источника. Для обработки документов после преобразования их в части задайте этап применения к POST_CHUNKING.
stepToApply -> (строка)
transformationFunction -> (структура)
Функция Lambda, обрабатывающая документы.
transformationLambdaConfiguration -> (структура)
Функция Lambda.
lambdaArn -> (строка)
parsingConfiguration -> (структура)
Настройки парсера для парсинга документов в вашем источнике данных. Если вы исключите это поле, будет использоваться парсер по умолчанию.
bedrockDataAutomationConfiguration -> (структура)
Если вы задали BEDROCK_DATA_AUTOMATION как стратегию парсинга для обработки вашего источника данных, используйте этот объект для изменения настроек использования парсера Amazon Bedrock Data Automation.
parsingModality -> (строка)
bedrockFoundationModelConfiguration -> (структура)
Если вы задали BEDROCK_FOUNDATION_MODEL как стратегию парсинга для обработки вашего источника данных, используйте этот объект для изменения настроек использования модели основного фундамента для парсинга документов.
modelArn -> (строка)
parsingModality -> (строка)
parsingPrompt -> (структура)
Инструкции по интерпретации содержимого документа.
parsingPromptText -> (строка)
parsingStrategy -> (строка)
© Copyright 2025, Amazon Web Services. Created using Sphinx.