Интеграция с Anthropic inference
Создаёт конечную точку инференса для выполнения задачи инференса с помощью сервиса anthropic.
Запрос
PUT /_inference/<task_type>/<inference_id>
Параметры пути
-
<inference_id> - (Обязательный, строка) Уникальный идентификатор конечной точки инференса.
-
<task_type> -
(Обязательный, строка) Тип задачи инференса, которую будет выполнять модель.
Доступные типы задач:
-
completion
-
Тело запроса
-
chunking_settings -
(Необязательный, объект) Объект конфигурации фрагментации. Обратитесь к Конфигурирование фрагментации, чтобы узнать больше о фрагментации.
-
max_chunk_size - (Необязательный, целое число) Указывает максимальный размер фрагмента в словах. По умолчанию
250. Это значение не может быть больше300или меньше20(для стратегииsentence) или10(для стратегииword). -
overlap - (Необязательный, целое число) Только для стратегии фрагментации
word. Указывает количество перекрывающихся слов для фрагментов. По умолчанию100. Это значение не может быть больше половиныmax_chunk_size. -
sentence_overlap - (Необязательный, целое число) Только для стратегии фрагментации
sentence. Указывает количество перекрывающихся предложений для фрагментов. Может быть либо1, либо0. По умолчанию1. -
strategy - (Необязательный, строка) Указывает стратегию фрагментации. Может быть либо
sentence, либоword.
-
-
service - (Обязательный, строка) Тип сервиса, поддерживаемого для указанного типа задачи. В данном случае,
anthropic. -
service_settings -
(Обязательный, объект) Настройки для установки модели инференса.
Эти настройки специфичны для сервиса
anthropic.-
api_key - (Обязательный, строка) Действительный API ключ для Anthropic API.
-
model_id - (Обязательный, строка) Название модели для использования в задаче инференса. Поддерживаемые модели можно найти на странице Anthropic models.
-
rate_limit -
(Необязательный, объект) По умолчанию сервис
anthropicустанавливает количество разрешённых запросов в минуту на50. Это помогает минимизировать количество ошибок лимита запросов, возвращаемых Anthropic. Чтобы изменить это, установите настройкуrequests_per_minuteв настройках своего сервиса:"rate_limit": { "requests_per_minute": <<number_of_requests>> }
-
-
task_settings -
(Обязательный, объект) Настройки для конфигурирования задачи инференса. Эти настройки специфичны для указанного вами сервиса
<task_type>.task_settingsдля типа задачиcompletion-
max_tokens - (Обязательный, целое число) Максимальное количество токенов для генерации перед остановкой.
-
temperature -
(Необязательный, число с плавающей точкой) Количество случайности, введённое в ответ.
Подробнее о поддерживаемом диапазоне см. в Anthropic messages API.
-
top_k -
(Необязательный, целое число) Указывает на выбор только из верхних K вариантов для каждого последующего токена.
Рекомендуется только для продвинутых случаев использования. Обычно вам нужно использовать только
temperature.Для получения более подробной информации обратитесь к Anthropic messages API.
-
top_p -
(Необязательный, число с плавающей точкой) Указывает на использование ядерного сэмплирования Anthropic.
При ядерном сэмплировании Anthropic вычисляет кумулятивное распределение по всем вариантам для каждого последующего токена в порядке убывания вероятности и обрывает его, как только достигнет определённой вероятности, заданной
top_p. Вам следует изменить либоtemperature, либоtop_p, но не оба значения.Рекомендуется только для продвинутых случаев использования. Обычно вам нужно использовать только
temperature.Для получения более подробной информации обратитесь к Anthropic messages API.
-
Пример сервиса Anthropic
Следующий пример показывает, как создать конечную точку инференса под названием anthropic_completion для выполнения задачи типа completion.
resp = client.inference.put(
task_type="completion",
inference_id="anthropic_completion",
inference_config={
"service": "anthropic",
"service_settings": {
"api_key": "<api_key>",
"model_id": "<model_id>"
},
"task_settings": {
"max_tokens": 1024
}
},
)
print(resp) const response = await client.inference.put({
task_type: "completion",
inference_id: "anthropic_completion",
inference_config: {
service: "anthropic",
service_settings: {
api_key: "<api_key>",
model_id: "<model_id>",
},
task_settings: {
max_tokens: 1024,
},
},
});
console.log(response); PUT _inference/completion/anthropic_completion
{
"service": "anthropic",
"service_settings": {
"api_key": "<api_key>",
"model_id": "<model_id>"
},
"task_settings": {
"max_tokens": 1024
}
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/infer-service-anthropic.html