Spec-Zone.ru › Elasticsearch 8
›Elasticsearch Guide [8.17] ›REST API ›Inference APIs

Интеграция с Anthropic inference

Справочник нового API

Для получения самых свежих данных по API обратитесь к Inference APIs.

Создаёт конечную точку инференса для выполнения задачи инференса с помощью сервиса anthropic.

Запрос

PUT /_inference/<task_type>/<inference_id>

Параметры пути

<inference_id>
(Обязательный, строка) Уникальный идентификатор конечной точки инференса.
<task_type>

(Обязательный, строка) Тип задачи инференса, которую будет выполнять модель.

Доступные типы задач:

  • completion

Тело запроса

chunking_settings

(Необязательный, объект) Объект конфигурации фрагментации. Обратитесь к Конфигурирование фрагментации, чтобы узнать больше о фрагментации.

max_chunk_size
(Необязательный, целое число) Указывает максимальный размер фрагмента в словах. По умолчанию 250. Это значение не может быть больше 300 или меньше 20 (для стратегии sentence) или 10 (для стратегии word).
overlap
(Необязательный, целое число) Только для стратегии фрагментации word. Указывает количество перекрывающихся слов для фрагментов. По умолчанию 100. Это значение не может быть больше половины max_chunk_size.
sentence_overlap
(Необязательный, целое число) Только для стратегии фрагментации sentence. Указывает количество перекрывающихся предложений для фрагментов. Может быть либо 1, либо 0. По умолчанию 1.
strategy
(Необязательный, строка) Указывает стратегию фрагментации. Может быть либо sentence, либо word.
service
(Обязательный, строка) Тип сервиса, поддерживаемого для указанного типа задачи. В данном случае, anthropic.
service_settings

(Обязательный, объект) Настройки для установки модели инференса.

Эти настройки специфичны для сервиса anthropic.

api_key
(Обязательный, строка) Действительный API ключ для Anthropic API.
model_id
(Обязательный, строка) Название модели для использования в задаче инференса. Поддерживаемые модели можно найти на странице Anthropic models.
rate_limit

(Необязательный, объект) По умолчанию сервис anthropic устанавливает количество разрешённых запросов в минуту на 50. Это помогает минимизировать количество ошибок лимита запросов, возвращаемых Anthropic. Чтобы изменить это, установите настройку requests_per_minute в настройках своего сервиса:

"rate_limit": {
    "requests_per_minute": <<number_of_requests>>
}
task_settings

(Обязательный, объект) Настройки для конфигурирования задачи инференса. Эти настройки специфичны для указанного вами сервиса <task_type>.

task_settings для типа задачи completion
max_tokens
(Обязательный, целое число) Максимальное количество токенов для генерации перед остановкой.
temperature

(Необязательный, число с плавающей точкой) Количество случайности, введённое в ответ.

Подробнее о поддерживаемом диапазоне см. в Anthropic messages API.

top_k

(Необязательный, целое число) Указывает на выбор только из верхних K вариантов для каждого последующего токена.

Рекомендуется только для продвинутых случаев использования. Обычно вам нужно использовать только temperature.

Для получения более подробной информации обратитесь к Anthropic messages API.

top_p

(Необязательный, число с плавающей точкой) Указывает на использование ядерного сэмплирования Anthropic.

При ядерном сэмплировании Anthropic вычисляет кумулятивное распределение по всем вариантам для каждого последующего токена в порядке убывания вероятности и обрывает его, как только достигнет определённой вероятности, заданной top_p. Вам следует изменить либо temperature, либо top_p, но не оба значения.

Рекомендуется только для продвинутых случаев использования. Обычно вам нужно использовать только temperature.

Для получения более подробной информации обратитесь к Anthropic messages API.

Пример сервиса Anthropic

Следующий пример показывает, как создать конечную точку инференса под названием anthropic_completion для выполнения задачи типа completion.

resp = client.inference.put(
    task_type="completion",
    inference_id="anthropic_completion",
    inference_config={
        "service": "anthropic",
        "service_settings": {
            "api_key": "<api_key>",
            "model_id": "<model_id>"
        },
        "task_settings": {
            "max_tokens": 1024
        }
    },
)
print(resp)
const response = await client.inference.put({
  task_type: "completion",
  inference_id: "anthropic_completion",
  inference_config: {
    service: "anthropic",
    service_settings: {
      api_key: "<api_key>",
      model_id: "<model_id>",
    },
    task_settings: {
      max_tokens: 1024,
    },
  },
});
console.log(response);
PUT _inference/completion/anthropic_completion
{
    "service": "anthropic",
    "service_settings": {
        "api_key": "<api_key>",
        "model_id": "<model_id>"
    },
    "task_settings": {
        "max_tokens": 1024
    }
}

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/infer-service-anthropic.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API