Spec-Zone.ru › Elasticsearch 8
›Elasticsearch Guide [8.17] ›REST APIs ›Inference APIs

Интеграция с Azure AI Studio для выполнения инференса

Справочник по новым API

Для получения самых последних данных об API обратитесь к Inference APIs.

Создаёт конечную точку инференса для выполнения задачи инференса с помощью сервиса azureaistudio.

Запрос

PUT /_inference/<task_type>/<inference_id>

Параметры пути

<inference_id>
(Обязательный, строка) Уникальный идентификатор конечной точки инференса.
<task_type>

(Обязательный, строка) Тип задачи инференса, которую выполнит модель.

Доступные типы задач:

  • completion,
  • text_embedding.

Тело запроса

chunking_settings

(Необязательный, объект) Объект конфигурации фрагментации. Обратитесь к Конфигурирование фрагментации, чтобы узнать больше о фрагментации.

max_chunk_size
(Необязательный, целое число) Указывает максимальный размер фрагмента в словах. По умолчанию 250. Это значение не может быть больше 300 или меньше 20 (для стратегии sentence) или 10 (для стратегии word).
overlap
(Необязательный, целое число) Только для стратегии фрагментации word. Указывает количество перекрывающихся слов для фрагментов. По умолчанию 100. Это значение не может быть больше половины max_chunk_size.
sentence_overlap
(Необязательный, целое число) Только для стратегии фрагментации sentence. Указывает количество перекрывающихся предложений для фрагментов. Может быть либо 1, либо 0. По умолчанию 1.
strategy
(Необязательный, строка) Указывает стратегию фрагментации. Может быть либо sentence, либо word.
service
(Обязательный, строка) Тип службы, поддерживаемой для указанного типа задачи. В данном случае azureaistudio.
service_settings

(Обязательный, объект) Параметры, используемые для установки модели инференса.

Эти параметры специфичны для сервиса azureaistudio.

api_key

(Обязательный, строка) Действительный ключ API вашей модели развертывания Azure AI Studio. Этот ключ можно найти на странице обзора вашего развертывания в разделе управления вашей учётной записью Azure AI Studio.

Вам нужно предоставить ключ API только один раз при создании модели инференса. API Получение API инференса не извлекает ваш ключ API. После создания модели инференса вы не можете изменить связанный ключ API. Если вы хотите использовать другой ключ API, удалите модель инференса и пересоздайте её с тем же именем и обновлённым ключом API.

target
(Обязательный, строка) Целевой URL-адрес вашего развертывания модели Azure AI Studio. Его можно найти на странице обзора вашего развертывания в разделе управления вашей учётной записью Azure AI Studio.
provider

(Обязательный, строка) Поставщик модели для вашего развертывания. Обратите внимание, что некоторые поставщики могут поддерживать только определённые типы задач. Поддерживаемые поставщики включают:

  • cohere - доступен для типов задач text_embedding и completion
  • databricks - доступен только для типа задачи completion
  • meta - доступен только для типа задачи completion
  • microsoft_phi - доступен только для типа задачи completion
  • mistral - доступен только для типа задачи completion
  • openai - доступен для типов задач text_embedding и completion
endpoint_type
(Обязательный, строка) Один из token или realtime. Указывает тип конечной точки, используемой в вашем развертывании модели. Существуют два типа конечных точек, доступные для развертывания через Azure AI Studio. Конечные точки «платите по мере использования» взимаются за каждый токен. Для них необходимо указать token для вашего endpoint_type. Для конечных точек «реального времени», которые взимаются за каждый час использования, укажите realtime.
rate_limit

(Необязательный, объект) По умолчанию служба azureaistudio устанавливает количество разрешённых запросов в минуту на 240. Это помогает свести к минимуму количество ошибок ограничения скорости, возвращаемых Azure AI Studio. Чтобы изменить это, установите параметр requests_per_minute этого объекта в настройках службы:

"rate_limit": {
    "requests_per_minute": <<number_of_requests>>
}
task_settings

(Необязательный, объект) Настройки для конфигурации задачи инференса. Эти настройки специфичны для <task_type>, который вы указали.

task_settings для типа задачи completion
do_sample
(Необязательный, число с плавающей запятой) Указывает процессу инференса выполнить выборку или нет. Не имеет эффекта, если не указаны temperature или top_p.
max_new_tokens
(Необязательный, целое число) Предоставляет подсказку для максимального количества генерируемых выходных токенов. По умолчанию 64.
temperature
(Необязательный, число с плавающей запятой) Число в диапазоне от 0,0 до 2,0, которое указывает температуру выборки для использования, которая контролирует кажущуюся креативность сгенерированных завершений. Не следует использовать, если указано top_p.
top_p
(Необязательный, число с плавающей запятой) Число в диапазоне от 0,0 до 2,0, которое является альтернативным значением температуры, которое заставляет модель учитывать результаты токенов с вероятностью выборки ядра. Не следует использовать, если указано temperature.
task_settings для типа задачи text_embedding
user
(необязательный, строка) Указывает пользователя, который выдал запрос, что может использоваться для выявления злоупотреблений.

Пример использования Azure AI Studio

Следующий пример демонстрирует, как создать конечную точку инференса под названием azure_ai_studio_embeddings для выполнения типа задачи text_embedding. Обратите внимание, что модель здесь не указана, так как она уже определена через наше развертывание Azure AI Studio.

Список моделей встраивания, которые вы можете выбрать в своём развертывании, можно найти в обозревателе моделей Azure AI Studio.

resp = client.inference.put(
    task_type="text_embedding",
    inference_id="azure_ai_studio_embeddings",
    inference_config={
        "service": "azureaistudio",
        "service_settings": {
            "api_key": "<api_key>",
            "target": "<target_uri>",
            "provider": "<model_provider>",
            "endpoint_type": "<endpoint_type>"
        }
    },
)
print(resp)
const response = await client.inference.put({
  task_type: "text_embedding",
  inference_id: "azure_ai_studio_embeddings",
  inference_config: {
    service: "azureaistudio",
    service_settings: {
      api_key: "<api_key>",
      target: "<target_uri>",
      provider: "<model_provider>",
      endpoint_type: "<endpoint_type>",
    },
  },
});
console.log(response);
PUT _inference/text_embedding/azure_ai_studio_embeddings
{
    "service": "azureaistudio",
    "service_settings": {
        "api_key": "<api_key>",
        "target": "<target_uri>",
        "provider": "<model_provider>",
        "endpoint_type": "<endpoint_type>"
    }
}

Следующий пример демонстрирует, как создать конечную точку инференса под названием azure_ai_studio_completion для выполнения типа задачи completion.

resp = client.inference.put(
    task_type="completion",
    inference_id="azure_ai_studio_completion",
    inference_config={
        "service": "azureaistudio",
        "service_settings": {
            "api_key": "<api_key>",
            "target": "<target_uri>",
            "provider": "<model_provider>",
            "endpoint_type": "<endpoint_type>"
        }
    },
)
print(resp)
const response = await client.inference.put({
  task_type: "completion",
  inference_id: "azure_ai_studio_completion",
  inference_config: {
    service: "azureaistudio",
    service_settings: {
      api_key: "<api_key>",
      target: "<target_uri>",
      provider: "<model_provider>",
      endpoint_type: "<endpoint_type>",
    },
  },
});
console.log(response);
PUT _inference/completion/azure_ai_studio_completion
{
    "service": "azureaistudio",
    "service_settings": {
        "api_key": "<api_key>",
        "target": "<target_uri>",
        "provider": "<model_provider>",
        "endpoint_type": "<endpoint_type>"
    }
}

Список моделей чат-завершений, которые вы можете выбрать в своём развертывании, можно найти в обозревателе моделей Azure AI Studio.

© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/infer-service-azure-ai-studio.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API