Интеграция с Azure AI Studio для выполнения инференса
Создаёт конечную точку инференса для выполнения задачи инференса с помощью сервиса azureaistudio.
Запрос
PUT /_inference/<task_type>/<inference_id>
Параметры пути
-
<inference_id> - (Обязательный, строка) Уникальный идентификатор конечной точки инференса.
-
<task_type> -
(Обязательный, строка) Тип задачи инференса, которую выполнит модель.
Доступные типы задач:
-
completion, -
text_embedding.
-
Тело запроса
-
chunking_settings -
(Необязательный, объект) Объект конфигурации фрагментации. Обратитесь к Конфигурирование фрагментации, чтобы узнать больше о фрагментации.
-
max_chunk_size - (Необязательный, целое число) Указывает максимальный размер фрагмента в словах. По умолчанию
250. Это значение не может быть больше300или меньше20(для стратегииsentence) или10(для стратегииword). -
overlap - (Необязательный, целое число) Только для стратегии фрагментации
word. Указывает количество перекрывающихся слов для фрагментов. По умолчанию100. Это значение не может быть больше половиныmax_chunk_size. -
sentence_overlap - (Необязательный, целое число) Только для стратегии фрагментации
sentence. Указывает количество перекрывающихся предложений для фрагментов. Может быть либо1, либо0. По умолчанию1. -
strategy - (Необязательный, строка) Указывает стратегию фрагментации. Может быть либо
sentence, либоword.
-
-
service - (Обязательный, строка) Тип службы, поддерживаемой для указанного типа задачи. В данном случае
azureaistudio. -
service_settings -
(Обязательный, объект) Параметры, используемые для установки модели инференса.
Эти параметры специфичны для сервиса
azureaistudio.-
api_key -
(Обязательный, строка) Действительный ключ API вашей модели развертывания Azure AI Studio. Этот ключ можно найти на странице обзора вашего развертывания в разделе управления вашей учётной записью Azure AI Studio.
Вам нужно предоставить ключ API только один раз при создании модели инференса. API Получение API инференса не извлекает ваш ключ API. После создания модели инференса вы не можете изменить связанный ключ API. Если вы хотите использовать другой ключ API, удалите модель инференса и пересоздайте её с тем же именем и обновлённым ключом API.
-
target - (Обязательный, строка) Целевой URL-адрес вашего развертывания модели Azure AI Studio. Его можно найти на странице обзора вашего развертывания в разделе управления вашей учётной записью Azure AI Studio.
-
provider -
(Обязательный, строка) Поставщик модели для вашего развертывания. Обратите внимание, что некоторые поставщики могут поддерживать только определённые типы задач. Поддерживаемые поставщики включают:
-
cohere- доступен для типов задачtext_embeddingиcompletion -
databricks- доступен только для типа задачиcompletion -
meta- доступен только для типа задачиcompletion -
microsoft_phi- доступен только для типа задачиcompletion -
mistral- доступен только для типа задачиcompletion -
openai- доступен для типов задачtext_embeddingиcompletion
-
-
endpoint_type - (Обязательный, строка) Один из
tokenилиrealtime. Указывает тип конечной точки, используемой в вашем развертывании модели. Существуют два типа конечных точек, доступные для развертывания через Azure AI Studio. Конечные точки «платите по мере использования» взимаются за каждый токен. Для них необходимо указатьtokenдля вашегоendpoint_type. Для конечных точек «реального времени», которые взимаются за каждый час использования, укажитеrealtime. -
rate_limit -
(Необязательный, объект) По умолчанию служба
azureaistudioустанавливает количество разрешённых запросов в минуту на240. Это помогает свести к минимуму количество ошибок ограничения скорости, возвращаемых Azure AI Studio. Чтобы изменить это, установите параметрrequests_per_minuteэтого объекта в настройках службы:"rate_limit": { "requests_per_minute": <<number_of_requests>> }
-
-
task_settings -
(Необязательный, объект) Настройки для конфигурации задачи инференса. Эти настройки специфичны для
<task_type>, который вы указали.task_settingsдля типа задачиcompletion-
do_sample - (Необязательный, число с плавающей запятой) Указывает процессу инференса выполнить выборку или нет. Не имеет эффекта, если не указаны
temperatureилиtop_p. -
max_new_tokens - (Необязательный, целое число) Предоставляет подсказку для максимального количества генерируемых выходных токенов. По умолчанию 64.
-
temperature - (Необязательный, число с плавающей запятой) Число в диапазоне от 0,0 до 2,0, которое указывает температуру выборки для использования, которая контролирует кажущуюся креативность сгенерированных завершений. Не следует использовать, если указано
top_p. -
top_p - (Необязательный, число с плавающей запятой) Число в диапазоне от 0,0 до 2,0, которое является альтернативным значением температуры, которое заставляет модель учитывать результаты токенов с вероятностью выборки ядра. Не следует использовать, если указано
temperature.
task_settingsдля типа задачиtext_embedding-
user - (необязательный, строка) Указывает пользователя, который выдал запрос, что может использоваться для выявления злоупотреблений.
-
Пример использования Azure AI Studio
Следующий пример демонстрирует, как создать конечную точку инференса под названием azure_ai_studio_embeddings для выполнения типа задачи text_embedding. Обратите внимание, что модель здесь не указана, так как она уже определена через наше развертывание Azure AI Studio.
Список моделей встраивания, которые вы можете выбрать в своём развертывании, можно найти в обозревателе моделей Azure AI Studio.
resp = client.inference.put(
task_type="text_embedding",
inference_id="azure_ai_studio_embeddings",
inference_config={
"service": "azureaistudio",
"service_settings": {
"api_key": "<api_key>",
"target": "<target_uri>",
"provider": "<model_provider>",
"endpoint_type": "<endpoint_type>"
}
},
)
print(resp) const response = await client.inference.put({
task_type: "text_embedding",
inference_id: "azure_ai_studio_embeddings",
inference_config: {
service: "azureaistudio",
service_settings: {
api_key: "<api_key>",
target: "<target_uri>",
provider: "<model_provider>",
endpoint_type: "<endpoint_type>",
},
},
});
console.log(response); PUT _inference/text_embedding/azure_ai_studio_embeddings
{
"service": "azureaistudio",
"service_settings": {
"api_key": "<api_key>",
"target": "<target_uri>",
"provider": "<model_provider>",
"endpoint_type": "<endpoint_type>"
}
} Следующий пример демонстрирует, как создать конечную точку инференса под названием azure_ai_studio_completion для выполнения типа задачи completion.
resp = client.inference.put(
task_type="completion",
inference_id="azure_ai_studio_completion",
inference_config={
"service": "azureaistudio",
"service_settings": {
"api_key": "<api_key>",
"target": "<target_uri>",
"provider": "<model_provider>",
"endpoint_type": "<endpoint_type>"
}
},
)
print(resp) const response = await client.inference.put({
task_type: "completion",
inference_id: "azure_ai_studio_completion",
inference_config: {
service: "azureaistudio",
service_settings: {
api_key: "<api_key>",
target: "<target_uri>",
provider: "<model_provider>",
endpoint_type: "<endpoint_type>",
},
},
});
console.log(response); PUT _inference/completion/azure_ai_studio_completion
{
"service": "azureaistudio",
"service_settings": {
"api_key": "<api_key>",
"target": "<target_uri>",
"provider": "<model_provider>",
"endpoint_type": "<endpoint_type>"
}
} Список моделей чат-завершений, которые вы можете выбрать в своём развертывании, можно найти в обозревателе моделей Azure AI Studio.
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/infer-service-azure-ai-studio.html