Создание API вывода
Создает конечную точку вывода для выполнения задачи вывода.
- API вывода позволяют использовать определенные службы, такие как встроенные модели машинного обучения (ELSER, E5), модели, загруженные через Eland, Cohere, OpenAI, Mistral, Azure OpenAI, Google AI Studio, Google Vertex AI, Anthropic, Watsonx.ai или Hugging Face.
- Для встроенных моделей и моделей, загруженных через Eland, API вывода предлагают альтернативный способ использования и управления обученными моделями. Однако, если вы не планируете использовать API вывода для этих моделей или хотите использовать не-NLP-модели, используйте API моделей машинного обучения.
Запрос
PUT /_inference/<task_type>/<inference_id>
Предварительные требования
- Требуется
manage_inferenceправо доступа к кластеру (встроенная рольinference_adminпредоставляет это право)
Параметры пути
-
<inference_id> - (Обязательный, строка) Уникальный идентификатор конечной точки вывода.
-
<task_type> -
(Обязательный, строка) Тип задачи вывода, которую будет выполнять модель.
Список доступных типов задач см. в разделе Описание API.
Описание
API создания конечной точки вывода позволяет создать конечную точку вывода и настроить модель машинного обучения для выполнения определенной задачи вывода.
- При создании конечной точки вывода связанная модель машинного обучения автоматически развертывается, если она еще не запущена.
- После создания конечной точки подождите завершения развертывания модели, прежде чем использовать ее. Статус развертывания можно проверить с помощью API Получение статистики обученных моделей. В ответе найдите
"state": "fully_allocated"и убедитесь, что"allocation_count"соответствует"target_allocation_count". - Избегайте создания нескольких конечных точек для одной и той же модели, если это не требуется, поскольку каждая конечная точка потребляет значительные ресурсы.
Через API вывода доступны следующие интеграции. Доступные типы задач можно найти рядом с именем интеграции. Щелкните ссылки, чтобы ознакомиться с параметрами конфигурации интеграций:
- Интеграция AlibabaCloud AI Search (
completion,rerank,sparse_embedding,text_embedding) - Интеграция Amazon Bedrock (
completion,text_embedding) - Интеграция Anthropic (
completion) - Интеграция Azure AI Studio (
completion,text_embedding) - Интеграция Azure OpenAI (
completion,text_embedding) - Интеграция Cohere (
completion,rerank,text_embedding) - Интеграция Elasticsearch (
rerank,sparse_embedding,text_embedding— эта служба предназначена для встроенных моделей и моделей, загруженных через Eland) - Интеграция ELSER (
sparse_embedding) - Интеграция Google AI Studio (
completion,text_embedding) - Интеграция Google Vertex AI (
rerank,text_embedding) - Интеграция Hugging Face (
text_embedding) - Интеграция Mistral (
text_embedding) - Интеграция OpenAI (
completion,text_embedding) - Интеграция Watsonx (
text_embedding)
Сервисы Elasticsearch и ELSER работают на узле машинного обучения в вашем кластере Elasticsearch. Остальные интеграции подключаются к внешним службам.
Адаптивные распределения
Адаптивные распределения позволяют конечным точкам вывода динамически изменять количество распределений модели в зависимости от текущей нагрузки.
При включении адаптивных распределений:
- Количество распределений автоматически увеличивается при увеличении нагрузки.
- Распределения уменьшаются до минимума 0 при уменьшении нагрузки, что экономит ресурсы.
Дополнительную информацию об адаптивных распределениях и ресурсах см. в документации по автоматическому масштабированию моделей.
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/put-inference-api.html