Интеграция с Google AI Studio для выполнения инференса
Создает точку входа для инференса, чтобы выполнить задачу инференса с помощью сервиса googleaistudio.
Запрос
PUT /_inference/<task_type>/<inference_id>
Параметры пути
-
<inference_id> - (Обязательно, строка) Уникальный идентификатор точки входа для инференса.
-
<task_type> -
(Обязательно, строка) Тип задачи инференса, которую будет выполнять модель.
Доступные типы задач:
-
completion, -
text_embedding.
-
Тело запроса
-
chunking_settings -
(Необязательно, объект) Объект конфигурации фрагментации. Обратитесь к Настройка фрагментации, чтобы узнать больше о фрагментации.
-
max_chunk_size - (Необязательно, целое число) Указывает максимальный размер фрагмента в словах. По умолчанию
250. Это значение не может быть больше300или меньше20(для стратегииsentence) или10(для стратегииword). -
overlap - (Необязательно, целое число) Только для стратегии фрагментации
word. Указывает количество перекрывающихся слов для фрагментов. По умолчанию100. Это значение не может быть больше половиныmax_chunk_size. -
sentence_overlap - (Необязательно, целое число) Только для стратегии фрагментации
sentence. Указывает количество перекрывающихся предложений для фрагментов. Может быть либо1, либо0. По умолчанию1. -
strategy - (Необязательно, строка) Указывает стратегию фрагментации. Может быть либо
sentence, либоword.
-
-
service - (Обязательно, строка) Тип сервиса, поддерживаемого для указанного типа задачи. В данном случае,
googleaistudio. -
service_settings -
(Обязательно, объект) Настройки для установки модели инференса.
Эти настройки специфичны для сервиса
googleaistudio.-
api_key - (Обязательно, строка) Действительный API ключ для Google Gemini API.
-
model_id - (Обязательно, строка) Название модели для использования в задаче инференса. Поддерживаемые модели можно найти на странице моделей Gemini API.
-
rate_limit -
(Необязательно, объект) По умолчанию, сервис
googleaistudioустанавливает количество разрешенных запросов в минуту на360. Это помогает минимизировать количество ошибок лимита запросов, возвращаемых Google AI Studio. Чтобы изменить это, установите настройкуrequests_per_minuteв настройках вашего сервиса:"rate_limit": { "requests_per_minute": <<number_of_requests>> }
-
Пример сервиса Google AI Studio
В следующем примере показано, как создать точку входа для инференса под названием google_ai_studio_completion для выполнения задачи типа completion.
resp = client.inference.put(
task_type="completion",
inference_id="google_ai_studio_completion",
inference_config={
"service": "googleaistudio",
"service_settings": {
"api_key": "<api_key>",
"model_id": "<model_id>"
}
},
)
print(resp) const response = await client.inference.put({
task_type: "completion",
inference_id: "google_ai_studio_completion",
inference_config: {
service: "googleaistudio",
service_settings: {
api_key: "<api_key>",
model_id: "<model_id>",
},
},
});
console.log(response); PUT _inference/completion/google_ai_studio_completion
{
"service": "googleaistudio",
"service_settings": {
"api_key": "<api_key>",
"model_id": "<model_id>"
}
}
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/infer-service-google-ai-studio.html