API получения обученных моделей
Возвращает конфигурационную информацию для обученной модели.
Запрос
GET _ml/trained_models/
GET _ml/trained_models/<model_id>
GET _ml/trained_models/_all
GET _ml/trained_models/<model_id1>,<model_id2>
GET _ml/trained_models/<model_id_pattern*>
Предварительные условия
Требуется привилегия кластера monitor_ml. Эта привилегия включена в встроенную роль machine_learning_user.
Параметры пути
-
<model_id> -
(Необязательно, строка) Уникальный идентификатор обученной модели или псевдонима модели.
Вы можете получить информацию для нескольких обученных моделей в одном запросе API, используя список идентификаторов моделей, разделенных запятыми, или выражение с подстановкой.
Параметры запроса
-
allow_no_match -
(Необязательно, логическое значение) Указывает, что делать, когда запрос:
- Содержит подстановки, и нет моделей, соответствующих условиям.
- Содержит строку
_allили нет идентификаторов, и нет совпадений. - Содержит выражения с подстановкой, и есть только частичные совпадения.
Значение по умолчанию —
true, которое возвращает пустой массив, когда нет совпадений, и подмножество результатов, когда есть частичные совпадения. Если этот параметр равенfalse, запрос возвращает код состояния404, когда нет совпадений или только частичные совпадения. -
decompress_definition - (Необязательно, логическое значение) Указывает, должно ли включенное определение модели возвращаться как JSON-карта (
true) или в пользовательском сжатом формате (false). По умолчанию —true. -
exclude_generated - (Необязательно, логическое значение) Указывает, следует ли удалять определенные поля из конфигурации при получении. Это позволяет получить конфигурацию в приемлемом формате для последующего получения и добавления в другой кластер. По умолчанию — false.
-
from - (Необязательно, целое число) Пропускает указанное количество моделей. Значение по умолчанию —
0. -
include -
(Необязательно, строка) Строка, содержащая список необязательных полей для включения в ответ. По умолчанию пустая, что означает, что необязательные поля не включены. Допустимые варианты:
-
definition: Включает определение модели. -
feature_importance_baseline: Включает базовый уровень для значений важности признаков. -
hyperparameters: Включает информацию об используемых гиперпараметрах для обучения модели. Эта информация состоит из значения, абсолютной и относительной важности гиперпараметра, а также индикатора, был ли он задан пользователем или настроен во время оптимизации гиперпараметров. -
total_feature_importance: Включает общую важность признаков для набора обучающих данных. -
definition_status: Включает полеfully_defined, указывающее, присутствует ли полное определение модели. Значения базового уровня и общей важности признаков возвращаются в полеmetadataв теле ответа.
-
-
size - (Необязательно, целое число) Указывает максимальное количество моделей для получения. Значение по умолчанию —
100. -
tags - (Необязательно, строка) Разделитель запятыми списка тегов. Обученная модель может иметь множество тегов или вообще не иметь тегов. При указании параметра возвращаются только те обученные модели, которые содержат все перечисленные теги.
Тело ответа
-
trained_model_configs -
(массив) Массив обученных моделей ресурсов, отсортированных по значению
model_idв порядке возрастания.Свойства обученных моделей ресурсов
-
created_by - (строка) Создатель обученной модели.
-
create_time - (единицы измерения времени) Время создания обученной модели.
-
default_field_map -
(объект) Строковый объект, содержащий отображение полей по умолчанию для использования при инференции модели. Например, аналитика фреймов данных может обучить модель на определенном многопольном
foo.keyword. Затем задача аналитики предоставит запись отображения полей по умолчанию для"foo" : "foo.keyword".Любое отображение полей, описанное в настройках инференции, имеет приоритет.
-
description - (строка) Текстовое описание обученной модели.
-
model_size_bytes - (целое число) Приблизительный размер модели в байтах для хранения обученной модели в памяти. Этот параметр применяется только к моделям, обученным аналитикой фреймов данных.
-
estimated_operations - (целое число) Приблизительное количество операций для использования обученной модели.
-
inference_config -
(объект) Настройка по умолчанию для инференции. Это может быть либо настройка
regression, либоclassification. Она должна соответствовать типуtarget_typeбазовогоdefinition.trained_model.Свойства
inference_config-
classification -
(объект) Настройка конфигурации инференции для классификации.
Свойства инференции классификации
-
num_top_classes - (целое число) Указывает количество лучших предсказаний классов для возврата. По умолчанию 0.
-
num_top_feature_importance_values - (целое число) Указывает максимальное количество значений важности признаков на документ. По умолчанию 0, что означает отсутствие расчета важности признаков.
-
prediction_field_type - (строка) Указывает тип прогнозируемого поля для записи. Допустимые значения:
string,number,boolean. При указанииbooleanзначение1.0преобразуется вtrue, а0.0вfalse. -
results_field - (строка) Поле, добавляемое в входные документы для хранения прогноза инференции. По умолчанию
predicted_value. -
top_classes_results_field - (строка) Указывает поле, в которое записываются лучшие классы. По умолчанию
top_classes.
-
-
fill_mask -
(Необязательный, объект) Настройка для задачи заполнения маски (fill_mask) в области обработки естественного языка (NLP). Задача заполнения маски работает с моделями, оптимизированными для действия маскирования. Например, для моделей BERT может быть предоставлен следующий текст: "Столица Франции — [MASK].". Ответ указывает значение, наиболее вероятно заменяющее
[MASK]. В данном случае наиболее вероятный токен —paris.Свойства инференции заполнения маски
-
mask_token - (Необязательная, строка) Строка/токен, который будет удален из входных документов и заменен прогнозом инференции. В ответе это поле содержит маркер маски для указанной модели/токеннизера. У каждой модели и токеннизера есть предопределенный маркер маски, который нельзя изменить. Поэтому рекомендуется не устанавливать это значение в запросах. Однако, если это поле присутствует в запросе, его значение должно совпадать с предопределенным значением для данной модели/токеннизера, в противном случае запрос завершится ошибкой.
-
tokenization -
(Необязательный, объект) Указывает выполняемую токенизацию и желаемые параметры. Конфигурация токенизации по умолчанию —
bert. Допустимые значения токенизации:-
bert: Использовать для моделей BERT -
deberta_v2: Использовать для моделей DeBERTa v2 и v3 -
mpnet: Использовать для моделей MPNet -
roberta: Использовать для моделей RoBERTa и BART - [предварительный просмотр] Эта функция находится на стадии технического предварительного просмотра и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA.
xlm_roberta: Использовать для моделей XLMRoBERTa - [предварительный просмотр] Эта функция находится на стадии технического предварительного просмотра и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA.
bert_ja: Использовать для моделей BERT, обученных на японском языке.
-
-
-
-
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT выполняется с указанными настройками.
Свойства bert
-
do_lower_case - (Необязательно, логическое значение) Указывает, должна ли токенизация привести текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Производить токенизацию со специальными токенами. Обычно в токенизации в стиле BERT включаются следующие токены:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает разделитель последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa выполняется с указанными настройками.
Свойства roberta
-
add_prefix_space - (Необязательно, логическое значение) Указывает, должен ли токенизатор добавить пробел перед токенизированным вводом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Производить токенизацию со специальными токенами. Обычно в токенизации в стиле RoBERTa включаются следующие токены:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделитель последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet выполняется с указанными настройками.
Свойства mpnet
-
do_lower_case - (Необязательно, логическое значение) Указывает, должна ли токенизация привести текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Производить токенизацию со специальными токенами. Обычно в токенизации в стиле MPNet включаются следующие токены:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделитель последовательностей.
-
-
-
xlm_roberta -
(Необязательно, объект) [preview] Эта функция находится в техническом превью и может быть изменена или удалена в будущих релизах. Elastic будет работать над устранением любых проблем, но функции в техническом превью не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле XLMRoBERTa выполняется с указанными настройками.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Производить токенизацию со специальными токенами. Обычно в токенизации в стиле RoBERTa включаются следующие токены:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделитель последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [preview] Эта функция находится в техническом превью и может быть изменена или удалена в будущих релизах. Elastic будет работать над устранением любых проблем, но функции в техническом превью не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле BERT для японского текста выполняется с указанными настройками.
Свойства bert_ja
-
do_lower_case - (Необязательно, логическое значение) Указывает, должна ли токенизация привести текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens - (Необязательно, логическое значение) Производить токенизацию со специальными токенами, если
true.
-
-
-
vocabulary
-
(Необязательный, объект) Настройка для получения словаря модели. Словарь затем используется во время вывода. Эта информация обычно предоставляется автоматически путем хранения словаря в известном, внутренне управляемом индексе.
Свойства словаря
-
index - (Обязательный, строка) Индекс, в котором хранится словарь.
-
-
-
ner -
(Необязательный, объект) Настраивает задачу распознавания именованных сущностей (NER). NER является частным случаем классификации токенов. Каждый токен в последовательности классифицируется в соответствии с предоставленными метками классификации. В настоящее время задача NER требует
classification_labelsметок в формате Inside-Outside-Beginning (IOB). Поддерживаются только персоны, организации, места и прочие.Свойства вывода NER
-
classification_labels - (Необязательный, строка) Массив меток классификации. NER поддерживает только метки Inside-Outside-Beginning (IOB) и только персоны, организации, места и прочие. Например:
["O", "B-PER", "I-PER", "B-ORG", "I-ORG", "B-LOC", "I-LOC", "B-MISC", "I-MISC"]. -
tokenization -
(Необязательный, объект) Указывает токенизацию для выполнения и желаемые настройки. Настройка токенизации по умолчанию -
bert. Допустимые значения токенизации:-
bert: Использовать для моделей BERT-стиля -
deberta_v2: Использовать для моделей DeBERTa v2 и v3-стиля -
mpnet: Использовать для моделей MPNet-стиля -
roberta: Использовать для моделей RoBERTa-стиля и BART-стиля - [preview] Эта функциональность находится на стадии технического предварительного просмотра и может быть изменена или удалена в будущих выпусках. Elastic будет работать над исправлением любых проблем, но функции на стадии технического предварительного просмотра не подпадают под SLA поддержки официальных функций GA.
xlm_roberta: Использовать для моделей XLMRoBERTa-стиля - [preview] Эта функциональность находится на стадии технического предварительного просмотра и может быть изменена или удалена в будущих выпусках. Elastic будет работать над исправлением любых проблем, но функции на стадии технического предварительного просмотра не подпадают под SLA поддержки официальных функций GA.
bert_ja: Использовать для моделей BERT-стиля, обученных для японского языка.
-
-
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT будет выполнена с указанными настройками.
Свойства bert
-
do_lower_case - (Необязательно, логическое значение) Указывает, нужно ли преобразовать текст в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые должен вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, если они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос на вывод получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включенные в токенизацию в стиле BERT:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает разделение последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa будет выполнена с указанными настройками.
Свойства roberta
-
add_prefix_space - (Необязательно, логическое значение) Указывает, нужно ли добавлять пробел перед токенизированным вводом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые должен вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, если они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос на вывод получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включенные в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet будет выполнена с указанными настройками.
Свойства mpnet
-
do_lower_case - (Необязательно, логическое значение) Указывает, нужно ли преобразовать текст в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые должен вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, если они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос на вывод получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включенные в токенизацию в стиле MPNet:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
xlm_roberta -
(Необязательно, объект) [preview] Данная функциональность находится на стадии технического предварительного просмотра и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции на стадии технического предварительного просмотра не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле XLMRoBERTa будет выполнена с указанными настройками.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые должен вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, если они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос на вывод получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включенные в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [preview] Данная функциональность находится на стадии технического предварительного просмотра и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции на стадии технического предварительного просмотра не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле BERT для японского текста будет выполнена с указанными настройками.
Свойства bert_ja
-
do_lower_case - (Необязательно, логическое значение) Указывает, нужно ли преобразовать текст в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые должен вывести токенизатор.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, если они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос на вывод получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens - (Необязательно, логическое значение) Токенизировать со специальными токенами, если
true.
-
-
-
vocabulary
-
(Необязательно, объект) Настройка для получения словаря модели. Словарь используется во время инференции. Эта информация обычно предоставляется автоматически путём сохранения словаря в известном, внутренне управляемом индексе.
Свойства словаря
-
index - (Обязательно, строка) Индекс, в котором хранится словарь
-
-
-
pass_through -
(Необязательно, объект) Настраивает задачу
pass_through. Эта задача полезна для отладки, так как никакой пост-обработки не выполняется над результатом инференции, и результаты слоя необработанного пулинга возвращаются вызывающему объекту.Свойства инференции проходного типа
-
tokenization -
(Необязательно, объект) Указывает, какую токенизацию выполнять и какие настройки использовать. По умолчанию используется конфигурация токенизации
bert. Допустимые значения токенизации:-
bert: Используется для моделей типа BERT -
deberta_v2: Используется для моделей типа DeBERTa v2 и v3 -
mpnet: Используется для моделей типа MPNet -
roberta: Используется для моделей типа RoBERTa и BART - [preview] Данная функция находится в техническом предварительном просмотре и может быть изменена или удалена в будущих релизах. Elastic будет работать над исправлением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA.
xlm_roberta: Используется для моделей типа XLMRoBERTa - [preview] Данная функция находится в техническом предварительном просмотре и может быть изменена или удалена в будущих релизах. Elastic будет работать над исправлением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA.
bert_ja: Используется для моделей типа BERT, обученных для японского языка.
-
-
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT должна выполняться с указанными настройками.
Свойства bert
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизации приводить текстовую последовательность к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, усекается она.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизация со специальными токенами. Токены, обычно включаемые в токенизацию в стиле BERT:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает на разделение последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa должна выполняться с указанными настройками.
Свойства roberta
-
add_prefix_space - (Необязательно, логическое значение) Указывает, следует ли токенизации добавлять пробел перед токенизированным вводом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, усекается она.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизация со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает на разделение последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet должна выполняться с указанными настройками.
Свойства mpnet
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизации приводить текстовую последовательность к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, усекается она.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизация со специальными токенами. Токены, обычно включаемые в токенизацию в стиле MPNet:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает на разделение последовательностей.
-
-
-
xlm_roberta -
(Необязательно, объект) [preview] This functionality is in technical preview and may be changed or removed in a future release. Elastic will work to fix any issues, but features in technical preview are not subject to the support SLA of official GA features. Токенизация в стиле XLMRoBERTa должна выполняться с указанными настройками.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, усекается она.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизация со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает на разделение последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [preview] This functionality is in technical preview and may be changed or removed in a future release. Elastic will work to fix any issues, but features in technical preview are not subject to the support SLA of official GA features. Токенизация в стиле BERT для японского текста должна выполняться с указанными настройками.
Свойства bert_ja
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизации приводить текстовую последовательность к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, усекается она.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens - (Необязательно, логическое значение) Токенизация со специальными токенами, если
true.
-
-
vocabulary
-
-
(Необязательно, объект) Настройка для получения словаря модели. Словарь используется во время вывода. Эта информация обычно предоставляется автоматически путём сохранения словаря в известном, внутренне управляемом индексе.
Свойства словаря
-
index - (Обязательно, строка) Индекс, в котором хранится словарь.
-
-
-
regression -
(объект) Настройка регрессии для вывода.
Свойства вывода регрессии
-
num_top_feature_importance_values - (целое число) Указывает максимальное количество значений важности признаков на документ. По умолчанию равно нулю, и вычисление важности признаков не выполняется.
-
results_field - (строка) Поле, добавляемое в поступающие документы для хранения прогноза вывода. По умолчанию равно
predicted_value.
-
-
text_classification
-
(Необязательно, объект) Задача классификации текста. Классификация текста классифицирует предоставленную текстовую последовательность в ранее известные целевые классы. Конкретный пример этого — анализ настроений, который возвращает вероятные целевые классы, указывающие на настроение текста, такие как «грустный», «счастливый» или «злой».
Свойства вывода text_classification
-
classification_labels - (Необязательно, строка) Массив меток классификации.
-
num_top_classes - (Необязательно, целое число) Указывает количество лучших прогнозов класса для возврата. По умолчанию — все классы (-1).
-
tokenization -
(Необязательно, объект) Указывает на токенизацию, которую необходимо выполнить, и желаемые настройки. Конфигурация токенизации по умолчанию —
bert. Допустимые значения токенизации:-
bert: Используйте для моделей в стиле BERT -
deberta_v2: Используйте для моделей в стиле DeBERTa v2 и v3 -
mpnet: Используйте для моделей в стиле MPNet -
roberta: Используйте для моделей в стиле RoBERTa и BART - [preview] This functionality is in technical preview and may be changed or removed in a future release. Elastic will work to fix any issues, but features in technical preview are not subject to the support SLA of official GA features.
xlm_roberta: Используйте для моделей в стиле XLMRoBERTa - [preview] This functionality is in technical preview and may be changed or removed in a future release. Elastic will work to fix any issues, but features in technical preview are not subject to the support SLA of official GA features.
bert_ja: Используйте для моделей в стиле BERT, обученных для японского языка.
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT должна выполняться с указанными настройками.
Свойства bert
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизации приводить текстовую последовательность к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разделить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрываются между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие оконного или охватывающего действия.Если ваш типичный ввод лишь немного больше, чем
max_sequence_length, лучше просто усечь его; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, она усекается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле BERT:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает на разделение последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa должна выполняться с указанными настройками.
Свойства roberta
-
add_prefix_space - (Необязательно, логическое значение) Указывает, должна ли токенизация добавлять пробел перед токенизированным вводом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разделить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрываются между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие оконного или охватывающего действия.Если ваш типичный ввод лишь немного больше, чем
max_sequence_length, лучше просто усечь его; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, она усекается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает на разделение последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet должна выполняться с указанными настройками.
Свойства mpnet
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизации приводить текстовую последовательность к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые могут быть выведены токенизатором.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разделить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрываются между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие оконного или охватывающего действия.Если ваш типичный ввод лишь немного больше, чем
max_sequence_length, лучше просто усечь его; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как усекаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Усечение не происходит; запрос на вывод получает ошибку. -
first: Усекается только первая последовательность. -
second: Усекается только вторая последовательность. Если есть только одна последовательность, она усекается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле MPNet:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает на разделение последовательностей.
-
-
-
xlm_roberta
-
-
-
-
(Необязательно, объект) [превью] Данная функция находится в техническом превью и может быть изменена или удалена в будущих выпусках. Elastic будет работать над исправлением любых проблем, но функции в техническом превью не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле XLMRoBERTa должна выполняться с указанными настройками.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разбить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрываются между каждой подпоследовательностью.Значение по умолчанию равно
-1, что означает отсутствие окон или перекрытий.Если ваш типичный ввод всего лишь немного больше, чем
max_sequence_length, возможно, лучше просто выполнить обрезку; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, она обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [превью] Данная функция находится в техническом превью и может быть изменена или удалена в будущих выпусках. Elastic будет работать над исправлением любых проблем, но функции в техническом превью не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле BERT для японского текста должна выполняться с указанными настройками.
Свойства bert_ja
-
do_lower_case - (Необязательно, логическое значение) Указывает, должна ли токенизация приводить текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разбить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрываются между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие окон или перекрытий.Если ваш типичный ввод всего лишь немного больше, чем
max_sequence_length, возможно, лучше просто выполнить обрезку; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, она обрезается.
-
Для
zero_shot_classificationпоследовательность гипотезы всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens - (Необязательно, логическое значение) Токенизировать со специальными токенами, если
true.
-
-
-
vocabulary -
(Необязательно, объект) Настройки для извлечения словаря модели. Словарь затем используется во время вывода. Эта информация обычно предоставляется автоматически путём хранения словаря в известном, внутренне управляемом индексе.
Свойства словаря
-
index - (Обязательно, строка) Индекс, в котором хранится словарь.
-
-
text_embedding -
(Объект, необязательно) Векторное представление текста берёт входную последовательность и преобразует её в вектор чисел. Эти векторы не просто фиксируют токены, но и семантические значения и контекст. Эти векторы могут быть использованы в поле плотность вектора для получения глубоких инсайтов.
Свойства вывода текстового вложения
-
embedding_size - (Необязательно, целое число) Количество измерений в векторе вложения, создаваемом моделью.
-
results_field - (Необязательно, строка) Поле, добавляемое в поступающие документы для хранения предсказания вывода. По умолчанию —
predicted_value. -
tokenization -
(Необязательно, объект) Указывает, какую токенизацию выполнить и какие настройки использовать. Настройка токенизации по умолчанию —
bert. Допустимые значения токенизации:-
bert: Используется для моделей в стиле BERT -
deberta_v2: Используется для моделей в стиле DeBERTa v2 и v3 -
mpnet: Используется для моделей в стиле MPNet -
roberta: Используется для моделей в стиле RoBERTa и BART - [превью] Данная функция находится в техническом превью и может быть изменена или удалена в будущих выпусках. Elastic будет работать над исправлением любых проблем, но функции в техническом превью не подпадают под SLA поддержки официальных функций GA.
xlm_roberta: Используется для моделей в стиле XLMRoBERTa - [превью] Данная функция находится в техническом превью и может быть изменена или удалена в будущих выпусках. Elastic будет работать над исправлением любых проблем, но функции в техническом превью не подпадают под SLA поддержки официальных функций GA.
bert_ja: Используется для моделей в стиле BERT, обученных для японского языка.
-
-
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT должна выполняться с указанными параметрами.
Свойства bert
-
do_lower_case - (Необязательно, булево) Указывает, следует ли токенизации преобразовывать текст в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию -first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если существует только одна последовательность, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле BERT:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает разделение последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa должна выполняться с указанными параметрами.
Свойства roberta
-
add_prefix_space - (Необязательно, булево) Указывает, следует ли токенизации добавлять пробел перед токенизированным входом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию -first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если существует только одна последовательность, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet должна выполняться с указанными параметрами.
Свойства mpnet
-
do_lower_case - (Необязательно, булево) Указывает, следует ли токенизации преобразовывать текст в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию -first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если существует только одна последовательность, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле MPNet:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
xlm_roberta -
(Необязательно, объект) [превью] Эта функция находится на стадии технического превью и может быть изменена или удалена в будущих релизах. Elastic будет работать над устранением любых проблем, но функции технического превью не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле XLMRoBERTa должна выполняться с указанными параметрами.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию -first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если существует только одна последовательность, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [превью] Эта функция находится на стадии технического превью и может быть изменена или удалена в будущих релизах. Elastic будет работать над устранением любых проблем, но функции технического превью не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле BERT для японского текста должна выполняться с указанными параметрами.
Свойства bert_ja
-
do_lower_case - (Необязательно, булево) Указывает, следует ли токенизации преобразовывать текст в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию -first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если существует только одна последовательность, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens - (Необязательно, булево) Токенизировать со специальными токенами, если
true.
-
-
-
vocabulary
-
(Необязательно, объект) Настройка для получения словаря модели. Словарь используется во время вывода. Эта информация обычно предоставляется автоматически путём хранения словаря в известном, внутренне управляемом индексе.
Свойства словаря
-
index - (Обязательно, строка) Индекс, где хранится словарь.
-
-
-
text_similarity -
(Объект, необязательно) Сходство текста принимает входную последовательность и сравнивает её с другой входной последовательностью. Это обычно называют кросс-кодированием. Эта задача полезна для ранжирования текстов документов при сравнении их с другим предоставленным текстовым вводом.
Свойства вывода text_similarity
-
span_score_combination_function -
(Необязательно, строка) Указывает, как комбинировать полученный результат сходства, когда предоставленный фрагмент текста длиннее, чем
max_sequence_lengthи должен быть автоматически разделен для нескольких вызовов. Это применимо только тогда, когдаtruncateравенnoneиspanявляется неотрицательным числом. Значение по умолчанию —max. Доступные варианты:-
max: Возвращается максимальный балл из всех участков. -
mean: Возвращается средний балл по всем участкам.
-
-
tokenization -
(Необязательно, объект) Указывает, какую токенизацию выполнить и желаемые настройки. Настройка токенизации по умолчанию —
bert. Допустимые значения токенизации:-
bert: Использовать для моделей типа BERT -
deberta_v2: Использовать для моделей типа DeBERTa v2 и v3 -
mpnet: Использовать для моделей типа MPNet -
roberta: Использовать для моделей типа RoBERTa и BART - [превью] Эта функциональность находится на стадии технического превью и может быть изменена или удалена в будущих релизах. Elastic будет работать над устранением любых проблем, но функции на стадии технического превью не подпадают под SLA поддержки официальных функций GA.
xlm_roberta: Использовать для моделей типа XLMRoBERTa - [превью] Эта функциональность находится на стадии технического превью и может быть изменена или удалена в будущих релизах. Elastic будет работать над устранением любых проблем, но функции на стадии технического превью не подпадают под SLA поддержки официальных функций GA.
bert_ja: Использовать для моделей типа BERT, обученных для японского языка.
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT выполняется с указанными настройками.
Свойства bert
-
do_lower_case - (Необязательно, булево) Указывает, следует ли токенизатору приводить текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, можно разбить более длинные последовательности текста для вывода. Значение указывает, сколько токенов перекрывается между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие оконного режима или перекрытия.Когда типичный ввод всего лишь немного больше, чем
max_sequence_length, лучше просто выполнить обрезку; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле BERT:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает разделение последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa выполняется с указанными настройками.
Свойства roberta
-
add_prefix_space - (Необязательно, булево) Указывает, следует ли токенизатору добавлять пробел перед токенизированным вводом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, можно разбить более длинные последовательности текста для вывода. Значение указывает, сколько токенов перекрывается между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие оконного режима или перекрытия.Когда типичный ввод всего лишь немного больше, чем
max_sequence_length, лучше просто выполнить обрезку; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet выполняется с указанными настройками.
Свойства mpnet
-
do_lower_case - (Необязательно, булево) Указывает, следует ли токенизатору приводить текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые может вывести токенизатор.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, можно разбить более длинные последовательности текста для вывода. Значение указывает, сколько токенов перекрывается между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие оконного режима или перекрытия.Когда типичный ввод всего лишь немного больше, чем
max_sequence_length, лучше просто выполнить обрезку; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если последовательность одна, она обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, булево) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле MPNet:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
xlm_roberta
-
-
-
(Необязательно, объект) [preview] Данная функциональность находится в техническом предварительном просмотре и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле XLMRoBERTa должна выполняться с указанными настройками.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые разрешено выводить токенизатору.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разбить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрывается между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие окон или перекрытий.Когда ваш типичный ввод всего немного больше, чем
max_sequence_length, может быть лучше просто обрезать; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не происходит; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Токены, обычно включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [preview] Данная функциональность находится в техническом предварительном просмотре и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле BERT для японского текста выполняется с указанными настройками.
Свойства bert_ja
-
do_lower_case - (Необязательно, логическое значение) Указывает, преобразует ли токенизация последовательность текста в нижний регистр при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, которые разрешено выводить токенизатору.
-
span -
(Необязательно, целое число) Когда
truncateравноnone, вы можете разбить более длинные текстовые последовательности для вывода. Значение указывает, сколько токенов перекрывается между каждой подпоследовательностью.Значение по умолчанию —
-1, что означает отсутствие окон или перекрытий.Когда ваш типичный ввод всего немного больше, чем
max_sequence_length, может быть лучше просто обрезать; во второй подпоследовательности будет очень мало информации. -
truncate -
(Необязательно, строка) Указывает, как обрезаются токены, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не происходит; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если есть только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classificationгипотетическая последовательность всегда является второй последовательностью. Поэтому не используйтеsecondв этом случае.-
with_special_tokens - (Необязательно, логическое значение) Токенизировать со специальными токенами, если
true.
-
-
-
vocabulary -
(Необязательно, объект) Настройка для получения словаря модели. Словарь используется во время вывода. Эта информация обычно предоставляется автоматически путем хранения словаря в известном, внутренне управляемом индексе.
Свойства vocabulary
-
index - (Обязательно, строка) Индекс, где хранится словарь.
-
-
zero_shot_classification -
(Объект, необязательно) Настраивает задачу классификации нулевого вывода. Классификация нулевого вывода позволяет выполнять классификацию текста без предварительно определенных меток. Во время вывода можно настроить метки для классификации. Это делает этот тип модели и задачи очень гибкими.
Если вы постоянно классифицируете одни и те же метки, лучше использовать модель тонкой настройки для классификации текста.
Свойства вывода zero_shot_classification
-
classification_labels - (Обязательно, массив) Метки классификации, используемые во время классификации нулевого вывода. Метки классификации не должны быть пустыми или нулевыми и устанавливаются только при создании модели. Они должны быть все три из ["entailment", "neutral", "contradiction"].
Это НЕ то же самое, что
labels, которые представляют собой значения, которые пытается классифицировать zero-shot.-
hypothesis_template -
(Необязательно, строка) Это шаблон, используемый при токенизации последовательностей для классификации.
Метки заменяют значение
{}в тексте. Значение по умолчанию:This example is {}. -
labels - (Необязательно, массив) Метки для классификации. Можно задать при создании для меток по умолчанию, а затем обновить их во время вывода.
-
multi_label - (Необязательно, логическое значение) Указывает, возможно ли более одной метки
trueна основе ввода. Это полезно при маркировке текста, который может относиться к нескольким меткам входных данных. По умолчаниюfalse. -
tokenization -
(Необязательно, объект) Указывает, какую токенизацию выполнить и какие настройки желательны. Настройка токенизации по умолчанию —
bert. Допустимые значения токенизации:-
bert: Используйте для моделей BERT-стиля -
deberta_v2: Используйте для моделей DeBERTa v2 и v3-стиля -
mpnet: Используйте для моделей MPNet-стиля -
roberta: Используйте для моделей RoBERTa-стиля и BART-стиля - [preview] Данная функциональность находится в техническом предварительном просмотре и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA.
xlm_roberta: Используйте для моделей XLMRoBERTa-стиля - [preview] Данная функциональность находится в техническом предварительном просмотре и может быть изменена или удалена в будущих выпусках. Elastic будет работать над устранением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA.
bert_ja: Используйте для моделей BERT-стиля, обученных для японского языка.
-
-
Свойства токенизации
-
bert -
(Необязательно, объект) Токенизация в стиле BERT должна выполняться с указанными настройками.
Свойства bert
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизация приводить текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включаемые в токенизацию в стиле BERT:
-
[CLS]: Первый токен классифицируемой последовательности. -
[SEP]: Указывает разделение последовательностей.
-
-
-
roberta -
(Необязательно, объект) Токенизация в стиле RoBERTa должна выполняться с указанными настройками.
Свойства roberta
-
add_prefix_space - (Необязательно, логическое значение) Указывает, следует ли токенизации добавлять пробел перед токенизированным входом в модель.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
mpnet -
(Необязательно, объект) Токенизация в стиле MPNet должна выполняться с указанными настройками.
Свойства mpnet
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизация приводить текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включаемые в токенизацию в стиле MPNet:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
xlm_roberta -
(Необязательно, объект) [preview] Данная функциональность находится в техническом предварительном просмотре и может быть изменена или удалена в будущих версиях. Elastic будет работать над исправлением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле XLMRoBERTa должна выполняться с указанными настройками.
Свойства xlm_roberta
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens -
(Необязательно, логическое значение) Токенизировать со специальными токенами. Типичные токены, включаемые в токенизацию в стиле RoBERTa:
-
<s>: Первый токен классифицируемой последовательности. -
</s>: Указывает разделение последовательностей.
-
-
-
bert_ja -
(Необязательно, объект) [preview] Данная функциональность находится в техническом предварительном просмотре и может быть изменена или удалена в будущих версиях. Elastic будет работать над исправлением любых проблем, но функции в техническом предварительном просмотре не подпадают под SLA поддержки официальных функций GA. Токенизация в стиле BERT для японского текста должна выполняться с указанными настройками.
Свойства bert_ja
-
do_lower_case - (Необязательно, логическое значение) Указывает, следует ли токенизация приводить текст к нижнему регистру при построении токенов.
-
max_sequence_length - (Необязательно, целое число) Указывает максимальное количество токенов, разрешенных для вывода токенизатором.
-
truncate -
(Необязательно, строка) Указывает, как происходит обрезка токенов, когда они превышают
max_sequence_length. Значение по умолчанию —first.-
none: Обрезка не выполняется; запрос вывода получает ошибку. -
first: Обрезается только первая последовательность. -
second: Обрезается только вторая последовательность. Если имеется только одна последовательность, эта последовательность обрезается.
-
Для
zero_shot_classification, гипотетическая последовательность всегда является второй последовательностью. Поэтому в этом случае не используйтеsecond.-
with_special_tokens - (Необязательно, логическое значение) Токенизировать со специальными токенами, если
true.
-
-
-
vocabulary
-
(Необязательно, объект) Настройка для получения словаря модели. Словарь используется во время вывода. Эта информация обычно предоставляется автоматически при сохранении словаря в известном, внутренне управляемом индексе.
Свойства словаря
-
index - (Обязательно, строка) Индекс, в котором хранится словарь.
-
-
-
input -
(объект) Имена входных полей для определения модели.
Свойства
input-
field_names - (строка) Массив имён входных полей для модели.
-
fully_defined - (логическое значение) True, если полное определение модели присутствует. Это поле присутствует только если
include=definition_statusбыло указано в запросе.
-
-
location -
(Необязательно, объект) Местоположение определения модели. Должно быть предоставлено, если
definitionилиcompressed_definitionне предоставлены.Свойства
location-
index - (Обязательно, объект) Указывает, что определение модели хранится в индексе. Оно должно быть пустым, так как индекс для хранения определений моделей настраивается автоматически.
-
-
license_level - (строка) Уровень лицензии обученной модели.
-
metadata -
(объект) Объект, содержащий метаданные об обученной модели. Например, модели, созданные с помощью аналитики фреймов данных, содержат объекты
analysis_configиinput.Свойства метаданных
-
feature_importance_baseline - (объект) Объект, содержащий базу для значений важности признаков. Для регрессионного анализа это одно значение. Для классификационного анализа имеется значение для каждого класса.
-
hyperparameters -
(массив) Список доступных гиперпараметров, оптимизированных во время фазы
fine_parameter_tuning, а также указанных пользователем.Свойства гиперпараметров
-
absolute_importance - (вещественное число) Положительное число, показывающее, насколько параметр влияет на вариацию функции потерь. Для гиперпараметров со значениями, не заданными пользователем, а настроенными во время оптимизации гиперпараметров.
-
max_trees - (целое число) Максимальное количество деревьев решений в лесу. Максимальное значение равно 2000. По умолчанию это значение вычисляется во время оптимизации гиперпараметров.
-
name - (строка) Название гиперпараметра.
-
relative_importance - (вещественное число) Число от 0 до 1, показывающее долю влияния на вариацию функции потерь среди всех настроенных гиперпараметров. Для гиперпараметров со значениями, не заданными пользователем, а настроенными во время оптимизации гиперпараметров.
-
supplied - (логическое значение) Указывает, задан ли гиперпараметр пользователем (
true) или оптимизирован (false). -
value - (вещественное число) Значение гиперпараметра, оптимизированного или указанного пользователем.
-
-
total_feature_importance -
(массив) Массив общей важности признаков для каждого признака, используемого из набора данных обучения. Этот массив объектов возвращается, если модель обучена с помощью аналитики фреймов данных, и запрос включает
total_feature_importanceв параметре запросаinclude.Свойства общей важности признаков
-
feature_name - (строка) Признак, для которого была рассчитана эта важность.
-
importance -
(объект) Коллекция статистических данных о важности признака, связанных с набором данных обучения для этого конкретного признака.
Свойства важности признака
-
mean_magnitude - (вещественное число) Среднее значение этого признака по всем данным обучения. Это значение является средним из абсолютных значений важности для этого признака.
-
max - (целое число) Максимальное значение важности по всем данным обучения для этого признака.
-
min - (целое число) Минимальное значение важности по всем данным обучения для этого признака.
-
-
classes -
(массив) Если обученная модель — модель классификации, статистические данные о важности признака собираются по каждому значению целевого класса.
Свойства важности признака по классам
-
class_name - (строка) Значение целевого класса. Может быть строкой, логическим значением или числом.
-
importance -
(объект) Коллекция статистических данных о важности признака, связанных с набором данных обучения для этого конкретного признака.
Свойства важности признака
-
mean_magnitude - (вещественное число) Среднее значение этого признака по всем данным обучения. Это значение является средним из абсолютных значений важности для этого признака.
-
max - (целое число) Максимальное значение важности по всем данным обучения для этого признака.
-
min - (целое число) Минимальное значение важности по всем данным обучения для этого признака.
-
-
-
-
-
model_id - (строка) Идентификатор обученной модели.
-
model_type -
(Необязательно, строка) Тип созданной модели. По умолчанию тип модели —
tree_ensemble. Подходящие типы:-
tree_ensemble: Определение модели — ансамблевая модель деревьев решений. -
lang_ident: Специальный тип, зарезервированный для моделей определения языка. -
pytorch: Сохранённое определение — модель PyTorch (в частности, TorchScript). В настоящее время поддерживаются только модели NLP.
-
-
tags - (строка) Разделитель запятыми строка тегов. Обученная модель может иметь множество тегов или не иметь их.
-
version - (строка) Номер версии конфигурации машинного обучения, в которой была создана обученная модель.
Начиная с Elasticsearch 8.10.0, используется новый номер версии для отслеживания изменений конфигурации и состояния в плагине машинного обучения. Этот новый номер версии не связан с версией продукта и будет увеличиваться независимо. Значение
versionпредставляет новый номер версии.
Коды ответов
-
400 - Если
include_model_definitionимеет значениеtrue, этот код указывает, что более одной модели соответствуют шаблону ID. -
404(Отсутствующие ресурсы) - Если
allow_no_matchимеет значениеfalse, этот код указывает, что ресурсов, соответствующих запросу, нет или есть только частичные совпадения с запросом.
Примеры
Следующий пример получает информацию о конфигурации для всех обученных моделей:
resp = client.ml.get_trained_models() print(resp)
response = client.ml.get_trained_models puts response
const response = await client.ml.getTrainedModels(); console.log(response);
GET _ml/trained_models/
© 2023-2025 Elasticsearch
As of September 2024, Elasticsearch is available under a choice of three licenses: the Server Side Public License (SSPL), the Elastic License, or the AGPLv3 (OSI approved).
Elasticsearch and the Elasticsearch logo are trademarks of Elasticsearch B.V., registered in the U.S. and in other countries.
https://www.elastic.co/guide/en/elasticsearch/reference/8.17/get-trained-models.html