Spec-Zone.ru › TensorFlow 2.3

tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding

Слой CategoryEncoding.

Наследуется от: CategoryEncoding

tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding(
    max_tokens=None, output_mode=BINARY, sparse=False, **kwargs
)

Этот слой предоставляет варианты сжатия входных данных в более плотные представления. Он принимает на вход целые числа или строки, позволяет пользователям сопоставлять эти входные данные с непрерывным целочисленным пространством и выводит либо эти целые числа (один образец = 1D тензор целочисленных индексов токенов), либо плотное представление (один образец = 1D тензор вещественных значений, представляющих данные о токенах образца).

Если необходимо, пользователь может вызвать метод adapt() этого слоя на наборе данных. При адаптации этого слоя он проанализирует набор данных, определит частоту отдельных целых или строковых значений и создаст «словарь» из них. Этот словарь может иметь неограниченный размер или быть ограниченным, в зависимости от конфигурационных параметров этого слоя; если количество уникальных значений во входе больше максимального размера словаря, для создания словаря будут использоваться самые частые термины.

Атрибуты
max_elements Максимальный размер словаря для этого слоя. Если None, размер словаря не ограничен.
output_mode Необязательное указание вывода слоя. Значения могут быть "int", "binary", "count" или "tf-idf", настраивая слой следующим образом: "int": Вывод целочисленных индексов, по одному целочисленному индексу на разделительный токен строки. "binary": Вывод единственного целочисленного массива на пакет, размером vocab_size или max_elements, содержащего 1 в тех элементах, где токен, сопоставленный с этим индексом, встречается хотя бы один раз в элементе пакета. "count": Как "binary", но целочисленный массив содержит количество раз, когда токен в этом индексе встречался в элементе пакета. "tf-idf": Как "binary", но применяется алгоритм TF-IDF для определения значения в каждом слоте токена.
output_sequence_length Действительно только в режиме INT. Если установлено, размер временного измерения вывода будет заполнен или обрезан до ровно output_sequence_length значений, что приведет к тензору формы [размер_пакета, длина_последовательности_вывода] независимо от формы входа.
pad_to_max_elements Действительно только в режимах "binary", "count" и "tf-idf". Если True, размер оси признаков вывода будет заполнен до max_elements даже если количество уникальных значений в словаре меньше max_elements, что приведет к тензору формы [размер_пакета, max_elements] независимо от размера словаря. По умолчанию False.

Методы

adapt

Посмотреть исходный код

adapt(
    data, reset_state=True
)

Подбирает состояние слоя предобработки к набору данных.

Переопределяет метод adapt по умолчанию, чтобы применить соответствующую предобработку к входам перед передачей в комбинатор.

Аргументы
data Данные для обучения. Можно передать либо как tf.data Dataset, либо как массив NumPy.
reset_state Необязательный аргумент, определяющий, следует ли очистить состояние слоя в начале вызова adapt. Это должно быть True для этого слоя, который не поддерживает повторные вызовы adapt.
Исключения
RuntimeError если слой не может быть адаптирован в данный момент.

set_num_elements

Посмотреть исходный код

set_num_elements(
    num_elements
)

set_tfidf_data

Посмотреть исходный код

set_tfidf_data(
    tfidf_data
)

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/compat/v1/keras/layers/experimental/preprocessing/CategoryEncoding

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API