tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding
Слой CategoryEncoding.
Наследуется от: CategoryEncoding
tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding(
max_tokens=None, output_mode=BINARY, sparse=False, **kwargs
)
Этот слой предоставляет варианты сжатия входных данных в более плотные представления. Он принимает на вход целые числа или строки, позволяет пользователям сопоставлять эти входные данные с непрерывным целочисленным пространством и выводит либо эти целые числа (один образец = 1D тензор целочисленных индексов токенов), либо плотное представление (один образец = 1D тензор вещественных значений, представляющих данные о токенах образца).
Если необходимо, пользователь может вызвать метод adapt() этого слоя на наборе данных. При адаптации этого слоя он проанализирует набор данных, определит частоту отдельных целых или строковых значений и создаст «словарь» из них. Этот словарь может иметь неограниченный размер или быть ограниченным, в зависимости от конфигурационных параметров этого слоя; если количество уникальных значений во входе больше максимального размера словаря, для создания словаря будут использоваться самые частые термины.
| Атрибуты | |
|---|---|
max_elements | Максимальный размер словаря для этого слоя. Если None, размер словаря не ограничен. |
output_mode | Необязательное указание вывода слоя. Значения могут быть "int", "binary", "count" или "tf-idf", настраивая слой следующим образом: "int": Вывод целочисленных индексов, по одному целочисленному индексу на разделительный токен строки. "binary": Вывод единственного целочисленного массива на пакет, размером vocab_size или max_elements, содержащего 1 в тех элементах, где токен, сопоставленный с этим индексом, встречается хотя бы один раз в элементе пакета. "count": Как "binary", но целочисленный массив содержит количество раз, когда токен в этом индексе встречался в элементе пакета. "tf-idf": Как "binary", но применяется алгоритм TF-IDF для определения значения в каждом слоте токена. |
output_sequence_length | Действительно только в режиме INT. Если установлено, размер временного измерения вывода будет заполнен или обрезан до ровно output_sequence_length значений, что приведет к тензору формы [размер_пакета, длина_последовательности_вывода] независимо от формы входа. |
pad_to_max_elements | Действительно только в режимах "binary", "count" и "tf-idf". Если True, размер оси признаков вывода будет заполнен до max_elements даже если количество уникальных значений в словаре меньше max_elements, что приведет к тензору формы [размер_пакета, max_elements] независимо от размера словаря. По умолчанию False. |
Методы
adapt
adapt(
data, reset_state=True
)
Подбирает состояние слоя предобработки к набору данных.
Переопределяет метод adapt по умолчанию, чтобы применить соответствующую предобработку к входам перед передачей в комбинатор.
| Аргументы | |
|---|---|
data | Данные для обучения. Можно передать либо как tf.data Dataset, либо как массив NumPy. |
reset_state | Необязательный аргумент, определяющий, следует ли очистить состояние слоя в начале вызова adapt. Это должно быть True для этого слоя, который не поддерживает повторные вызовы adapt. |
| Исключения | |
|---|---|
RuntimeError | если слой не может быть адаптирован в данный момент. |
set_num_elements
set_num_elements(
num_elements
)
set_tfidf_data
set_tfidf_data(
tfidf_data
)
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/compat/v1/keras/layers/experimental/preprocessing/CategoryEncoding