tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding
Слой CategoryEncoding.
Наследуется от: CategoryEncoding, PreprocessingLayer, Layer, Module
tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding(
max_tokens=None, output_mode=BINARY, sparse=False, **kwargs
)
Этот слой предоставляет варианты сжатия входных данных в более плотные представления. Он принимает целые значения или строки в качестве входных данных, позволяет пользователям отображать эти входные данные в непрерывное целочисленное пространство и выводит либо эти целые значения (один образец = 1D тензор целых индексов токенов), либо плотное представление (один образец = 1D тензор чисел с плавающей точкой, представляющих данные о токенах образца).
При необходимости пользователь может вызвать метод adapt() этого слоя на наборе данных. Когда этот слой адаптирован, он проанализирует набор данных, определит частоту отдельных целочисленных или строковых значений и создаст «словарь» из них. Этот словарь может иметь неограниченный размер или быть ограниченным, в зависимости от конфигурационных параметров этого слоя; если во входных данных больше уникальных значений, чем максимальный размер словаря, для создания словаря будут использоваться наиболее часто встречающиеся термины.
| Атрибуты | |
|---|---|
max_elements | Максимальный размер словаря для этого слоя. Если None, размер словаря не ограничен. |
output_mode | Необязательное указание выхода слоя. Значения могут быть «int», «binary», «count» или «tf-idf», настраивающие слой следующим образом: «int»: выводит целые индексы, по одному целочисленному индексу на каждый токен разделенной строки. «binary»: выводит один массив целых чисел на пакет, размером либо vocab_size, либо max_elements, содержащий 1 в всех элементах, где токен, отображенный на этот индекс, встречается по крайней мере один раз в элементе пакета. «count»: как «binary», но массив целых чисел содержит количество раз, когда токен в этом индексе появился в элементе пакета. «tf-idf»: как «binary», но применяется алгоритм TF-IDF для поиска значения в каждом слоте токена. |
output_sequence_length | Действительно только в режиме INT. Если установлено, выходной временной размер будет дополнен или усечен до ровно output_sequence_length значений, что приведет к тензору формы [batch_size, output_sequence_length] независимо от входной формы. |
pad_to_max_elements | Действительно только в режимах «binary», «count» и «tf-idf». Если True, ось признаков вывода будет дополнена до max_elements даже если количество уникальных значений в словаре меньше max_elements, что приведет к тензору формы [batch_size, max_elements] независимо от размера словаря. По умолчанию False. |
Методы
adapt
adapt(
data, reset_state=True
)
Подбирает состояние слоя предобработки к набору данных.
Переопределяет метод adapt по умолчанию, чтобы применить соответствующую предобработку к входным данным перед передачей в комбинирующий слой.
| Аргументы | |
|---|---|
data | Данные для обучения. Его можно передать либо в виде набора данных tf.data, либо в виде массива numpy. |
reset_state | Необязательный аргумент, указывающий, нужно ли очистить состояние слоя в начале вызова adapt. Это должно быть True для этого слоя, который не поддерживает повторные вызовы adapt. |
| Исключения | |
|---|---|
RuntimeError | если слой не может быть адаптирован в данный момент. |
set_num_elements
set_num_elements(
num_elements
)
set_tfidf_data
set_tfidf_data(
tfidf_data
)
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/compat/v1/keras/layers/experimental/preprocessing/CategoryEncoding