Spec-Zone.ru › TensorFlow 2.4

tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding

Слой CategoryEncoding.

Наследуется от: CategoryEncoding, PreprocessingLayer, Layer, Module

tf.compat.v1.keras.layers.experimental.preprocessing.CategoryEncoding(
    max_tokens=None, output_mode=BINARY, sparse=False, **kwargs
)

Этот слой предоставляет варианты сжатия входных данных в более плотные представления. Он принимает целые значения или строки в качестве входных данных, позволяет пользователям отображать эти входные данные в непрерывное целочисленное пространство и выводит либо эти целые значения (один образец = 1D тензор целых индексов токенов), либо плотное представление (один образец = 1D тензор чисел с плавающей точкой, представляющих данные о токенах образца).

При необходимости пользователь может вызвать метод adapt() этого слоя на наборе данных. Когда этот слой адаптирован, он проанализирует набор данных, определит частоту отдельных целочисленных или строковых значений и создаст «словарь» из них. Этот словарь может иметь неограниченный размер или быть ограниченным, в зависимости от конфигурационных параметров этого слоя; если во входных данных больше уникальных значений, чем максимальный размер словаря, для создания словаря будут использоваться наиболее часто встречающиеся термины.

Атрибуты
max_elements Максимальный размер словаря для этого слоя. Если None, размер словаря не ограничен.
output_mode Необязательное указание выхода слоя. Значения могут быть «int», «binary», «count» или «tf-idf», настраивающие слой следующим образом: «int»: выводит целые индексы, по одному целочисленному индексу на каждый токен разделенной строки. «binary»: выводит один массив целых чисел на пакет, размером либо vocab_size, либо max_elements, содержащий 1 в всех элементах, где токен, отображенный на этот индекс, встречается по крайней мере один раз в элементе пакета. «count»: как «binary», но массив целых чисел содержит количество раз, когда токен в этом индексе появился в элементе пакета. «tf-idf»: как «binary», но применяется алгоритм TF-IDF для поиска значения в каждом слоте токена.
output_sequence_length Действительно только в режиме INT. Если установлено, выходной временной размер будет дополнен или усечен до ровно output_sequence_length значений, что приведет к тензору формы [batch_size, output_sequence_length] независимо от входной формы.
pad_to_max_elements Действительно только в режимах «binary», «count» и «tf-idf». Если True, ось признаков вывода будет дополнена до max_elements даже если количество уникальных значений в словаре меньше max_elements, что приведет к тензору формы [batch_size, max_elements] независимо от размера словаря. По умолчанию False.

Методы

adapt

Просмотреть исходный код

adapt(
    data, reset_state=True
)

Подбирает состояние слоя предобработки к набору данных.

Переопределяет метод adapt по умолчанию, чтобы применить соответствующую предобработку к входным данным перед передачей в комбинирующий слой.

Аргументы
data Данные для обучения. Его можно передать либо в виде набора данных tf.data, либо в виде массива numpy.
reset_state Необязательный аргумент, указывающий, нужно ли очистить состояние слоя в начале вызова adapt. Это должно быть True для этого слоя, который не поддерживает повторные вызовы adapt.
Исключения
RuntimeError если слой не может быть адаптирован в данный момент.

set_num_elements

Просмотреть исходный код

set_num_elements(
    num_elements
)

set_tfidf_data

Просмотреть исходный код

set_tfidf_data(
    tfidf_data
)

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/compat/v1/keras/layers/experimental/preprocessing/CategoryEncoding

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API