tf.compat.v1.feature_column.categorical_column_with_vocabulary_file
Столбец категориальных данных с файлом словаря.
tf.compat.v1.feature_column.categorical_column_with_vocabulary_file(
key,
vocabulary_file,
vocabulary_size=None,
num_oov_buckets=0,
default_value=None,
dtype=tf.dtypes.string
)
Используйте этот столбец, когда ваши входные данные имеют строковый или целочисленный формат, и у вас есть файл словаря, который сопоставляет каждое значение целочисленному идентификатору. По умолчанию значения, отсутствующие в словаре, игнорируются. Используйте либо (но не оба) num_oov_buckets и default_value, чтобы указать, как обрабатывать значения, отсутствующие в словаре.
Для входного словаря features, features[key] это либо Tensor или SparseTensor. Если Tensor, пропущенные значения могут быть представлены как -1 для целых чисел и '' для строк, которые будут отброшены этим столбцом признаков.
Пример с num_oov_buckets: Файл '/us/states.txt' содержит 50 строк, каждая с двухсимвольным сокращением штата США. Все входные значения, присутствующие в этом файле, получают идентификатор от 0 до 49, соответствующий номеру строки. Все остальные значения хешируются и получают идентификатор от 50 до 54.
import tensorflow as tf
states = tf.feature_column.categorical_column_with_vocabulary_file(
key='states', vocabulary_file='states.txt', vocabulary_size=5,
num_oov_buckets=1)
columns = [states]
features = {'states':tf.constant([['california', 'georgia', 'michigan',
'texas', 'new york'], ['new york', 'georgia', 'california', 'michigan',
'texas']])}
linear_prediction = tf.compat.v1.feature_column.linear_model(features,
columns)
Пример с default_value: Файл '/us/states.txt' содержит 51 строку — первая строка — 'XX', а остальные 50 — двухсимвольные сокращения штатов США. Как буквальное 'XX' ввода, так и другие значения, отсутствующие в файле, будут присвоены идентификатору 0. Все остальные значения получают соответствующий номер строки от 1 до 50.
import tensorflow as tf
states = tf.feature_column.categorical_column_with_vocabulary_file(
key='states', vocabulary_file='states.txt', vocabulary_size=6,
default_value=0)
columns = [states]
features = {'states':tf.constant([['california', 'georgia', 'michigan',
'texas', 'new york'], ['new york', 'georgia', 'california', 'michigan',
'texas']])}
linear_prediction = tf.compat.v1.feature_column.linear_model(features,
columns)
И для создания встраивания с использованием либо:
import tensorflow as tf
states = tf.feature_column.categorical_column_with_vocabulary_file(
key='states', vocabulary_file='states.txt', vocabulary_size=5,
num_oov_buckets=1)
columns = [tf.feature_column.embedding_column(states, 3)]
features = {'states':tf.constant([['california', 'georgia', 'michigan',
'texas', 'new york'], ['new york', 'georgia', 'california', 'michigan',
'texas']])}
input_layer = tf.keras.layers.DenseFeatures(columns)
dense_tensor = input_layer(features)
| Аргументы | |
|---|---|
key | Уникальная строка, идентифицирующая входной признак. Она используется в качестве имени столбца и ключа словаря для конфигурации разбора признаков, объектов признаков Tensor и столбцов признаков. |
vocabulary_file | Имя файла словаря. |
vocabulary_size | Количество элементов в словаре. Это значение должно быть не больше длины vocabulary_file, если меньше, то последующие значения игнорируются. Если None, то устанавливается в длину vocabulary_file. |
num_oov_buckets | Неотрицательное целое число, количество ведер для значений, отсутствующих в словаре. Все входные значения, отсутствующие в словаре, будут присвоены идентификаторы в диапазоне [vocabulary_size, vocabulary_size+num_oov_buckets) на основе хеширования входного значения. Положительное num_oov_buckets не может быть указано вместе с default_value. |
default_value | Целочисленное значение идентификатора, возвращаемое для значений признаков, отсутствующих в словаре; по умолчанию -1. Это значение не может быть указано вместе с положительным num_oov_buckets. |
dtype | Тип признаков. Поддерживаются только строковые и целочисленные типы. |
| Возвращает | |
|---|---|
| Столбец категориальных данных с файлом словаря. |
| Исключения | |
|---|---|
ValueError | vocabulary_file отсутствует или не может быть открыт. |
ValueError | vocabulary_size отсутствует или меньше 1. |
ValueError | num_oov_buckets является отрицательным целым числом. |
ValueError | num_oov_buckets и default_value указаны одновременно. |
ValueError | dtype не является ни строкой, ни целым числом. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/compat/v1/feature_column/categorical_column_with_vocabulary_file