Spec-Zone.ru › TensorFlow 1.15

tf.compat.v2.feature_column.categorical_column_with_vocabulary_file

Столбец категориальных данных с файлом словаря.

tf.compat.v2.feature_column.categorical_column_with_vocabulary_file(
    key, vocabulary_file, vocabulary_size=None, dtype=tf.dtypes.string,
    default_value=None, num_oov_buckets=0
)

Используйте этот столбец, когда ваши входные данные представлены в строчном или целочисленном формате, и у вас есть файл словаря, который сопоставляет каждое значение целочисленному идентификатору. По умолчанию значения, отсутствующие в словаре, игнорируются. Используйте либо (но не оба) num_oov_buckets и default_value для указания, как обрабатывать значения, отсутствующие в словаре.

Для входного словаря features, features[key] равно либо Tensor, либо SparseTensor. Если Tensor, пропущенные значения могут быть представлены как -1 для целых чисел и '' для строк, которые будут пропущены этим столбцом признаков.

Пример со num_oov_buckets: Файл '/us/states.txt' содержит 50 строк, каждая из которых содержит двухсимвольное сокращение штата США. Все входные данные со значениями из этого файла получают идентификатор от 0 до 49, соответствующий номеру строки. Все другие значения хэшируются и получают идентификатор от 50 до 54.

states = categorical_column_with_vocabulary_file(
    key='states', vocabulary_file='/us/states.txt', vocabulary_size=50,
    num_oov_buckets=5)
columns = [states, ...]
features = tf.io.parse_example(..., features=make_parse_example_spec(columns))
linear_prediction = linear_model(features, columns)

Пример с default_value: Файл '/us/states.txt' содержит 51 строку - первая строка - 'XX', а остальные 50 содержат двухсимвольное сокращение штата США. Как буквальное 'XX' во входных данных, так и другие значения, отсутствующие в файле, получат идентификатор 0. Все остальные получают соответствующий номер строки от 1 до 50.

states = categorical_column_with_vocabulary_file(
    key='states', vocabulary_file='/us/states.txt', vocabulary_size=51,
    default_value=0)
columns = [states, ...]
features = tf.io.parse_example(..., features=make_parse_example_spec(columns))
linear_prediction, _, _ = linear_model(features, columns)

И для создания встраивания (embedding) можно использовать:

columns = [embedding_column(states, 3),...]
features = tf.io.parse_example(..., features=make_parse_example_spec(columns))
dense_tensor = input_layer(features, columns)
Аргументы
key Уникальная строка, идентифицирующая входной признак. Используется в качестве имени столбца и ключа словаря для конфигурации разбора признаков, объектов признаков Tensor и столбцов признаков.
vocabulary_file Имя файла словаря.
vocabulary_size Количество элементов в словаре. Должно быть не больше длины vocabulary_file, если меньше, то последующие значения игнорируются. Если None, устанавливается равным длине vocabulary_file.
dtype Тип признаков. Поддерживаются только строковый и целочисленный типы.
default_value Целочисленное значение идентификатора, возвращаемое для значений признаков, отсутствующих в словаре. По умолчанию -1. Не может быть указано вместе с положительным num_oov_buckets.
num_oov_buckets Неотрицательное целое число, количество ведер для значений, отсутствующих в словаре. Все входные данные, отсутствующие в словаре, будут назначены идентификаторам в диапазоне [vocabulary_size, vocabulary_size+num_oov_buckets) на основе хэширования входного значения. Положительный num_oov_buckets не может быть указан вместе с default_value.
Возвращаемое значение
Столбец категориальных данных с файлом словаря.
Исключения
ValueError Файл vocabulary_file отсутствует или недоступен.
ValueError Файл vocabulary_size отсутствует или содержит меньше 1 значения.
ValueError num_oov_buckets является отрицательным числом.
ValueError num_oov_buckets и default_value оба указаны.
ValueError dtype не является строкой или целым числом.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r1.15/api_docs/python/tf/compat/v2/feature_column/categorical_column_with_vocabulary_file

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API