tf.feature_column.sequence_categorical_column_with_vocabulary_file
Последовательность категориальных терминов, где идентификаторы используют файл словаря. (устарело)
tf.feature_column.sequence_categorical_column_with_vocabulary_file(
key,
vocabulary_file,
vocabulary_size=None,
num_oov_buckets=0,
default_value=None,
dtype=tf.dtypes.string
)
Передайте это в embedding_column или indicator_column, чтобы преобразовать последовательные категорические данные в плотное представление для ввода в последовательную нейронную сеть, такую как RNN.
Пример:
states = sequence_categorical_column_with_vocabulary_file(
key='states', vocabulary_file='/us/states.txt', vocabulary_size=50,
num_oov_buckets=5)
states_embedding = embedding_column(states, dimension=10)
columns = [states_embedding]
features = tf.io.parse_example(..., features=make_parse_example_spec(columns))
sequence_feature_layer = SequenceFeatures(columns)
sequence_input, sequence_length = sequence_feature_layer(features)
sequence_length_mask = tf.sequence_mask(sequence_length)
rnn_cell = tf.keras.layers.SimpleRNNCell(hidden_size)
rnn_layer = tf.keras.layers.RNN(rnn_cell)
outputs, state = rnn_layer(sequence_input, mask=sequence_length_mask)
| Аргументы | |
|---|---|
key | Уникальная строка, идентифицирующая входной признак. |
vocabulary_file | Имя файла словаря. |
vocabulary_size | Количество элементов в словаре. Это значение должно быть не больше длины vocabulary_file; если меньше, то последующие значения игнорируются. Если None, то устанавливается равным длине vocabulary_file. |
num_oov_buckets | Неотрицательное целое число, количество ведер вне словаря. Все входные данные вне словаря будут назначены идентификаторам в диапазоне [vocabulary_size, vocabulary_size+num_oov_buckets) на основе хэша входного значения. Положительное num_oov_buckets не может быть указано с default_value. |
default_value | Целое значение ID, которое возвращается для значений признаков вне словаря, по умолчанию -1. Это значение не может быть указано с положительным num_oov_buckets. |
dtype | Тип признаков. Поддерживаются только строковые и целочисленные типы. |
| Возвращаемые значения | |
|---|---|
SequenceCategoricalColumn. |
| Исключения | |
|---|---|
ValueError | Файл vocabulary_file отсутствует или не может быть открыт. |
ValueError | Файл vocabulary_size отсутствует или < 1. |
ValueError | num_oov_buckets — отрицательное целое число. |
ValueError | num_oov_buckets и default_value оба указаны. |
ValueError | dtype — ни строка, ни целое число. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/feature_column/sequence_categorical_column_with_vocabulary_file