tf.raw_ops.GenerateVocabRemapping
Учитывая путь к новым и старым файлам словаря, возвращает тензор перемапирования длиной num_new_vocab, где remapping[i] содержит номер строки в старом словаре, соответствующий строке i в новом словаре (начиная с new_vocab_offset и до num_new_vocab сущностей), или -1, если запись i в новом словаре отсутствует в старом словаре. Старый словарь ограничен первыми old_vocab_size записями, если old_vocab_size не имеет значения по умолчанию -1.
tf.raw_ops.GenerateVocabRemapping(
new_vocab_file,
old_vocab_file,
new_vocab_offset,
num_new_vocab,
old_vocab_size=-1,
name=None
)
num_vocab_offset позволяет использовать операцию в случае разбиения переменных и в общем случае должна устанавливаться путем проверки информации о разбиении. Формат файлов должен быть текстовым, при этом каждая строка содержит единственную сущность в словаре.
Например, если new_vocab_file – текстовый файл, содержащий каждый из следующих элементов в отдельной строке: [f0, f1, f2, f3], old_vocab_file = [f1, f0, f3], num_new_vocab = 3, new_vocab_offset = 1, возвращаемое перемапирование будет [0, -1, 2].
Операция также возвращает количество записей в новом словаре, присутствующих в старом словаре, что используется для расчета количества значений для инициализации в матрице весов перемапирования
Эта функциональность может использоваться для перемапирования словарей строк (как правило, признаков) и столбцов (как правило, классов) из контрольных точек TensorFlow. Обратите внимание, что логика разбиения полагается на непрерывные словари, соответствующие переменным, разбиение которых выполняется с использованием div. Кроме того, подлежащее перемапирование использует IndexTable (в отличие от неточного CuckooTable), поэтому код клиента должен использовать соответствующую функцию index_table_from_file(), как это делает фреймворк FeatureColumn (в отличие от tf.feature_to_id(), который использует CuckooTable).
| Аргументы | |
|---|---|
new_vocab_file | A Tensor типа string. Путь к новому файлу словаря. |
old_vocab_file | A Tensor типа string. Путь к старому файлу словаря. |
new_vocab_offset | An int значение которого >= 0. Количество записей в новом файле словаря, с которых начать чтение. |
num_new_vocab | An int значение которого >= 0. Количество записей в новом файле словаря для перемапирования. |
old_vocab_size | Необязательный int со значением >= -1. Значение по умолчанию -1. Количество записей в старом файле словаря для рассмотрения. Если -1, используется весь старый словарь. |
name | Имя операции (необязательно). |
| Возвращаемые значения | |
|---|---|
Кортеж объектов Tensor (remapping, num_present). | |
remapping | A Tensor типа int64. |
num_present | A Tensor типа int32. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/raw_ops/GenerateVocabRemapping