tf.raw_ops.GenerateVocabRemapping
Учитывая пути к новым и старым файлам словарей, возвращает тензор переназначения
tf.raw_ops.GenerateVocabRemapping(
new_vocab_file, old_vocab_file, new_vocab_offset, num_new_vocab,
old_vocab_size=-1, name=None
)
длиной num_new_vocab, где remapping[i] содержит номер строки в старом словаре, соответствующий строке i в новом словаре (начиная с строки new_vocab_offset и до num_new_vocab сущностей), или -1, если запись i в новом словаре отсутствует в старом словаре. Старый словарь ограничен первыми old_vocab_size записями, если old_vocab_size не имеет значения по умолчанию -1.
num_vocab_offset позволяет использовать в случае разбиения переменных и обычно должно устанавливаться путем проверки информации о разбиении. Формат файлов должен быть текстовым файлом, в котором каждая строка содержит одну сущность в словаре.
Например, с new_vocab_file текстовым файлом, содержащим каждый из следующих элементов в отдельной строке: [f0, f1, f2, f3], old_vocab_file = [f1, f0, f3], num_new_vocab = 3, new_vocab_offset = 1, возвращаемое переназначение будет [0, -1, 2].
Операция также возвращает количество записей в новом словаре, присутствующих в старом словаре, которое используется для расчета количества значений для инициализации в матрице весов, подлежащих переназначению.
Эта функциональность может использоваться для переназначения как строк словарей (обычно признаков), так и столбцов словарей (обычно классов) из контрольных точек TensorFlow. Обратите внимание, что логика разбиения основана на непрерывных словарях, соответствующих переменным, разделяемым по делению. Кроме того, основное переназначение использует таблицу индексов (в отличие от неточной таблицы CuckooTable), поэтому клиентский код должен использовать соответствующую функцию index_table_from_file(), как это делает структура FeatureColumn (в отличие от tf.feature_to_id(), которая использует таблицу CuckooTable).
| Аргументы | |
|---|---|
new_vocab_file | A Tensor типа string. Путь к новому файлу словаря. |
old_vocab_file | A Tensor типа string. Путь к старому файлу словаря. |
new_vocab_offset | A int значением >= 0. С какой записи в новом файле словаря начинать чтение. |
num_new_vocab | A int значением >= 0. Количество записей в новом файле словаря для переназначения. |
old_vocab_size | Необязательный int значением >= -1. По умолчанию -1. Количество записей в старом файле словаря для рассмотрения. Если -1, используется весь старый словарь. |
name | Имя операции (необязательно). |
| Возвращаемое значение | |
|---|---|
Кортеж объектов Tensor (переназначение, количество_присутствующих). | |
remapping | A Tensor типа int64. |
num_present | A Tensor типа int32. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/raw_ops/GenerateVocabRemapping