tf.raw_ops.GenerateVocabRemapping
Учитывая путь к новым и старым файлам словаря, возвращает тензор перепривязки
tf.raw_ops.GenerateVocabRemapping(
new_vocab_file, old_vocab_file, new_vocab_offset, num_new_vocab,
old_vocab_size=-1, name=None
)
длины num_new_vocab, где remapping[i] содержит номер строки в старом словаре, соответствующей строке i в новом словаре (начиная с строки new_vocab_offset и до num_new_vocab сущностей), или -1 если запись i в новом словаре отсутствует в старом словаре. Старый словарь ограничен первыми old_vocab_size записями, если old_vocab_size не имеет значения по умолчанию -1.
num_vocab_offset позволяет использовать в случае с разбиением переменных и в целом должен настраиваться путем проверки информации о разбиении. Формат файлов должен быть текстовым файлом, каждая строка которого содержит одну сущность в словаре.
Например, если new_vocab_file — это текстовый файл, содержащий каждый из следующих элементов в отдельной строке: [f0, f1, f2, f3], old_vocab_file = [f1, f0, f3], num_new_vocab = 3, new_vocab_offset = 1, возвращаемая перепривязка будет [0, -1, 2].
Операция также возвращает количество записей в новом словаре, присутствующих в старом словаре, которое используется для расчета количества значений, которые нужно инициализировать в матрице весов при перепривязке.
Данная функциональность может быть использована для перепривязки словарей строк (как правило, признаков) и столбцов (как правило, классов) из контрольных точек TensorFlow. Обратите внимание, что логика разбиения основана на непрерывных словарях, соответствующих переменным, разбитым по делению. Более того, основная перепривязка использует IndexTable (в отличие от неточной CuckooTable), поэтому код клиента должен использовать соответствующую функцию index_table_from_file(), как это делает фреймворк FeatureColumn (в отличие от tf.feature_to_id(), который использует CuckooTable).
| Аргументы | |
|---|---|
new_vocab_file | A Tensor типа string. Путь к новому файлу словаря. |
old_vocab_file | A Tensor типа string. Путь к старому файлу словаря. |
new_vocab_offset | An int that is >= 0. С какой записи нового файла словаря начинать чтение. |
num_new_vocab | An int that is >= 0. Количество записей в новом файле словаря для перепривязки. |
old_vocab_size | Необязательный int типа >= -1. По умолчанию -1. Количество записей в старом файле словаря для рассмотрения. Если -1, используется весь старый словарь. |
name | Имя операции (необязательно). |
| Возвращаемые значения | |
|---|---|
Кортеж объектов Tensor (перепривязка, num_present). | |
remapping | A Tensor типа int64. |
num_present | A Tensor типа int32. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/raw_ops/GenerateVocabRemapping