tf.raw_ops.FixedUnigramCandidateSampler
Генерирует метки для выборки кандидатов с использованием выученной униграмной распределения.
tf.raw_ops.FixedUnigramCandidateSampler(
true_classes,
num_true,
num_sampled,
unique,
range_max,
vocab_file='',
distortion=1,
num_reserved_ids=0,
num_shards=1,
shard=0,
unigrams=[],
seed=0,
seed2=0,
name=None
)
Униграмный выборщик может использовать фиксированное униграмное распределение, считанное из файла или переданное в виде массива в памяти, вместо построения распределения из данных на лету. Также есть возможность исказить распределение, применив степень искажения к весам.
Файл словаря должен быть в формате, похожем на CSV, где последнее поле — вес, связанный со словом.
Для каждой партии этот оператор выбирает один набор выборочных меток кандидатов.
Преимущества выборки кандидатов по партиям — простота и возможность эффективной умножения матриц с плотной записью. Недостаток заключается в том, что выбранные кандидаты должны выбираться независимо от контекста и истинных меток.
| Аргументы | |
|---|---|
true_classes | Матрица типа int64, размер batch_size * num_true, в которой каждая строка содержит идентификаторы num_true целевых классов в соответствующей исходной метке. |
num_true | Целое число. Количество истинных меток на контекст. |
num_sampled | Целое число. Количество кандидатов для случайной выборки. |
unique | Булево значение. Если значение true, мы производим выборку с отбраковкой, так что все выбранные кандидаты в партии уникальны. Это требует некоторого приближения для оценки вероятностей выборки после отбраковки. |
range_max | Целое число. Выборщик будет выбирать целые числа из интервала [0, range_max). |
vocab_file | Необязательный строковый путь к файлу. По умолчанию "". Каждая допустимая строка в этом файле (который должен иметь формат, похожий на CSV) соответствует допустимому идентификатору слова. Идентификаторы упорядочены последовательно, начиная с num_reserved_ids. Ожидается, что последняя запись в каждой строке будет значением, соответствующим счету или относительной вероятности. Точно один из vocab_file и unigrams должен быть передан в этот оператор. |
distortion | Необязательное вещественное число. По умолчанию 1. Искажение используется для искажения униграмного распределения вероятностей. Каждый вес сначала возводится в степень искажения перед добавлением в внутреннее униграмное распределение. В результате distortion = 1.0 дает обычную униграмную выборку (как определено в файле vocab), а distortion = 0.0 дает равномерное распределение. |
num_reserved_ids | Необязательное целое число. По умолчанию 0. Пользователи могут дополнительно добавить некоторые зарезервированные идентификаторы в диапазоне [0, ..., num_reserved_ids). Один из вариантов использования — использование специального маркера неизвестного слова с ID 0. Вероятность выборки этих идентификаторов будет равна 0. |
num_shards | Необязательное целое число. По умолчанию 1. Выборщик может использоваться для выборки из подмножества исходного диапазона для ускорения вычислений за счет параллелизма. Этот параметр (вместе с 'shard') указывает на количество разделов, используемых в общем вычислении. |
shard | Необязательное целое число. По умолчанию 0. Выборщик может использоваться для выборки из подмножества исходного диапазона для ускорения вычислений за счет параллелизма. Этот параметр (вместе с 'num_shards') указывает конкретный номер раздела оператора выборщика при использовании разбиения. |
unigrams | Необязательный список целых чисел. По умолчанию []. Список униграмных подсчетов или вероятностей, по одному на ID в последовательном порядке. Точно один из vocab_file и unigrams должен быть передан в этот оператор. |
seed | Необязательное целое число. По умолчанию 0. Если seed или seed2 установлены отличными от нуля, генератор случайных чисел инициализируется заданным seed. В противном случае он инициализируется случайным seed. |
seed2 | Необязательное целое число. По умолчанию 0. Второй seed для предотвращения столкновений seed. |
name | Название операции (необязательно). |
| Возвращаемые значения | |
|---|---|
Кортеж объектов Tensor (sampled_candidates, true_expected_count, sampled_expected_count). | |
sampled_candidates | Матрица типа int64. |
true_expected_count | Массив типа float32. |
sampled_expected_count | Массив типа float32. |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/raw_ops/FixedUnigramCandidateSampler