tf.random.fixed_unigram_candidate_sampler
| Просмотреть исходный код на GitHub |
Выборка набора классов с использованием предоставленного (фиксированного) базового распределения.
tf.random.fixed_unigram_candidate_sampler(
true_classes, num_true, num_sampled, unique, range_max, vocab_file='',
distortion=1.0, num_reserved_ids=0, num_shards=1, shard=0, unigrams=(),
seed=None, name=None
)
Эта операция случайным образом выбирает тензор выборочных классов (sampled_candidates) из диапазона целых чисел [0, range_max).
Элементы sampled_candidates выбираются без повторения (если unique=True) или с повторением (если unique=False) из базового распределения.
Базовое распределение считывается из файла или передается в виде массива в оперативной памяти. Также есть возможность исказить распределение, применив степень искажения к весам.
Кроме того, эта операция возвращает тензоры true_expected_count и sampled_expected_count, представляющие количество раз, когда каждый из целевых классов (true_classes) и выборочные классы (sampled_candidates) ожидается, что они появятся в среднем тензоре выборочных классов. Эти значения соответствуют Q(y|x) в этом документе. Если unique=True, тогда это вероятности после отбраковки, и мы вычисляем их приближенно.
| Аргументы | |
|---|---|
true_classes | A Tensor типа int64 и формы [batch_size, num_true]. Целевые классы. |
num_true | An int. Количество целевых классов на пример обучения. |
num_sampled | An int. Количество классов для случайной выборки. |
unique | A bool. Определяет, уникальны ли все выбранные классы в пакете. |
range_max | An int. Количество возможных классов. |
vocab_file | Каждая допустимая строка в этом файле (которая должна иметь формат, похожий на CSV) соответствует допустимому идентификатору слова. Идентификаторы в последовательном порядке, начиная с num_reserved_ids. Ожидается, что последняя запись в каждой строке будет значением, соответствующим счету или относительной вероятности. Точно один из vocab_file и unigrams должен быть передан в эту операцию. |
distortion | Искажение используется для искажения распределения вероятностей униграмм. Каждый вес сначала возводится в степень искажения, прежде чем добавляться к внутреннему распределению униграмм. В результате, distortion = 1.0 дает обычную выборку униграмм (как определено в файле vocab), а distortion = 0.0 дает равномерное распределение. |
num_reserved_ids | Пользователи могут дополнительно добавить некоторые зарезервированные идентификаторы в диапазоне [0, num_reserved_ids). Одним из вариантов использования является использование специального маркера неизвестного слова в качестве идентификатора 0. У этих идентификаторов будет вероятность выборки 0. |
num_shards | Образец может использоваться для выборки из подмножества исходного диапазона, чтобы ускорить всю вычислительную работу с помощью параллелизма. Этот параметр (вместе с shard) указывает количество разбиений, используемых в общем вычислении. |
shard | Образец может использоваться для выборки из подмножества исходного диапазона, чтобы ускорить всю вычислительную работу с помощью параллелизма. Этот параметр (вместе с num_shards) указывает конкретный номер разбиения операции, когда используется разбиение. |
unigrams | Список подсчетов или вероятностей униграмм, по одному на каждый идентификатор в последовательном порядке. Точно один из vocab_file и unigrams должен быть передан в эту операцию. |
seed | An int. Семена, специфичные для операции. По умолчанию 0. |
name | Название операции (необязательно). |
| Возвращаемые значения | |
|---|---|
sampled_candidates | A tensor типа int64 и формы [num_sampled]. Выбранные классы. |
true_expected_count | A tensor типа float. Такая же форма, как у true_classes. Ожидаемые подсчеты по распределению выборки каждого из true_classes. |
sampled_expected_count | A tensor типа float. Такая же форма, как у sampled_candidates. Ожидаемые подсчеты по распределению выборки каждого из sampled_candidates. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/random/fixed_unigram_candidate_sampler