tf.contrib.layers.sparse_column_with_hash_bucket
Создаёт _SparseColumn с конфигурацией хешированных ведер.
tf.contrib.layers.sparse_column_with_hash_bucket(
column_name, hash_bucket_size, combiner='sum', dtype=tf.dtypes.string,
hash_keys=None
)
Используйте этот метод, когда ваши разреженные признаки представлены в строчном или целочисленном формате, но у вас нет файла vocab, сопоставляющего каждое значение целочисленному идентификатору. output_id = Hash(input_feature_string) % bucket_size
При установке hash_keys создаются несколько целочисленных идентификаторов для каждой пары ключей в hash_keys. Это полезно для уменьшения коллизий хешированных идентификаторов.
| Аргументы | |
|---|---|
column_name | Строка, определяющая имя разреженного столбца. |
hash_bucket_size | Целое число, большее 1. Количество ведер. |
combiner | Строка, определяющая способ агрегации, если разреженный столбец многозначный. В настоящее время поддерживаются "mean", "sqrtn" и "sum", по умолчанию используется "sum". "sqrtn" часто обеспечивает хорошую точность, особенно для столбцов "мешок слов".
|
dtype | Тип признаков. Поддерживаются только строковые и целочисленные типы. |
hash_keys | Ключи хеширования для использования. Это список списков из двух uint64. Если None, используется простой и быстрый алгоритм хеширования. В противном случае, с каждой парой uint64 в этом аргументе будут создаваться несколько сильных хеш-идентификаторов. |
| Возвращаемые значения | |
|---|---|
| _SparseColumn с конфигурацией хешированных ведер |
| Исключения | |
|---|---|
ValueError | hash_bucket_size не больше 2. |
ValueError | тип dtype не является строковым или целочисленным. |
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r1.15/api_docs/python/tf/contrib/layers/sparse_column_with_hash_bucket