tf.keras.preprocessing.text.hashing_trick
| Просмотреть исходный код на GitHub |
Преобразует текст в последовательность индексов в пространстве хэширования фиксированного размера.
tf.keras.preprocessing.text.hashing_trick(
text, n, hash_function=None,
filters='!"#$%&()*+,-./:;<=>?@[\\]^_`{|}~\t\n',
lower=True, split=' '
)
| Аргументы | |
|---|---|
text | Текст-вход (строка). |
n | Размер пространства хэширования. |
hash_function | по умолчанию использует функцию python hash, может быть 'md5' или любой функцией, которая принимает на вход строку и возвращает целое число. Обратите внимание, что 'hash' - это не стабильная функция хэширования, поэтому она не согласована в разных запусках, в то время как 'md5' - это стабильная функция хэширования. |
filters | список (или конкатенация) символов для фильтрации, таких как знаки препинания. По умолчанию: !"#$%&()*+,-./:;<=>?@[\]^_`{|}~\t\n, включает основные знаки препинания, табуляции и новые строки. |
lower | булево значение. Преобразовать ли текст в нижний регистр. |
split | строка. Разделитель для разделения слов. |
| Возвращаемое значение | |
|---|---|
| Список целых индексов слов (уникальность не гарантируется). |
0 - это зарезервированный индекс, который не будет назначен ни одному слову.
Два или более слова могут быть назначены одному индексу из-за возможных коллизий функции хэширования. Вероятность коллизии зависит от размера пространства хэширования и количества уникальных объектов.
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/keras/preprocessing/text/hashing_trick