tf.keras.preprocessing.text.one_hot
| Просмотреть исходный код на GitHub |
Кодирует текст в виде списка индексов слов размером n.
tf.keras.preprocessing.text.one_hot(
input_text,
n,
filters='!"#$%&()*+,-./:;<=>?@[\\]^_`{|}~\t\n',
lower=True,
split=' ',
analyzer=None
)
Эта функция принимает на вход строку текста и возвращает список закодированных целых чисел, каждый из которых соответствует слову (или маркеризированному слову) в данной входной строке.
| Аргументы | |
|---|---|
input_text | Текст на входе (строка). |
n | int. Размер словаря. |
filters | список (или конкатенация) символов для фильтрации, например, знаков препинания. По умолчанию: '!"#$%&()*+,-./:;<=>?@[\]^_`{|}~\t\n, включает основные знаки препинания, табуляцию и переводы строк. |
lower | boolean. Приводить ли текст к нижнему регистру. |
split | str. Разделитель для разделения слов. |
analyzer | функция. Пользовательский анализатор для разделения текста. |
| Возвращаемое значение | |
|---|---|
Список целых чисел в формате [1, n]. Каждое целое число кодирует слово (уникальность не гарантируется). |
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/keras/preprocessing/text/one_hot