tf.keras.preprocessing.text.Tokenizer
Утилита для токенизации текста.
tf.keras.preprocessing.text.Tokenizer(
num_words=None, filters='!"#$%&()*+,-./:;<=>?@[\\]^_`{|}~\t\n', lower=True,
split=' ', char_level=False, oov_token=None, document_count=0, **kwargs
)
Этот класс позволяет векторизовать текстовый корпус, преобразуя каждый текст либо в последовательность целых чисел (каждое целое число — индекс токена в словаре), либо в вектор, где коэффициент для каждого токена может быть двоичным, на основе количества слов, на основе tf-idf и т. д.
Аргументы
num_words: the maximum number of words to keep, based
on word frequency. Only the most common `num_words-1` words will
be kept.
filters: a string where each element is a character that will be
filtered from the texts. The default is all punctuation, plus
tabs and line breaks, minus the `'` character.
lower: boolean. Whether to convert the texts to lowercase.
split: str. Separator for word splitting.
char_level: if True, every character will be treated as a token.
oov_token: if given, it will be added to word_index and used to
replace out-of-vocabulary words during text_to_sequence calls
По умолчанию вся пунктуация удаляется, превращая тексты в последовательности слов, разделённых пробелами (слова могут включать символ '). Эти последовательности затем разбиваются на списки токенов. Затем они будут индексироваться или векторизоваться.
0 — это зарезервированный индекс, который не будет назначен ни одному слову.
Методы
fit_on_sequences
fit_on_sequences(
sequences
)
Обновляет внутренний словарь на основе списка последовательностей.
Необходимый этап перед использованием sequences_to_matrix (если fit_on_texts никогда не вызывался).
Аргументы
sequences: A list of sequence.
A "sequence" is a list of integer word indices.
fit_on_texts
fit_on_texts(
texts
)
Обновляет внутренний словарь на основе списка текстов.
В случае, если тексты содержат списки, предполагается, что каждый элемент в списках — это токен.
Необходимый этап перед использованием texts_to_sequences или texts_to_matrix.
Аргументы
texts: can be a list of strings,
a generator of strings (for memory-efficiency),
or a list of list of strings.
get_config
get_config()
Возвращает конфигурацию токенизатора в виде словаря Python. Словари подсчётов слов, используемые токенизатором, сериализуются в обычный JSON, поэтому конфигурация может быть прочитана другими проектами.
Возвращаемое значение
A Python dictionary with the tokenizer configuration.
sequences_to_matrix
sequences_to_matrix(
sequences, mode='binary'
)
Преобразует список последовательностей в матрицу Numpy.
Аргументы
sequences: list of sequences
(a sequence is a list of integer word indices).
mode: one of "binary", "count", "tfidf", "freq"
Возвращаемое значение
A Numpy matrix.
Исключения
ValueError: In case of invalid `mode` argument,
or if the Tokenizer requires to be fit to sample data.
sequences_to_texts
sequences_to_texts(
sequences
)
Преобразует каждую последовательность в список текстов.
Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.
Аргументы
sequences: A list of sequences (list of integers).
Возвращаемое значение
A list of texts (strings)
sequences_to_texts_generator
sequences_to_texts_generator(
sequences
)
Преобразует каждую последовательность в sequences в список текстов (строк).
Каждая последовательность должна быть списком целых чисел. Другими словами, последовательности должны быть списком последовательностей.
Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.
Аргументы
sequences: A list of sequences.
Выходные значения
Yields individual texts.
texts_to_matrix
texts_to_matrix(
texts, mode='binary'
)
Преобразует список текстов в матрицу Numpy.
Аргументы
texts: list of strings. mode: one of "binary", "count", "tfidf", "freq".
Возвращаемое значение
A Numpy matrix.
texts_to_sequences
texts_to_sequences(
texts
)
Преобразует каждый текст в тексте в последовательность целых чисел.
Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.
Аргументы
texts: A list of texts (strings).
Возвращаемое значение
A list of sequences.
texts_to_sequences_generator
texts_to_sequences_generator(
texts
)
Преобразует каждый текст в texts в последовательность целых чисел.
Каждый элемент в тексте также может быть списком, в этом случае каждый элемент этого списка считается токеном.
Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.
Аргументы
texts: A list of texts (strings).
Выходные значения
Yields individual sequences.
to_json
to_json(
**kwargs
)
Возвращает строку JSON, содержащую конфигурацию токенизатора. Чтобы загрузить токенизатор из строки JSON, используйте keras.preprocessing.text.tokenizer_from_json(json_string).
Аргументы
**kwargs: Additional keyword arguments
to be passed to `json.dumps()`.
Возвращаемое значение
A JSON string containing the tokenizer configuration.
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/keras/preprocessing/text/Tokenizer