Spec-Zone.ru › TensorFlow 2.3

tf.keras.preprocessing.text.Tokenizer

Утилита для токенизации текста.

Просмотр псевдонимов

Псевдонимы для миграции

См. Руководство по миграции для получения дополнительных сведений.

tf.compat.v1.keras.preprocessing.text.Tokenizer

tf.keras.preprocessing.text.Tokenizer(
    num_words=None, filters='!"#$%&()*+,-./:;<=>?@[\\]^_`{|}~\t\n', lower=True,
    split=' ', char_level=False, oov_token=None, document_count=0, **kwargs
)

Этот класс позволяет векторизовать текстовый корпус, преобразуя каждый текст либо в последовательность целых чисел (каждое целое число — индекс токена в словаре), либо в вектор, где коэффициент для каждого токена может быть двоичным, на основе количества слов, на основе tf-idf и т. д.

Аргументы

num_words: the maximum number of words to keep, based
    on word frequency. Only the most common `num_words-1` words will
    be kept.
filters: a string where each element is a character that will be
    filtered from the texts. The default is all punctuation, plus
    tabs and line breaks, minus the `'` character.
lower: boolean. Whether to convert the texts to lowercase.
split: str. Separator for word splitting.
char_level: if True, every character will be treated as a token.
oov_token: if given, it will be added to word_index and used to
    replace out-of-vocabulary words during text_to_sequence calls

По умолчанию вся пунктуация удаляется, превращая тексты в последовательности слов, разделённых пробелами (слова могут включать символ '). Эти последовательности затем разбиваются на списки токенов. Затем они будут индексироваться или векторизоваться.

0 — это зарезервированный индекс, который не будет назначен ни одному слову.

Методы

fit_on_sequences

fit_on_sequences(
    sequences
)

Обновляет внутренний словарь на основе списка последовательностей.

Необходимый этап перед использованием sequences_to_matrix (если fit_on_texts никогда не вызывался).

Аргументы

sequences: A list of sequence.
    A "sequence" is a list of integer word indices.

fit_on_texts

fit_on_texts(
    texts
)

Обновляет внутренний словарь на основе списка текстов.

В случае, если тексты содержат списки, предполагается, что каждый элемент в списках — это токен.

Необходимый этап перед использованием texts_to_sequences или texts_to_matrix.

Аргументы

texts: can be a list of strings,
    a generator of strings (for memory-efficiency),
    or a list of list of strings.

get_config

get_config()

Возвращает конфигурацию токенизатора в виде словаря Python. Словари подсчётов слов, используемые токенизатором, сериализуются в обычный JSON, поэтому конфигурация может быть прочитана другими проектами.

Возвращаемое значение

A Python dictionary with the tokenizer configuration.

sequences_to_matrix

sequences_to_matrix(
    sequences, mode='binary'
)

Преобразует список последовательностей в матрицу Numpy.

Аргументы

sequences: list of sequences
    (a sequence is a list of integer word indices).
mode: one of "binary", "count", "tfidf", "freq"

Возвращаемое значение

A Numpy matrix.

Исключения

ValueError: In case of invalid `mode` argument,
    or if the Tokenizer requires to be fit to sample data.

sequences_to_texts

sequences_to_texts(
    sequences
)

Преобразует каждую последовательность в список текстов.

Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.

Аргументы

sequences: A list of sequences (list of integers).

Возвращаемое значение

A list of texts (strings)

sequences_to_texts_generator

sequences_to_texts_generator(
    sequences
)

Преобразует каждую последовательность в sequences в список текстов (строк).

Каждая последовательность должна быть списком целых чисел. Другими словами, последовательности должны быть списком последовательностей.

Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.

Аргументы

sequences: A list of sequences.

Выходные значения

Yields individual texts.

texts_to_matrix

texts_to_matrix(
    texts, mode='binary'
)

Преобразует список текстов в матрицу Numpy.

Аргументы

texts: list of strings.
mode: one of "binary", "count", "tfidf", "freq".

Возвращаемое значение

A Numpy matrix.

texts_to_sequences

texts_to_sequences(
    texts
)

Преобразует каждый текст в тексте в последовательность целых чисел.

Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.

Аргументы

texts: A list of texts (strings).

Возвращаемое значение

A list of sequences.

texts_to_sequences_generator

texts_to_sequences_generator(
    texts
)

Преобразует каждый текст в texts в последовательность целых чисел.

Каждый элемент в тексте также может быть списком, в этом случае каждый элемент этого списка считается токеном.

Будут учтены только num_words-1 самых частых слов. Будут учтены только слова, известные токенизатору.

Аргументы

texts: A list of texts (strings).

Выходные значения

Yields individual sequences.

to_json

to_json(
    **kwargs
)

Возвращает строку JSON, содержащую конфигурацию токенизатора. Чтобы загрузить токенизатор из строки JSON, используйте keras.preprocessing.text.tokenizer_from_json(json_string).

Аргументы

**kwargs: Additional keyword arguments
    to be passed to `json.dumps()`.

Возвращаемое значение

A JSON string containing the tokenizer configuration.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/keras/preprocessing/text/Tokenizer

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API