Spec-Zone.ru › TensorFlow 2.9

tf.keras.datasets.imdb.load_data

Просмотреть исходный код на GitHub

Загружает набор данных IMDB.

Просмотр псевдонимов

Псевдонимы для миграции

См. руководство по миграции для получения дополнительной информации.

tf.compat.v1.keras.datasets.imdb.load_data

tf.keras.datasets.imdb.load_data(
    path='imdb.npz',
    num_words=None,
    skip_top=0,
    maxlen=None,
    seed=113,
    start_char=1,
    oov_char=2,
    index_from=3,
    **kwargs
)

Это набор данных из 25 000 обзоров фильмов с IMDB, помеченных по степени восприятия (положительно/отрицательно). Обзоры были предварительно обработаны, и каждый обзор закодирован как список индексов слов (целые числа). Для удобства слова индексируются по частоте в наборе данных, поэтому, например, целое число «3» кодирует 3-е по частоте слово в данных. Это позволяет быстро выполнять фильтрующие операции, такие как: «учитывать только 10 000 наиболее распространенных слов, но исключить 20 наиболее распространенных слов».

По соглашению, «0» не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.

Аргументы
path место для кеширования данных (относительно ~/.keras/dataset).
num_words целое число или None. Слова ранжируются по частоте их появления (в обучающем наборе), и сохраняются только num_words наиболее часто встречающихся слов. Любое менее частое слово будет отображаться как oov_char значение в данных последовательности. Если None, все слова сохраняются. По умолчанию None, поэтому сохраняются все слова.
skip_top пропустить верхние N наиболее часто встречающихся слов (которые могут быть неинформативными). Эти слова будут отображаться как oov_char значение в наборе данных. По умолчанию 0, поэтому слова не пропускаются.
maxlen целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. По умолчанию None, что означает, что обрезка не выполняется.
seed целое число. Семено для воспроизводимого перемешивания данных.
start_char целое число. Начало последовательности будет помечено этим символом. По умолчанию 1, поскольку 0 обычно является символом заполнения.
oov_char целое число. Символ слова за пределами словаря. Слова, которые были исключены из-за ограничений num_words или skip_top, будут заменены этим символом.
index_from целое число. Индексы фактических слов с этим индексом и выше.
**kwargs Используется для обратной совместимости.
Возвращаемые значения
Кортеж массивов Numpy: (x_train, y_train), (x_test, y_test).

x_train, x_test: списки последовательностей, которые являются списками индексов (целые числа). Если был указан аргумент num_words, максимальное возможное значение индекса равно num_words - 1. Если был указан аргумент maxlen, максимальная возможная длина последовательности равна maxlen.

y_train, y_test: списки целочисленных меток (1 или 0).

Исключения
ValueError в случае, если maxlen настолько низкий, что ни одна входная последовательность не могла быть сохранена.

Обратите внимание, что символ «вне словаря» используется только для слов, которые были в обучающем наборе, но не включены, потому что они не прошли num_words фильтр здесь. Слова, которые не встречались в обучающем наборе, но присутствуют в тестовом наборе, были просто пропущены.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/keras/datasets/imdb/load_data

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API