Spec-Zone.ru › TensorFlow 2.4

tf.keras.datasets.imdb.load_data

Просмотреть исходный код на GitHub

Загружает набор данных IMDB.

Просмотр псевдонимов

Псевдонимы для миграции

См. Руководство по миграции для получения дополнительной информации.

tf.compat.v1.keras.datasets.imdb.load_data

tf.keras.datasets.imdb.load_data(
    path='imdb.npz', num_words=None, skip_top=0, maxlen=None, seed=113,
    start_char=1, oov_char=2, index_from=3, **kwargs
)

Это набор данных из 25 000 обзоров фильмов из IMDB, помеченных по эмоциональной окраске (положительная/отрицательная). Обзоры были предварительно обработаны, и каждый обзор закодирован как список индексов слов (целых чисел). Для удобства слова индексируются по общей частоте в наборе данных, так что, например, целое число «3» кодирует 3-е по частоте слово в данных. Это позволяет быстро выполнять фильтрацию, например: «учитывать только 10 000 наиболее часто встречающихся слов, но исключить 20 наиболее часто встречающихся слов».

По соглашению, «0» не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.

Аргументы
path место кэширования данных (относительно ~/.keras/dataset).
num_words целое число или None. Слова ранжируются по частоте их появления (в обучающей выборке) и сохраняются только num_words наиболее часто встречающихся слов. Любое менее часто встречающееся слово будет отображаться как oov_char значение в данных последовательности. Если None, сохраняются все слова. По умолчанию None, поэтому сохраняются все слова.
skip_top пропустить первые N наиболее часто встречающихся слов (которые могут быть неинформативными). Эти слова появятся как oov_char значение в наборе данных. По умолчанию 0, поэтому слова не пропускаются.
maxlen целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. По умолчанию None, что означает отсутствие усечения.
seed целое число. Семечко для воспроизводимой перестановки данных.
start_char целое число. Начало последовательности будет помечено этим символом. По умолчанию 1, так как 0 обычно является символом заполнения.
oov_char целое число. Символ слова вне словаря. Слова, которые были исключены из-за num_words или skip_top ограничений, будут заменены этим символом.
index_from целое число. Индексировать фактические слова с этим индексом и выше.
**kwargs Используется для обратной совместимости.
Возвращаемое значение
Кортеж массивов Numpy: (x_train, y_train), (x_test, y_test).

x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если аргумент num_words был указан, максимальное возможное значение индекса равно num_words - 1. Если аргумент maxlen был указан, максимальная возможная длина последовательности равна maxlen.

y_train, y_test: списки целочисленных меток (1 или 0).

Исключения
ValueError в случае, если maxlen настолько низкий, что ни одна входная последовательность не могла быть сохранена.

Обратите внимание, что символ «вне словаря» используется только для слов, которые присутствовали в обучающей выборке, но не включены, поскольку они не прошли num_words отбор здесь. Слова, которые не встречались в обучающей выборке, но присутствуют в тестовой выборке, просто пропущены.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/keras/datasets/imdb/load_data

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API