Spec-Zone.ru › TensorFlow

tf.keras.datasets.imdb.load_data

Загрузка набора данных IMDB.

tf.keras.datasets.imdb.load_data(
    path='imdb.npz',
    num_words=None,
    skip_top=0,
    maxlen=None,
    seed=113,
    start_char=1,
    oov_char=2,
    index_from=3,
    **kwargs
)

Это набор данных, содержащий 25 000 рецензий на фильмы из IMDB, помеченных по типу отклика (положительный/отрицательный). Рецензии были предварительно обработаны, и каждая рецензия закодирована как список индексов слов (целые числа). Для удобства слова индексируются по общей частоте в наборе данных, так что, например, целое число "3" кодирует 3-е по частоте слово в данных. Это позволяет быстро выполнять операции фильтрации, такие как: «учитывать только 10 000 самых распространённых слов, но исключить 20 самых распространённых слов».

По соглашению, «0» не обозначает конкретное слово, а используется для кодирования маркера заполнения.

Аргументы
path место кеширования данных (относительно ~/.keras/dataset).
num_words целое число или None. Слова ранжируются по частоте появления (в обучающем наборе), и сохраняются только num_words самых частых слов. Любое слово с меньшей частотой будет отображаться как значение oov_char в данных последовательности. Если None, сохраняются все слова. По умолчанию None.
skip_top пропускаются N самых часто встречающихся слов (которые могут не быть информативными). Эти слова будут отображаться как значение oov_char в наборе данных. При значении 0 слова не пропускаются. По умолчанию 0.
maxlen целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. None — означает отсутствие усечения. По умолчанию None.
seed целое число. Зерно для воспроизводимого перемешивания данных.
start_char целое число. Начало последовательности будет отмечено этим символом. 0 обычно является символом заполнения. По умолчанию 1.
oov_char целое число. Символ слова вне словаря. Слова, которые были исключены из-за ограничений num_words или skip_top, будут заменены этим символом.
index_from целое число. Индексы фактических слов с этим индексом и выше.
Возвращаемое значение
Кортеж массивов NumPy: (x_train, y_train), (x_test, y_test).

x_train, x_test: списки последовательностей, которые представляют собой списки индексов (целые числа). Если аргумент num_words был указан, максимальное возможное значение индекса равно num_words - 1. Если аргумент maxlen был указан, максимальная возможная длина последовательности равна maxlen.

y_train, y_test: списки целых меток (1 или 0).

Примечание: Символ «слова вне словаря» используется только для слов, которые присутствовали в обучающем наборе, но не включены, так как они не прошли num_words отбор. Слова, которые не встречались в обучающем наборе, но присутствуют в тестовом наборе, просто пропущены.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/keras/datasets/imdb/load_data

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API