tf.keras.datasets.imdb.load_data
| Просмотреть исходный код на GitHub |
Загружает набор данных IMDB.
tf.keras.datasets.imdb.load_data(
path='imdb.npz', num_words=None, skip_top=0, maxlen=None, seed=113,
start_char=1, oov_char=2, index_from=3, **kwargs
)
Это набор данных из 25 000 обзоров фильмов из IMDB, помеченных по эмоциональной окраске (положительная/отрицательная). Обзоры были предварительно обработаны, и каждый обзор закодирован как список индексов слов (целых чисел). Для удобства слова индексируются по общей частоте в наборе данных, так что, например, целое число «3» кодирует 3-е по частоте слово в данных. Это позволяет быстро выполнять фильтрацию, например: «учитывать только 10 000 наиболее часто встречающихся слов, но исключить 20 наиболее часто встречающихся слов».
По соглашению, «0» не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.
| Аргументы | |
|---|---|
path | место кэширования данных (относительно ~/.keras/dataset). |
num_words | целое число или None. Слова ранжируются по частоте их появления (в обучающей выборке) и сохраняются только num_words наиболее часто встречающихся слов. Любое менее часто встречающееся слово будет отображаться как oov_char значение в данных последовательности. Если None, сохраняются все слова. По умолчанию None, поэтому сохраняются все слова. |
skip_top | пропустить первые N наиболее часто встречающихся слов (которые могут быть неинформативными). Эти слова появятся как oov_char значение в наборе данных. По умолчанию 0, поэтому слова не пропускаются. |
maxlen | целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. По умолчанию None, что означает отсутствие усечения. |
seed | целое число. Семечко для воспроизводимой перестановки данных. |
start_char | целое число. Начало последовательности будет помечено этим символом. По умолчанию 1, так как 0 обычно является символом заполнения. |
oov_char | целое число. Символ слова вне словаря. Слова, которые были исключены из-за num_words или skip_top ограничений, будут заменены этим символом. |
index_from | целое число. Индексировать фактические слова с этим индексом и выше. |
**kwargs | Используется для обратной совместимости. |
| Возвращаемое значение | |
|---|---|
Кортеж массивов Numpy: (x_train, y_train), (x_test, y_test). x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если аргумент num_words был указан, максимальное возможное значение индекса равно y_train, y_test: списки целочисленных меток (1 или 0). |
| Исключения | |
|---|---|
ValueError | в случае, если maxlen настолько низкий, что ни одна входная последовательность не могла быть сохранена. |
Обратите внимание, что символ «вне словаря» используется только для слов, которые присутствовали в обучающей выборке, но не включены, поскольку они не прошли num_words отбор здесь. Слова, которые не встречались в обучающей выборке, но присутствуют в тестовой выборке, просто пропущены.
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.4/api_docs/python/tf/keras/datasets/imdb/load_data