tf.keras.datasets.reuters.load_data
Загружает набор данных о классификации новостных лент Reuters.
tf.keras.datasets.reuters.load_data(
path='reuters.npz',
num_words=None,
skip_top=0,
maxlen=None,
test_split=0.2,
seed=113,
start_char=1,
oov_char=2,
index_from=3
)
Это набор данных из 11 228 новостных лент Reuters, помеченных более чем по 46 темам.
Изначально он был сгенерирован путём анализа и предобработки классического набора данных Reuters-21578, но код предобработки больше не входит в Keras. Более подробную информацию можно найти в этом обсуждении на GitHub.
Каждая новостная лента кодируется как список индексов слов (целые числа). Для удобства слова индексируются по частоте встречаемости в наборе данных, так что, например, целое число "3" кодирует третье по частоте слово в данных. Это позволяет выполнять быстрые операции фильтрации, такие как: «учитывать только 10 000 самых часто встречающихся слов, но исключить 20 самых часто встречающихся слов».
По соглашению, "0" не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.
| Аргументы | |
|---|---|
path | место кэширования данных (относительно ~/.keras/dataset). |
num_words | целое число или None. Слова ранжируются по частоте их появления (в обучающем наборе), и сохраняются только num_words самых часто встречающихся слов. Любое слово с меньшей частотой появления будет отображаться как oov_char значение в данных последовательности. Если None, сохраняются все слова. По умолчанию None. |
skip_top | пропустить N самых часто встречающихся слов (которые могут быть неинформативными). Эти слова будут отображаться как oov_char значение в наборе данных. 0 означает, что слова не пропускаются. По умолчанию 0. |
maxlen | целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет обрезана. None означает, что обрезка не выполняется. По умолчанию None. |
test_split | Число с плавающей точкой от 0. до 1.. Часть набора данных, которая будет использоваться в качестве тестовых данных. 0.2 означает, что 20% набора данных используется как тестовые данные. По умолчанию 0.2. |
seed | целое число. Зерно для воспроизводимого перемешивания данных. |
start_char | целое число. Начало последовательности будет отмечено этим символом. 0 обычно является символом заполнения. По умолчанию 1. |
oov_char | целое число. Символ вне словаря. Слова, которые были исключены из-за num_words или skip_top ограничений, будут заменены этим символом. |
index_from | целое число. Индексировать реальные слова с этим индексом и выше. |
| Возвращаемое значение | |
|---|---|
Кортеж массивов Numpy: (x_train, y_train), (x_test, y_test). |
x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если аргумент num_words был указан, максимальное возможное значение индекса равно num_words - 1. Если аргумент maxlen был указан, максимальная возможная длина последовательности равна maxlen.
y_train, y_test: списки целочисленных меток (1 или 0).
Примечание: Символ «вне словаря» используется только для слов, которые присутствовали в обучающем наборе, но не включены, потому что они не проходят num_words отбор здесь. Слова, которые не встречались в обучающем наборе, но присутствуют в тестовом наборе, просто пропущены.
© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/keras/datasets/reuters/load_data