tf.keras.datasets.reuters.load_data
| Просмотреть исходный код на GitHub |
Загружает набор данных для классификации новостей Reuters.
tf.keras.datasets.reuters.load_data(
path='reuters.npz', num_words=None, skip_top=0, maxlen=None, test_split=0.2,
seed=113, start_char=1, oov_char=2, index_from=3, **kwargs
)
Это набор данных из 11 228 новостных сообщений Reuters, помеченных по 46 темам.
Изначально он был сгенерирован путём разбора и предобработки классического набора данных Reuters-21578, но код предобработки больше не входит в Keras. См. эту дискуссию на GitHub для получения дополнительной информации.
Каждое новостное сообщение кодируется как список индексов слов (целых чисел). Для удобства слова индексируются по общей частоте в наборе данных, так что, например, целое число "3" кодирует 3-е по частоте слово в данных. Это позволяет выполнять быстрые операции фильтрации, такие как: «рассмотреть только 10 000 самых частотных слов, но исключить 20 самых частотных слов».
По соглашению, "0" не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.
| Аргументы | |
|---|---|
path | место кэширования данных (относительно ~/.keras/dataset). |
num_words | целое число или None. Слова ранжируются по частоте их появления (в обучающей выборке), и сохраняются только num_words самых частотных слов. Любое слово с меньшей частотой будет отображаться как значение oov_char в данных последовательности. Если None, сохраняются все слова. По умолчанию None, то есть сохраняются все слова. |
skip_top | пропустить верхних N наиболее часто встречающихся слов (которые могут быть неинформативными). Эти слова будут отображаться как значение oov_char в наборе данных. По умолчанию 0, то есть не пропускаются никакие слова. |
maxlen | целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. По умолчанию None, то есть усечение не выполняется. |
test_split | Число с плавающей точкой от 0 до 1. Доля набора данных, используемая в качестве тестовых данных. По умолчанию 0,2, что означает, что 20% набора данных используются в качестве тестовых данных. |
seed | Целое число. Зерно для воспроизводимого перемешивания данных. |
start_char | Целое число. Начало последовательности будет отмечено этим символом. По умолчанию 1, потому что 0 обычно является символом заполнения. |
oov_char | Целое число. Символ вне словаря. Слова, которые были исключены из-за ограничений num_words или skip_top, будут заменены этим символом. |
index_from | Целое число. Индексы фактических слов с этим индексом и выше. |
**kwargs | Используется для обратной совместимости. |
| Возвращаемые значения | |
|---|---|
Кортеж массивов NumPy: (x_train, y_train), (x_test, y_test). x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если был указан аргумент num_words, максимальное возможное значение индекса равно y_train, y_test: списки целых меток (1 или 0). |
Примечание: Символ «вне словаря» используется только для слов, которые присутствовали в обучающей выборке, но не включены, потому что они не удовлетворяют условиям num_words здесь. Слова, которые не встречались в обучающей выборке, но встречаются в тестовой выборке, просто пропущены.
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/keras/datasets/reuters/load_data