tf.keras.datasets.reuters.load_data
| Просмотреть исходный код на GitHub |
Загружает набор данных для классификации новостных лент Reuters.
tf.keras.datasets.reuters.load_data(
path='reuters.npz', num_words=None, skip_top=0, maxlen=None, test_split=0.2,
seed=113, start_char=1, oov_char=2, index_from=3, **kwargs
)
| Аргументы | |
|---|---|
path | место кэширования данных (относительно ~/.keras/dataset). |
num_words | максимальное количество слов для включения. Слова ранжируются по частоте их появления (в обучающей выборке), и сохраняются только самые частотные слова |
skip_top | пропустить верхние N самых часто встречающихся слов (которые могут не быть информативными). |
maxlen | обрезать последовательности после этой длины. |
test_split | Доля набора данных, которая будет использована в качестве тестовых данных. |
seed | случайное семя для перемешивания выборок. |
start_char | Начало последовательности будет помечено этим символом. Установлено в 1, так как 0 обычно является символом заполнения. |
oov_char | слова, которые были исключены из-за ограничения num_words или skip_top ограничения, будут заменены этим символом. |
index_from | индексировать фактические слова с этим и более высоким индексом. |
**kwargs | Используется для обратной совместимости. |
| Возвращаемые значения | |
|---|---|
Кортеж массивов NumPy: (x_train, y_train), (x_test, y_test). |
Обратите внимание, что символ «не вошедшего в словарь» используется только для слов, которые были в обучающей выборке, но не включены, потому что они не прошли num_words отбор. Слова, которые не были встречены в обучающей выборке, но присутствуют в тестовой выборке, просто пропущены.
© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r1.15/api_docs/python/tf/keras/datasets/reuters/load_data