Spec-Zone.ru › TensorFlow

tf.keras.datasets.reuters.load_data

Загружает набор данных о классификации новостных лент Reuters.

tf.keras.datasets.reuters.load_data(
    path='reuters.npz',
    num_words=None,
    skip_top=0,
    maxlen=None,
    test_split=0.2,
    seed=113,
    start_char=1,
    oov_char=2,
    index_from=3
)

Это набор данных из 11 228 новостных лент Reuters, помеченных более чем по 46 темам.

Изначально он был сгенерирован путём анализа и предобработки классического набора данных Reuters-21578, но код предобработки больше не входит в Keras. Более подробную информацию можно найти в этом обсуждении на GitHub.

Каждая новостная лента кодируется как список индексов слов (целые числа). Для удобства слова индексируются по частоте встречаемости в наборе данных, так что, например, целое число "3" кодирует третье по частоте слово в данных. Это позволяет выполнять быстрые операции фильтрации, такие как: «учитывать только 10 000 самых часто встречающихся слов, но исключить 20 самых часто встречающихся слов».

По соглашению, "0" не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.

Аргументы
path место кэширования данных (относительно ~/.keras/dataset).
num_words целое число или None. Слова ранжируются по частоте их появления (в обучающем наборе), и сохраняются только num_words самых часто встречающихся слов. Любое слово с меньшей частотой появления будет отображаться как oov_char значение в данных последовательности. Если None, сохраняются все слова. По умолчанию None.
skip_top пропустить N самых часто встречающихся слов (которые могут быть неинформативными). Эти слова будут отображаться как oov_char значение в наборе данных. 0 означает, что слова не пропускаются. По умолчанию 0.
maxlen целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет обрезана. None означает, что обрезка не выполняется. По умолчанию None.
test_split Число с плавающей точкой от 0. до 1.. Часть набора данных, которая будет использоваться в качестве тестовых данных. 0.2 означает, что 20% набора данных используется как тестовые данные. По умолчанию 0.2.
seed целое число. Зерно для воспроизводимого перемешивания данных.
start_char целое число. Начало последовательности будет отмечено этим символом. 0 обычно является символом заполнения. По умолчанию 1.
oov_char целое число. Символ вне словаря. Слова, которые были исключены из-за num_words или skip_top ограничений, будут заменены этим символом.
index_from целое число. Индексировать реальные слова с этим индексом и выше.
Возвращаемое значение
Кортеж массивов Numpy: (x_train, y_train), (x_test, y_test).

x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если аргумент num_words был указан, максимальное возможное значение индекса равно num_words - 1. Если аргумент maxlen был указан, максимальная возможная длина последовательности равна maxlen.

y_train, y_test: списки целочисленных меток (1 или 0).

Примечание: Символ «вне словаря» используется только для слов, которые присутствовали в обучающем наборе, но не включены, потому что они не проходят num_words отбор здесь. Слова, которые не встречались в обучающем наборе, но присутствуют в тестовом наборе, просто пропущены.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/api_docs/python/tf/keras/datasets/reuters/load_data

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API