Spec-Zone.ru › TensorFlow 2.3

tf.keras.datasets.reuters.load_data

Просмотреть исходный код на GitHub

Загружает набор данных для классификации новостей Reuters.

Просмотреть псевдонимы

Псевдонимы для миграции

См. Руководство по миграции для получения более подробной информации.

tf.compat.v1.keras.datasets.reuters.load_data

tf.keras.datasets.reuters.load_data(
    path='reuters.npz', num_words=None, skip_top=0, maxlen=None, test_split=0.2,
    seed=113, start_char=1, oov_char=2, index_from=3, **kwargs
)

Это набор данных из 11 228 новостных сообщений Reuters, помеченных по 46 темам.

Изначально он был сгенерирован путём разбора и предобработки классического набора данных Reuters-21578, но код предобработки больше не входит в Keras. См. эту дискуссию на GitHub для получения дополнительной информации.

Каждое новостное сообщение кодируется как список индексов слов (целых чисел). Для удобства слова индексируются по общей частоте в наборе данных, так что, например, целое число "3" кодирует 3-е по частоте слово в данных. Это позволяет выполнять быстрые операции фильтрации, такие как: «рассмотреть только 10 000 самых частотных слов, но исключить 20 самых частотных слов».

По соглашению, "0" не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.

Аргументы
path место кэширования данных (относительно ~/.keras/dataset).
num_words целое число или None. Слова ранжируются по частоте их появления (в обучающей выборке), и сохраняются только num_words самых частотных слов. Любое слово с меньшей частотой будет отображаться как значение oov_char в данных последовательности. Если None, сохраняются все слова. По умолчанию None, то есть сохраняются все слова.
skip_top пропустить верхних N наиболее часто встречающихся слов (которые могут быть неинформативными). Эти слова будут отображаться как значение oov_char в наборе данных. По умолчанию 0, то есть не пропускаются никакие слова.
maxlen целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. По умолчанию None, то есть усечение не выполняется.
test_split Число с плавающей точкой от 0 до 1. Доля набора данных, используемая в качестве тестовых данных. По умолчанию 0,2, что означает, что 20% набора данных используются в качестве тестовых данных.
seed Целое число. Зерно для воспроизводимого перемешивания данных.
start_char Целое число. Начало последовательности будет отмечено этим символом. По умолчанию 1, потому что 0 обычно является символом заполнения.
oov_char Целое число. Символ вне словаря. Слова, которые были исключены из-за ограничений num_words или skip_top, будут заменены этим символом.
index_from Целое число. Индексы фактических слов с этим индексом и выше.
**kwargs Используется для обратной совместимости.
Возвращаемые значения
Кортеж массивов NumPy: (x_train, y_train), (x_test, y_test).

x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если был указан аргумент num_words, максимальное возможное значение индекса равно num_words - 1. Если был указан аргумент maxlen, максимальная возможная длина последовательности равна maxlen.

y_train, y_test: списки целых меток (1 или 0).

Примечание: Символ «вне словаря» используется только для слов, которые присутствовали в обучающей выборке, но не включены, потому что они не удовлетворяют условиям num_words здесь. Слова, которые не встречались в обучающей выборке, но встречаются в тестовой выборке, просто пропущены.

© 2020 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 3.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.3/api_docs/python/tf/keras/datasets/reuters/load_data

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API