Spec-Zone.ru › TensorFlow 2.9

tf.keras.datasets.reuters.load_data

Просмотреть исходный код на GitHub

Загружает набор данных о классификации новостных лент Reuters.

Просмотр псевдонимов

Псевдонимы для миграции

См. Руководство по миграции для получения более подробной информации.

tf.compat.v1.keras.datasets.reuters.load_data

tf.keras.datasets.reuters.load_data(
    path='reuters.npz',
    num_words=None,
    skip_top=0,
    maxlen=None,
    test_split=0.2,
    seed=113,
    start_char=1,
    oov_char=2,
    index_from=3,
    **kwargs
)

Это набор данных из 11 228 новостных лент Reuters, помеченных более чем по 46 темам.

Первоначально он был сгенерирован путем парсинга и предварительной обработки классического набора данных Reuters-21578, но код предварительной обработки больше не входит в пакет Keras. См. эту обсуждение на GitHub для получения дополнительной информации.

Каждая новостная лента закодирована как список индексов слов (целых чисел). Для удобства слова индексируются по общей частоте в наборе данных, так что, например, целое число «3» кодирует третье по частоте слово в данных. Это позволяет быстро выполнять операции фильтрации, такие как: «рассмотреть только 10 000 наиболее часто встречающихся слов, но исключить 20 наиболее часто встречающихся слов».

По соглашению «0» не обозначает конкретное слово, а используется для кодирования любого неизвестного слова.

Аргументы
path место для кеширования данных (относительно ~/.keras/dataset).
num_words целое число или None. Слова ранжируются по частоте их появления (в обучающем наборе), и сохраняются только num_words наиболее часто встречающихся слов. Любое менее частое слово будет отображаться как значение oov_char в данных последовательности. Если None, сохраняются все слова. По умолчанию None, поэтому сохраняются все слова.
skip_top пропустить первые N наиболее часто встречающихся слов (которые могут быть неинформативными). Эти слова будут отображаться как значение oov_char в наборе данных. По умолчанию 0, поэтому слова не пропускаются.
maxlen целое число или None. Максимальная длина последовательности. Любая более длинная последовательность будет усечена. По умолчанию None, что означает отсутствие усечения.
test_split число с плавающей запятой от 0 до 1. Доля набора данных, которая должна использоваться в качестве проверочного набора данных. По умолчанию 0,2, что означает, что 20% набора данных используются в качестве проверочного набора данных.
seed целое число. Зерно для воспроизводимого перемешивания данных.
start_char целое число. Начало последовательности будет помечено этим символом. По умолчанию 1, так как 0 обычно является символом заполнения.
oov_char целое число. Символ вне словаря. Слова, которые были исключены из-за ограничений num_words или skip_top, будут заменены этим символом.
index_from целое число. Индексировать фактические слова с этим индексом и выше.
**kwargs Используется для обратной совместимости.
Возвращаемые значения
Кортеж массивов NumPy: (x_train, y_train), (x_test, y_test).

x_train, x_test: списки последовательностей, которые являются списками индексов (целых чисел). Если был указан аргумент num_words, максимальное возможное значение индекса равно num_words - 1. Если был указан аргумент maxlen, максимальная возможная длина последовательности равна maxlen.

y_train, y_test: списки целочисленных меток (1 или 0).

Примечание: Символ «вне словаря» используется только для слов, которые присутствовали в обучающем наборе, но не включены, потому что они не прошли отбор num_words здесь. Слова, которые не встречались в обучающем наборе, но присутствуют в проверочном наборе, просто пропущены.

© 2022 The TensorFlow Authors. All rights reserved.
Licensed under the Creative Commons Attribution License 4.0.
Code samples licensed under the Apache 2.0 License.
https://www.tensorflow.org/versions/r2.9/api_docs/python/tf/keras/datasets/reuters/load_data

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API