fetch_20newsgroups
- sklearn.datasets.fetch_20newsgroups(*, data_home=None, subset='train', categories=None, shuffle=True, random_state=42, remove=(), download_if_missing=True, return_X_y=False, n_retries=3, delay=1.0)[source]
-
Загрузка файлов и данных из набора данных 20 новостных групп (классификация).
Загружает данные при необходимости.
Классы
20
Всего образцов
18846
Размерность
1
Признаки
текст
Подробнее см. в Руководстве пользователя.
- Parameters:
-
- data_homestr или путь, по умолчанию None
-
Укажите папку для загрузки и кеширования наборов данных. Если None, все данные scikit-learn хранятся в подпапках ‘~/scikit_learn_data’.
- subset{‘train’, ‘test’, ‘all’}, по умолчанию ‘train’
-
Выберите набор данных для загрузки: ‘train’ для набора обучающих данных, ‘test’ для набора тестовых данных, ‘all’ для обоих, с перетасованным порядком.
- categoriesмассив-подобный, dtype=str, по умолчанию None
-
Если None (по умолчанию), загружаются все категории. Если не None, список имен категорий для загрузки (другие категории игнорируются).
- shufflebool, по умолчанию True
-
Перемешивать данные или нет: может быть важно для моделей, которые предполагают, что образцы независимы и одинаково распределены (i.i.d.), такие как стохастический градиентный спуск.
- random_stateint, экземпляр RandomState или None, по умолчанию 42
-
Определяет генерацию случайных чисел для перемешивания набора данных. Передайте целое число для воспроизводимого вывода при многократном вызове функции. См. Глоссарий.
- removeкортеж, по умолчанию ()
-
Может содержать любой подмножество (‘headers’, ‘footers’, ‘quotes’). Каждый из них представляет собой типы текста, которые будут обнаружены и удалены из сообщений новостных групп, предотвращая переобучение классификаторов по метаданным.
‘headers’ удаляет заголовки новостных групп, ‘footers’ удаляет блоки в конце сообщений, похожие на подписи, а ‘quotes’ удаляет строки, которые кажутся цитатами другого сообщения.
‘headers’ следует точному стандарту; другие фильтры не всегда корректны.
- download_if_missingbool, по умолчанию True
-
Если False, возникает OSError, если данные недоступны локально, вместо попытки загрузки данных с сайта источника.
- return_X_ybool, по умолчанию False
-
Если True, возвращает
(data.data, data.target)вместо объекта Bunch.Добавлена в версии 0.22.
- n_retriesint, по умолчанию 3
-
Число попыток при возникновении ошибок HTTP.
Добавлена в версии 1.5.
- delayfloat, по умолчанию 1.0
-
Количество секунд между повторами.
Добавлена в версии 1.5.
- Returns:
-
-
bunch
Bunch -
Объект типа словарь, с приведенными ниже атрибутами.
- dataсписок формы (n_samples,)
-
Список данных для обучения.
- target: массив формы (n_samples,)
-
Метки целевых переменных.
- filenames: список формы (n_samples,)
-
Путь к расположению данных.
- DESCR: str
-
Полное описание набора данных.
- target_names: список формы (n_classes,)
-
Имена классов целевых переменных.
-
(data, target)кортеж, если
return_X_y=True -
Кортеж из двух массивов NumPy. Первый содержит двумерный массив формы (n_samples, n_classes), где каждая строка представляет один образец, а каждый столбец — признаки. Второй массив формы (n_samples,) содержит целевые образцы.
Добавлена в версии 0.22.
-
bunch
Примеры
>>> from sklearn.datasets import fetch_20newsgroups >>> cats = ['alt.atheism', 'sci.space'] >>> newsgroups_train = fetch_20newsgroups(subset='train', categories=cats) >>> list(newsgroups_train.target_names) ['alt.atheism', 'sci.space'] >>> newsgroups_train.filenames.shape (1073,) >>> newsgroups_train.target.shape (1073,) >>> newsgroups_train.target[:10] array([0, 1, 1, 1, 0, 1, 1, 0, 0, 0])
Примеры из галереи
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.datasets.fetch_20newsgroups.html