Spec-Zone.ru › scikit-learn

fetch_20newsgroups

sklearn.datasets.fetch_20newsgroups(*, data_home=None, subset='train', categories=None, shuffle=True, random_state=42, remove=(), download_if_missing=True, return_X_y=False, n_retries=3, delay=1.0)[source]

Загрузка файлов и данных из набора данных 20 новостных групп (классификация).

Загружает данные при необходимости.

Классы

20

Всего образцов

18846

Размерность

1

Признаки

текст

Подробнее см. в Руководстве пользователя.

Parameters:
data_homestr или путь, по умолчанию None

Укажите папку для загрузки и кеширования наборов данных. Если None, все данные scikit-learn хранятся в подпапках ‘~/scikit_learn_data’.

subset{‘train’, ‘test’, ‘all’}, по умолчанию ‘train’

Выберите набор данных для загрузки: ‘train’ для набора обучающих данных, ‘test’ для набора тестовых данных, ‘all’ для обоих, с перетасованным порядком.

categoriesмассив-подобный, dtype=str, по умолчанию None

Если None (по умолчанию), загружаются все категории. Если не None, список имен категорий для загрузки (другие категории игнорируются).

shufflebool, по умолчанию True

Перемешивать данные или нет: может быть важно для моделей, которые предполагают, что образцы независимы и одинаково распределены (i.i.d.), такие как стохастический градиентный спуск.

random_stateint, экземпляр RandomState или None, по умолчанию 42

Определяет генерацию случайных чисел для перемешивания набора данных. Передайте целое число для воспроизводимого вывода при многократном вызове функции. См. Глоссарий.

removeкортеж, по умолчанию ()

Может содержать любой подмножество (‘headers’, ‘footers’, ‘quotes’). Каждый из них представляет собой типы текста, которые будут обнаружены и удалены из сообщений новостных групп, предотвращая переобучение классификаторов по метаданным.

‘headers’ удаляет заголовки новостных групп, ‘footers’ удаляет блоки в конце сообщений, похожие на подписи, а ‘quotes’ удаляет строки, которые кажутся цитатами другого сообщения.

‘headers’ следует точному стандарту; другие фильтры не всегда корректны.

download_if_missingbool, по умолчанию True

Если False, возникает OSError, если данные недоступны локально, вместо попытки загрузки данных с сайта источника.

return_X_ybool, по умолчанию False

Если True, возвращает (data.data, data.target) вместо объекта Bunch.

Добавлена в версии 0.22.

n_retriesint, по умолчанию 3

Число попыток при возникновении ошибок HTTP.

Добавлена в версии 1.5.

delayfloat, по умолчанию 1.0

Количество секунд между повторами.

Добавлена в версии 1.5.

Returns:
bunchBunch

Объект типа словарь, с приведенными ниже атрибутами.

dataсписок формы (n_samples,)

Список данных для обучения.

target: массив формы (n_samples,)

Метки целевых переменных.

filenames: список формы (n_samples,)

Путь к расположению данных.

DESCR: str

Полное описание набора данных.

target_names: список формы (n_classes,)

Имена классов целевых переменных.

(data, target)кортеж, если return_X_y=True

Кортеж из двух массивов NumPy. Первый содержит двумерный массив формы (n_samples, n_classes), где каждая строка представляет один образец, а каждый столбец — признаки. Второй массив формы (n_samples,) содержит целевые образцы.

Добавлена в версии 0.22.

Примеры

>>> from sklearn.datasets import fetch_20newsgroups
>>> cats = ['alt.atheism', 'sci.space']
>>> newsgroups_train = fetch_20newsgroups(subset='train', categories=cats)
>>> list(newsgroups_train.target_names)
['alt.atheism', 'sci.space']
>>> newsgroups_train.filenames.shape
(1073,)
>>> newsgroups_train.target.shape
(1073,)
>>> newsgroups_train.target[:10]
array([0, 1, 1, 1, 0, 1, 1, 0, 0, 0])

Примеры из галереи

Биклостеризация документов с помощью алгоритма Spectral Co-clustering

Извлечение тем с помощью неотрицательной матричной факторизации и Latent Dirichlet Allocation

Образцовая цепочка для извлечения и оценки текстовых признаков

Преобразователь столбцов с разнородными источниками данных

Полусупервизированная классификация на наборе данных текстов

Классификация текстовых документов с использованием разреженных признаков

Кластеризация текстовых документов с помощью k-средних

Сравнение FeatureHasher и DictVectorizer

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.datasets.fetch_20newsgroups.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API