fetch_20newsgroups_vectorized
- sklearn.datasets.fetch_20newsgroups_vectorized(*, subset='train', remove=(), data_home=None, download_if_missing=True, return_X_y=False, normalize=True, as_frame=False, n_retries=3, delay=1.0)[source]
-
Загрузка и векторизация набора данных 20 новостных групп (классификация).
Скачивает его при необходимости.
Это удобная функция; преобразование выполняется с использованием параметров по умолчанию для
CountVectorizer. Для более продвинутого использования (фильтрация стоп-слов, извлечение n-грам и т. д.), объедините fetch_20newsgroups с настраиваемымCountVectorizer,HashingVectorizer,TfidfTransformerилиTfidfVectorizer.Полученные подсчеты нормализуются с помощью
sklearn.preprocessing.normalize, если normalize не установлено в значение False.Классы
20
Всего образцов
18846
Размерность
130107
Признаки
вещественные
Дополнительные сведения см. в Руководстве пользователя.
- Параметры:
-
- subset{‘train’, ‘test’, ‘all’}, по умолчанию=’train’
-
Выбор набора данных для загрузки: ‘train’ для обучающего набора, ‘test’ для тестового набора, ‘all’ для обоих, с перемешанным порядком.
- removeкортеж, по умолчанию=()
-
Может содержать любой поднабор (‘headers’, ‘footers’, ‘quotes’). Каждый из этих типов текста будет распознаваться и удаляться из сообщений новостных групп, предотвращая переобучение классификатора на метаданных.
‘headers’ удаляет заголовки новостных групп, ‘footers’ удаляет блоки в конце сообщений, похожие на подписи, а ‘quotes’ удаляет строки, которые кажутся цитированием другого сообщения.
- data_homeстрока или путь, по умолчанию=None
-
Указывает папку для загрузки и кэширования наборов данных. Если None, все данные scikit-learn хранятся в подпапках ‘~/scikit_learn_data’.
- download_if_missingbool, по умолчанию=True
-
Если False, при отсутствии данных локально возникает исключение OSError, вместо попытки загрузить данные с сайта источника.
- return_X_ybool, по умолчанию=False
-
Если True, возвращает
(data.data, data.target), вместо объекта Bunch.Добавлен в версии 0.20.
- normalizebool, по умолчанию=True
-
Если True, нормализует вектор признаков каждого документа до единичной нормы, используя
sklearn.preprocessing.normalize.Добавлен в версии 0.22.
- as_framebool, по умолчанию=False
-
Если True, данные представляют собой DataFrame pandas, содержащий столбцы с соответствующими типами данных (числовые, строковые или категориальные). Целевое значение — DataFrame или Series pandas в зависимости от количества
target_columns.Добавлен в версии 0.24.
- n_retriesint, по умолчанию=3
-
Количество попыток при возникновении ошибок HTTP.
Добавлен в версии 1.5.
- delayfloat, по умолчанию=1.0
-
Количество секунд между попытками.
Добавлен в версии 1.5.
- Возвращаемые значения:
-
-
bunch
Bunch -
Объект типа словаря, с следующими атрибутами.
- data: {разреженная матрица, dataframe} формы (n_samples, n_features)
-
Матрица входных данных. Если
as_frameявляетсяTrue, тоdata— DataFrame pandas со столбцами типа разреженные матрицы. - target: {массив NumPy, серия} формы (n_samples,)
-
Метки целевых значений. Если
as_frameявляетсяTrue, тоtarget— серия pandas. - target_names: список формы (n_classes,)
-
Названия классов целевых значений.
- DESCR: строка
-
Полное описание набора данных.
- frame: dataframe формы (n_samples, n_features + 1)
-
Присутствует только при
as_frame=True. DataFrame pandas со столбцамиdataиtarget.Добавлен в версии 0.24.
-
(data, target)кортеж, если
return_X_yравно True -
dataиtargetбудут иметь формат, определенный в описанииBunchвыше.Добавлен в версии 0.20.
-
bunch
Примеры
>>> from sklearn.datasets import fetch_20newsgroups_vectorized >>> newsgroups_vectorized = fetch_20newsgroups_vectorized(subset='test') >>> newsgroups_vectorized.data.shape (7532, 130107) >>> newsgroups_vectorized.target.shape (7532,)
Примеры галереи
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.datasets.fetch_20newsgroups_vectorized.html