Spec-Zone.ru › scikit-learn

make_multilabel_classification

sklearn.datasets.make_multilabel_classification(n_samples=100, n_features=20, *, n_classes=5, n_labels=2, length=50, allow_unlabeled=True, sparse=False, return_indicator='dense', return_distributions=False, random_state=None)[source]

Генерирует случайную проблему многозначной классификации.

Для каждого образца процесс генерации выглядит следующим образом:
  • выбрать количество меток: n ~ Poisson(n_labels)
  • n раз выбрать класс c: c ~ Multinomial(theta)
  • выбрать длину документа: k ~ Poisson(length)
  • k раз выбрать слово: w ~ Multinomial(theta_c)

В указанном процессе используется отбрасывающая выборка, чтобы гарантировать, что n никогда не равно нулю или больше n_classes, а длина документа никогда не равна нулю. Аналогично, мы отбрасываем классы, которые уже были выбраны.

Пример использования см. в Графики случайно сгенерированного набора данных для многозначной классификации.

Подробнее см. в Руководстве пользователя.

Параметры:
n_samplesint, по умолчанию=100

Количество образцов.

n_featuresint, по умолчанию=20

Общее количество признаков.

n_classesint, по умолчанию=5

Количество классов задачи классификации.

n_labelsint, по умолчанию=2

Среднее число меток на экземпляр. Более точно, число меток на образец выбирается из распределения Пуассона со средним значением n_labels, но образцы ограничены (с помощью отбрасывающей выборки) n_classes, и должны быть отличны от нуля, если allow_unlabeled равно False.

lengthint, по умолчанию=50

Сумма признаков (число слов, если документы) выбирается из распределения Пуассона со средним значением.

allow_unlabeledbool, по умолчанию=True

Если True, некоторые экземпляры могут не принадлежать ни одному классу.

sparsebool, по умолчанию=False

Если True, возвращается разреженная матрица признаков.

Добавлена в версии 0.17: параметр для разреженного вывода.

return_indicator{‘dense’, ‘sparse’} или False, по умолчанию=’dense’

Если 'dense', возвращает Y в плотной двоичной форме индикатора. Если 'sparse', возвращает Y в разреженной двоичной форме индикатора. False возвращает список списков меток.

return_distributionsbool, по умолчанию=False

Если True, возвращает вероятность априори каждого класса и условные вероятности признаков, учитывая классы, из которых были получены данные.

random_stateint, экземпляр RandomState или None, по умолчанию=None

Определяет генерацию случайных чисел для создания набора данных. Передайте целое число для воспроизводимого результата при нескольких вызовах функции. См. Словарь.

Возвращает:
Xndarray формы (n_samples, n_features)

Сгенерированные образцы.

Y{ndarray, разреженная матрица} формы (n_samples, n_classes)

Наборы меток. Разреженная матрица должна иметь формат CSR.

p_cndarray формы (n_classes,)

Вероятность выбора каждого класса. Возвращается только если return_distributions=True.

p_w_cndarray формы (n_features, n_classes)

Вероятность выбора каждого признака для каждого класса. Возвращается только если return_distributions=True.

Примеры

>>> from sklearn.datasets import make_multilabel_classification
>>> X, y = make_multilabel_classification(n_labels=3, random_state=42)
>>> X.shape
(100, 20)
>>> y.shape
(100, 5)
>>> list(y[:3])
[array([1, 1, 0, 1, 0]), array([0, 1, 1, 1, 0]), array([0, 1, 0, 0, 0])]

Примеры галереи

Графики случайно сгенерированного набора данных для многозначной классификации

Многозначная классификация

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.datasets.make_multilabel_classification.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API