make_multilabel_classification
- sklearn.datasets.make_multilabel_classification(n_samples=100, n_features=20, *, n_classes=5, n_labels=2, length=50, allow_unlabeled=True, sparse=False, return_indicator='dense', return_distributions=False, random_state=None)[source]
-
Генерирует случайную проблему многозначной классификации.
- Для каждого образца процесс генерации выглядит следующим образом:
-
- выбрать количество меток: n ~ Poisson(n_labels)
- n раз выбрать класс c: c ~ Multinomial(theta)
- выбрать длину документа: k ~ Poisson(length)
- k раз выбрать слово: w ~ Multinomial(theta_c)
В указанном процессе используется отбрасывающая выборка, чтобы гарантировать, что n никогда не равно нулю или больше
n_classes, а длина документа никогда не равна нулю. Аналогично, мы отбрасываем классы, которые уже были выбраны.Пример использования см. в Графики случайно сгенерированного набора данных для многозначной классификации.
Подробнее см. в Руководстве пользователя.
- Параметры:
-
- n_samplesint, по умолчанию=100
-
Количество образцов.
- n_featuresint, по умолчанию=20
-
Общее количество признаков.
- n_classesint, по умолчанию=5
-
Количество классов задачи классификации.
- n_labelsint, по умолчанию=2
-
Среднее число меток на экземпляр. Более точно, число меток на образец выбирается из распределения Пуассона со средним значением
n_labels, но образцы ограничены (с помощью отбрасывающей выборки)n_classes, и должны быть отличны от нуля, еслиallow_unlabeledравно False. - lengthint, по умолчанию=50
-
Сумма признаков (число слов, если документы) выбирается из распределения Пуассона со средним значением.
- allow_unlabeledbool, по умолчанию=True
-
Если
True, некоторые экземпляры могут не принадлежать ни одному классу. - sparsebool, по умолчанию=False
-
Если
True, возвращается разреженная матрица признаков.Добавлена в версии 0.17: параметр для разреженного вывода.
- return_indicator{‘dense’, ‘sparse’} или False, по умолчанию=’dense’
-
Если
'dense', возвращаетYв плотной двоичной форме индикатора. Если'sparse', возвращаетYв разреженной двоичной форме индикатора.Falseвозвращает список списков меток. - return_distributionsbool, по умолчанию=False
-
Если
True, возвращает вероятность априори каждого класса и условные вероятности признаков, учитывая классы, из которых были получены данные. - random_stateint, экземпляр RandomState или None, по умолчанию=None
-
Определяет генерацию случайных чисел для создания набора данных. Передайте целое число для воспроизводимого результата при нескольких вызовах функции. См. Словарь.
- Возвращает:
-
- Xndarray формы (n_samples, n_features)
-
Сгенерированные образцы.
- Y{ndarray, разреженная матрица} формы (n_samples, n_classes)
-
Наборы меток. Разреженная матрица должна иметь формат CSR.
- p_cndarray формы (n_classes,)
-
Вероятность выбора каждого класса. Возвращается только если
return_distributions=True. - p_w_cndarray формы (n_features, n_classes)
-
Вероятность выбора каждого признака для каждого класса. Возвращается только если
return_distributions=True.
Примеры
>>> from sklearn.datasets import make_multilabel_classification >>> X, y = make_multilabel_classification(n_labels=3, random_state=42) >>> X.shape (100, 20) >>> y.shape (100, 5) >>> list(y[:3]) [array([1, 1, 0, 1, 0]), array([0, 1, 1, 1, 0]), array([0, 1, 0, 0, 0])]
Примеры галереи
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.datasets.make_multilabel_classification.html