Spec-Zone.ru › scikit-learn

train_test_split

sklearn.model_selection.train_test_split(*arrays, test_size=None, train_size=None, random_state=None, shuffle=True, stratify=None)[source]

Разделение массивов или матриц на случайные обучающие и тестовые подмножества.

Быстрая утилита, которая оборачивает валидацию ввода, next(ShuffleSplit().split(X, y)), и применение к входным данным в одном вызове для разделения (и, необязательно, подвыборки) данных в одной строке.

Подробнее см. в Руководстве пользователя.

Параметры:
*arraysпоследовательность индексируемых объектов с одинаковой длиной/формой[0]

Допустимые типы ввода: списки, массивы NumPy, разреженные матрицы SciPy или фреймы данных Pandas.

test_sizefloat или int, по умолчанию=None

Если float, должен быть от 0,0 до 1,0 и представлять собой долю набора данных для включения в тестовую выборку. Если int, представляет собой абсолютное число тестовых образцов. Если None, значение устанавливается как дополнение к размеру обучающей выборки. Если train_size также None, оно будет установлено в 0,25.

train_sizefloat или int, по умолчанию=None

Если float, должен быть от 0,0 до 1,0 и представлять собой долю набора данных для включения в обучающую выборку. Если int, представляет собой абсолютное число обучающих образцов. Если None, значение автоматически устанавливается как дополнение к размеру тестовой выборки.

random_stateint, экземпляр RandomState или None, по умолчанию=None

Управляет перемешиванием, применяемым к данным перед применением разделения. Передайте целое число для воспроизводимого результата при нескольких вызовах функции. См. Словарь.

shufflebool, по умолчанию=True

Перемешивать данные перед разделением или нет. Если shuffle=False, то stratify должен быть None.

stratifyarray-like, по умолчанию=None

Если не None, данные разделены по стратифицированному методу, используя это как метки классов. Подробнее см. в Руководстве пользователя.

Возвращаемое значение:
splittingсписок, длина=2 * len(arrays)

Список, содержащий разделение обучающей и тестовой выборки входных данных.

Добавлен в версии 0.16: Если входные данные разреженные, выход будет scipy.sparse.csr_matrix. В противном случае тип вывода такой же, как тип ввода.

Примеры

>>> import numpy as np
>>> from sklearn.model_selection import train_test_split
>>> X, y = np.arange(10).reshape((5, 2)), range(5)
>>> X
array([[0, 1],
       [2, 3],
       [4, 5],
       [6, 7],
       [8, 9]])
>>> list(y)
[0, 1, 2, 3, 4]
>>> X_train, X_test, y_train, y_test = train_test_split(
...     X, y, test_size=0.33, random_state=42)
...
>>> X_train
array([[4, 5],
       [0, 1],
       [6, 7]])
>>> y_train
[2, 0, 3]
>>> X_test
array([[2, 3],
       [8, 9]])
>>> y_test
[1, 4]
>>> train_test_split(y, shuffle=False)
[[0, 1, 2], [3, 4]]

Примеры галереи

Основные моменты выпуска scikit-learn 1.5

Основные моменты выпуска scikit-learn 1.4

Основные моменты выпуска scikit-learn 0.24

Основные моменты выпуска scikit-learn 0.23

Основные моменты выпуска scikit-learn 0.22

Сравнение откалибровки классификаторов

Кривые калибровки вероятности

Калибровка вероятности классификаторов

Сравнение классификаторов

Распознавание рукописных цифр

Регрессия главных компонентов против регрессии наименьших квадратов

Обрезка деревьев решений с обрезкой по сложности затрат

Понимание структуры дерева решений

Ядерная PCA

Сравнение случайных лесов и мета-классификатора для нескольких выходов

Ранняя остановка в градиентном бустинге

Важность признаков с помощью леса деревьев

Преобразования признаков с помощью ансамблей деревьев

Функции в деревьях гистограммной градиентной регрессии

Оценки Gradient Boosting Out-of-Bag

Регрессия Gradient Boosting

Регуляризация Gradient Boosting

Пример IsolationForest

Деревья решений AdaBoost для многоклассовой классификации

Интервалы прогнозирования для регрессии Gradient Boosting

Пример распознавания лиц с использованием eigenfaces и SVM

Шумоподавление изображений с помощью Kernel PCA

Запаздывающие признаки для прогнозирования временных рядов

Влияние сложности модели

Задержка прогнозирования

Пайплайн ANOVA SVM

Выбор признаков с использованием однофакторного анализа

Примеры использования FrozenEstimator

Сравнение различных онлайн-решателей

Преждевременное прекращение Stochastic Gradient Descent

Модели на основе L1 для разреженных сигналов

Классификация MNIST с помощью многономиальной логистической регрессии + L1

Многоклассовая разреженная логистическая регрессия на 20newsgroups

Неотрицательные наименьшие квадраты

Пример обычных наименьших квадратов

Регрессия Пуассона и ненормальная потеря

Регрессия Твидди на страховых претензиях

Распространенные ошибки в интерпретации коэффициентов линейных моделей

Невозможность машинного обучения вывести причинно-следственные связи

Важность перестановки против важности признаков случайного леса (MDI)

Важность перестановки с мультиколлинеарными или коррелированными признаками

Масштабируемое обучение с приближением полиномиального ядра

Оценка алгоритмов обнаружения выбросов

Представление API set_output

ROC-кривая с визуализацией API

Визуализации с объектами отображения

Отношения правдоподобия классов для измерения производительности классификации

Матрица ошибок

Настраиваемая стратегия повторной подгонки поиска по сетке с перекрестной проверкой

Кривая DET (Detection Error Tradeoff)

Влияние регуляризации модели на тренировочную и тестовую ошибки

Многоклассовая ROC-кривая

Настройка порога принятия решений для обучения с учетом стоимости

Точность-полнота

Многоклассовая классификация с использованием цепочки классификаторов

Сравнение ближайших соседей с и без анализа компонентов окрестностей

Снижение размерности с помощью анализа ближайших компонентов

Классификация ближайших соседей

Признаки ограниченной машины Больцмана для классификации цифр

Изменение регуляризации в многослойном перцептроне

Визуализация весов MLP на MNIST

Преобразователь столбцов для смешанных типов

Влияние преобразования целевой переменной в модели регрессии

Дискретизация признаков

Важность масштабирования признаков

Преобразование данных к нормальному распределению

Внутренняя перекрестная подгонка TargetEncoder

Полунадзорная классификация на текстовом наборе данных

© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.model_selection.train_test_split.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API