train_test_split
- sklearn.model_selection.train_test_split(*arrays, test_size=None, train_size=None, random_state=None, shuffle=True, stratify=None)[source]
-
Разделение массивов или матриц на случайные обучающие и тестовые подмножества.
Быстрая утилита, которая оборачивает валидацию ввода,
next(ShuffleSplit().split(X, y)), и применение к входным данным в одном вызове для разделения (и, необязательно, подвыборки) данных в одной строке.Подробнее см. в Руководстве пользователя.
- Параметры:
-
- *arraysпоследовательность индексируемых объектов с одинаковой длиной/формой[0]
-
Допустимые типы ввода: списки, массивы NumPy, разреженные матрицы SciPy или фреймы данных Pandas.
- test_sizefloat или int, по умолчанию=None
-
Если float, должен быть от 0,0 до 1,0 и представлять собой долю набора данных для включения в тестовую выборку. Если int, представляет собой абсолютное число тестовых образцов. Если None, значение устанавливается как дополнение к размеру обучающей выборки. Если
train_sizeтакже None, оно будет установлено в 0,25. - train_sizefloat или int, по умолчанию=None
-
Если float, должен быть от 0,0 до 1,0 и представлять собой долю набора данных для включения в обучающую выборку. Если int, представляет собой абсолютное число обучающих образцов. Если None, значение автоматически устанавливается как дополнение к размеру тестовой выборки.
- random_stateint, экземпляр RandomState или None, по умолчанию=None
-
Управляет перемешиванием, применяемым к данным перед применением разделения. Передайте целое число для воспроизводимого результата при нескольких вызовах функции. См. Словарь.
- shufflebool, по умолчанию=True
-
Перемешивать данные перед разделением или нет. Если shuffle=False, то stratify должен быть None.
- stratifyarray-like, по умолчанию=None
-
Если не None, данные разделены по стратифицированному методу, используя это как метки классов. Подробнее см. в Руководстве пользователя.
- Возвращаемое значение:
-
- splittingсписок, длина=2 * len(arrays)
-
Список, содержащий разделение обучающей и тестовой выборки входных данных.
Добавлен в версии 0.16: Если входные данные разреженные, выход будет
scipy.sparse.csr_matrix. В противном случае тип вывода такой же, как тип ввода.
Примеры
>>> import numpy as np >>> from sklearn.model_selection import train_test_split >>> X, y = np.arange(10).reshape((5, 2)), range(5) >>> X array([[0, 1], [2, 3], [4, 5], [6, 7], [8, 9]]) >>> list(y) [0, 1, 2, 3, 4]>>> X_train, X_test, y_train, y_test = train_test_split( ... X, y, test_size=0.33, random_state=42) ... >>> X_train array([[4, 5], [0, 1], [6, 7]]) >>> y_train [2, 0, 3] >>> X_test array([[2, 3], [8, 9]]) >>> y_test [1, 4]>>> train_test_split(y, shuffle=False) [[0, 1, 2], [3, 4]]
Примеры галереи
© 2007–2025 The scikit-learn developers
Licensed under the 3-clause BSD License.
https://scikit-learn.org/1.6/modules/generated/sklearn.model_selection.train_test_split.html