Spec-Zone.ru › pandas 1

Руководство пользователя

Руководство пользователя охватывает все разделы pandas по темам. Каждый подраздел представляет тему (например, «работа с пропущенными данными») и описывает подход pandas к этой проблеме, с множеством примеров.

Пользователи, только начинающие работать с pandas, должны начать с 10 минут с pandas.

Для краткого обзора основных принципов pandas см. Введение в структуры данных и Основные базовые функции.

Дополнительную информацию о любом конкретном методе можно получить в Справочнике API.

Как читать эти руководства

В этих руководствах вы увидите код ввода в блоках кода, таких как:

import pandas as pd
pd.DataFrame({'A': [1, 2, 3]})

или:

In [1]: import pandas as pd

In [2]: pd.DataFrame({'A': [1, 2, 3]})
Out[2]: 
   A
0  1
1  2
2  3

Первый блок — это стандартный ввод Python, а во втором блок In [1]: указывает, что ввод находится в блокноте. В Jupyter Notebook печатается последняя строка и отображаются графики.

Например:

In [3]: a = 1

In [4]: a
Out[4]: 1

эквивалентно:

a = 1
print(a)

Руководства

  • 10 минут с pandas
    • Создание объектов
    • Просмотр данных
    • Выбор
    • Пропущенные данные
    • Операции
    • Объединение
    • Группировка
    • Изменение формы
    • Временные ряды
    • Категории
    • Построение графиков
    • Импорт и экспорт данных
    • Особенности
  • Введение в структуры данных
    • Ряд
    • Таблица
  • Основные базовые функции
    • Начало и конец
    • Атрибуты и основополагающие данные
    • Ускоренные операции
    • Гибкие двоичные операции
    • Дескриптивная статистика
    • Применение функций
    • Переиндексация и изменение меток
    • Итерация
    • .dt аксессор
    • Векторные строковые методы
    • Сортировка
    • Копирование
    • dtypes
    • Выбор столбцов на основе типа данных
  • Инструменты ввода-вывода (текст, CSV, HDF5, …)
    • CSV и текстовые файлы
    • JSON
    • HTML
    • LaTeX
    • XML
    • Файлы Excel
    • Таблицы OpenDocument
    • Бинарные файлы Excel (.xlsb)
    • Буфер обмена
    • Пиклирование
    • msgpack
    • HDF5 (PyTables)
    • Feather
    • Parquet
    • ORC
    • SQL-запросы
    • Google BigQuery
    • Формат Stata
    • Форматы SAS
    • Форматы SPSS
    • Другие форматы файлов
    • Рекомендации по производительности
  • Индексирование и выбор данных
    • Разные варианты индексирования
    • Основы
    • Доступ к атрибутам
    • Срезы диапазонов
    • Выбор по метке
    • Выбор по позиции
    • Выбор по вызываемому объекту
    • Комбинирование позиционного и основанного на метке индексирования
    • Индексирование списком с отсутствующими метками устарело
    • Выбор случайных выборок
    • Установка с увеличением
    • Быстрое получение и установка скалярных значений
    • Булево индексирование
    • Индексирование с isin
    • Метод where и маскирование
    • Установка с увеличением условно с использованием numpy
    • Метод query
    • Дубликаты данных
    • Метод get, подобный словарю
    • Поиск значений по индексу/меткам столбцов
    • Объекты индекса
    • Установка/сброс индекса
    • Возврат представления по сравнению с копией
  • MultiIndex / расширенное индексирование
    • Иерархическое индексирование (MultiIndex)
    • Расширенное индексирование с иерархическим индексом
    • Сортировка многоуровневого индекса
    • Методы take
    • Типы индексов
    • Разное, FAQ по индексированию
  • Объединение, присоединение, конкатенация и сравнение
    • Конкатенация объектов
    • Объединение/слияние DataFrame или именованных Series в стиле базы данных
    • Дружественное к временным рядам объединение
    • Сравнение объектов
END_OF_DOCUMENT_MARKER
  • Преобразование формы и сводные таблицы
    • Преобразование формы путём поворота объектов DataFrame
    • Преобразование формы путём укладки и выгрузки
    • Преобразование формы путём melt
    • Комбинирование со статистикой и GroupBy
    • Сводные таблицы
    • Перекрёстные сводки
    • Мозаика
    • Вычисление индикаторных/фиктивных переменных
    • Факторизация значений
    • Примеры
    • Развертывание столбца, подобного списку
  • Работа с текстовыми данными
    • Типы текстовых данных
    • Методы строк
    • Разделение и замена строк
    • Конкатенация
    • Индексирование с .str
    • Извлечение подстрок
    • Проверка строк, соответствующих или содержащих шаблон
    • Создание индикаторных переменных
    • Краткое описание методов
  • Работа с пропущенными данными
    • Значения, считающиеся «пропущенными»
    • Вставка пропущенных данных
    • Вычисления с пропущенными данными
    • Сумма/произведение пустых/NaN
    • Значения NA в GroupBy
    • Заполнение пропущенных значений: fillna
    • Заполнение объектом Pandas
    • Удаление меток осей с пропущенными данными: dropna
    • Интерполяция
    • Замена общих значений
    • Замена строк/регулярных выражений
    • Числовая замена
    • Экспериментальный NA скаляр для обозначения пропущенных значений
  • Дубликаты меток
    • Последствия дубликатов меток
    • Обнаружение дубликатов меток
    • Запрет дубликатов меток
  • Категориальные данные
    • Создание объекта
    • CategoricalDtype
    • Описание
    • Работа с категориями
    • Сортировка и порядок
    • Сравнения
    • Операции
    • Обработка данных
    • Ввод/вывод данных
    • Пропущенные данные
    • Отличия от фактора R
    • Особенности
  • Тип данных целых чисел с возможностью пропущенных значений
    • Конструирование
    • Операции
    • Скалярное значение NA
  • Тип данных булевых значений с возможностью пропущенных значений
    • Индексирование со значениями NA
    • Логические операции Клини
  • Визуализация диаграмм
    • Основные построения графиков: plot
    • Другие графики
    • Построение графиков с пропущенными данными
    • Инструменты построения графиков
    • Форматирование графиков
    • Построение графиков непосредственно с Matplotlib
    • Бэкенды построения графиков
  • Визуализация таблиц
    • Объект Styler и HTML
    • Форматирование отображения
    • Методы добавления стилей
    • Стили таблиц
    • Установка классов и ссылка на внешний CSS
    • Функции Styler
    • Подсказки и заголовки
    • Более тонкий контроль с использованием срезов
    • Оптимизация
    • Встроенные стили
    • Обмен стилями
    • Ограничения
    • Другие полезные вещи
    • Экспорт в Excel
    • Экспорт в LaTeX
    • Дополнительная информация о CSS и HTML
    • Расширяемость
  • Группировка: split-apply-combine
    • Разбиение объекта на группы
    • Итерация по группам
    • Выбор группы
    • Агрегирование
    • Преобразование
    • Фильтрация
    • Отправка в методы экземпляров
    • Гибкое применение apply
    • Ускоренные вычисления с помощью Numba
    • Другие полезные функции
    • Примеры
  • Операции с окнами
    • Обзор
    • Скользящее окно
    • Взвешенное окно
    • Расширяющееся окно
    • Экспоненциально взвешенное окно
  • Функции работы со временными рядами/датами
    • Обзор
    • Маркеры времени против временных промежутков
    • Преобразование в маркеры времени
    • Генерация диапазонов маркеров времени
    • Ограничения маркеров времени
    • Индексирование
    • Компоненты времени/даты
    • Объекты DateOffset
    • Методы экземпляров, связанные со временными рядами
    • Ресемплинг
    • Представление временного интервала
    • Преобразование между представлениями
    • Представление интервалов, выходящих за пределы
    • Обработка часовых поясов
  • Временные интервалы
    • Разбор
    • Операции
    • Сводные характеристики
    • Преобразование частоты
    • Атрибуты
    • TimedeltaIndex
    • Ресемплинг
  • Параметры и настройки
    • Обзор
    • Доступные параметры
    • Получение и установка параметров
    • Установка начальных параметров в среде Python/IPython
    • Часто используемые параметры
    • Форматирование чисел
    • Форматирование Unicode
    • Отображение схемы таблицы
  • Повышение производительности
    • Cython (написание расширений на C для pandas)
    • Numba (компиляция JIT)
    • Вычисление выражений с помощью eval()
  • Масштабирование до больших наборов данных
    • Загрузка меньшего объема данных
    • Использование эффективных типов данных
    • Использование чанкинга
    • Использование других библиотек
  • Структуры разреженных данных
    • SparseArray
    • SparseDtype
    • Доступ к разреженным данным
    • Вычисления с разреженными данными
    • Миграция
    • Взаимодействие с scipy.sparse
  • Часто задаваемые вопросы (FAQ)
    • Использование памяти DataFrame
    • Использование операторов if/truth с pandas
    • Изменение с помощью пользовательских функций (UDF)
    • Пропущенные значения, целые числа, значения NA и повышение типа NA
    • Отличия от NumPy
    • Потокобезопасность
    • Проблемы с порядком байтов
  • Справочник рецептов
    • Идиомы
    • Выбор
    • Многоуровневый индекс
    • Пропущенные данные
    • Группировка
    • Временные ряды
    • Объединение
    • Отображение
    • Ввод/вывод данных
    • Вычисления
    • Временные интервалы
    • Создание тестовых данных

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/1.5.0/user_guide/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API