Spec-Zone.ru › pandas 2

Руководство пользователя

Руководство пользователя охватывает все pandas по тематическим областям. Каждый из подразделов знакомит с темой (например, «работа с отсутствующими данными») и обсуждает подход pandas к проблеме, с множеством примеров.

Пользователям, новым для pandas, следует начать с 10 минут с pandas.

Для получения краткого обзора основных принципов pandas см. Введение в структуры данных и Основные базовые функции.

Дополнительную информацию о любом конкретном методе можно получить в Справочнике API.

Как читать эти руководства

В этих руководствах вы увидите входной код внутри блоков кода, таких как:

import pandas as pd
pd.DataFrame({'A': [1, 2, 3]})

или:

In [1]: import pandas as pd

In [2]: pd.DataFrame({'A': [1, 2, 3]})
Out[2]: 
   A
0  1
1  2
2  3

Первый блок — это стандартный входной код Python, а во втором In [1]: указывает, что входной код находится в блокноте. В Jupyter Notebook выводится последняя строка и отображаются графики.

Например:

In [3]: a = 1

In [4]: a
Out[4]: 1

эквивалентно:

a = 1
print(a)

Руководства

  • 10 минут с pandas
    • Основные структуры данных в pandas
    • Создание объектов
    • Просмотр данных
    • Выбор
    • Пропущенные данные
    • Операции
    • Объединение
    • Группировка
    • Изменение формы
    • Временные ряды
    • Категории
    • Графики
    • Импорт и экспорт данных
    • Особенности
  • Введение в структуры данных
    • Ряд
    • Таблица
  • Основные базовые функции
    • Начало и конец
    • Атрибуты и основополагающие данные
    • Ускоренные операции
    • Гибкие бинарные операции
    • Дескриптивная статистика
    • Применение функций
    • Переиндексация и изменение меток
    • Итерация
    • .dt accessor
    • Векторизованные строковые методы
    • Сортировка
    • Копирование
    • dtypes
    • Выбор столбцов на основе dtype
  • Инструменты ввода-вывода (текст, CSV, HDF5 и т. д.)
    • CSV и текстовые файлы
    • JSON
    • HTML
    • LaTeX
    • XML
    • Файлы Excel
    • Электронные таблицы OpenDocument
    • Бинарные файлы Excel (.xlsb)
    • Calamine (файлы Excel и ODS)
    • Буфер обмена
    • Замораживание
    • msgpack
    • HDF5 (PyTables)
    • Feather
    • Parquet
    • ORC
    • SQL-запросы
    • Google BigQuery
    • Формат Stata
    • Форматы SAS
    • Форматы SPSS
    • Другие форматы файлов
    • Соображения производительности
  • Функциональность PyArrow
    • Интеграция структур данных
    • Операции
    • Чтение ввода-вывода
  • Индексирование и выбор данных
    • Разные варианты индексирования
    • Основы
    • Доступ к атрибутам
    • Срезы диапазонов
    • Выбор по метке
    • Выбор по позиции
    • Выбор по вызываемому объекту
    • Сочетание позиционного и основанного на метках индексирования
    • Выбор случайных выборок
    • Установка с расширением
    • Быстрое получение и установка скалярных значений
    • Булево индексирование
    • Индексирование с isin
    • Метод where и мас­кирование
    • Установление с расширением условно с использованием NumPy
    • Метод query
    • Дубликаты данных
    • Метод get, подобный словарям
    • Поиск значений по индексу/меткам столбцов
    • Объекты индексов
    • Установить/сбросить индекс
    • Возвращение представления по сравнению с копией
  • Многоуровневый индекс/расширенное индексирование
    • Иерархическое индексирование (MultiIndex)
    • Расширенное индексирование с иерархическим индексом
    • Сортировка многоуровневого индекса
    • Методы take
    • Типы индексов
    • Разное по индексированию (FAQ)
  • Копирование при записи (CoW)
    • Предыдущее поведение
    • Переход на копирование при записи
    • Описание
    • Цепная присваивание
    • Только для чтения массивы NumPy
    • Шаблоны, которых следует избегать
    • Оптимизации копирования при записи
    • Как включить CoW
END_OF_DOCUMENT_MARKER
  • Объединение, присоединение, конкатенация и сравнение
    • concat()
    • merge()
    • DataFrame.join()
    • merge_ordered()
    • merge_asof()
    • compare()
  • Изменение формы и сводные таблицы
    • pivot() и pivot_table()
    • stack() и unstack()
    • melt() и wide_to_long()
    • get_dummies() и from_dummies()
    • explode()
    • crosstab()
    • cut()
    • factorize()
  • Работа с текстовыми данными
    • Типы текстовых данных
    • Методы строк
    • Разделение и замена строк
    • Конкатенация
    • Индексирование с помощью .str
    • Извлечение подстрок
    • Проверка строк, которые соответствуют или содержат шаблон
    • Создание индикаторных переменных
    • Краткое описание методов
  • Работа с пропущенными данными
    • Значения, рассматриваемые как «пропущенные»
    • Семантика NA
    • Вставка пропущенных данных
    • Вычисления с пропущенными данными
    • Удаление пропущенных данных
    • Заполнение пропущенных данных
  • Дубликаты меток
    • Последствия дубликатов меток
    • Обнаружение дубликатов меток
    • Запрет дубликатов меток
  • Категориальные данные
    • Создание объектов
    • CategoricalDtype
    • Описание
    • Работа с категориями
    • Сортировка и порядок
    • Сравнения
    • Операции
    • Преобразование данных
    • Получение данных в/из
    • Пропущенные данные
    • Различия с фактором R
    • Особенности
  • Тип данных целых чисел с возможностью пропуска
    • Конструкции
    • Операции
    • Скалярное значение NA
  • Тип данных булевых значений с возможностью пропуска
    • Индексирование с значениями NA
    • Логические операции Клини
  • Визуализация диаграмм
    • Базовое построение графиков: plot
    • Другие графики
    • Построение графиков с пропущенными данными
    • Инструменты построения графиков
    • Форматирование графиков
    • Построение графиков непосредственно с помощью Matplotlib
    • Платформы построения графиков
  • Визуализация таблиц
    • Объект Styler и настройка отображения
    • Форматирование отображения
    • Объект Styler и HTML
    • Методы добавления стилей
    • Стили таблиц
    • Установка классов и подключение к внешнему CSS
    • Функции Styler
    • Подсказки и подписи
    • Более тонкий контроль с помощью срезов
    • Оптимизация
    • Встроенные стили
    • Обмен стилями
    • Ограничения
    • Другие интересные и полезные вещи
    • Экспорт в Excel
    • Экспорт в LaTeX
    • Подробнее о CSS и HTML
    • Расширяемость
  • Группировка: разделение-применение-комбинирование
    • Разделение объекта на группы
    • Итерация по группам
    • Выбор группы
    • Агрегирование
    • Преобразование
    • Фильтрация
    • Гибкое apply
    • Numba ускоренные процедуры
    • Другие полезные функции
    • Примеры
  • Операции с окнами
    • Обзор
    • Скользящее окно
    • Взвешенное окно
    • Расширяющееся окно
    • Экспоненциально взвешенное окно
  • Функциональность временных рядов/дат
    • Обзор
    • Маркеры времени против временных интервалов
    • Преобразование во временные метки
    • Генерация диапазонов временных меток
    • Ограничения временных меток
    • Индексирование
    • Компоненты времени/даты
    • Объекты DateOffset
    • Методы, относящиеся к временным рядам
    • Перевыборка
    • Представление временного интервала
    • Преобразование между представлениями
    • Представление интервалов, выходящих за пределы
    • Обработка часовых поясов
  • Временные дельты
    • Парсинг
    • Операции
    • Сводки
    • Преобразование частоты
    • Атрибуты
    • TimedeltaIndex
    • Перевыборка
  • Параметры и настройки
    • Обзор
    • Доступные параметры
    • Получение и установка параметров
    • Установка параметров запуска в среде Python/IPython
    • Часто используемые параметры
    • Форматирование чисел
    • Форматирование Unicode
    • Отображение схемы таблицы
  • Повышение производительности
    • Cython (создание расширений на C для pandas)
    • Numba (JIT-компиляция)
    • Вычисление выражений с помощью eval()
  • Масштабирование до больших наборов данных
    • Загрузка меньшего количества данных
    • Использование эффективных типов данных
    • Использование чанкинга
    • Использование других библиотек
  • Структуры разреженных данных
    • SparseArray
    • SparseDtype
    • Разреженный аксессор
    • Вычисления с разреженными данными
    • Взаимодействие с scipy.sparse
  • Часто задаваемые вопросы (FAQ)
    • Использование памяти DataFrame
    • Использование операторов if/truth в pandas
    • Изменение с помощью пользовательских функций (UDF)
    • Представление пропущенных значений для типов NumPy
    • Отличия от NumPy
    • Безопасность потоков
    • Проблемы с порядком байтов
  • Кулинарная книга
    • Идиомы
    • Выбор
    • Многоуровневый индекс
    • Отсутствующие данные
    • Группирование
    • Временные ряды
    • Слияние
    • Графики
    • Ввод/вывод данных
    • Вычисления
    • Временные дельты
    • Создание тестовых данных
    • Постоянные ряды

© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/user_guide/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API