Руководство пользователя
Руководство пользователя охватывает все pandas по тематическим областям. Каждый из подразделов знакомит с темой (например, «работа с отсутствующими данными») и обсуждает подход pandas к проблеме, с множеством примеров.
Пользователям, новым для pandas, следует начать с 10 минут с pandas.
Для получения краткого обзора основных принципов pandas см. Введение в структуры данных и Основные базовые функции.
Дополнительную информацию о любом конкретном методе можно получить в Справочнике API.
Как читать эти руководства
В этих руководствах вы увидите входной код внутри блоков кода, таких как:
import pandas as pd
pd.DataFrame({'A': [1, 2, 3]})
или:
In [1]: import pandas as pd
In [2]: pd.DataFrame({'A': [1, 2, 3]})
Out[2]:
A
0 1
1 2
2 3
Первый блок — это стандартный входной код Python, а во втором In [1]: указывает, что входной код находится в блокноте. В Jupyter Notebook выводится последняя строка и отображаются графики.
Например:
In [3]: a = 1
In [4]: a
Out[4]: 1
эквивалентно:
a = 1
print(a)
Руководства
- 10 минут с pandas
- Введение в структуры данных
- Основные базовые функции
-
Инструменты ввода-вывода (текст, CSV, HDF5 и т. д.)
- CSV и текстовые файлы
- JSON
- HTML
- LaTeX
- XML
- Файлы Excel
- Электронные таблицы OpenDocument
- Бинарные файлы Excel (.xlsb)
- Calamine (файлы Excel и ODS)
- Буфер обмена
- Замораживание
- msgpack
- HDF5 (PyTables)
- Feather
- Parquet
- ORC
- SQL-запросы
- Google BigQuery
- Формат Stata
- Форматы SAS
- Форматы SPSS
- Другие форматы файлов
- Соображения производительности
- Функциональность PyArrow
-
Индексирование и выбор данных
- Разные варианты индексирования
- Основы
- Доступ к атрибутам
- Срезы диапазонов
- Выбор по метке
- Выбор по позиции
- Выбор по вызываемому объекту
- Сочетание позиционного и основанного на метках индексирования
- Выбор случайных выборок
- Установка с расширением
- Быстрое получение и установка скалярных значений
- Булево индексирование
- Индексирование с isin
- Метод where и маскирование
- Установление с расширением условно с использованием NumPy
- Метод query
- Дубликаты данных
- Метод get, подобный словарям
- Поиск значений по индексу/меткам столбцов
- Объекты индексов
- Установить/сбросить индекс
- Возвращение представления по сравнению с копией
- Многоуровневый индекс/расширенное индексирование
- Копирование при записи (CoW)
- Объединение, присоединение, конкатенация и сравнение
- Изменение формы и сводные таблицы
- Работа с текстовыми данными
- Работа с пропущенными данными
- Дубликаты меток
- Категориальные данные
- Тип данных целых чисел с возможностью пропуска
- Тип данных булевых значений с возможностью пропуска
- Визуализация диаграмм
-
Визуализация таблиц
- Объект Styler и настройка отображения
- Форматирование отображения
- Объект Styler и HTML
- Методы добавления стилей
- Стили таблиц
- Установка классов и подключение к внешнему CSS
- Функции Styler
- Подсказки и подписи
- Более тонкий контроль с помощью срезов
- Оптимизация
- Встроенные стили
- Обмен стилями
- Ограничения
- Другие интересные и полезные вещи
- Экспорт в Excel
- Экспорт в LaTeX
- Подробнее о CSS и HTML
- Расширяемость
- Группировка: разделение-применение-комбинирование
- Операции с окнами
-
Функциональность временных рядов/дат
- Обзор
- Маркеры времени против временных интервалов
- Преобразование во временные метки
- Генерация диапазонов временных меток
- Ограничения временных меток
- Индексирование
- Компоненты времени/даты
- Объекты DateOffset
- Методы, относящиеся к временным рядам
- Перевыборка
- Представление временного интервала
- Преобразование между представлениями
- Представление интервалов, выходящих за пределы
- Обработка часовых поясов
- Временные дельты
- Параметры и настройки
- Повышение производительности
- Масштабирование до больших наборов данных
- Структуры разреженных данных
- Часто задаваемые вопросы (FAQ)
- Кулинарная книга
© 2008–2022, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/2.2.2/user_guide/index.html