pandas
Дата: 05 авг. 2018 г. Версия: 0.23.4
Двоичные установщики: https://pypi.org/project/pandas
Репозиторий исходного кода: http://github.com/pandas-dev/pandas
Проблемы и идеи: https://github.com/pandas-dev/pandas/issues
Поддержка вопросов и ответов: http://stackoverflow.com/questions/tagged/pandas
Список рассылки разработчиков: http://groups.google.com/group/pydata
pandas — пакет Python, предоставляющий быстрые, гибкие и выразительные структуры данных, предназначенные для удобной и интуитивной работы с «реляционными» или «мечеными» данными. Он призван стать фундаментальным высокоуровневым строительным блоком для практического анализа данных в реальном мире на языке Python. Кроме того, он преследует более широкую цель — стать самым мощным и гибким инструментом анализа и обработки данных с открытым исходным кодом, доступным на любом языке. Он уже движется к этой цели.
pandas хорошо подходит для многих типов данных:
- Табличные данные с разнородными столбцами, как в таблице SQL или электронных таблицах Excel
- Упорядоченные и неупорядоченные (не обязательно с фиксированной частотой) временные ряды.
- Произвольные матричные данные (однородные или разнородные) с метками строк и столбцов
- Любые другие формы набора данных наблюдений / статистики. Данные фактически не должны быть помечены, чтобы их можно было поместить в структуру данных pandas
Две основные структуры данных pandas, Series (одномерные) и DataFrame (двумерные), обрабатывают подавляющее большинство типичных случаев использования в финансах, статистике, социальных науках и многих областях техники. Для пользователей R DataFrame предоставляет все, что предоставляет R’s data.frame, и многое другое. pandas построен поверх NumPy и предназначен для хорошей интеграции в среду научных вычислений с многими другими сторонними библиотеками.
Вот лишь некоторые из того, что pandas делает хорошо:
- Легкая обработка пропущенных данных (представленных как NaN) в данных с плавающей запятой и нечисловых данных
- Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и объектов более высокой размерности
- Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто пропустить метки и позволить
Series,DataFrame, и т. д. автоматически выровнять данные для вас в вычислениях - Мощная, гибкая функциональность group by для выполнения операций split-apply-combine на наборах данных, как для агрегирования, так и для преобразования данных
- Упрощение преобразования фрагментированных, имеющих разные индексы данных в других структурах данных Python и NumPy в объекты DataFrame
- Интеллектуальное извлечение срезов, индексация с помощью произвольного набора элементов и выделение подмножеств больших наборов данных
- Интуитивное слияние и соединение наборов данных
- Гибкое преобразование формы и поворот наборов данных
- Иерархическая маркировка осей (возможность иметь несколько меток на тике)
- Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделителями), файлов Excel, баз данных и сохранения/загрузки данных из сверхбыстрого формата HDF5
- Функциональность временных рядов: генерация диапазонов дат и преобразование частоты, статистика скользящего окна, скользящие линейные регрессии, сдвиги дат и задержки и т.д.
Многие из этих принципов здесь для решения недостатков, часто возникающих при использовании других языков/сред научных исследований. Для ученых данных работа с данными обычно делится на несколько этапов: подготовка и очистка данных, анализ/моделирование, а затем организация результатов анализа в форму, подходящую для построения графиков или табличного отображения. pandas — идеальный инструмент для всех этих задач.
Некоторые другие замечания
- pandas быстрый. Многие низкоуровневые алгоритмические детали были значительно улучшены в коде Cython. Однако, как и в любом другом случае, обобщение обычно жертвует производительностью. Поэтому, если вы сосредоточитесь на одной функции для своего приложения, вы сможете создать более специализированный и быстрый инструмент.
- pandas является зависимостью statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
- pandas широко используется в производственных финансовых приложениях.
Примечание
Эта документация предполагает общую осведомленность с NumPy. Если вы не очень много или совсем не работали с NumPy, сначала потратьте некоторое время на ознакомление с NumPy.
См. обзор пакета для получения более подробной информации о том, что входит в библиотеку.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/index.html