pandas
Дата: 30 дек. 2017 г. Версия: 0.22.0
Установка бинарных пакетов: http://pypi.python.org/pypi/pandas
Репозиторий исходного кода: http://github.com/pandas-dev/pandas
Проблемы и идеи: https://github.com/pandas-dev/pandas/issues
Поддержка вопросов и ответов: http://stackoverflow.com/questions/tagged/pandas
Список рассылки разработчиков: http://groups.google.com/group/pydata
pandas — пакет Python, предоставляющий быстрые, гибкие и выразительные структуры данных, разработанные для удобной и интуитивной работы с «реляционными» или «мечеными» данными. Он призван стать основополагающим инструментом высокого уровня для выполнения практического анализа данных в реальном мире на языке Python. Кроме того, он преследует более широкую цель — стать самым мощным и гибким инструментом для анализа и обработки данных с открытым исходным кодом, доступным на любом языке программирования. Он уже близок к достижению этой цели.
pandas хорошо подходит для многих типов данных:
- Табличные данные с разнородными столбцами, как в таблице SQL или электронных таблицах Excel
- Упорядоченные и неупорядоченные (не обязательно с фиксированной частотой) временные ряды.
- Произвольные матричные данные (однородного или разнородного типа) с метками строк и столбцов
- Любые другие формы наблюдательных / статистических наборов данных. Данные фактически не должны быть помечены для размещения в структуре данных pandas
Две основные структуры данных pandas, Series (одномерные) и DataFrame (двумерные), обрабатывают подавляющее большинство типичных случаев использования в финансах, статистике, социальных науках и во многих областях техники. Для пользователей R, DataFrame обеспечивает всё, что предоставляет R's data.frame, и многое другое. pandas построен на основе NumPy и предназначен для эффективной интеграции в среду научных вычислений с многими другими сторонними библиотеками.
Вот лишь несколько задач, с которыми хорошо справляется pandas:
- Легкое обращение с пропущенными данными (представленными как NaN) в данных с плавающей запятой, а также в данных без плавающей запятой
- Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и многомерных объектов
- Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто проигнорировать метки и позволить
Series,DataFrame, и т.д. автоматически выравнивать данные для вычислений - Мощная, гибкая группировка для выполнения операций разбиения-применения-объединения над наборами данных как для агрегирования, так и для преобразования данных
- Упрощение преобразования неравномерных данных с различными индексами из других структур данных Python и NumPy в объекты DataFrame
- Интеллектуальный срез, fancy indexing и подмножество больших наборов данных на основе меток
- Интуитивное слияние и соединение наборов данных
- Гибкое изменение формы и сводка наборов данных
- Иерархическое маркирование осей (возможность иметь несколько меток на одной отметке)
- Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделители), файлов Excel, баз данных и сохранения/загрузки данных в сверхскоростном формате HDF5
- Функциональность, специфичная для временных рядов: генерация диапазонов дат и преобразование частоты, статистика скользящего окна, линейная регрессия скользящего окна, сдвиг дат и отставание и т.д.
Многие из этих принципов разработаны для устранения недостатков, которые часто встречаются при использовании других языков / научных исследовательских сред. Для специалистов по данным работа с данными обычно делится на несколько этапов: подготовка и очистка данных, их анализ / моделирование, а затем организация результатов анализа в форму, подходящую для построения графиков или табличного представления. pandas — идеальный инструмент для всех этих задач.
Некоторые дополнительные замечания
- pandas быстрый. Многие низкоуровневые алгоритмические части были существенно оптимизированы на языке Cython. Однако, как и в любом другом случае, обобщение обычно жертвует производительностью. Поэтому, если вы сосредоточитесь на одной функции для своего приложения, вы можете создать более быстрый специализированный инструмент.
- pandas является зависимостью от statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
- pandas широко используется в производственных приложениях в финансовой сфере.
Примечание
Эта документация предполагает общее знакомство с NumPy. Если вы не пользовались NumPy или практически не использовали его, сначала потратьте некоторое время на изучение NumPy.
Дополнительные сведения о библиотеке см. в обзоре пакета.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/index.html