Spec-Zone.ru › pandas 0.21

pandas

Дата: 12 дек. 2017 г. Версия: 0.21.1

Бинарные установщики: http://pypi.python.org/pypi/pandas

Репозиторий исходного кода: http://github.com/pandas-dev/pandas

Проблемы и идеи: https://github.com/pandas-dev/pandas/issues

Поддержка по вопросам и ответам: http://stackoverflow.com/questions/tagged/pandas

Список рассылки разработчиков: http://groups.google.com/group/pydata

pandas — это пакет Python, предоставляющий быстрые, гибкие и выразительные структуры данных, предназначенные для удобной и интуитивно понятной работы с «реляционными» или «мечеными» данными. Он призван стать фундаментальным высокоуровневым строительным блоком для практического анализа данных в реальном мире на Python. Кроме того, он преследует более широкую цель — стать самым мощным и гибким инструментом открытого исходного кода для анализа и обработки данных, доступным на любом языке. Он уже успешно движется к этой цели.

pandas хорошо подходит для многих типов данных:

  • Табличные данные с разнородными типами столбцов, как в таблице SQL или электронных таблицах Excel
  • Упорядоченные и неупорядоченные (не обязательно с фиксированной частотой) временные ряды.
  • Произвольные матричные данные (однородного типа или разнородные) с метками строк и столбцов
  • Любые другие типы наблюдательных/статистических наборов данных. Данные фактически не обязательно должны быть помечены, чтобы быть помещены в структуру данных pandas

Две основные структуры данных pandas, Series (одномерная) и DataFrame (двумерная), обрабатывают подавляющее большинство типичных случаев использования в финансах, статистике, социальных науках и многих областях техники. Для пользователей R, DataFrame предоставляет всё, что предоставляет data.frame, и многое другое. pandas построен поверх NumPy и предназначен для эффективной интеграции в среду научных вычислений с множеством других сторонних библиотек.

Вот лишь некоторые из возможностей pandas:

  • Легкое обращение с пропущенными данными (представленными как NaN) в данных с плавающей точкой, а также в данных не с плавающей точкой
  • Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и многомерных объектов
  • Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто игнорировать метки и позволить Series, DataFrame, и т.д. автоматически выравнивать данные для вас в вычислениях
  • Мощная и гибкая функциональность группировки для выполнения операций разделения-применения-комбинирования на наборах данных для агрегирования и преобразования данных
  • Легко конвертировать неровные, с разными индексами данные в других структурах данных Python и NumPy в объекты DataFrame
  • Интеллектуальное фрагментирование, индексирование и подмножества больших наборов данных
  • Интуитивное слияние и соединение наборов данных
  • Гибкое преобразование и перемещение наборов данных
  • Иерархическая маркировка осей (возможность иметь несколько меток на каждом делении)
  • Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделители), файлов Excel, баз данных и сохранения/загрузки данных в сверхбыстром формате HDF5
  • Функциональность, специфичная для временных рядов: генерация диапазона дат и преобразование частоты, статистики скользящего окна, скользящие линейные регрессии, смещение дат и задержка и т.д.

Многие из этих принципов направлены на устранение недостатков, часто возникающих при использовании других языков/сред научных исследований. Для специалистов по данным работа с данными обычно разделена на несколько этапов: обработка и очистка данных, их анализ/моделирование, затем организация результатов анализа в форму, подходящую для построения графиков или табличного отображения. pandas является идеальным инструментом для всех этих задач.

Некоторые другие замечания

  • pandas быстрый. Многие из низкоуровневых алгоритмических элементов были существенно улучшены в коде Cython. Однако, как и в случае с чем-либо еще, обобщение обычно жертвует производительностью. Таким образом, если вы сосредоточитесь на одной функции для своего приложения, вы можете создать более быстрый специализированный инструмент.
  • pandas является зависимостью от statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
  • pandas широко использовался в производственных финансовых приложениях.

Примечание

Данная документация предполагает общее знакомство с NumPy. Если вы не использовали NumPy много или вообще, потратьте некоторое время на изучение NumPy сначала.

Дополнительные подробности о содержании библиотеки см. в обзоре пакета.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.21.1/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API