Spec-Zone.ru › pandas 0.19

Экосистема pandas

Всё чаще пакеты создаются поверх pandas для решения конкретных задач подготовки, анализа и визуализации данных. Это обнадеживает, потому что это означает, что pandas не только помогает пользователям обрабатывать задачи с данными, но и предоставляет лучшую отправную точку для разработчиков, чтобы создавать мощные и более специализированные инструменты для работы с данными. Создание библиотек, дополняющих функциональность pandas, также позволяет развитию pandas оставаться сосредоточенным на его первоначальных требованиях.

Это неполный список проектов, построенных на основе pandas для предоставления инструментов в пространстве PyData.

Мы хотели бы сделать поиск этих проектов более простым для пользователей. Если вы знаете другие значимые проекты, которые, по вашему мнению, должны быть в этом списке, сообщите нам об этом.

Статистики и машинное обучение

Statsmodels

Statsmodels — это ведущая питоновская библиотека «статистики и эконометрики», и у нее давние особые отношения с pandas. Statsmodels предоставляет мощные возможности статистики, эконометрики, анализа и моделирования, которые выходят за рамки возможностей pandas. Statsmodels использует объекты pandas в качестве базового контейнера данных для вычислений.

sklearn-pandas

Используйте pandas DataFrame в вашей цепочке обработки ML scikit-learn.

Визуализация

Bokeh

Bokeh — это интерактивная библиотека визуализации Python для больших наборов данных, которая в родном виде использует новейшие веб-технологии. Ее цель — предоставить элегантную, лаконичную конструкцию новых графиков в стиле Protovis/D3, обеспечивая высокую производительность интерактивности с большими данными на тонких клиентах.

yhat/ggplot

ggplot2 Хэдли Уикхема — это фундаментальный пакет исследовательской визуализации для языка R. Основанный на “Грамматике графиков”, он предоставляет мощный, декларативный и чрезвычайно общий способ генерации индивидуальных графиков любого типа данных. Это действительно невероятно. Различные реализации для других языков доступны, но надёжной реализации для пользователей Python давно не хватало. Несмотря на то, что проект yhat/ggplot (по состоянию на январь 2014 г.) еще молод, он быстро прогрессирует в этом направлении.

Seaborn

Хотя в pandas есть достаточно функционала для простого построения графиков, визуализация, особенно статистическая графика, — обширная область с богатой традицией и множеством задач. Проект Seaborn построен поверх pandas и matplotlib, чтобы предоставить лёгкое построение графиков данных, расширяющееся до более сложных типов графиков, чем те, которые предлагает pandas.

Vincent

Проект Vincent использует Vega (который в свою очередь использует d3), чтобы создавать графики. Хотя функциональный, по состоянию на лето 2016 года проект Vincent не обновлялся более двух лет и, скорее всего, не будет обновляться в будущем.

IPython Vega

Как и Vincent, проект IPython Vega использует Vega для создания графиков, но в первую очередь ориентирован на среду IPython Notebook.

Plotly

API Plotly для Python обеспечивает интерактивные фигуры и возможность совместного использования в веб-среде. Карты, 2D, 3D и графики потоковой передачи в реальном времени отрисовываются с помощью WebGL и D3.js. Библиотека поддерживает построение графиков непосредственно из pandas DataFrame и облачное сотрудничество. Пользователи matplotlib, ggplot для Python и Seaborn могут преобразовывать фигуры в интерактивные веб-графики. Графики можно рисовать в IPython Notebooks, редактировать с помощью R или MATLAB, изменять в графическом интерфейсе или встраивать в приложения и панели управления. Plotly бесплатно для неограниченного совместного использования и имеет облачный, локальный или настольный аккаунты для личного использования.

Pandas-Qt

Вынесенный из основной библиотеки pandas, проект Pandas-Qt позволяет визуализировать и обрабатывать DataFrame в приложениях PyQt4 и PySide.

IDE

IPython

IPython — это интерактивная командная оболочка и среда распределённых вычислений. IPython Notebook — это веб-приложение для создания IPython-блокнотов. IPython-блокнот — это JSON-документ, содержащий упорядоченный список ячеек ввода/вывода, которые могут содержать код, текст, математические формулы, графики и медиа-контент. IPython-блокноты могут быть преобразованы в ряд выходных форматов открытых стандартов (HTML, HTML-презентационные слайды, LaTeX, PDF, ReStructuredText, Markdown, Python) через «Скачать как» в веб-интерфейсе и ipython nbconvert в оболочке.

Pandas DataFrames реализуют _repr_html_ методы, которые используются IPython Notebook для отображения (сокращённых) HTML-таблиц. (Примечание: HTML-таблицы могут или не могут быть совместимы с не-HTML-форматами вывода IPython.)

quantopian/qgrid

qgrid — это «интерактивная сетка для сортировки и фильтрации DataFrames в IPython Notebook», созданная с помощью SlickGrid.

Spyder

Spyder — кроссплатформенный IDE на основе Qt с открытым исходным кодом для Python, с возможностями редактирования, тестирования, отладки и интроспекции. Spyder теперь может инспектировать и отображать Pandas DataFrame и показывать как «минимальные/максимальные значения по столбцам, так и глобальные минимальные/максимальные значения с цветовым выделением».

API

pandas-datareader

pandas-datareader — это библиотека удалённого доступа к данным для pandas. pandas.io из pandas < 0.17.0 теперь переработан/вынесен и импортируем из pandas_datareader (PyPI:pandas-datareader). У многих/большинства поддерживаемых API есть по крайней мере параграф документации в документации pandas-datareader:

Доступны следующие источники данных:

  • Yahoo! Finance
  • Google Finance
  • FRED
  • Fama/French
  • Всемирный банк
  • OECD
  • Eurostat
  • EDGAR Index

quandl/Python

Quandl API для Python оборачивает Quandl REST API для возврата Pandas DataFrame с временными индексами.

pydatastream

PyDatastream — это Python-интерфейс к SOAP-API Thomson Dataworks Enterprise (DWE/Datastream) для возврата индексированных Pandas DataFrame или Panel с финансовыми данными. Для этого пакета необходимы действительные учётные данные для этого API (не бесплатно).

pandaSDMX

pandaSDMX — это расширяемая библиотека для получения и извлечения статистических данных и метаданных, распространённых в формате SDMX 2.1. Этот стандарт в настоящее время поддерживается Европейским статистическим управлением (Eurostat) и Европейским центральным банком (ЕЦБ). Наборы данных могут быть возвращены в виде pandas Series или многоуровневых DataFrame.

fredapi

fredapi — это Python-интерфейс к Federal Reserve Economic Data (FRED), предоставленный Федеральным резервным банком Сент-Луиса. Он работает как с базой данных FRED, так и с базой данных ALFRED, которая содержит данные на момент времени (т. е. исторические данные с пересмотрами). fredapi предоставляет оберточку на Python для HTTP-API FRED, а также несколько удобных методов для парсинга и анализа данных на момент времени из ALFRED. fredapi использует pandas и возвращает данные в виде Series или DataFrame. Для этого модуля требуется ключ API FRED, который вы можете получить бесплатно на веб-сайте FRED.

Специализированные области

Geopandas

Geopandas расширяет объекты данных pandas, добавляя географическую информацию, которая поддерживает геометрические операции. Если ваша работа включает карты и географические координаты, и вам нравится pandas, вам следует внимательно изучить Geopandas.

xarray

xarray переносит возможности маркированной обработки данных pandas в область физических наук, предоставляя N-мерные аналоги основных структур данных pandas. Он призван предоставить аналогичный pandas и совместимый с pandas инструмент для анализа многомерных массивов, а не табличных данных, в которых pandas преуспевает.

Вычислительные операции вне оперативной памяти

Dask

Dask — это гибкая библиотека параллельных вычислений для анализа данных. Dask позволяет использовать знакомый DataFrame интерфейс для операций вне оперативной памяти, параллельных и распределённых вычислений.

Blaze

Blaze предоставляет стандартный API для вычислений с различными встроенными и вне памяти бекендами: NumPy, Pandas, SQLAlchemy, MongoDB, PyTables, PySpark.

Odo

Odo предоставляет унифицированный API для перемещения данных между различными форматами. Он использует собственные read_csv pandas для CSV-ввода/вывода и использует многие существующие пакеты, такие как PyTables, h5py и pymongo, для перемещения данных между не-pandas форматами. Его подход на основе графов также расширяется конечными пользователями для пользовательских форматов, которые могут быть слишком специфичными для ядра odo.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.19.2/ecosystem.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API