Spec-Zone.ru › pandas 0.22

Экосистема pandas

Всё больше пакетов разрабатывается на основе pandas для решения конкретных задач подготовки, анализа и визуализации данных. Это обнадеживает, так как это означает, что pandas не только помогает пользователям справляться со своими задачами по работе с данными, но и предоставляет разработчикам лучшую отправную точку для создания мощных и более специализированных инструментов для работы с данными. Создание библиотек, дополняющих функциональность pandas, также позволяет развитию pandas оставаться сосредоточенным на его первоначальных требованиях.

Это неисчерпывающий список проектов, которые строятся на основе pandas, чтобы предоставить инструменты в пространстве PyData.

Мы хотели бы упростить пользователям поиск этих проектов. Если вам известны другие значимые проекты, которые, по вашему мнению, должны быть в этом списке, сообщите нам об этом.

Статистика и машинное обучение

Statsmodels

Statsmodels — это ведущая Python-библиотека «статистики и эконометрики», и у неё давние особые отношения с pandas. Statsmodels предоставляет мощные возможности для статистического анализа, эконометрики, анализа и моделирования, которые выходят за рамки возможностей pandas. Statsmodels использует объекты pandas в качестве базовых контейнеров данных для вычислений.

sklearn-pandas

Используйте pandas DataFrame в вашей pipeline машинного обучения scikit-learn.

Визуализация

Bokeh

Bokeh — это интерактивная библиотека визуализации Python для больших наборов данных, которая изначально использует новейшие веб-технологии. Её цель — предоставление элегантного и лаконичного создания новых графиков в стиле Protovis/D3, при одновременной доставке высокой производительности интерактивности с большими данными на тонких клиентах.

seaborn

Seaborn — это библиотека визуализации Python, основанная на matplotlib. Она предоставляет высокоуровневый, ориентированный на набор данных интерфейс для создания привлекательных статистических графиков. Функции построения графиков в seaborn понимают объекты pandas и используют операции группировки pandas внутри для поддержки лаконичной спецификации сложных визуализаций. Seaborn также выходит за рамки matplotlib и pandas, предоставляя возможность выполнения статистической оценки при построении графиков, агрегирования по наблюдениям и визуализации подгонки статистических моделей для выделения закономерностей в наборе данных.

yhat/ggplot

ggplot2 — фундаментальный пакет исследовательской визуализации от Хэдли Уикхема для языка R. Основанный на «The Grammar of Graphics», он предоставляет мощный, декларативный и чрезвычайно универсальный способ генерации настраиваемых графиков любого типа данных. Это действительно очень впечатляет. Доступны различные реализации для других языков, но надёжная реализация для пользователей Python долгое время отсутствовала. Хотя и молодой (по состоянию на январь 2014 г.), проект yhat/ggplot быстро продвигается в этом направлении.

Vincent

Проект Vincent использует Vega (который в свою очередь использует d3) для создания графиков. Несмотря на функциональность, по состоянию на лето 2016 года проект Vincent не обновлялся более двух лет и, скорее всего, не будет получать дальнейших обновлений. Ссылка.

IPython Vega

Подобно Vincent, проект IPython Vega использует Vega для создания графиков, но в основном ориентирован на среду IPython Notebook.

Plotly

Plotly Python API позволяет создавать интерактивные фигуры и осуществлять их совместное использование в сети. Карты, 2D, 3D и графики потоковой передачи данных отрисовываются с помощью WebGL и D3.js. Библиотека поддерживает построение графиков непосредственно из pandas DataFrame и облачное совместное использование. Пользователи matplotlib, ggplot для Python и Seaborn могут преобразовывать фигуры в интерактивные веб-графики. Графики можно рисовать в IPython Notebooks, редактировать с помощью R или MATLAB, изменять в графическом интерфейсе или встраивать в приложения и панели мониторинга. Plotly бесплатно для неограниченного совместного использования и имеет облачные, локальные или локальные аккаунты для частного использования.

QtPandas

Выделенная из основной библиотеки pandas, библиотека qtpandas позволяет визуализировать и манипулировать DataFrame в приложениях PyQt4 и PySide.

IDE

IPython

IPython — это интерактивная командная оболочка и среда распределённых вычислений. IPython Notebook — это веб-приложение для создания IPython блокнотов. IPython блокнот — это JSON-документ, содержащий упорядоченный список ячеек ввода/вывода, которые могут содержать код, текст, математические формулы, графики и богатые медиа. IPython блокноты могут быть преобразованы в ряд открытых стандартных выходных форматов (HTML, слайды презентации HTML, LaTeX, PDF, ReStructuredText, Markdown, Python) через «Скачать как» в веб-интерфейсе и ipython nbconvert в оболочке.

Pandas DataFrames реализуют _repr_html_ методы, которые используются IPython Notebook для отображения (сокращённых) HTML-таблиц. (Примечание: HTML-таблицы могут или не могут быть совместимы с не-HTML форматами вывода IPython.)

quantopian/qgrid

qgrid — это «интерактивная сетка для сортировки и фильтрации DataFrames в IPython Notebook», созданная с помощью SlickGrid.

Spyder

Spyder — кроссплатформенная IDE на основе Qt с открытым исходным кодом для Python с функциями редактирования, тестирования, отладки и интроспекции. Spyder теперь может инспектировать и отображать Pandas DataFrames и показывать «минимум/максимум по столбцу и глобальный минимум/максимум в цвете».

API

pandas-datareader

pandas-datareader — это библиотека удалённого доступа к данным для pandas. pandas.io из pandas < 0.17.0 теперь переработана/выделена и импортируема из pandas_datareader (PyPI:pandas-datareader). Многие/большинство поддерживаемых API имеют по крайней мере параграф документации в документации pandas-datareader:

Доступны следующие каналы данных:

  • Yahoo! Finance
  • Google Finance
  • FRED
  • Fama/French
  • Всемирный банк
  • OECD
  • Eurostat
  • EDGAR Index

quandl/Python

Quandl API для Python оборачивает Quandl REST API для возврата Pandas DataFrames с индексами временных рядов.

pydatastream

PyDatastream — это Python-интерфейс к Thomson Dataworks Enterprise (DWE/Datastream) SOAP API для возврата индексированных Pandas DataFrames или Panel с финансовыми данными. Этот пакет требует действительных учетных данных для этого API (не бесплатный).

pandaSDMX

pandaSDMX — это библиотека для извлечения и получения статистических данных и метаданных, распространяемых в формате SDMX 2.1, стандарте ISO, широко используемом такими организациями, как статистические ведомства, центральные банки и международные организации. pandaSDMX может представлять наборы данных и связанные структурные метаданные, включая потоки данных, списки кодов и определения структур данных, в виде pandas Series или многоуровневых DataFrames.

fredapi

fredapi — это Python-интерфейс к Federal Reserve Economic Data (FRED), предоставляемый Федеральной резервной системой Сент-Луиса. Он работает как с базой данных FRED, так и с базой данных ALFRED, которая содержит данные точечных измерений (т. е. исторические данные с пересмотрами). fredapi предоставляет оболочку в Python для HTTP API FRED, а также несколько удобных методов для анализа и обработки данных точечных измерений из ALFRED. fredapi использует pandas и возвращает данные в виде Series или DataFrame. Для этого модуля требуется ключ API FRED, который можно получить бесплатно на веб-сайте FRED.

Область применения

Geopandas

Geopandas расширяет объекты данных pandas, включая географическую информацию, которая поддерживает геометрические операции. Если ваша работа связана с картами и географическими координатами, и вы любите pandas, то вам стоит обратить внимание на Geopandas.

xarray

xarray расширяет мощь маркированных данных pandas до физических наук, предоставляя N-мерные варианты основных структур данных pandas. Он призван предоставить набор инструментов, подобный pandas и совместимый с pandas, для анализа многомерных массивов, а не табличных данных, для которых pandas превосходит.

Вне ядра

Dask

Dask — это гибкая библиотека параллельных вычислений для аналитики. Dask предоставляет знакомый DataFrame интерфейс для вычислений вне ядра, параллельных и распределённых вычислений.

Dask-ML

Dask-ML позволяет выполнять параллельное и распределённое машинное обучение с использованием Dask наряду с существующими библиотеками машинного обучения, такими как Scikit-Learn, XGBoost и TensorFlow.

Blaze

Blaze предоставляет стандартный API для вычислений с различными внутренними и внешними источниками данных: NumPy, Pandas, SQLAlchemy, MongoDB, PyTables, PySpark.

Odo

Odo предоставляет единый API для перемещения данных между различными форматами. Он использует собственные read_csv pandas для CSV-ввода/вывода и использует множество существующих пакетов, таких как PyTables, h5py и pymongo, для перемещения данных между форматами, отличными от pandas. Его подход, основанный на графах, также расширяется конечными пользователями для настраиваемых форматов, которые могут быть слишком специфическими для ядра odo.

Валидация данных

Engarde

Engarde — это лёгкая библиотека, используемая для явного указания ваших предположений о ваших наборах данных и проверки того, что они на самом деле верны.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.21.1/ecosystem.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API