Spec-Zone.ru › pandas 0.23

Экосистема pandas

Все больше и больше пакетов разрабатываются поверх pandas для решения конкретных задач подготовки, анализа и визуализации данных. Это обнадеживает, поскольку это означает, что pandas не только помогает пользователям справляться с задачами обработки данных, но и предоставляет лучшую стартовую точку для разработчиков, чтобы создавать мощные и более специализированные инструменты для работы с данными. Создание библиотек, дополняющих функциональность pandas, также позволяет развитию pandas оставаться сосредоточенным на его первоначальных требованиях.

Это неисчерпывающий список проектов, которые строятся на pandas, чтобы предоставить инструменты в пространстве PyData.

Мы хотели бы облегчить пользователям поиск этих проектов. Если вам известны другие значимые проекты, которые, по вашему мнению, должны быть в этом списке, сообщите нам об этом.

Статистика и машинное обучение

Statsmodels

Statsmodels — ведущая Python-библиотека «статистики и эконометрики», и у нее давние особые отношения с pandas. Statsmodels предоставляет мощные функции статистики, эконометрики, анализа и моделирования, которые выходят за рамки возможностей pandas. Statsmodels использует объекты pandas в качестве базового контейнера данных для вычислений.

sklearn-pandas

Используйте pandas DataFrame в вашем scikit-learn конвейере машинного обучения.

Featuretools

Featuretools — это Python-библиотека для автоматизированной генерации признаков, построенная поверх pandas. Она отлично справляется с преобразованием временных и реляционных наборов данных в матрицы признаков для машинного обучения с использованием многократно используемых «примитивов» для генерации признаков. Пользователи могут вносить свой вклад в создание собственных примитивов на Python и делиться ими с сообществом.

Визуализация

Bokeh

Bokeh — это интерактивная Python-библиотека визуализации для больших наборов данных, которая изначально использует новейшие веб-технологии. Ее цель состоит в предоставлении элегантной и лаконичной конструкции новых графиков в стиле Protovis/D3, при этом обеспечивая высокую производительность интерактивности с большими данными на тонких клиентах.

seaborn

Seaborn — это Python-библиотека визуализации, основанная на matplotlib. Она предоставляет интерфейс высокого уровня, ориентированный на данные, для создания привлекательных статистических графиков. Функции построения графиков в seaborn понимают объекты pandas и используют операции группировки pandas внутри, чтобы поддерживать лаконичное описание сложных визуализаций. Seaborn также выходит за рамки matplotlib и pandas, предоставляя возможность выполнения статистической оценки при построении графиков, агрегируя наблюдения и визуализируя подгонку статистических моделей, чтобы подчеркнуть закономерности в наборе данных.

yhat/ggplot

ggplot2 — фундаментальный пакет визуализации для исследования данных от Hadley Wickham для языка программирования R. Основанный на “Грамматике графиков”, он предоставляет мощный, декларативный и чрезвычайно универсальный способ создания индивидуальных графиков любого типа данных. Это действительно невероятно. Различные реализации для других языков доступны, но отсутствует надёжная реализация для пользователей Python. Несмотря на то, что он ещё молод (по состоянию на январь 2014 года), проект yhat/ggplot быстро продвигается в этом направлении.

Vincent

Проект Vincent использует Vega (который, в свою очередь, использует d3), для создания графиков. Хотя функционален, проект Vincent по состоянию на лето 2016 года не обновлялся более двух лет и, скорее всего, не получит дальнейших обновлений.

IPython Vega

Как и Vincent, проект IPython Vega использует Vega для создания графиков, но в основном ориентирован на среду IPython Notebook.

Plotly

Plotly Python API позволяет создавать интерактивные фигуры и делиться ими в сети. Карты, 2D, 3D и графики потоковой передачи данных отрисовываются с помощью WebGL и D3.js. Библиотека поддерживает построение графиков непосредственно из DataFrame pandas и облачное сотрудничество. Пользователи matplotlib, ggplot для Python и Seaborn могут преобразовать фигуры в интерактивные веб-графики. Графики можно рисовать в IPython Notebooks, редактировать с помощью R или MATLAB, изменять в графическом интерфейсе или встраивать в приложения и панели мониторинга. Plotly бесплатно для неограниченного совместного использования и имеет облачные, автономные или локальные учётные записи для частного использования.

QtPandas

Выделенная из основной библиотеки pandas, библиотека qtpandas позволяет визуализировать и обрабатывать DataFrame в приложениях PyQt4 и PySide.

IDE

IPython

IPython — это интерактивная командная оболочка и среда распределённых вычислений. IPython Notebook — это веб-приложение для создания IPython ноутбуков. IPython ноутбук — это JSON-документ, содержащий упорядоченный список ячеек ввода/вывода, которые могут содержать код, текст, математические выражения, графики и богатые медиа. IPython ноутбуки могут быть преобразованы в ряд выходных форматов открытых стандартов (HTML, HTML презентации, LaTeX, PDF, ReStructuredText, Markdown, Python) с помощью «Скачать как» в веб-интерфейсе и ipython nbconvert в оболочке.

Pandas DataFrame реализуют _repr_html_ методы, которые используются IPython Notebook для отображения (упрощенных) HTML таблиц. (Примечание: HTML таблицы могут или не могут быть совместимы с форматами вывода IPython, отличными от HTML.)

quantopian/qgrid

qgrid — это «интерактивная сетка для сортировки и фильтрации DataFrame в IPython Notebook», построенная с использованием SlickGrid.

Spyder

Spyder — это кроссплатформенная IDE на основе Qt с открытым исходным кодом для Python, с функциями редактирования, тестирования, отладки и интроспекции. Spyder теперь может выполнять интроспекцию и отображать Pandas DataFrame и отображать «минимальное/максимальное значение по столбцу и глобальное минимальное/максимальное значение с окраской».

API

pandas-datareader

pandas-datareader — это библиотека удаленного доступа к данным для pandas (PyPI:pandas-datareader). Она основана на функциональности, которая находилась в pandas.io.data и pandas.io.wb , но была выделена в версии v0.19. Дополнительную информацию см. в документации pandas-datareader:

Доступны следующие источники данных:

  • Yahoo! Finance
  • Google Finance
  • FRED
  • Fama/French
  • Всемирный банк
  • ОЭСР
  • Eurostat
  • EDGAR Index

quandl/Python

Quandl API для Python обёртка REST API Quandl для возврата Pandas DataFrame с временными индексами.

pydatastream

PyDatastream — это Python-интерфейс к SOAP API Thomson Dataworks Enterprise (DWE/Datastream) для возврата индексированных Pandas DataFrame или Panel с финансовыми данными. Для этого пакета требуются действительные учетные данные для этого API (не бесплатно).

pandaSDMX

pandaSDMX — это библиотека для извлечения и получения статистических данных и метаданных, распространяемых в SDMX 2.1, широко используемом стандарте ISO такими учреждениями, как статистические ведомства, центральные банки и международные организации. pandaSDMX может экспонировать наборы данных и связанные структурные метаданные, включая потоки данных, списки кодов и определения структур данных, в виде pandas Series или многоуровневых DataFrame.

fredapi

fredapi — это Python-интерфейс к Federal Reserve Economic Data (FRED), предоставляемый Федеральным резервным банком Сент-Луиса. Она работает как с базой данных FRED, так и с базой данных ALFRED, содержащей данные в определенные моменты времени (т.е. исторические версии данных). fredapi предоставляет обёртку на Python к HTTP API FRED, а также несколько удобных методов для парсинга и анализа данных, полученных в определенные моменты времени из ALFRED. fredapi использует pandas и возвращает данные в виде Series или DataFrame. Для этого модуля требуется ключ API FRED, который можно бесплатно получить на сайте FRED.

Специфичные для области

Geopandas

Geopandas расширяет объекты данных pandas, чтобы включить географическую информацию, которая поддерживает геометрические операции. Если ваша работа включает карты и географические координаты, и вам нравится pandas, вы должны внимательно изучить Geopandas.

xarray

xarray расширяет возможности pandas с метками данных для физических наук, предоставляя N-мерные варианты основных структур данных pandas. Он предназначен для обеспечения инструментария, похожей на pandas и совместимой с pandas, для анализа многомерных массивов, в отличие от табличных данных, для которых pandas отлично подходит.

Выход за рамки ядра

Dask

Dask — это гибкая библиотека параллельных вычислений для анализа. Dask предоставляет знакомый DataFrame интерфейс для вычислений вне ядра, параллельных и распределённых вычислений.

Dask-ML

Dask-ML позволяет выполнять параллельное и распределённое машинное обучение с использованием Dask наряду с существующими библиотеками машинного обучения, такими как Scikit-Learn, XGBoost и TensorFlow.

Blaze

Blaze предоставляет стандартный API для вычислений с различными внутренними и внешними хранилищами: NumPy, Pandas, SQLAlchemy, MongoDB, PyTables, PySpark.

Odo

Odo предоставляет единый API для перемещения данных между различными форматами. Он использует собственную read_csv pandas для CSV-ввода/вывода и использует многие существующие пакеты, такие как PyTables, h5py и pymongo, для перемещения данных между форматами, отличными от pandas. Его основанный на графах подход также расширяется конечными пользователями для пользовательских форматов, которые могут быть слишком специфичными для ядра odo.

Валидация данных

Engarde

Engarde — это лёгкая библиотека, используемая для явного указания предположений о ваших наборах данных и проверки того, что они действительно верны.

Расширенные типы данных

Pandas предоставляет интерфейс для определения расширенных типов для расширения системы типов NumPy. Следующие библиотеки реализуют этот интерфейс для предоставления типов, отсутствующих в NumPy или pandas, которые хорошо работают с контейнерами данных pandas.

cyberpandas

Cyberpandas предоставляет расширенный тип для хранения массивов IP-адресов. Эти массивы могут быть сохранены внутри pandas Series и DataFrame.

Доступ к экосистеме

Справочник проектов, предоставляющих расширенные средства доступа. Это для пользователей, чтобы обнаруживать новые средства доступа, и для авторов библиотек, чтобы координировать пространство имен.

Библиотека Средство доступа Классы
cyberpandas ip Series
pdvega vgplot Series, DataFrame

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/ecosystem.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API