Spec-Zone.ru › pandas 0.19

pandas

Дата: 24 дек. 2016 г. Версия: 0.19.2

Бинарные установщики: http://pypi.python.org/pypi/pandas

Репозиторий исходного кода: http://github.com/pydata/pandas

Проблемы и идеи: https://github.com/pydata/pandas/issues

Поддержка вопросов и ответов: http://stackoverflow.com/questions/tagged/pandas

Список рассылки разработчиков: http://groups.google.com/group/pydata

pandas — это пакет Python, предоставляющий быстрые, гибкие и выразительные структуры данных, предназначенные для удобной и интуитивной работы с «реляционными» или «мечеными» данными. Он призван стать основным высокоуровневым строительным блоком для практического анализа данных в реальном мире в Python. Кроме того, он преследует более широкую цель — стать самым мощным и гибким инструментом анализа и обработки данных с открытым исходным кодом, доступным на любом языке. Он уже близок к достижению этой цели.

pandas подходит для многих типов данных:

  • Табличные данные с разнородными типами столбцов, как в таблице SQL или электронных таблицах Excel
  • Упорядоченные и неупорядоченные (не обязательно с фиксированной частотой) временные ряды.
  • Произвольные матричные данные (однородного типа или разнородные) с метками строк и столбцов
  • Любые другие формы наблюдательных/статистических наборов данных. Данные фактически не обязательно должны быть помечены, чтобы быть помещены в структуру данных pandas

Две основные структуры данных pandas, Series (одномерные) и DataFrame (двумерные), обрабатывают подавляющее большинство типичных случаев использования в финансах, статистике, социальных науках и многих областях техники. Для пользователей R, DataFrame предоставляет все, что предоставляет data.frame R, и многое другое. pandas построен поверх NumPy и предназначен для эффективной интеграции в среду научных вычислений с многими другими библиотеками третьих сторон.

Вот лишь некоторые из возможностей pandas:

  • Легкое обращение с пропущенными данными (представленными как NaN) в данных с плавающей запятой и не только
  • Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и объектов более высокой размерности
  • Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто пропустить метки и позволить Series, DataFrame, и т. д. автоматически выравнивать данные для вас в вычислениях
  • Мощная, гибкая функциональность группировки для выполнения операций разделения-применения-объединения над наборами данных, как для агрегирования, так и для преобразования данных
  • Упрощение преобразования неровных данных с различными индексами в других структурах данных Python и NumPy в объекты DataFrame
  • Интеллектуальное вырезание, fancy индексация и подмножества больших наборов данных
  • Интуитивное слияние и соединение наборов данных
  • Гибкое преобразование и поворот наборов данных
  • Иерархическое маркирование осей (возможно иметь несколько меток на каждой отметке)
  • Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделительных), файлов Excel, баз данных и сохранения/загрузки данных из сверхбыстрого формата HDF5
  • Функциональность, специфичная для временных рядов: генерация диапазонов дат и преобразование частоты, статистические характеристики скользящего окна, скользящие линейные регрессии, сдвиг дат и отставание и т. д.

Многие из этих принципов направлены на устранение недостатков, часто встречающихся при использовании других языков/средах научных исследований. Для специалистов по данным работа с данными обычно делится на несколько этапов: приведение данных в порядок и очистка, анализ/моделирование, а затем упорядочение результатов анализа в форму, подходящую для построения графиков или табличного отображения. pandas — идеальный инструмент для всех этих задач.

Дополнительные замечания

  • pandas быстрый. Многие низкоуровневые алгоритмические части были значительно улучшены в коде Cython. Однако, как и в любом другом случае, обобщение обычно жертвует производительностью. Поэтому, если вы сосредоточитесь на одной функции для своего приложения, вы сможете создать более быстрый специализированный инструмент.
  • pandas — зависимость от statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
  • pandas широко используется в производственных финансовых приложениях.

Примечание

Эта документация предполагает общее знакомство с NumPy. Если вы не пользовались NumPy, потратьте некоторое время на изучение NumPy сначала.

См. обзор пакета для получения более подробной информации о том, что содержится в библиотеке.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.19.2/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API