Spec-Zone.ru › pandas 0.20

pandas

Дата: 07 июля 2017 г. Версия: 0.20.3

Установщики бинарных файлов: http://pypi.python.org/pypi/pandas

Репозиторий исходного кода: http://github.com/pandas-dev/pandas

Проблемы и идеи: https://github.com/pandas-dev/pandas/issues

Поддержка вопросов и ответов: http://stackoverflow.com/questions/tagged/pandas

Список рассылки разработчиков: http://groups.google.com/group/pydata

pandas — это пакет Python, обеспечивающий быстрые, гибкие и выразительные структуры данных, предназначенные для работы с «реляционными» или «мечеными» данными простым и интуитивно понятным способом. Он призван стать фундаментальным высокоуровневым строительным блоком для практического анализа данных в реальном мире с помощью Python. Кроме того, он имеет более широкую цель — стать самым мощным и гибким инструментом анализа и манипулирования данными с открытым исходным кодом, доступным на любом языке программирования. Он уже на пути к достижению этой цели.

pandas хорошо подходит для многих типов данных:

  • Табличные данные с гетерогенными типами столбцов, как в таблице SQL или электронной таблице Excel
  • Упорядоченные и неупорядоченные (не обязательно с фиксированной частотой) временные ряды.
  • Произвольные матричные данные (гомогенного или гетерогенного типа) со строковыми и столбцовыми метками
  • Любые другие формы набора данных наблюдений/статистики. Данные фактически не обязательно должны быть помечены для размещения в структуре данных pandas

Две основные структуры данных pandas, Series (одномерные) и DataFrame (двумерные), обрабатывают подавляющее большинство типичных случаев использования в финансовой сфере, статистике, социальных науках и многих областях инженерии. Для пользователей R, DataFrame предоставляет всё, что предоставляет R’s data.frame, и многое другое. pandas построен на основе NumPy и предназначен для хорошей интеграции в среду научных вычислений с многими другими сторонними библиотеками.

Вот лишь некоторые из задач, с которыми хорошо справляется pandas:

  • Простая обработка пропущенных данных (представленных как NaN) в данных с плавающей запятой и без нее
  • Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и объектов более высокой размерности
  • Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто игнорировать метки и позволить Series, DataFrame, и т. д. автоматически выравнивать данные для вас в вычислениях
  • Мощная, гибкая группировка для выполнения операций разделения-применения-комбинирования на наборах данных для агрегирования и преобразования данных
  • Упростить преобразование нерегулярных данных с различными индексами в других структурах данных Python и NumPy в объекты DataFrame
  • Интеллектуальное фрагментирование, индексирование и подмножества больших наборов данных на основе меток
  • Интуитивное слияние и объединение наборов данных
  • Гибкая реструктуризация и создание сводных таблиц наборов данных
  • Иерархическая маркировка осей (возможность иметь несколько меток на каждой метке)
  • Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделителей), файлов Excel, баз данных и сохранения/загрузки данных из сверхбыстрого формата HDF5
  • Функциональные возможности, специфичные для временных рядов: генерация диапазонов дат и преобразование частот, статистические данные скользящего окна, линейная регрессия скользящего окна, сдвиг дат и лагирования и т. д.

Многие из этих принципов предназначены для решения проблем, часто возникающих при использовании других языков/сред научных исследований. Для специалистов по данным работа с данными обычно делится на несколько этапов: подготовка и очистка данных, их анализ/моделирование, затем организация результатов анализа в форму, подходящую для построения графиков или табличного отображения. pandas — идеальный инструмент для всех этих задач.

Дополнительные замечания

  • pandas быстрый. Многие низкоуровневые алгоритмические фрагменты были значительно улучшены в коде Cython. Однако, как и в любом другом случае, обобщение обычно приводит к снижению производительности. Поэтому, если вы сосредоточитесь на одной функции для своего приложения, вы сможете создать более быстрый специализированный инструмент.
  • pandas является зависимостью statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
  • pandas широко используется в производственных финансовых приложениях.

Примечание

Эта документация предполагает общее знакомство с NumPy. Если вы мало или совсем не пользовались NumPy, сначала уделите время изучению NumPy.

Для получения более подробной информации о библиотеке см. обзор пакета.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API