Spec-Zone.ru › pandas 0.18

pandas

Дата: 03 мая 2016 Версия: 0.18.1

Бинарные установщики: http://pypi.python.org/pypi/pandas

Репозиторий исходного кода: http://github.com/pydata/pandas

Вопросы и идеи: https://github.com/pydata/pandas/issues

Поддержка Q&A: http://stackoverflow.com/questions/tagged/pandas

Список рассылки разработчиков: http://groups.google.com/group/pydata

pandas — пакет Python, обеспечивающий быстрые, гибкие и выразительные структуры данных, разработанные для лёгкой и интуитивно понятной работы с «реляционными» или «мечеными» данными. Он призван стать фундаментальным инструментом высокого уровня для практического анализа данных в реальном мире с использованием Python. Кроме того, он преследует более широкую цель — стать наиболее мощным и гибким инструментом анализа и обработки данных с открытым исходным кодом, доступным на любом языке. Он уже уверенно движется к достижению этой цели.

pandas хорошо подходит для многих типов данных:

  • Табличные данные с разнородными типами столбцов, как в таблице SQL или электронной таблице Excel
  • Последовательности данных во времени, упорядоченные и неупорядоченные (не обязательно с фиксированной частотой).
  • Произвольные матричные данные (однородного или разнородного типа) с метками строк и столбцов
  • Любые другие наборы наблюдаемых/статистических данных. Данные фактически не обязательно должны быть помечены, чтобы быть размещёнными в структуре данных pandas

Две основные структуры данных pandas, Series (одномерная) и DataFrame (двумерная), обрабатывают подавляющее большинство типичных случаев использования в финансах, статистике, социальных науках и многих областях техники. Для пользователей R, DataFrame предоставляет всё, что предоставляет data.frame, и многое другое. pandas построен поверх NumPy и предназначен для эффективной интеграции в среду научных вычислений с множеством других сторонних библиотек.

Вот лишь некоторые из того, что хорошо делает pandas:

  • Легкая обработка пропущенных данных (представленных как NaN) в данных с плавающей точкой, а также в данных без плавающей точкой
  • Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и объектов более высокой размерности
  • Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто игнорировать метки и позволить Series, DataFrame, и т. д. автоматически выравнивать данные для вычислений
  • Мощная, гибкая функция группировки для выполнения операций разделения-применения-комбинирования над наборами данных, как для агрегирования, так и для преобразования данных
  • Упрощение преобразования фрагментированных, имеющих разные индексы данных в других структурах данных Python и NumPy в объекты DataFrame
  • Интеллектуальный срез, индексирование и подмножество данных больших наборов данных на основе меток
  • Интуитивное объединение и присоединение наборов данных
  • Гибкая перестройка и сводка наборов данных
  • Иерархическая маркировка осей (возможность иметь несколько меток на каждом делении)
  • Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделителей), файлов Excel, баз данных и сохранения/загрузки данных из сверхбыстрого формата HDF5
  • Функциональность, специфичная для временных рядов: генерация диапазонов дат и преобразование частоты, статистические данные скользящего окна, линейные регрессии скользящего окна, сдвиг дат и отставание и т.д.

Многие из этих принципов предназначены для устранения недостатков, часто возникающих при использовании других языков/сред научных исследований. Для специалистов по данным работа с данными обычно делится на несколько этапов: подготовка и очистка данных, их анализ/моделирование, а затем организация результатов анализа в форму, подходящую для построения графиков или табличного отображения. pandas — идеальный инструмент для всех этих задач.

Некоторые другие замечания

  • pandas — быстрый. Многие низкоуровневые алгоритмические элементы были существенно улучшены на языке Cython. Однако, как и в любом другом случае, обобщение обычно приводит к потере производительности. Поэтому, если вы сосредоточитесь на одной функции для своего приложения, вы сможете создать более специализированный и быстрый инструмент.
  • pandas — зависимость от statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
  • pandas широко используется в финансовых приложениях.

Примечание

Это документация предполагает общее знакомство с NumPy. Если вы не работали с NumPy или работали с ним мало, потратьте время на изучение NumPy сначала.

См. обзор пакета для получения более подробной информации о содержимом библиотеки.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API