Spec-Zone.ru › pandas 0.23

pandas

Дата: 05 авг. 2018 г. Версия: 0.23.4

Двоичные установщики: https://pypi.org/project/pandas

Репозиторий исходного кода: http://github.com/pandas-dev/pandas

Проблемы и идеи: https://github.com/pandas-dev/pandas/issues

Поддержка вопросов и ответов: http://stackoverflow.com/questions/tagged/pandas

Список рассылки разработчиков: http://groups.google.com/group/pydata

pandas — пакет Python, предоставляющий быстрые, гибкие и выразительные структуры данных, предназначенные для удобной и интуитивной работы с «реляционными» или «мечеными» данными. Он призван стать фундаментальным высокоуровневым строительным блоком для практического анализа данных в реальном мире на языке Python. Кроме того, он преследует более широкую цель — стать самым мощным и гибким инструментом анализа и обработки данных с открытым исходным кодом, доступным на любом языке. Он уже движется к этой цели.

pandas хорошо подходит для многих типов данных:

  • Табличные данные с разнородными столбцами, как в таблице SQL или электронных таблицах Excel
  • Упорядоченные и неупорядоченные (не обязательно с фиксированной частотой) временные ряды.
  • Произвольные матричные данные (однородные или разнородные) с метками строк и столбцов
  • Любые другие формы набора данных наблюдений / статистики. Данные фактически не должны быть помечены, чтобы их можно было поместить в структуру данных pandas

Две основные структуры данных pandas, Series (одномерные) и DataFrame (двумерные), обрабатывают подавляющее большинство типичных случаев использования в финансах, статистике, социальных науках и многих областях техники. Для пользователей R DataFrame предоставляет все, что предоставляет R’s data.frame, и многое другое. pandas построен поверх NumPy и предназначен для хорошей интеграции в среду научных вычислений с многими другими сторонними библиотеками.

Вот лишь некоторые из того, что pandas делает хорошо:

  • Легкая обработка пропущенных данных (представленных как NaN) в данных с плавающей запятой и нечисловых данных
  • Изменяемость размера: столбцы могут быть вставлены и удалены из DataFrame и объектов более высокой размерности
  • Автоматическое и явное выравнивание данных: объекты могут быть явно выровнены по набору меток, или пользователь может просто пропустить метки и позволить Series, DataFrame, и т. д. автоматически выровнять данные для вас в вычислениях
  • Мощная, гибкая функциональность group by для выполнения операций split-apply-combine на наборах данных, как для агрегирования, так и для преобразования данных
  • Упрощение преобразования фрагментированных, имеющих разные индексы данных в других структурах данных Python и NumPy в объекты DataFrame
  • Интеллектуальное извлечение срезов, индексация с помощью произвольного набора элементов и выделение подмножеств больших наборов данных
  • Интуитивное слияние и соединение наборов данных
  • Гибкое преобразование формы и поворот наборов данных
  • Иерархическая маркировка осей (возможность иметь несколько меток на тике)
  • Надежные инструменты ввода-вывода для загрузки данных из плоских файлов (CSV и разделителями), файлов Excel, баз данных и сохранения/загрузки данных из сверхбыстрого формата HDF5
  • Функциональность временных рядов: генерация диапазонов дат и преобразование частоты, статистика скользящего окна, скользящие линейные регрессии, сдвиги дат и задержки и т.д.

Многие из этих принципов здесь для решения недостатков, часто возникающих при использовании других языков/сред научных исследований. Для ученых данных работа с данными обычно делится на несколько этапов: подготовка и очистка данных, анализ/моделирование, а затем организация результатов анализа в форму, подходящую для построения графиков или табличного отображения. pandas — идеальный инструмент для всех этих задач.

Некоторые другие замечания

  • pandas быстрый. Многие низкоуровневые алгоритмические детали были значительно улучшены в коде Cython. Однако, как и в любом другом случае, обобщение обычно жертвует производительностью. Поэтому, если вы сосредоточитесь на одной функции для своего приложения, вы сможете создать более специализированный и быстрый инструмент.
  • pandas является зависимостью statsmodels, что делает его важной частью экосистемы статистических вычислений в Python.
  • pandas широко используется в производственных финансовых приложениях.

Примечание

Эта документация предполагает общую осведомленность с NumPy. Если вы не очень много или совсем не работали с NumPy, сначала потратьте некоторое время на ознакомление с NumPy.

См. обзор пакета для получения более подробной информации о том, что входит в библиотеку.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.23.4/index.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API