Spec-Zone.ru › pandas 0.20

Установка

Самый простой способ установки pandas для большинства пользователей — установить его вместе с дистрибутивом Anaconda, кроссплатформенным дистрибутивом для анализа данных и научных вычислений. Это рекомендуемый способ установки для большинства пользователей.

Также предоставляются инструкции по установке из исходного кода, с PyPI, для различных дистрибутивов Linux или разработки версии.

Поддержка версий Python

Официально поддерживаются Python 2.7, 3.4, 3.5 и 3.6

Установка pandas

Установка pandas с Anaconda

Установка pandas и остального стека NumPy и SciPy может быть немного сложной для начинающих пользователей.

Самый простой способ установить не только pandas, но и Python, и наиболее популярные пакеты, составляющие стек SciPy (IPython, NumPy, Matplotlib, ...), — это использовать Anaconda, кроссплатформенное (Linux, Mac OS X, Windows) дистрибутив Python для аналитики данных и научных вычислений.

После запуска простого установщика пользователь получит доступ к pandas и остальному стеку SciPy, не устанавливая ничего другого и не дожидаясь компиляции какого-либо программного обеспечения.

Инструкции по установке Anaconda можно найти здесь.

Полный список пакетов, доступных в составе дистрибутива Anaconda, можно найти здесь.

Дополнительным преимуществом установки с Anaconda является то, что для этого не требуются права администратора, установка будет происходить в домашнем каталоге пользователя, а это также упрощает удаление Anaconda в будущем (достаточно удалить папку).

Установка pandas с Miniconda

В предыдущем разделе описано, как установить pandas в составе дистрибутива Anaconda. Однако такой подход означает, что вы установите более ста пакетов, и потребуется скачать установщик размером в несколько сотен мегабайт.

Если вы хотите иметь больший контроль над пакетами или у вас ограниченная пропускная способность интернета, установка pandas с Miniconda может быть лучшим решением.

Conda — менеджер пакетов, на котором основан дистрибутив Anaconda. Это менеджер пакетов, который является как кроссплатформенным, так и независимым от языка (он может выполнять схожую роль сочетания pip и virtualenv).

Miniconda позволяет создать минимальную автономную установку Python, а затем использовать команду Conda для установки дополнительных пакетов.

Сначала вам понадобится Conda. Скачать и запустить Miniconda вы сделаете это.

Установка доступна здесь.

Следующим шагом является создание новой среды conda (аналогично virtualenv, но она также позволяет точно указать версию Python, которую нужно установить). Выполните следующие команды из терминального окна:

conda create -n name_of_my_env python

Это создаст минимальную среду с установленным только Python. Чтобы попасть в эту среду, выполните:

source activate name_of_my_env

В Windows команда:

activate name_of_my_env

Последний необходимый шаг — установить pandas. Это можно сделать с помощью следующей команды:

conda install pandas

Для установки определенной версии pandas:

conda install pandas=0.13.1

Для установки других пакетов, например IPython:

conda install ipython

Для установки полного дистрибутива Anaconda:

conda install anaconda

Если вам нужны пакеты, которые доступны через pip, но не через conda, просто установите pip и используйте pip для установки этих пакетов:

conda install pip
pip install django

Установка с PyPI

pandas можно установить через pip с PyPI.

pip install pandas

Вероятно, это потребует установки ряда зависимостей, включая NumPy, потребует компилятора для компиляции необходимых фрагментов кода и может занять несколько минут.

Установка с помощью менеджера пакетов вашей дистрибуции Linux

Команды в этой таблице установят pandas для Python 2 из вашего дистрибутива. Для установки pandas для Python 3 вам может потребоваться использовать пакет python3-pandas.

Дистрибутив Статус Ссылка на скачивание/репозиторий Метод установки
Debian стабильная официальный репозиторий Debian sudo apt-get install python-pandas
Debian & Ubuntu нестабильная (последние пакеты) NeuroDebian sudo apt-get install python-pandas
Ubuntu стабильная официальный репозиторий Ubuntu sudo apt-get install python-pandas
Ubuntu нестабильная (ежедневные сборки) PythonXY PPA; активируется: sudo add-apt-repository ppa:pythonxy/pythonxy-devel && sudo apt-get update sudo apt-get install python-pandas
OpenSuse стабильная Репозиторий OpenSuse zypper in  python-pandas
Fedora стабильная официальный репозиторий Fedora dnf install python-pandas
Centos/RHEL стабильная репозиторий EPEL yum install python-pandas

Установка из исходного кода

См. документацию по участию для получения полных инструкций по сборке из дерева исходного кода git. Кроме того, см. создание среды разработки, если вы хотите создать среду разработки pandas.

Запуск набора тестов

pandas оснащён исчерпывающим набором модульных тестов, покрывающих около 97% кода на момент написания. Чтобы запустить его на вашем компьютере, чтобы проверить, что всё работает (и у вас установлены все зависимости, программные и аппаратные), убедитесь, что у вас установлен pytest, и запустите:

>>> import pandas as pd
>>> pd.test()
Running unit tests for pandas
pandas version 0.18.0
numpy version 1.10.2
pandas is installed in pandas
Python version 2.7.11 |Continuum Analytics, Inc.|
   (default, Dec  6 2015, 18:57:58) [GCC 4.2.1 (Apple Inc. build 5577)]
nose version 1.3.7
..................................................................S......
........S................................................................
.........................................................................

----------------------------------------------------------------------
Ran 9252 tests in 368.339s

OK (SKIP=117)

Зависимости

  • setuptools
  • NumPy: 1.7.1 или выше
  • python-dateutil: 1.5 или выше
  • pytz: Требуется для поддержки часовых поясов

Рекомендуемые зависимости

  • numexpr: для ускорения некоторых числовых операций. numexpr использует несколько ядер, а также умное фрагментирование и кэширование для достижения значительного ускорения. При установке должна быть версии 2.4.6 или выше.
  • bottleneck: для ускорения определённых типов nan вычислений. bottleneck использует специализированные cython-функции для достижения значительного ускорения.

Примечание

Настоятельно рекомендуется установить эти библиотеки, так как они обеспечивают значительное ускорение, особенно при работе с большими наборами данных.

Необязательные зависимости

  • Cython: Необходимо только для сборки версии для разработки. Версия 0.23 или выше.
  • SciPy: различные статистические функции
  • xarray: обработка данных с количеством измерений > 2, как в pandas, необходимо для преобразования панелей в объекты xarray. Рекомендуется версия 0.7.0 или выше.
  • PyTables: необходимо для хранения данных в формате HDF5. Требуется версия 3.0.0 или выше, сильно рекомендуется версия 3.2.1 или выше.
  • Feather Format: необходимо для хранения данных в формате feather, версия 0.3.1 или выше.
  • SQLAlchemy: для поддержки баз данных SQL. Рекомендуется версия 0.8.1 или выше. Помимо SQLAlchemy, вам также потребуется драйвер, специфичный для базы данных. Обзор поддерживаемых драйверов для каждого диалекта SQL можно найти в документации SQLAlchemy. Некоторые распространенные драйверы:

    • psycopg2: для PostgreSQL
    • pymysql: для MySQL.
    • SQLite: для SQLite, по умолчанию входит в стандартную библиотеку Python.
  • matplotlib: для построения графиков
  • Для работы с Excel:

    • xlrd/xlwt: чтение (xlrd) и запись (xlwt) Excel файлов
    • openpyxl: openpyxl версии 1.6.1 или выше (но ниже 2.0.0), или версии 2.2 или выше, для записи файлов .xlsx (xlrd >= 0.9.0)
    • XlsxWriter: Альтернативный модуль для записи в Excel
  • Jinja2: Шаблонизатор для условного форматирования HTML.
  • s3fs: необходим для доступа к Amazon S3 (s3fs >= 0.0.7).
  • blosc: для сжатия msgpack с использованием blosc
  • Один из PyQt4, PySide, pygtk, xsel, или xclip: необходимо для использования read_clipboard(). Большинство менеджеров пакетов в дистрибутивах Linux имеют xclip и/или xsel для немедленной установки.
  • Для работы с Google BigQuery I/O - см. здесь
  • Backports.lzma: Только для Python 2, для записи и/или чтения сжатого xz DataFrame в CSV; поддержка Python 3 включена в стандартную библиотеку.
  • Для использования функции верхнего уровня read_html() необходима одна из следующих комбинаций библиотек:

    • BeautifulSoup4 и html5lib (Любая современная версия html5lib подойдёт.)
    • BeautifulSoup4 и lxml
    • BeautifulSoup4 и html5lib и lxml
    • Только lxml, хотя см. Обработка HTML таблиц, для понимания причин, почему, вероятно, не стоит использовать этот подход.

    Предупреждение

    • Если вы установили BeautifulSoup4, вы должны установить либо lxml, либо html5lib, либо оба. read_html() не будет работать с только установленным BeautifulSoup4.
    • Сильно рекомендуется прочитать Особые случаи при парсинге HTML таблиц. В нём объясняются проблемы, связанные с установкой и использованием трёх вышеперечисленных библиотек.
    • Возможно, вам понадобится установить более старую версию BeautifulSoup4: Версии 4.2.1, 4.1.3 и 4.0.2 подтверждены для 64- и 32-разрядных Ubuntu/Debian

    Примечание

    • Если у вас система с apt-get вы можете выполнить

      sudo apt-get build-dep python-lxml
      

      чтобы получить необходимые зависимости для установки lxml. Это предотвратит будущие головные боли.

Примечание

Без дополнительных зависимостей многие полезные функции не будут работать. Поэтому настоятельно рекомендуется установить их. Рассмотрите возможность использования сборки с пакетами, такой как Anaconda или Enthought Canopy.

© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/install.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API