Установка
Самый простой способ установки pandas для большинства пользователей — установить его вместе с дистрибутивом Anaconda, кроссплатформенным дистрибутивом для анализа данных и научных вычислений. Это рекомендуемый способ установки для большинства пользователей.
Также предоставляются инструкции по установке из исходного кода, с PyPI, для различных дистрибутивов Linux или разработки версии.
Поддержка версий Python
Официально поддерживаются Python 2.7, 3.4, 3.5 и 3.6
Установка pandas
Установка pandas с Anaconda
Установка pandas и остального стека NumPy и SciPy может быть немного сложной для начинающих пользователей.
Самый простой способ установить не только pandas, но и Python, и наиболее популярные пакеты, составляющие стек SciPy (IPython, NumPy, Matplotlib, ...), — это использовать Anaconda, кроссплатформенное (Linux, Mac OS X, Windows) дистрибутив Python для аналитики данных и научных вычислений.
После запуска простого установщика пользователь получит доступ к pandas и остальному стеку SciPy, не устанавливая ничего другого и не дожидаясь компиляции какого-либо программного обеспечения.
Инструкции по установке Anaconda можно найти здесь.
Полный список пакетов, доступных в составе дистрибутива Anaconda, можно найти здесь.
Дополнительным преимуществом установки с Anaconda является то, что для этого не требуются права администратора, установка будет происходить в домашнем каталоге пользователя, а это также упрощает удаление Anaconda в будущем (достаточно удалить папку).
Установка pandas с Miniconda
В предыдущем разделе описано, как установить pandas в составе дистрибутива Anaconda. Однако такой подход означает, что вы установите более ста пакетов, и потребуется скачать установщик размером в несколько сотен мегабайт.
Если вы хотите иметь больший контроль над пакетами или у вас ограниченная пропускная способность интернета, установка pandas с Miniconda может быть лучшим решением.
Conda — менеджер пакетов, на котором основан дистрибутив Anaconda. Это менеджер пакетов, который является как кроссплатформенным, так и независимым от языка (он может выполнять схожую роль сочетания pip и virtualenv).
Miniconda позволяет создать минимальную автономную установку Python, а затем использовать команду Conda для установки дополнительных пакетов.
Сначала вам понадобится Conda. Скачать и запустить Miniconda вы сделаете это.
Установка доступна здесь.
Следующим шагом является создание новой среды conda (аналогично virtualenv, но она также позволяет точно указать версию Python, которую нужно установить). Выполните следующие команды из терминального окна:
conda create -n name_of_my_env python
Это создаст минимальную среду с установленным только Python. Чтобы попасть в эту среду, выполните:
source activate name_of_my_env
В Windows команда:
activate name_of_my_env
Последний необходимый шаг — установить pandas. Это можно сделать с помощью следующей команды:
conda install pandas
Для установки определенной версии pandas:
conda install pandas=0.13.1
Для установки других пакетов, например IPython:
conda install ipython
Для установки полного дистрибутива Anaconda:
conda install anaconda
Если вам нужны пакеты, которые доступны через pip, но не через conda, просто установите pip и используйте pip для установки этих пакетов:
conda install pip pip install django
Установка с PyPI
pandas можно установить через pip с PyPI.
pip install pandas
Вероятно, это потребует установки ряда зависимостей, включая NumPy, потребует компилятора для компиляции необходимых фрагментов кода и может занять несколько минут.
Установка с помощью менеджера пакетов вашей дистрибуции Linux
Команды в этой таблице установят pandas для Python 2 из вашего дистрибутива. Для установки pandas для Python 3 вам может потребоваться использовать пакет python3-pandas.
| Дистрибутив | Статус | Ссылка на скачивание/репозиторий | Метод установки |
|---|---|---|---|
| Debian | стабильная | официальный репозиторий Debian | sudo apt-get install python-pandas |
| Debian & Ubuntu | нестабильная (последние пакеты) | NeuroDebian | sudo apt-get install python-pandas |
| Ubuntu | стабильная | официальный репозиторий Ubuntu | sudo apt-get install python-pandas |
| Ubuntu | нестабильная (ежедневные сборки) |
PythonXY PPA; активируется: sudo add-apt-repository ppa:pythonxy/pythonxy-devel && sudo apt-get update
| sudo apt-get install python-pandas |
| OpenSuse | стабильная | Репозиторий OpenSuse | zypper in python-pandas |
| Fedora | стабильная | официальный репозиторий Fedora | dnf install python-pandas |
| Centos/RHEL | стабильная | репозиторий EPEL | yum install python-pandas |
Установка из исходного кода
См. документацию по участию для получения полных инструкций по сборке из дерева исходного кода git. Кроме того, см. создание среды разработки, если вы хотите создать среду разработки pandas.
Запуск набора тестов
pandas оснащён исчерпывающим набором модульных тестов, покрывающих около 97% кода на момент написания. Чтобы запустить его на вашем компьютере, чтобы проверить, что всё работает (и у вас установлены все зависимости, программные и аппаратные), убедитесь, что у вас установлен pytest, и запустите:
>>> import pandas as pd >>> pd.test() Running unit tests for pandas pandas version 0.18.0 numpy version 1.10.2 pandas is installed in pandas Python version 2.7.11 |Continuum Analytics, Inc.| (default, Dec 6 2015, 18:57:58) [GCC 4.2.1 (Apple Inc. build 5577)] nose version 1.3.7 ..................................................................S...... ........S................................................................ ......................................................................... ---------------------------------------------------------------------- Ran 9252 tests in 368.339s OK (SKIP=117)
Зависимости
- setuptools
- NumPy: 1.7.1 или выше
- python-dateutil: 1.5 или выше
- pytz: Требуется для поддержки часовых поясов
Рекомендуемые зависимости
-
numexpr: для ускорения некоторых числовых операций.
numexprиспользует несколько ядер, а также умное фрагментирование и кэширование для достижения значительного ускорения. При установке должна быть версии 2.4.6 или выше. -
bottleneck: для ускорения определённых типов
nanвычислений.bottleneckиспользует специализированные cython-функции для достижения значительного ускорения.
Примечание
Настоятельно рекомендуется установить эти библиотеки, так как они обеспечивают значительное ускорение, особенно при работе с большими наборами данных.
Необязательные зависимости
- Cython: Необходимо только для сборки версии для разработки. Версия 0.23 или выше.
- SciPy: различные статистические функции
- xarray: обработка данных с количеством измерений > 2, как в pandas, необходимо для преобразования панелей в объекты xarray. Рекомендуется версия 0.7.0 или выше.
- PyTables: необходимо для хранения данных в формате HDF5. Требуется версия 3.0.0 или выше, сильно рекомендуется версия 3.2.1 или выше.
- Feather Format: необходимо для хранения данных в формате feather, версия 0.3.1 или выше.
-
SQLAlchemy: для поддержки баз данных SQL. Рекомендуется версия 0.8.1 или выше. Помимо SQLAlchemy, вам также потребуется драйвер, специфичный для базы данных. Обзор поддерживаемых драйверов для каждого диалекта SQL можно найти в документации SQLAlchemy. Некоторые распространенные драйверы:
- matplotlib: для построения графиков
-
Для работы с Excel:
- xlrd/xlwt: чтение (xlrd) и запись (xlwt) Excel файлов
- openpyxl: openpyxl версии 1.6.1 или выше (но ниже 2.0.0), или версии 2.2 или выше, для записи файлов .xlsx (xlrd >= 0.9.0)
- XlsxWriter: Альтернативный модуль для записи в Excel
- Jinja2: Шаблонизатор для условного форматирования HTML.
- s3fs: необходим для доступа к Amazon S3 (s3fs >= 0.0.7).
-
blosc: для сжатия msgpack с использованием
blosc - Один из PyQt4, PySide, pygtk, xsel, или xclip: необходимо для использования
read_clipboard(). Большинство менеджеров пакетов в дистрибутивах Linux имеютxclipи/илиxselдля немедленной установки. - Для работы с Google BigQuery I/O - см. здесь
- Backports.lzma: Только для Python 2, для записи и/или чтения сжатого xz DataFrame в CSV; поддержка Python 3 включена в стандартную библиотеку.
-
Для использования функции верхнего уровня
read_html()необходима одна из следующих комбинаций библиотек:- BeautifulSoup4 и html5lib (Любая современная версия html5lib подойдёт.)
- BeautifulSoup4 и lxml
- BeautifulSoup4 и html5lib и lxml
- Только lxml, хотя см. Обработка HTML таблиц, для понимания причин, почему, вероятно, не стоит использовать этот подход.
Предупреждение
- Если вы установили BeautifulSoup4, вы должны установить либо lxml, либо html5lib, либо оба.
read_html()не будет работать с только установленным BeautifulSoup4. - Сильно рекомендуется прочитать Особые случаи при парсинге HTML таблиц. В нём объясняются проблемы, связанные с установкой и использованием трёх вышеперечисленных библиотек.
- Возможно, вам понадобится установить более старую версию BeautifulSoup4: Версии 4.2.1, 4.1.3 и 4.0.2 подтверждены для 64- и 32-разрядных Ubuntu/Debian
Примечание
-
Если у вас система с
apt-getвы можете выполнитьsudo apt-get build-dep python-lxml
чтобы получить необходимые зависимости для установки lxml. Это предотвратит будущие головные боли.
Примечание
Без дополнительных зависимостей многие полезные функции не будут работать. Поэтому настоятельно рекомендуется установить их. Рассмотрите возможность использования сборки с пакетами, такой как Anaconda или Enthought Canopy.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.20.3/install.html