Установка
Наиболее простой способ установки pandas для большинства пользователей — это установка его как части дистрибутива Anaconda, кроссплатформенного дистрибутива для анализа данных и научных вычислений. Это рекомендуемый метод установки для большинства пользователей.
Также предоставляются инструкции по установке из исходного кода, с PyPI, с использованием различных дистрибутивов Linux или разработкой версии.
Поддержка версий Python
Официально поддерживаются Python 2.7, 3.5 и 3.6.
Установка pandas
Установка pandas с Anaconda
Установка pandas и остальной части стека NumPy и SciPy может быть немного сложной для неопытных пользователей.
Самый простой способ установить не только pandas, но и Python и самые популярные пакеты, составляющие стек SciPy (IPython, NumPy, Matplotlib, ...) — с Anaconda, кроссплатформенным (Linux, Mac OS X, Windows) дистрибутивом Python для анализа данных и научных вычислений.
После запуска простого установщика пользователю будет доступен pandas и остальная часть стека SciPy без необходимости установки чего-либо ещё и без необходимости ожидания компиляции какого-либо программного обеспечения.
Инструкции по установке Anaconda можно найти здесь.
Полный список пакетов, доступных в составе дистрибутива Anaconda, можно найти здесь.
Дополнительным преимуществом установки с Anaconda является то, что вам не требуются права администратора для его установки, он будет установлен в домашний каталог пользователя, что также упрощает удаление Anaconda в будущем (просто удалите эту папку).
Установка pandas с Miniconda
В предыдущем разделе описано, как установить pandas как часть дистрибутива Anaconda. Однако такой подход означает, что вы установите более ста пакетов и потребует скачивания установщика размером несколько сотен мегабайт.
Если вы хотите иметь больший контроль над тем, какие пакеты использовать, или у вас ограниченная пропускная способность интернета, то установка pandas с Miniconda может быть лучшим решением.
Conda — это менеджер пакетов, на котором основан дистрибутив Anaconda. Это менеджер пакетов, который является как кроссплатформенным, так и независимым от языка (он может выполнять аналогичную роль комбинации pip и virtualenv).
Miniconda позволяет создавать минимальную автономную установку Python, а затем использовать команду Conda для установки дополнительных пакетов.
Сначала вам нужно установить Conda, а скачивание и запуск Miniconda сделает это за вас. Установщик можно найти здесь
Следующим шагом является создание новой среды conda (они аналогичны virtualenv, но также позволяют точно указать, какую версию Python установить). Выполните следующие команды из командной строки:
conda create -n name_of_my_env python
Это создаст минимальную среду только с установленным Python. Чтобы перейти в эту среду, выполните:
source activate name_of_my_env
В Windows команда имеет вид:
activate name_of_my_env
Последний необходимый шаг — установка pandas. Это можно сделать с помощью следующей команды:
conda install pandas
Для установки определенной версии pandas:
conda install pandas=0.20.3
Для установки других пакетов, например IPython:
conda install ipython
Для установки полного дистрибутива Anaconda:
conda install anaconda
Если вам нужны пакеты, доступные через pip, но не через conda, просто установите pip и используйте pip для установки этих пакетов:
conda install pip pip install django
Установка с PyPI
pandas можно установить через pip с PyPI.
pip install pandas
Это, вероятно, потребует установки ряда зависимостей, включая NumPy, потребует компилятора для компиляции необходимых фрагментов кода и может занять несколько минут.
Установка с помощью менеджера пакетов вашей дистрибуции Linux.
Команды в этой таблице установят pandas для Python 3 с вашего дистрибутива. Для установки pandas для Python 2 вам может потребоваться использовать пакет python-pandas.
| Дистрибутив | Статус | Ссылка на загрузку/репозиторий | Метод установки |
|---|---|---|---|
| Debian | stable | официальный репозиторий Debian | sudo apt-get install python3-pandas |
| Debian & Ubuntu | unstable (последние пакеты) | NeuroDebian | sudo apt-get install python3-pandas |
| Ubuntu | stable | официальный репозиторий Ubuntu | sudo apt-get install python3-pandas |
| OpenSuse | stable | Репозиторий OpenSuse | zypper in python3-pandas |
| Fedora | stable | официальный репозиторий Fedora | dnf install python3-pandas |
| Centos/RHEL | stable | репозиторий EPEL | yum install python3-pandas |
Однако пакеты в менеджерах пакетов Linux часто отстают на несколько версий, поэтому для получения последней версии pandas рекомендуется использовать методы pip или conda.
Установка из исходного кода
См. документацию по участию для получения полных инструкций по сборке из исходного дерева git. Кроме того, см. создание среды разработки, если вы хотите создать среду разработки pandas.
Запуск набора тестов
pandas оснащен исчерпывающим набором юнит-тестов, охватывающим около 97% кода на момент написания. Чтобы запустить его на своем компьютере и убедиться, что все работает (и у вас установлены все зависимости, программные и аппаратные), убедитесь, что у вас есть pytest и запустите:
>>> import pandas as pd >>> pd.test() running: pytest --skip-slow --skip-network C:\Users\TP\Anaconda3\envs\py36\lib\site-packages\pandas ============================= test session starts ============================= platform win32 -- Python 3.6.2, pytest-3.2.1, py-1.4.34, pluggy-0.4.0 rootdir: C:\Users\TP\Documents\Python\pandasdev\pandas, inifile: setup.cfg collected 12145 items / 3 skipped ..................................................................S...... ........S................................................................ ......................................................................... ==================== 12130 passed, 12 skipped in 368.339 seconds =====================
Зависимости
- setuptools
- NumPy: 1.9.0 или выше
- python-dateutil: 1.5 или выше
- pytz: Необходим для поддержки часовых поясов
Рекомендованные зависимости
-
numexpr: для ускорения некоторых числовых операций.
numexprиспользует несколько ядер, а также интеллектуальное дробление и кэширование для достижения больших приростов скорости. Если установлен, должна быть версия 2.4.6 или выше. -
bottleneck: для ускорения некоторых типов
nanвычислений.bottleneckиспользует специализированные цитоновые процедуры для достижения больших приростов скорости. Если установлен, должна быть версия 1.0.0 или выше.
Примечание
Мы настоятельно рекомендуем установить эти библиотеки, так как они обеспечивают значительные приросты скорости, особенно при работе с большими наборами данных.
Дополнительные зависимости
- Cython: Необходим только для сборки версии для разработчиков. Версия 0.23 или выше.
- SciPy: различные статистические функции, Версия 0.14.0 или выше
- xarray: обработка данных, подобная pandas, для > 2 измерений, необходима для преобразования панелей в объекты xarray. Рекомендуется версия 0.7.0 или выше.
- PyTables: необходим для хранения данных в формате HDF5. Требуется версия 3.0.0 или выше, сильно рекомендуется версия 3.2.1 или выше.
- Формат Feather: необходим для хранения данных в формате feather, версия 0.3.1 или выше.
- Apache Parquet, либо pyarrow (>= 0.4.1), либо fastparquet (>= 0.0.6) для хранения данных в формате parquet. Для поддержки сжатия доступны snappy и brotli.
-
SQLAlchemy: для поддержки баз данных SQL. Рекомендуется версия 0.8.1 или выше. Помимо SQLAlchemy, вам также нужен драйвер, специфичный для базы данных. Обзор поддерживаемых драйверов для каждого диалекта SQL можно найти в документации SQLAlchemy. Некоторые распространенные драйверы:
- matplotlib: для построения графиков, Версия 1.4.3 или выше.
-
Для работы с Excel:
- xlrd/xlwt: чтение (xlrd) и запись (xlwt) Excel файлов
- openpyxl: openpyxl версии 1.6.1 или выше (но ниже 2.0.0), или версия 2.2 или выше, для записи файлов .xlsx (xlrd >= 0.9.0)
- XlsxWriter: альтернативный инструмент для записи в Excel
- Jinja2: движок шаблонов для условного форматирования HTML.
- s3fs: необходим для доступа к Amazon S3 (s3fs >= 0.0.7).
-
blosc: для сжатия msgpack с использованием
blosc - Один из PyQt4, PySide, pygtk, xsel или xclip: необходим для использования
read_clipboard(). Большинство менеджеров пакетов в дистрибутивах Linux обеспечатxclipи/илиxselдля немедленной установки. - pandas-gbq: для работы с Google BigQuery.
- Backports.lzma: Только для Python 2, для записи в сжатый xz CSV DataFrame или чтения из него; поддержка Python 3 встроена в стандартную библиотеку.
-
Для использования функции верхнего уровня
read_html()требуется одна из следующих комбинаций библиотек:- BeautifulSoup4 и html5lib (Любая последняя версия html5lib подойдет.)
- BeautifulSoup4 и lxml
- BeautifulSoup4 и html5lib и lxml
- Только lxml, хотя см. Обработка HTML-таблиц по причинам, почему вы, вероятно, не должны использовать этот подход.
Предупреждение
- Если вы установили BeautifulSoup4, вы должны установить либо lxml, либо html5lib, либо оба.
read_html()не будет работать с только установленной BeautifulSoup4. - Сильно рекомендуется прочитать Трюки при обработке HTML-таблиц. Он объясняет проблемы, связанные с установкой и использованием перечисленных выше трех библиотек.
- Возможно, потребуется установить более старую версию BeautifulSoup4: Версии 4.2.1, 4.1.3 и 4.0.2 подтверждены для 64- и 32-битных Ubuntu/Debian
Примечание
-
Если у вас система с
apt-getвы можете выполнитьsudo apt-get build-dep python-lxml
чтобы получить необходимые зависимости для установки lxml. Это предотвратит дальнейшие сложности в будущем.
Примечание
Без дополнительных зависимостей многие полезные функции не будут работать. Поэтому настоятельно рекомендуется их установить. Рассмотрите возможность использования пакетированного дистрибутива, такого как Anaconda или Enthought Canopy.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.21.1/install.html