Установка
Самый простой способ установить pandas для большинства пользователей — установить его вместе с дистрибутивом Anaconda, кроссплатформенным дистрибутивом для анализа данных и научных вычислений. Это рекомендуемый метод установки для большинства пользователей.
Также предоставлены инструкции по установке из исходного кода, с PyPI, с различными дистрибутивами Linux или с разработчиком.
Поддержка версий Python
Официально поддерживаются Python 2.7, 3.5 и 3.6.
Установка pandas
Установка pandas с Anaconda
Установка pandas и остальной части стека NumPy и SciPy может быть немного сложной для начинающих пользователей.
Самый простой способ установить не только pandas, но и Python и самые популярные пакеты, составляющие стек SciPy (IPython, NumPy, Matplotlib, ...) — это использовать Anaconda, кроссплатформенный (Linux, Mac OS X, Windows) дистрибутив Python для анализа данных и научных вычислений.
После запуска простого установщика пользователь получит доступ к pandas и остальной части стека SciPy без необходимости установки чего-либо ещё и без необходимости ожидания компиляции программного обеспечения.
Инструкции по установке Anaconda можно найти здесь.
Полный список пакетов, доступных в составе дистрибутива Anaconda, можно найти здесь.
Дополнительным преимуществом установки с Anaconda является то, что для этого не требуются права администратора, установка будет происходить в домашнем каталоге пользователя, а также это упрощает удаление Anaconda в будущем (просто удалите папку).
Установка pandas с Miniconda
В предыдущем разделе описывается, как установить pandas в составе дистрибутива Anaconda. Однако этот подход означает, что вы установите более ста пакетов, и потребуется загрузить установщик, размер которого составляет несколько сотен мегабайт.
Если вы хотите иметь больший контроль над пакетами или у вас ограниченная пропускная способность интернета, то установка pandas с Miniconda может быть лучшим решением.
Conda — это менеджер пакетов, на котором основан дистрибутив Anaconda. Это менеджер пакетов, который является кроссплатформенным и независимым от языка (он может выполнять аналогичную роль комбинации pip и virtualenv).
Miniconda позволяет создать минимальную автономную установку Python, а затем использовать команду Conda для установки дополнительных пакетов.
Сначала вам нужно установить Conda, а загрузка и запуск Miniconda сделают это за вас. Установщик можно найти здесь
Следующим шагом является создание новой среды conda (они аналогичны virtualenv, но также позволяют точно указать, какую версию Python установить). Выполните следующие команды в окне терминала:
conda create -n name_of_my_env python
Это создаст минимальную среду с установленным только Python. Чтобы попасть в эту среду, выполните:
source activate name_of_my_env
В Windows команда выглядит следующим образом:
activate name_of_my_env
Последним необходимым шагом является установка pandas. Это можно сделать с помощью следующей команды:
conda install pandas
Для установки определенной версии pandas:
conda install pandas=0.20.3
Для установки других пакетов, например, IPython:
conda install ipython
Для установки полного дистрибутива Anaconda:
conda install anaconda
Если вам нужны какие-либо пакеты, доступные в pip, но не в conda, просто установите pip и используйте pip для установки этих пакетов:
conda install pip pip install django
Установка с PyPI
pandas можно установить через pip с PyPI.
pip install pandas
Это, вероятно, потребует установки ряда зависимостей, включая NumPy, потребует компилятора для компиляции необходимых фрагментов кода и может занять несколько минут.
Установка с помощью менеджера пакетов вашей дистрибуции Linux.
Команды в этой таблице установят pandas для Python 3 из вашего дистрибутива. Для установки pandas для Python 2 вам может потребоваться использовать пакет python-pandas.
| Дистрибутив | Статус | Ссылка на загрузку/репозиторий | Способ установки |
|---|---|---|---|
| Debian | стабильная версия | официальный репозиторий Debian | sudo apt-get install python3-pandas |
| Debian & Ubuntu | нестабильная (самые свежие пакеты) | NeuroDebian | sudo apt-get install python3-pandas |
| Ubuntu | стабильная версия | официальный репозиторий Ubuntu | sudo apt-get install python3-pandas |
| OpenSuse | стабильная версия | OpenSuse Repository | zypper in python3-pandas |
| Fedora | стабильная версия | официальный репозиторий Fedora | dnf install python3-pandas |
| Centos/RHEL | стабильная версия | EPEL репозиторий | yum install python3-pandas |
Однако, пакеты в менеджерах пакетов Linux часто отстают на несколько версий, поэтому для получения самой последней версии pandas рекомендуется использовать методы pip или conda выше.
Установка из исходного кода
См. документацию по участию для получения полных инструкций по сборке из исходного дерева git. Кроме того, см. создание среды разработки, если вы хотите создать среду разработки pandas.
Запуск набора тестов
pandas оснащён исчерпывающим набором юнит-тестов, охватывающим около 97% кодовой базы на момент написания данной документации. Чтобы запустить его на вашем компьютере, чтобы убедиться, что всё работает (и у вас установлены все зависимости, программные и аппаратные), убедитесь, что у вас установлен pytest и выполните:
>>> import pandas as pd >>> pd.test() running: pytest --skip-slow --skip-network C:\Users\TP\Anaconda3\envs\py36\lib\site-packages\pandas ============================= test session starts ============================= platform win32 -- Python 3.6.2, pytest-3.2.1, py-1.4.34, pluggy-0.4.0 rootdir: C:\Users\TP\Documents\Python\pandasdev\pandas, inifile: setup.cfg collected 12145 items / 3 skipped ..................................................................S...... ........S................................................................ ......................................................................... ==================== 12130 passed, 12 skipped in 368.339 seconds =====================
Зависимости
- setuptools
- NumPy: 1.9.0 или выше
- python-dateutil: 1.5 или выше
- pytz: Необходим для поддержки часовых поясов
Рекомендуемые зависимости
-
numexpr: для ускорения определённых числовых операций.
numexprиспользует несколько ядер, а также интеллектуальное дробление и кэширование для достижения значительного ускорения. При установке версия должна быть 2.4.6 или выше. -
bottleneck: для ускорения определённых типов
nanвычислений.bottleneckиспользует специализированные циклоны для достижения значительного ускорения. При установке версия должна быть 1.0.0 или выше.
Примечание
Мы настоятельно рекомендуем установить эти библиотеки, поскольку они обеспечивают значительное ускорение, особенно при работе с большими наборами данных.
Дополнительные зависимости
- Cython: Необходим только для сборки версии для разработчиков. Версия 0.23 или выше.
- SciPy: различные статистические функции, Версия 0.14.0 или выше
- xarray: обработка данных, подобная pandas, для > 2 измерений, необходима для преобразования панелей в объекты xarray. Рекомендуется версия 0.7.0 или выше.
- PyTables: необходим для хранения данных в формате HDF5. Требуется версия 3.0.0 или выше, сильно рекомендуется версия 3.2.1 или выше.
- Формат Feather: необходим для хранения данных в формате feather, версия 0.3.1 или выше.
- Apache Parquet, либо pyarrow (>= 0.4.1), либо fastparquet (>= 0.0.6) для хранения данных в формате parquet. Для поддержки сжатия доступны snappy и brotli.
-
SQLAlchemy: для поддержки баз данных SQL. Рекомендуется версия 0.8.1 или выше. Помимо SQLAlchemy, вам также нужен драйвер, специфичный для базы данных. Обзор поддерживаемых драйверов для каждого диалекта SQL можно найти в документации SQLAlchemy. Некоторые распространенные драйверы:
- matplotlib: для построения графиков, Версия 1.4.3 или выше.
-
Для работы с Excel:
- xlrd/xlwt: чтение (xlrd) и запись (xlwt) Excel файлов
- openpyxl: openpyxl версии 1.6.1 или выше (но ниже 2.0.0), или версия 2.2 или выше, для записи файлов .xlsx (xlrd >= 0.9.0)
- XlsxWriter: альтернативный инструмент для записи в Excel
- Jinja2: движок шаблонов для условного форматирования HTML.
- s3fs: необходим для доступа к Amazon S3 (s3fs >= 0.0.7).
-
blosc: для сжатия msgpack с использованием
blosc - Один из PyQt4, PySide, pygtk, xsel или xclip: необходим для использования
read_clipboard(). Большинство менеджеров пакетов в дистрибутивах Linux обеспечатxclipи/илиxselдля немедленной установки. - pandas-gbq: для работы с Google BigQuery.
- Backports.lzma: Только для Python 2, для записи в сжатый xz CSV DataFrame или чтения из него; поддержка Python 3 встроена в стандартную библиотеку.
-
Для использования функции верхнего уровня
read_html()требуется одна из следующих комбинаций библиотек:- BeautifulSoup4 и html5lib (Любая последняя версия html5lib подойдет.)
- BeautifulSoup4 и lxml
- BeautifulSoup4 и html5lib и lxml
- Только lxml, хотя см. Обработка HTML-таблиц по причинам, почему вы, вероятно, не должны использовать этот подход.
Предупреждение
- Если вы установили BeautifulSoup4, вы должны установить либо lxml, либо html5lib, либо оба.
read_html()не будет работать с только установленной BeautifulSoup4. - Сильно рекомендуется прочитать Трюки при обработке HTML-таблиц. Он объясняет проблемы, связанные с установкой и использованием перечисленных выше трех библиотек.
- Возможно, потребуется установить более старую версию BeautifulSoup4: Версии 4.2.1, 4.1.3 и 4.0.2 подтверждены для 64- и 32-битных Ubuntu/Debian
Примечание
-
Если у вас система с
apt-getвы можете выполнитьsudo apt-get build-dep python-lxml
чтобы получить необходимые зависимости для установки lxml. Это предотвратит дальнейшие сложности в будущем.
Примечание
Без дополнительных зависимостей многие полезные функции не будут работать. Поэтому настоятельно рекомендуется их установить. Рассмотрите возможность использования пакетированного дистрибутива, такого как Anaconda или Enthought Canopy.
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.22.0/install.html