Введение в структуры данных
Мы начнем с краткого, неполного обзора основных структур данных в pandas, чтобы помочь вам начать работу. Основное поведение в отношении типов данных, индексации и маркировки/выравнивания осей применимо ко всем объектам. Для начала импортируйте NumPy и загрузите pandas в ваше пространство имен:
In [1]: import numpy as np In [2]: import pandas as pd
Следует помнить об одном основном правиле: выравнивание данных является неотъемлемым. Связь между метками и данными не будет нарушена, если вы этого явно не сделаете.
Мы дадим краткое введение в структуры данных, а затем рассмотрим все широкие категории функциональности и методов в отдельных разделах.
Ряды
Series — это одномерный маркированный массив, способный хранить любые типы данных (целые числа, строки, числа с плавающей точкой, объекты Python и т. д.). Метки осей коллективно называются индексом. Основной метод создания ряда — вызов:
>>> s = pd.Series(data, index=index)
Здесь data может быть многими различными вещами:
- словарь Python
- ndarray
- скалярное значение (например, 5)
Переданный индекс — это список меток осей. Таким образом, это разделяется на несколько случаев в зависимости от того, что представляют собой данные:
Из ndarray
Если data является ndarray, индекс должен иметь такую же длину, как и данные. Если индекс не передан, он будет создан со значениями [0, ..., len(data) - 1].
In [3]: s = pd.Series(np.random.randn(5), index=['a', 'b', 'c', 'd', 'e']) In [4]: s Out[4]: a 0.469112 b -0.282863 c -1.509059 d -1.135632 e 1.212112 dtype: float64 In [5]: s.index
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.25.0/getting_started/dsintro.html