Введение в структуры данных
Мы начнем с краткого, неполного обзора основных структур данных в pandas, чтобы начать работу. Основное поведение относительно типов данных, индексации и маркировки/выравнивания осей применимо ко всем объектам. Для начала импортируйте NumPy и загрузите pandas в ваше пространство имен:
In [1]: import numpy as np In [2]: import pandas as pd
Вот основное правило, которое следует иметь в виду: выравнивание данных встроенно. Связь между метками и данными не будет нарушена, если вы этого явно не сделаете.
Мы дадим краткое введение в структуры данных, а затем рассмотрим все основные категории функциональности и методы в отдельных разделах.
Ряд
Series — это одномерный маркированный массив, способный хранить любые типы данных (целые числа, строки, числа с плавающей запятой, объекты Python и т. д.). Метки осей вместе называются индексом. Основной метод создания ряда — вызов:
>>> s = pd.Series(data, index=index)
Здесь data может быть разными вещами:
- словарь Python
- массив ndarray
- скалярное значение (например, 5)
Переданный индекс — это список меток осей. Таким образом, это разделяется на несколько случаев в зависимости от того, что представляют собой данные:
Из ndarray
Если data является массивом ndarray, индекс должен иметь такую же длину, как данные. Если индекс не указан, он будет создан со значениями [0, ..., len(data) - 1].
In [3]: s = pd.Series(np.random.randn(5), index=['a', 'b', 'c', 'd', 'e']) In [4]: s Out[4]: a 0.469112 b -0.282863 c -1.509059 d -1.135632 e 1.212112 dtype: float64 In [5]: s.index
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.24.2/getting_started/dsintro.html