pandas.read_stata
-
pandas.read_stata(filepath_or_buffer, convert_dates=True, convert_categoricals=True, encoding=None, index=None, convert_missing=False, preserve_dtypes=True, columns=None, order_categoricals=True, chunksize=None, iterator=False) -
Чтение файла Stata в DataFrame
Параметры: filepath_or_buffer : строка или файлоподобный объект
Путь к файлу .dta или объект, реализующий функцию двоичного чтения read()
convert_dates : булево, по умолчанию True
Преобразование переменных даты в значения времени DataFrame
convert_categoricals : булево, по умолчанию True
Чтение меток значений и преобразование столбцов в категориальные/факторные переменные
encoding : строка, None или кодировка
Кодировка, используемая для разбора файлов. None по умолчанию iso-8859-1.
index : идентификатор столбца индекса
Идентификатор столбца, который должен использоваться в качестве индекса DataFrame
convert_missing : булево, по умолчанию False
Флаг, указывающий, нужно ли преобразовывать пропущенные значения в их представления Stata. Если False, пропущенные значения заменяются на nan. Если True, столбцы, содержащие пропущенные значения, возвращаются с объектами типов данных, а пропущенные значения представляются объектами StataMissingValue.
preserve_dtypes : булево, по умолчанию True
Сохранение типов данных Stata. Если False, числовые данные повышаются до типов данных pandas по умолчанию для внешних данных (float64 или int64)
columns : список или None
Столбцы для сохранения. Столбцы будут возвращены в заданном порядке. None возвращает все столбцы
order_categoricals : булево, по умолчанию True
Флаг, указывающий, упорядочены ли преобразованные категориальные данные.
chunksize : целое число, по умолчанию None
Возвращает объект StataReader для итераций, возвращает фрагменты с заданным количеством строк
iterator : булево, по умолчанию False
Возвращает объект StataReader
Возвращаемое значение: DataFrame или StataReader
Примеры
Чтение файла Stata dta: >> df = pandas.read_stata(‘filename.dta’)
Чтение файла Stata dta частями по 10 000 строк: >> itr = pandas.read_stata(‘filename.dta’, chunksize=10000) >> for chunk in itr: >> do_something(chunk)
© 2008–2012, AQR Capital Management, LLC, Lambda Foundry, Inc. and PyData Development Team
Licensed under the 3-clause BSD License.
https://pandas.pydata.org/pandas-docs/version/0.18.1/generated/pandas.read_stata.html