Spec-Zone.ru › Octave 5

26.1 Описательная статистика

Одна из основных целей описательной статистики — кратко представить суть большого набора данных. Octave предоставляет функции mean, median и mode, которые все сводят набор данных к одному числу, соответствующему центральной тенденции данных.

mean (x)
mean (x, dim)
mean (x, opt)
mean (x, dim, opt)
mean (…, outtype)

Вычислить среднее значение элементов вектора x.

Среднее значение определяется как

mean (x) = SUM_i x(i) / N

где N — длина вектора x.

Если x — матрица, вычислить среднее значение для каждого столбца и вернуть их в строковом векторе.

Если задан необязательный аргумент dim, работать по этому измерению.

Необязательный аргумент opt выбирает тип среднего значения для вычисления. Признаны следующие варианты:

"a"

Вычислить (обычное) арифметическое среднее. [по умолчанию]

"g"

Вычислить геометрическое среднее.

"h"

Вычислить гармоническое среднее.

Необязательный аргумент outtype выбирает тип данных выходного значения. Признаны следующие варианты:

"default"

Вывод будет класса double, если только x не класса single, в этом случае вывод будет также single.

"double"

Вывод будет класса double.

"native"

Вывод будет того же класса, что и x, за исключением x типа logical, в этом случае он возвращает тип double.

И dim, и opt являются необязательными. Если оба заданы, либо может появиться первым.

См. также: median, mode.

median (x)
median (x, dim)

Вычислить медианное значение элементов вектора x.

Когда элементы x отсортированы, скажем s = sort (x), медиана определяется как

|  s(ceil(N/2))           N odd
median (x) = |
             | (s(N/2) + s(N/2+1))/2   N even

Если x — дискретного типа, такого как целое число или логическое значение, то случай с чётным N округляется вверх (или к true).

Если x является матрицей, вычислить медианное значение для каждого столбца и вернуть их в строковом векторе.

Если задан необязательный аргумент dim, работать по этому измерению.

См. также: mean, mode.

mode (x)
mode (x, dim)
[m, f, c] = mode (…)

Вычислить наиболее часто встречающееся значение в наборе данных (мода).

mode определяет частоту значений по первому неединичному измерению и возвращает значение с наибольшей частотой. Если два или более значений имеют одинаковую частоту mode возвращает наименьшее.

Если задан необязательный аргумент dim, работать по этому измерению.

Возвращаемая переменная f — количество появлений моды в наборе данных.

Массив ячеек c содержит все элементы с максимальной частотой.

См. также: mean, median.

Использование только одного числа, такого как среднее значение, для представления всего набора данных может не дать точной картины данных. Один из способов описания подходит — измерение дисперсии данных. Octave предоставляет несколько функций для измерения дисперсии.

[s, l] = bounds (x)
[s, l] = bounds (x, dim)
[s, l] = bounds (…, "nanflag")

Возвратить наименьшее и наибольшее значения входных данных x.

Если x — вектор, границы рассчитываются по элементам x. Если x — матрица, границы рассчитываются для каждого столбца. Для многомерного массива границы рассчитываются по первому неединичному измерению.

Если задан необязательный аргумент dim, работать по этому измерению.

Необязательный аргумент "nanflag" по умолчанию "omitnan", который не включает значения NaN в результате. Если аргумент "includenan" задан, а NaN присутствует, то результат для наименьших (s) и наибольших (l) элементов будет NaN.

Границы — быстро вычисляемое мера дисперсии набора данных, но менее точные, чем iqr, если есть выбросы.

См. также: range, iqr, mad, std.

range (x)
range (x, dim)

Возвратить размах, то есть разницу между максимальным и минимальным значениями входных данных.

Если x — вектор, размах рассчитывается по элементам x. Если x — матрица, размах рассчитывается для каждого столбца x.

Если задан необязательный аргумент dim, работать по этому измерению.

Размах — быстро вычисляемое мера дисперсии набора данных, но менее точные, чем iqr, если есть выбросы.

См. также: bounds, iqr, mad, std.

iqr (x)
iqr (x, dim)

Возвратить межквартильный размах, то есть разницу между верхним и нижним квартилем входных данных.

Если x — матрица, выполнить выше для первого неединичного измерения x.

Если задан необязательный аргумент dim, работать по этому измерению.

В качестве меры дисперсии межквартильный размах меньше зависит от выбросов, чем range или std.

См. также: bounds, mad, range, std.

mad (x)
mad (x, opt)
mad (x, opt, dim)

Вычислить среднее или медианное абсолютное отклонение элементов x.

Среднее абсолютное отклонение определяется как

mad = mean (abs (x - mean (x)))

Медианное абсолютное отклонение определяется как

mad = median (abs (x - median (x)))

Если x — матрица, вычислить mad для каждого столбца и вернуть результаты в строковом векторе. Для многомерного массива вычисление выполняется по первому неединичному измерению.

Необязательный аргумент opt определяет, вычисляется ли среднее или медианное абсолютное отклонение. По умолчанию 0, что соответствует среднему абсолютному отклонению; значение 1 соответствует медианному абсолютному отклонению.

Если задан необязательный аргумент dim, работать по этому измерению.

В качестве меры дисперсии mad меньше зависит от выбросов, чем std.

См. также: bounds, range, iqr, std, mean, median.

meansq (x)
meansq (x, dim)

Вычислить средний квадрат элементов вектора x.

Средний квадрат определяется как

meansq (x) = 1/N SUM_i x(i)^2

где N — длина вектора x.

Если x — матрица, вернуть строковый вектор, содержащий средний квадрат каждого столбца.

Если задан необязательный аргумент dim, работать по этому измерению.

См. также: var, std, moment.

std (x)
std (x, opt)
std (x, opt, dim)

Вычислить стандартное отклонение элементов вектора x.

Стандартное отклонение определяется как

std (x) = sqrt ( 1/(N-1) SUM_i (x(i) - mean(x))^2 )

где N — количество элементов вектора x.

Если x — матрица, вычислить стандартное отклонение для каждого столбца и вернуть их в строковом векторе.

Аргумент opt определяет тип нормализации. Допустимые значения

0:

нормализация с N-1, обеспечивает квадратный корень наилучшей несмещённой оценки дисперсии [по умолчанию]

1:

нормализация с N, это обеспечивает квадратный корень второй момент относительно среднего

Если необязательный аргумент dim задан, работать по этому измерению.

См. также: var, bounds, mad, range, iqr, mean, median.

Помимо знания размера дисперсии, полезно знать форму набора данных. Например, расположены ли точки данных в основном слева или справа от среднего значения? Octave предоставляет несколько общих мер для описания формы набора данных. Octave также может вычислять моменты, позволяющие разрабатывать произвольные меры формы.

var (x)
var (x, opt)
var (x, opt, dim)

Вычислить дисперсию элементов вектора x.

Дисперсия определяется как

var (x) = 1/(N-1) SUM_i (x(i) - mean(x))^2

где N — длина вектора x.

Если x — матрица, вычислить дисперсию для каждого столбца и вернуть их в строковом векторе.

Аргумент opt определяет тип нормализации. Допустимые значения

0:

нормализация с N-1, обеспечивает лучшую несмещенную оценку дисперсии [по умолчанию]

1:

нормализация с N, это обеспечивает второй момент относительно среднего

Если N равно 1, значение opt игнорируется, и используется нормализация с N.

Если необязательный аргумент dim задан, работать по этому измерению.

См. также: cov, std, skewness, kurtosis, moment.

асимметрия (x)
асимметрия (x, флаг)
асимметрия (x, флаг, размер)

Вычислить выборочную асимметрию элементов x.

Выборочная асимметрия определяется как

mean ((x - mean (x)).^3)
skewness (X) = ------------------------.
                      std (x).^3

Необязательный аргумент флаг управляет используемой нормализацией. Если флаг равен 1 (значение по умолчанию, используется, когда флаг опущен или пуст), возвращает выборочную асимметрию, как определено выше. Если флаг равен 0, возвращает скорректированный коэффициент асимметрии:

sqrt (N*(N-1))   mean ((x - mean (x)).^3)
skewness (X, 0) = -------------- * ------------------------.
                      (N - 2)             std (x).^3

где N — длина вектора x.

Скорректированный коэффициент асимметрии получается путём замены выборочных центральных моментов второго и третьего порядка их скорректированными аналогами.

Если x — матрица или, более общо, многомерный массив, возвращает асимметрию по первому неединичному измерению. Если необязательный аргумент размер указан, операция выполняется по этому измерению.

См. также: var, куртозис, момент.

куртозис (x)
куртозис (x, флаг)
куртозис (x, флаг, размер)

Вычислить выборочную куртозис элементов x.

Выборочная куртозис определяется как

mean ((x - mean (x)).^4)
k1 = ------------------------
            std (x).^4

Необязательный аргумент флаг управляет используемой нормализацией. Если флаг равен 1 (значение по умолчанию, используется, когда флаг опущен или пуст), возвращает выборочную куртозис, как определено выше. Если флаг равен 0, возвращает скорректированный коэффициент куртозиса:

N - 1
k0 = 3 + -------------- * ((N + 1) * k1 - 3 * (N - 1))
         (N - 2)(N - 3)

где N — длина вектора x.

Скорректированный коэффициент куртозиса получается путём замены выборочных центральных моментов второго и четвёртого порядка их несмещёнными аналогами. Он представляет собой несмещённую оценку куртозиса генеральной совокупности для нормальных генеральных совокупностей.

Если x — матрица или, более общо, многомерный массив, возвращает куртозис по первому неединичному измерению. Если необязательный аргумент размер указан, операция выполняется по этому измерению.

См. также: var, асимметрия, момент.

момент (x, p)
момент (x, p, тип)
момент (x, p, размер)
момент (x, p, тип, размер)
момент (x, p, размер, тип)

Вычислить p-й центральный момент вектора x.

p-й центральный момент x определяется как:

1/N SUM_i (x(i) - mean(x))^p

где N — длина вектора x.

Если x — матрица, возвращает строковый вектор, содержащий p-й центральный момент каждого столбца.

Если необязательный аргумент размер указан, операция выполняется по этому измерению.

Необязательный строковый аргумент тип определяет тип вычисляемого момента. Допустимые варианты:

"c"

Центральный момент (по умолчанию).

"a"
"ac"

Абсолютный центральный момент. Момент относительно среднего значения, игнорируя знак, определяется как

1/N SUM_i (abs (x(i) - mean(x)))^p
"r"

Начальный момент. Момент относительно нуля, определяется как

moment (x) = 1/N SUM_i x(i)^p
"ar"

Абсолютный начальный момент. Момент относительно нуля, игнорируя знак, определяется как

1/N SUM_i ( abs (x(i)) )^p

Если тип и размер указаны одновременно, они могут быть в любом порядке.

См. также: var, асимметрия, куртозис.

q = квантиль (x)
q = квантиль (x, p)
q = квантиль (x, p, размер)
q = квантиль (x, p, размер, метод)

Для выборки x вычислить квантили q, соответствующие значениям кумулятивной вероятности в p. Все нечисловые значения (NaN) в x игнорируются.

Если x — матрица, вычислить квантили для каждого столбца и вернуть их в матрице, так что i-я строка q содержит p(i)-е квантили каждого столбца x.

Если p не указано, вернуть квантили для [0.00 0.25 0.50 0.75 1.00]. Необязательный аргумент размер определяет измерение, по которому вычисляются квантили. Если размер опущен, он по умолчанию равен первому неединичному измерению.

Доступные методы вычисления выборочных квантилей — девять методов, используемых в R (https://www.r-project.org/). Значение по умолчанию — метод = 5.

Дисперсные методы вычисления выборочных квантилей 1, 2 и 3

  1. Метод 1: Обратная функция эмпирического распределения.
  2. Метод 2: Аналогичен методу 1, но с усреднением при разрывах.
  3. Метод 3: Определение SAS: ближайшая чётная порядковая статистика.

Непрерывные методы вычисления выборочных квантилей 4–9, где p(k) — функция линейной интерполяции, учитывающая представительную функцию распределения каждого метода.

  1. Метод 4: p(k) = k / N. То есть линейная интерполяция эмпирической функции распределения, где N — длина P.
  2. Метод 5: p(k) = (k - 0,5) / N. То есть кусочно-линейная функция, где узлы — значения посередине шагов эмпирической функции распределения.
  3. Метод 6: p(k) = k / (N + 1).
  4. Метод 7: p(k) = (k - 1) / (N - 1).
  5. Метод 8: p(k) = (k - 1/3) / (N + 1/3). Полученные оценки квантилей приблизительно несмещены относительно медианы независимо от распределения x.
  6. Метод 9: p(k) = (k - 3/8) / (N + 1/4). Полученные оценки квантилей приблизительно несмещены для ожидаемых порядковых статистик, если x имеет нормальное распределение.

Хайндман и Фэн (1996) рекомендуют метод 8. Maxima, S и R (версии до 2.0.0) используют 7 в качестве значения по умолчанию. Minitab и SPSS используют метод 6. MATLAB использует метод 5.

Литература:

  • Беккер, Р. А., Чемберс, Дж. М. и Уилкс, А. Р. (1988) Новый язык S. Wadsworth & Brooks/Cole.
  • Хайндман, Р. Дж. и Фэн, Й. (1996) Выборочные квантили в статистических пакетах, American Statistician, 50, 361–365.
  • R: Язык и среда для статистических вычислений; https://cran.r-project.org/doc/manuals/fullrefman.pdf.

Примеры:

x = randi (1000, [10, 1]);  # Create empirical data in range 1-1000
q = quantile (x, [0, 1]);   # Return minimum, maximum of distribution
q = quantile (x, [0.25 0.5 0.75]); # Return quartiles of distribution

См. также: процентиль.

q = процентиль (x)
q = процентиль (x, p)
q = процентиль (x, p, размер)

Для выборки x вычислить квантили q, соответствующие значениям кумулятивной вероятности p в процентах.

Если x — матрица, вычислить процентили для каждого столбца и вернуть их в матрице, так что i-я строка q содержит p(i)-е процентили каждого столбца x.

Если p не указано, вернуть процентили для [0 25 50 75 100].

Необязательный аргумент размер определяет измерение, по которому вычисляются процентили. Если размер опущен, он по умолчанию равен первому неединичному измерению.

Примечание для программистов: Все нечисловые значения (NaN) в x игнорируются.

См. также: квантиль.

Краткое описание набора данных можно быстро получить с помощью функции statistics.

статистики (x)
статистики (x, размер)

Возвращает вектор с минимальным, первым квартилем, медианой, третьим квартилем, максимальным значением, средним значением, стандартным отклонением, асимметрией и куртозисом элементов вектора x.

Если x — матрица, вычислить статистические данные по первому неединичному измерению.

Если необязательный аргумент размер указан, операция выполняется по этому измерению.

См. также: min, max, медиана, среднее, std, асимметрия, куртозис.

© 1996–2022 The Octave Project Developers
Permission is granted to make and distribute verbatim copies of this manual provided the copyright notice and this permission notice are preserved on all copies.
Permission is granted to copy and distribute modified versions of this manual under the conditions for verbatim copying, provided that the entire resulting derived work is distributed under the terms of a permission notice identical to this one.
Permission is granted to copy and distribute translations of this manual into another language, under the above conditions for modified versions.
https://docs.octave.org/v5.2.0/Descriptive-Statistics.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API