Spec-Zone.ru › Octave 7

26.1 Статистические описательные характеристики

Одна из основных целей описательной статистики – кратко представить суть большого набора данных. Octave предоставляет функции mean, median и mode, которые все вместе сводят набор данных к одному числу, соответствующему центральной тенденции данных.

: mean (x) ¶
: mean (x, dim) ¶
: mean (x, opt) ¶
: mean (x, dim, opt) ¶
: mean (…, outtype) ¶

Вычислить среднее значение элементов вектора x.

Среднее значение определяется как

mean (x) = SUM_i x(i) / N

где N – длина вектора x.

Если x – матрица, вычислить среднее значение для каждого столбца и вернуть их в виде строкового вектора.

Если задан необязательный аргумент dim, выполнять операцию по этому измерению.

Необязательный аргумент opt выбирает тип среднего значения для вычисления. Распознаются следующие варианты:

"a"

Вычислить (обычное) арифметическое среднее. [по умолчанию]

"g"

Вычислить геометрическое среднее.

"h"

Вычислить гармоническое среднее.

Необязательный аргумент outtype выбирает тип данных выходного значения. Распознаются следующие варианты:

"default"

Выход будет типа double, если x не имеет тип single, в противном случае выход будет иметь тип single.

"double"

Выход будет иметь тип double.

"native"

Выход будет иметь тот же тип, что и x, за исключением случая, когда x имеет тип логический, в этом случае возвращается тип double.

И dim, и opt являются необязательными. Если оба они заданы, любой из них может быть задан первым.

См. также: median, mode.

: median (x) ¶
: median (x, dim) ¶

Вычислить медианное значение элементов вектора x.

При сортировке элементов x, скажем s = sort (x), медиана определяется как

|  s(ceil(N/2))           N odd
median (x) = |
             | (s(N/2) + s(N/2+1))/2   N even

Если x имеет дискретный тип, например, целые числа или логические значения, то в случае чётного значения N округление выполняется вверх (или в сторону true).

Если x – матрица, вычислить медианное значение для каждого столбца и вернуть их в виде строкового вектора.

Если задан необязательный аргумент dim, выполнять операцию по этому измерению.

См. также: mean, mode.

: mode (x) ¶
: mode (x, dim) ¶
: [m, f, c] = mode (…) ¶

Вычислить наиболее часто встречающееся значение в наборе данных (моду).

mode определяет частоту значений вдоль первого неединичного измерения и возвращает значение с наибольшей частотой. Если два или более значения имеют одинаковую частоту mode возвращает наименьшее.

Если задан необязательный аргумент dim, выполнять операцию по этому измерению.

Переменная возврата f – это количество вхождений моды в наборе данных.

Ячейный массив c содержит все элементы с максимальной частотой.

См. также: mean, median.

Использование только одного числа, например, среднего значения, для представления всего набора данных может не дать точного представления данных. Один из способов характеристики подходит – измерение рассеивания данных. Octave предоставляет несколько функций для измерения рассеивания.

: [s, l] = bounds (x) ¶
: [s, l] = bounds (x, dim) ¶
: [s, l] = bounds (…, "nanflag") ¶

Возвратить наименьшее и наибольшее значения входных данных x.

Если x – вектор, границы вычисляются по элементам x. Если x – матрица, границы вычисляются для каждого столбца. Для многомерного массива границы вычисляются по первому неединичному измерению.

Если необязательный аргумент dim задан, выполнять операцию по этому измерению.

Необязательный аргумент "nanflag" по умолчанию равен "omitnan", что не включает значения NaN в результат. Если аргумент "includenan" задан и присутствует значение NaN, то результат для наименьшего (s) и наибольшего (l) элементов будет NaN.

Границы – это быстро вычисляемая мера рассеивания набора данных, но они менее точные, чем iqr, если существуют выбросы.

См. также: range, iqr, mad, std.

: range (x) ¶
: range (x, dim) ¶

Возвратить размах, т. е. разницу между максимальным и минимальным значениями входных данных.

Если x – вектор, размах вычисляется по элементам x. Если x – матрица, размах вычисляется по каждому столбцу x.

Если задан необязательный аргумент dim, выполнять операцию по этому измерению.

Размах – это быстро вычисляемая мера рассеивания набора данных, но он менее точен, чем iqr, если существуют выбросы.

См. также: bounds, iqr, mad, std.

: Z = iqr (x) ¶
: Z = iqr (x, dim) ¶
: Z = iqr (x, "ALL") ¶

Возвратить межквартильный размах x, определённый как расстояние между 25-м и 75-м процентилями значений x, вычисленных с использованием: quantile (x, [0.25 0.75])

Если x – вектор, iqr (x) будет обрабатывать данные в x.

Если x – матрица, iqr (x) будет обрабатывать независимо каждый столбец в x, возвращая строковый вектор Z.

Если x – n-мерный массив, iqr (x) будет обрабатывать независимо первое неединичное измерение в x, возвращая массив Z той же формы, что и x, с уменьшенным до 1 неединичным измерением.

Необязательная переменная dim может быть использована для принудительного выполнения iqr по указанному измерению. dim может быть скалярным измерением или вектором не повторяющихся измерений, по которым нужно действовать. В любом случае dim должен быть положительным целым числом. Вектор dim конкатенирует все указанные измерения для независимой обработки iqr.

Указание измерения "ALL" принудит iqr к обработке всех элементов x и эквивалентно iqr (x(:)). Аналогично, указание вектора измерений, включающего все неединичные измерения x, эквивалентно iqr (x, "ALL").

Если x – скаляр или указаны только единичные измерения для dim, выход будет zeros (size (x)).

В качестве меры рассеивания межквартильный размах меньше подвержен влиянию выбросов, чем range или std.

См. также: bounds, mad, range, std, prctile, quantile.

: mad (x) ¶
: mad (x, opt) ¶
: mad (x, opt, dim) ¶

Вычислить среднее или медианное абсолютное отклонение элементов x.

Среднее абсолютное отклонение определяется как

mad = mean (abs (x - mean (x)))

Медианное абсолютное отклонение определяется как

mad = median (abs (x - median (x)))

Если x является матрицей, вычислить mad для каждого столбца и вернуть результаты в строчном векторе. Для многомерного массива вычисление выполняется по первому неединичному измерению.

Необязательный аргумент opt определяет, вычисляется ли среднее или медианное абсолютное отклонение. По умолчанию значение 0 соответствует среднему абсолютному отклонению; значение 1 соответствует медианному абсолютному отклонению.

Если необязательный аргумент dim задан, выполняется операция по этому измерению.

В качестве меры рассеивания mad менее подвержено влиянию выбросов, чем std.

См. также: bounds, range, iqr, std, mean, median.

: meansq (x) ¶
: meansq (x, dim) ¶

Вычислить среднее значение квадрата элементов вектора x.

Среднее значение квадрата определяется как

meansq (x) = 1/N SUM_i x(i)^2

где N — длина вектора x.

Если x — матрица, вернуть строчный вектор, содержащий среднее значение квадрата каждого столбца.

Если необязательный аргумент dim задан, операция выполняется по этому измерению.

См. также: var, std, moment.

: std (x) ¶
: std (x, w) ¶
: std (x, w, dim) ¶
: std (x, w, "ALL") ¶

Вычислить стандартное отклонение элементов вектора x.

Стандартное отклонение определяется как

std (x) = sqrt ( 1/(N-1) SUM_i (x(i) - mean(x))^2 )

где N — количество элементов вектора x.

Если x — массив, вычислить стандартное отклонение для каждого столбца и вернуть их в строчном векторе (или для n-мерного массива результат возвращается как массив размерности 1 x n x m x …).

Необязательный аргумент w определяет используемую схему взвешивания. Допустимые значения:

0 [по умолчанию]:

Нормализовать на N-1. Это обеспечивает квадратный корень из наилучшей несмещенной оценки дисперсии.

1:

Нормализовать на N. Это предоставляет квадратный корень из второй моменты относительно среднего значения.

вектор:

Вычислить взвешенное стандартное отклонение с неотрицательными скалярными весами. Длина w должна быть равна размеру x по измерению dim.

Если N равно 1, значение W игнорируется, и используется нормализация на N.

Необязательная переменная dim заставляет std работать по заданному измерению. dim может быть скалярным измерением или вектором не повторяющихся измерений, по которым нужно выполнять операцию. Размеры должны быть положительными целыми числами, а стандартное отклонение вычисляется по срезу массива, определённому dim.

Указание размера "ALL" заставит std работать со всеми элементами x, что эквивалентно std (x(:)).

Когда dim является вектором или "ALL", w должно быть либо 0, либо 1.

См. также: var, bounds, mad, range, iqr, mean, median.

В дополнение к знанию размера рассеивания полезно знать форму набора данных. Например, сгруппированы ли точки данных слева или справа от среднего значения? Octave предоставляет несколько общих мер для описания формы набора данных. Octave также может вычислять моменты, что позволяет разрабатывать произвольные меры формы.

: var (x) ¶
: var (x, w) ¶
: var (x, w, dim) ¶
: var (x, w, "ALL") ¶

Вычислить дисперсию элементов вектора x.

Дисперсия определяется как

var (x) = 1/(N-1) SUM_i (x(i) - mean(x))^2

где N — длина вектора x.

Если x — массив, вычислить дисперсию для каждого столбца и вернуть их в строчном векторе (или для n-мерного массива результат возвращается как массив размерности 1 x n x m x …).

Необязательный аргумент w определяет используемую схему взвешивания. Допустимые значения:

0 [по умолчанию]:

Нормализовать на N-1. Это предоставляет наилучшую несмещенную оценку дисперсии.

1:

Нормализовать на N, это предоставляет квадратный корень из второй моменты относительно среднего значения

вектор:

Вычислить взвешенную дисперсию с неотрицательными скалярными весами. Длина w должна быть равна размеру x по измерению dim.

Если N равно 1, значение W игнорируется, и используется нормализация на N.

Необязательная переменная dim заставляет var работать по заданному измерению. dim может быть скалярным измерением или вектором не повторяющихся измерений, по которым нужно выполнять операцию. Размеры должны быть положительными целыми числами, а дисперсия вычисляется по срезу массива, определённому dim.

Указание размера "ALL" заставит var работать со всеми элементами x, что эквивалентно var (x(:)).

Когда dim является вектором или "ALL", w должно быть либо 0, либо 1.

См. также: cov, std, skewness, kurtosis, moment.

: skewness (x) ¶
: skewness (x, flag) ¶
: skewness (x, flag, dim) ¶

Вычислить выборочное значение асимметрии элементов x.

Выборочное значение асимметрии определяется как

mean ((x - mean (x)).^3)
skewness (X) = ------------------------.
                      std (x).^3

Необязательный аргумент flag управляет используемой нормализацией. Если flag равно 1 (значение по умолчанию, используется, когда flag опущен или пуст), вернуть выборочное значение асимметрии, как определено выше. Если flag равно 0, вернуть скорректированный коэффициент асимметрии:

sqrt (N*(N-1))   mean ((x - mean (x)).^3)
skewness (X, 0) = -------------- * ------------------------.
                      (N - 2)             std (x).^3

где N — длина вектора x.

Скорректированный коэффициент асимметрии получается заменой выборочных второго и третьего центральных моментов их исправленными версиями.

Если x — матрица или, более общо, многомерный массив, вернуть асимметрию по первому неединичному измерению. Если необязательный аргумент dim задан, выполнять операцию по этому измерению.

См. также: var, kurtosis, moment.

: эксцесс (x) ¶
: эксцесс (x, flag) ¶
: эксцесс (x, flag, dim) ¶

Вычислить выборочный эксцесс элементов x.

Выборочный эксцесс определяется как

mean ((x - mean (x)).^4)
k1 = ------------------------
            std (x).^4

Необязательный аргумент flag управляет нормализацией. Если flag равен 1 (значение по умолчанию, используется, когда flag опущен или пуст), возвращается выборочный эксцесс, как определено выше. Если flag равен 0, возвращается коэффициент эксцесса с поправкой на смещение:

N - 1
k0 = 3 + -------------- * ((N + 1) * k1 - 3 * (N - 1))
         (N - 2)(N - 3)

где N — длина вектора x.

Коэффициент эксцесса с поправкой на смещение получается путем замены выборочных центральных моментов второго и четвёртого порядков на их несмещённые версии. Это несмещённая оценка эксцесса генеральной совокупности для нормальных генеральных совокупностей.

Если x является матрицей или, более общим образом, многомерным массивом, возвращается эксцесс по первой неединичной размерности. Если необязательный аргумент dim указан, операции выполняются по этой размерности.

См. также: var, асимметрия, момент.

: момент (x, p) ¶
: момент (x, p, type) ¶
: момент (x, p, dim) ¶
: момент (x, p, type, dim) ¶
: момент (x, p, dim, type) ¶

Вычислить центральный момент p-го порядка вектора x.

Центральный момент p-го порядка x определяется как:

1/N SUM_i (x(i) - mean(x))^p

где N — длина вектора x.

Если x является матрицей, возвращается строковый вектор, содержащий центральные моменты p-го порядка для каждого столбца.

Если необязательный аргумент dim указан, операции выполняются по этой размерности.

Необязательная строка type определяет тип вычисляемого момента. Допустимые варианты:

"c"

Центральный момент (по умолчанию).

"a"
"ac"

Абсолютный центральный момент. Момент относительно среднего значения, игнорируя знак, определяется как

1/N SUM_i (abs (x(i) - mean(x)))^p
"r"

Необработанный момент. Момент относительно нуля, определённый как

moment (x) = 1/N SUM_i x(i)^p
"ar"

Абсолютный необработанный момент. Момент относительно нуля, игнорируя знак, определяется как

1/N SUM_i ( abs (x(i)) )^p

Если указаны и type, и dim, они могут быть указаны в любом порядке.

См. также: var, асимметрия, эксцесс.

: q = квантиль (x) ¶
: q = квантиль (x, p) ¶
: q = квантиль (x, p, dim) ¶
: q = квантиль (x, p, dim, method) ¶

Для выборки x вычислить квантили, q, соответствующие значениям кумулятивной вероятности в p. Все нечисловые значения (NaN) x игнорируются.

Если x является матрицей, вычислить квантили для каждого столбца и вернуть их в матрице, так что i-я строка q содержит p(i)-е квантили каждого столбца x.

Если p не указан, вернуть квантили для [0.00 0.25 0.50 0.75 1.00]. Необязательный аргумент dim определяет размерность, по которой рассчитываются квантили. Если dim опущен, он по умолчанию равен первой неединичной размерности.

Доступные методы расчёта выборочных квантилей — это девять методов, используемых в R (https://www.r-project.org/). Значение по умолчанию — method = 5.

Дискретные методы расчёта выборочных квантилей 1, 2 и 3

  1. Метод 1: Обратная функция эмпирического распределения.
  2. Метод 2: Аналогичен методу 1, но с усреднением на разрывах.
  3. Метод 3: Определение SAS: ближайшая чётная порядковая статистика.

Непрерывные методы расчёта выборочных квантилей с 4 по 9, где p(k) — функция линейной интерполяции, учитывающая соответствующую cdf каждого метода.

  1. Метод 4: p(k) = k / N. То есть линейная интерполяция эмпирической cdf, где N — длина P.
  2. Метод 5: p(k) = (k - 0.5) / N. То есть кусочно-линейная функция, узлы которой находятся посередине шагов эмпирической cdf.
  3. Метод 6: p(k) = k / (N + 1).
  4. Метод 7: p(k) = (k - 1) / (N - 1).
  5. Метод 8: p(k) = (k - 1/3) / (N + 1/3). Полученные оценки квантилей приблизительно несмещены относительно медианы независимо от распределения x.
  6. Метод 9: p(k) = (k - 3/8) / (N + 1/4). Полученные оценки квантилей приблизительно несмещены относительно ожидаемых порядковых статистик, если x имеет нормальное распределение.

Хиндман и Фан (1996) рекомендуют метод 8. Maxima, S и R (версии до 2.0.0) по умолчанию используют 7. Minitab и SPSS используют метод 6. MATLAB использует метод 5.

Ссылки:

  • Becker, R. A., Chambers, J. M. and Wilks, A. R. (1988) The New S Language. Wadsworth & Brooks/Cole.
  • Hyndman, R. J. and Fan, Y. (1996) Sample quantiles in statistical packages, American Statistician, 50, 361–365.
  • R: Язык и среда для статистических вычислений; https://cran.r-project.org/doc/manuals/fullrefman.pdf.

Примеры:

x = randi (1000, [10, 1]);  # Create empirical data in range 1-1000
q = quantile (x, [0, 1]);   # Return minimum, maximum of distribution
q = quantile (x, [0.25 0.5 0.75]); # Return quartiles of distribution

См. также: процентиль.

: q = процентиль (x) ¶
: q = процентиль (x, p) ¶
: q = процентиль (x, p, dim) ¶

Для выборки x вычислить квантили, q, соответствующие значениям кумулятивной вероятности в процентах, p.

Если x является матрицей, вычислить процентили для каждого столбца и вернуть их в матрице, так что i-я строка q содержит p(i)-е процентили каждого столбца x.

Если p не указан, вернуть процентили для [0 25 50 75 100].

Необязательный аргумент dim определяет размерность, по которой рассчитываются процентили. Если dim опущен, он по умолчанию равен первой неединичной размерности.

Примечание для программистов: все нечисловые значения (NaN) x игнорируются.

См. также: квантиль.

Быстрый вывод сводной характеристики набора данных можно получить с помощью функции statistics.

: статистики (x) ¶
: статистики (x, dim) ¶

Возвращает вектор с минимальным, первым квартилем, медианой, третьим квартилем, максимальным значением, средним значением, стандартным отклонением, асимметрией и эксцессом элементов вектора x.

Если x является матрицей, вычислить статистику по первой неединичной размерности.

Если необязательный аргумент dim указан, операции выполняются по этой размерности.

См. также: min, max, медиана, среднее, std, асимметрия, эксцесс.

© 1996–2022 The Octave Project Developers
Permission is granted to make and distribute verbatim copies of this manual provided the copyright notice and this permission notice are preserved on all copies.
Permission is granted to copy and distribute modified versions of this manual under the conditions for verbatim copying, provided that the entire resulting derived work is distributed under the terms of a permission notice identical to this one.
Permission is granted to copy and distribute translations of this manual into another language, under the above conditions for modified versions.
https://docs.octave.org/v7.2.0/Descriptive-Statistics.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API