Spec-Zone.ru › Octave 6

26.1 Описательная статистика

Одна из основных целей описательной статистики — кратко представить суть большого набора данных. Octave предоставляет функции mean, median и mode, которые все сводят набор данных к одному числу, соответствующему центральной тенденции данных.

: mean (x)
: mean (x, dim)
: mean (x, opt)
: mean (x, dim, opt)
: mean (…, outtype)

Вычислить среднее значение элементов вектора x.

Среднее определяется как

mean (x) = SUM_i x(i) / N

где N — длина вектора x.

Если x является матрицей, вычислить среднее для каждого столбца и вернуть их в строковом векторе.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

Необязательный аргумент opt выбирает тип среднего, который нужно вычислить. Признаются следующие варианты:

"a"

Вычислить (обычное) среднее арифметическое. [по умолчанию]

"g"

Вычислить среднее геометрическое.

"h"

Вычислить среднее гармоническое.

Необязательный аргумент outtype выбирает тип данных выходного значения. Признаются следующие варианты:

"default"

Выход будет класса double, если x не класса single, в противном случае — single.

"double"

Выход будет класса double.

"native"

Выход будет того же класса, что и x, за исключением случая, когда x — класса logical, в этом случае он возвращает double.

И dim, и opt — необязательные аргументы. Если оба указаны, то любой из них может стоять первым.

См. также: median, mode.

: median (x)
: median (x, dim)

Вычислить медианное значение элементов вектора x.

Когда элементы x отсортированы, скажем, s = sort (x), медиана определяется как

|  s(ceil(N/2))           N odd
median (x) = |
             | (s(N/2) + s(N/2+1))/2   N even

Если x относится к дискретному типу, такому как целое число или логическое значение, то в случае четного N округление производится вверх (или к true).

Если x — матрица, вычислить медианное значение для каждого столбца и вернуть их в строковом векторе.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

См. также: mean, mode.

: mode (x)
: mode (x, dim)
: [m, f, c] = mode (…)

Вычислить наиболее часто встречающееся значение в наборе данных (моду).

mode определяет частоту значений вдоль первого неединичного измерения и возвращает значение с наибольшей частотой. Если два или более значения имеют одинаковую частоту, mode возвращает наименьшее.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

Переменная возврата f представляет количество повторений моды в наборе данных.

Ячейковый массив c содержит все элементы с максимальной частотой.

См. также: mean, median.

Использование всего одного числа, например, среднего значения, для представления всего набора данных может не дать точной картины данных. Один из способов характеризовать подгонку — измерить рассеивание данных. Octave предоставляет несколько функций для измерения рассеивания.

: [s, l] = bounds (x)
: [s, l] = bounds (x, dim)
: [s, l] = bounds (…, "nanflag")

Возвращают наименьшее и наибольшее значения входных данных x.

Если x является вектором, границы вычисляются по элементам x. Если x — матрица, границы вычисляются для каждого столбца. Для многомерного массива границы вычисляются по первому неединичному измерению.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

Необязательный аргумент "nanflag" по умолчанию "omitnan", который не включает значения NaN в результате. Если аргумент "includenan" задан, и присутствует NaN, то результат для наименьшего (s) и наибольшего (l) элементов будет NaN.

Границы — быстро вычисляемая мера рассеивания набора данных, но менее точная, чем iqr, если есть выбросы.

См. также: range, iqr, mad, std.

: range (x)
: range (x, dim)

Возвращают размах, т.е. разность между максимальным и минимальным значениями входных данных.

Если x является вектором, диапазон вычисляется по элементам x. Если x — матрица, диапазон вычисляется по каждому столбцу x.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

Диапазон — быстро вычисляемая мера рассеивания набора данных, но менее точная, чем iqr, если есть выбросы.

См. также: bounds, iqr, mad, std.

: iqr (x)
: iqr (x, dim)

Возвращают межквартильный размах, т.е. разность между верхним и нижним квартилем входных данных.

Если x — матрица, выполняют вышеописанное для первого неединичного измерения x.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

В качестве меры рассеивания межквартильный размах меньше зависит от выбросов, чем range или std.

См. также: bounds, mad, range, std.

: mad (x)
: mad (x, opt)
: mad (x, opt, dim)

Вычислить среднее или медианное абсолютное отклонение элементов x.

Среднее абсолютное отклонение определяется как

mad = mean (abs (x - mean (x)))

Медианное абсолютное отклонение определяется как

mad = median (abs (x - median (x)))

Если x — матрица, вычислить mad для каждого столбца и вернуть результаты в строковом векторе. Для многомерного массива вычисление выполняется по первому неединичному измерению.

Необязательный аргумент opt определяет, вычисляется ли среднее или медианное абсолютное отклонение. По умолчанию 0 соответствует среднему абсолютному отклонению; Значение 1 соответствует медианному абсолютному отклонению.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

В качестве меры рассеивания mad менее чувствительно к выбросам, чем std.

См. также: bounds, range, iqr, std, mean, median.

: meansq (x)
: meansq (x, dim)

Вычислить среднее квадратичное значение элементов вектора x.

Среднее квадратичное определяется как

meansq (x) = 1/N SUM_i x(i)^2

где N — длина вектора x.

Если x — матрица, возвратить строковый вектор, содержащий среднее квадратичное каждого столбца.

Если задан необязательный аргумент dim, работать вдоль этого измерения.

См. также: var, std, moment.

: std (x)
: std (x, opt)
: std (x, opt, dim)

Вычислить стандартное отклонение элементов вектора x.

Стандартное отклонение определяется как

std (x) = sqrt ( 1/(N-1) SUM_i (x(i) - mean(x))^2 )

где N — количество элементов вектора x.

Если x — матрица, вычислить стандартное отклонение для каждого столбца и вернуть их в строковом векторе.

Аргумент opt определяет тип используемой нормализации. Допустимые значения

0:

нормализовать с N-1, обеспечивает квадратный корень из наилучшей несмещённой оценки дисперсии [по умолчанию]

1:

нормализовать с N, это даёт квадратный корень из второго момента относительно среднего

Если задан необязательный аргумент dim, работать вдоль этого измерения.

См. также: var, bounds, mad, range, iqr, mean, median.

Помимо знания размера рассеивания, полезно знать форму набора данных. Например, сгруппированы ли данные слева или справа от среднего значения? Octave предоставляет несколько общих мер для описания формы набора данных. Octave также может вычислять моменты, позволяя разрабатывать произвольные меры формы.

: var (x)
: var (x, opt)
: var (x, opt, dim)

Вычислите дисперсию элементов вектора x.

Дисперсия определяется как

var (x) = 1/(N-1) SUM_i (x(i) - mean(x))^2

где N — длина вектора x.

Если x является матрицей, вычислите дисперсию для каждого столбца и верните их в строковом векторе.

Аргумент opt определяет тип нормализации. Допустимые значения:

0:

нормализация с N-1, обеспечивает лучшую несмещенную оценку дисперсии [по умолчанию]

1:

нормализация с N, это обеспечивает второй момент относительно среднего значения

Если N равно 1, значение opt игнорируется, и используется нормализация с N.

Если задан необязательный аргумент dim, работайте вдоль этого измерения.

См. также: cov, std, skewness, kurtosis, moment.

: skewness (x)
: skewness (x, flag)
: skewness (x, flag, dim)

Вычислите выборовое значение асимметрии элементов x.

Выборочная асимметрия определяется как

mean ((x - mean (x)).^3)
skewness (X) = ------------------------.
                      std (x).^3

Необязательный аргумент flag управляет используемой нормализацией. Если flag равно 1 (значение по умолчанию, используется, если flag опущено или пусто), возвращает выборочное значение асимметрии, как определено выше. Если flag равно 0, вместо этого возвращается скорректированный коэффициент асимметрии:

sqrt (N*(N-1))   mean ((x - mean (x)).^3)
skewness (X, 0) = -------------- * ------------------------.
                      (N - 2)             std (x).^3

где N — длина вектора x.

Скорректированный коэффициент асимметрии получается путем замены выборочных второго и третьего центральных моментов их скорректированными версиями.

Если x является матрицей или, более общим образом, многомерным массивом, возвращает асимметрию вдоль первого неединичного измерения. Если задан необязательный аргумент dim, работайте вдоль этого измерения.

См. также: var, kurtosis, moment.

: kurtosis (x)
: kurtosis (x, flag)
: kurtosis (x, flag, dim)

Вычислите выборочное значение эксцесса элементов x.

Выборочный эксцесс определяется как

mean ((x - mean (x)).^4)
k1 = ------------------------
            std (x).^4

Необязательный аргумент flag управляет используемой нормализацией. Если flag равно 1 (значение по умолчанию, используется, если flag опущено или пусто), возвращает выборочное значение эксцесса, как определено выше. Если flag равно 0, возвращается скорректированный коэффициент эксцесса:

N - 1
k0 = 3 + -------------- * ((N + 1) * k1 - 3 * (N - 1))
         (N - 2)(N - 3)

где N — длина вектора x.

Скорректированный коэффициент эксцесса получается путем замены выборочных второго и четвертого центральных моментов их несмещенными версиями. Он является несмещенной оценкой эксцесса генеральной совокупности для нормальных генеральных совокупностей.

Если x является матрицей или, более общим образом, многомерным массивом, возвращает эксцесс вдоль первого неединичного измерения. Если задан необязательный аргумент dim, работайте вдоль этого измерения.

См. также: var, skewness, moment.

: moment (x, p)
: moment (x, p, type)
: moment (x, p, dim)
: moment (x, p, type, dim)
: moment (x, p, dim, type)

Вычислите центральный момент p-го порядка вектора x.

Центральный момент p-го порядка x определяется как:

1/N SUM_i (x(i) - mean(x))^p

где N — длина вектора x.

Если x является матрицей, возвращает строковый вектор, содержащий p-й центральный момент каждого столбца.

Если задан необязательный аргумент dim, работайте вдоль этого измерения.

Необязательный строковый аргумент type указывает тип вычисляемого момента. Допустимые варианты:

"c"

Центральный момент (по умолчанию).

"a"
"ac"

Абсолютный центральный момент. Момент относительно среднего значения, игнорируя знак, определяется как

1/N SUM_i (abs (x(i) - mean(x)))^p
"r"

Сырой момент. Момент относительно нуля, определяется как

moment (x) = 1/N SUM_i x(i)^p
"ar"

Абсолютный сырой момент. Момент относительно нуля, игнорируя знак, определяется как

1/N SUM_i ( abs (x(i)) )^p

Если заданы как type, так и dim, они могут появиться в любом порядке.

См. также: var, skewness, kurtosis.

: q = quantile (x)
: q = quantile (x, p)
: q = quantile (x, p, dim)
: q = quantile (x, p, dim, method)

Для выборки x, рассчитайте квантили, q, соответствующие значениям кумулятивной вероятности в p. Все нечисленные значения (NaN) x игнорируются.

Если x является матрицей, вычислите квантили для каждого столбца и верните их в матрице, так что i-я строка q содержит p(i)-й квантили каждого столбца x.

Если p не указано, верните квантили для [0.00 0.25 0.50 0.75 1.00]. Необязательный аргумент dim определяет измерение, по которому рассчитываются квантили. Если dim опущено, по умолчанию используется первое неединичное измерение.

Доступные методы вычисления выборочных квантилей — девять методов, используемых в R (https://www.r-project.org/). Значение по умолчанию — method = 5.

Дискретные методы вычисления выборочных квантилей 1, 2 и 3

  1. Метод 1: Обратная функция эмпирического распределения.
  2. Метод 2: Аналогично методу 1, но с усреднением на разрывах.
  3. Метод 3: Определение SAS: ближайшая чётная порядковая статистика.

Непрерывные методы вычисления выборочных квантилей с 4 по 9, где p(k) — функция линейной интерполяции, учитывающая характерную для каждого метода функцию распределения.

  1. Метод 4: p(k) = k / N. То есть линейная интерполяция эмпирической функции распределения, где N — длина P.
  2. Метод 5: p(k) = (k - 0.5) / N. То есть кусочно-линейная функция, где узлы — значения посередине шагов эмпирической функции распределения.
  3. Метод 6: p(k) = k / (N + 1).
  4. Метод 7: p(k) = (k - 1) / (N - 1).
  5. Метод 8: p(k) = (k - 1/3) / (N + 1/3). Полученные оценки квантилей приблизительно медианно-несмещенные независимо от распределения x.
  6. Метод 9: p(k) = (k - 3/8) / (N + 1/4). Полученные оценки квантилей приблизительно несмещены для ожидаемых порядковых статистик, если x нормально распределён.

Хиндман и Фэн (1996) рекомендуют метод 8. Maxima, S и R (версии до 2.0.0) используют 7 в качестве значения по умолчанию. Minitab и SPSS используют метод 6. MATLAB использует метод 5.

Ссылки:

  • Беккер, Р. А., Чемберс, Дж. М. и Уилкс, А. Р. (1988) Новый язык S. Wadsworth & Brooks/Cole.
  • Хиндман, Р. Дж. и Фэн, Ю. (1996) Выборочные квантили в статистических пакетах, American Statistician, 50, 361–365.
  • R: Язык и среда для статистических вычислений; https://cran.r-project.org/doc/manuals/fullrefman.pdf.

Примеры:

x = randi (1000, [10, 1]);  # Create empirical data in range 1-1000
q = quantile (x, [0, 1]);   # Return minimum, maximum of distribution
q = quantile (x, [0.25 0.5 0.75]); # Return quartiles of distribution

См. также: prctile.

: q = prctile (x)
: q = prctile (x, p)
: q = prctile (x, p, dim)

Для выборки x, вычислите квантили, q, соответствующие значениям кумулятивной вероятности, p, в процентах.

Если x является матрицей, вычислите процентили для каждого столбца и верните их в матрице, так что i-я строка q содержит p(i)-й процентили каждого столбца x.

Если p не указано, верните квантили для [0 25 50 75 100].

Необязательный аргумент dim определяет измерение, по которому рассчитываются процентили. Если dim опущено, по умолчанию используется первое неединичное измерение.

Примечание к программисту: все нечисленные значения (NaN) x игнорируются.

См. также: quantile.

Быстрый обзор набора данных можно получить с помощью функции statistics.

: statistics (x)
: statistics (x, dim)

Возвращает вектор с минимальным, первым квартилем, медианой, третьим квартилем, максимальным значением, средним значением, стандартным отклонением, асимметрией и эксцессом элементов вектора x.

Если x является матрицей, вычисляются статистики по первому неединичному измерению.

Если задан необязательный аргумент dim, работайте вдоль этого измерения.

См. также: min, max, median, mean, std, skewness, kurtosis.

© 1996–2022 The Octave Project Developers
Permission is granted to make and distribute verbatim copies of this manual provided the copyright notice and this permission notice are preserved on all copies.
Permission is granted to copy and distribute modified versions of this manual under the conditions for verbatim copying, provided that the entire resulting derived work is distributed under the terms of a permission notice identical to this one.
Permission is granted to copy and distribute translations of this manual into another language, under the above conditions for modified versions.
https://docs.octave.org/v6.4.0/Descriptive-Statistics.html

Spec-Zone.ru

Настройки Оффлайн Что нового Помощь О нас
Spec-Zone .ru
спецификации, руководства, описания, API