Метод главных компонент

Метод главных компонент (англ. principal component analysis, PCA) — один из основных способов уменьшить размерность данных, потеряв наименьшее количество информации. Изобретён Карлом Пирсоном в 1901 году. Применяется во многих областях, в том числе в эконометрике, биоинформатике, обработке изображений, для сжатия данных, в общественных науках➤.

Вычисление главных компонент может быть сведено к вычислению сингулярного разложения матрицы данных➤ или к вычислению собственных векторов и собственных значений ковариационной матрицы исходных данных➤. Иногда метод главных компонент называют преобразованием Кархунена — Лоэва^[1] или преобразованием Хотеллинга (англ. Hotelling transform).

Remove ads

Формальная постановка задачи

Суммиров вкратце

Перспектива

Задача анализа главных компонент имеет, как минимум, четыре базовые версии:

аппроксимировать данные линейными многообразиями меньшей размерности;
найти подпространства меньшей размерности, в ортогональной проекции на которые разброс данных (то есть среднеквадратичное отклонение от среднего значения) максимален;
найти подпространства меньшей размерности, в ортогональной проекции на которые среднеквадратичное расстояние между точками максимально;
для данной многомерной случайной величины построить такое ортогональное преобразование координат, в результате которого корреляции между отдельными координатами обратятся в нуль.

Первые три версии оперируют конечными множествами данных. Они эквивалентны и не используют никакой гипотезы о статистическом порождении данных. Четвёртая версия оперирует случайными величинами. Конечные множества появляются здесь как выборки из данного распределения, а решение трёх первых задач — как приближение к разложению по теореме Кархунена — Лоэва («истинному преобразованию Кархунена — Лоэва»). При этом возникает дополнительный и не вполне тривиальный вопрос о точности этого приближения.

Аппроксимация данных линейными многообразиями

Thumb — Иллюстрация к знаменитой работе Пирсона (1901): даны точки $P_{i}$ на плоскости, $p_{i}$ — расстояние от $P_{i}$ до прямой $AB$ . Ищется прямая $AB$ , минимизирующая сумму $\sum _{i}p_{i}^{2}$

Метод главных компонент начинался с задачи наилучшей аппроксимации конечного множества точек прямыми и плоскостями (Пирсон, 1901). Дано конечное множество векторов $x_{1},x_{2},\dots ,x_{m}\in \mathbb {R} ^{n}$ , для каждого $k=0,1,\dots ,n-1$ среди всех $k$ -мерных линейных многообразий в $\mathbb {R} ^{n}$ найти такое $L_{k}\subset \mathbb {R} ^{n}$ , что сумма квадратов уклонений $x_{i}$ от $L_{k}$ минимальна:

\sum _{i=1}^{m}\operatorname {dist} ^{2}(x_{i},L_{k})\to \min

где $\operatorname {dist} (x_{i},L_{k})$ — евклидово расстояние от точки до линейного многообразия. Всякое $k$ -мерное линейное многообразие в $\mathbb {R} ^{n}$ может быть задано как множество линейных комбинаций $L_{k}=\{a_{0}+\beta _{1}a_{1}+\dots +\beta _{k}a_{k}|\beta _{i}\in \mathbb {R} \}$ , где параметры $\beta _{i}$ пробегают вещественную прямую $\mathbb {R}$ , $a_{0}\in \mathbb {R} ^{n}$ а $\left\{a_{1},\dots ,a_{k}\right\}\subset \mathbb {R} ^{n}$ — ортонормированный набор векторов

\operatorname {dist} ^{2}(x_{i},L_{k})=\Vert x_{i}-a_{0}-\sum _{j=1}^{k}a_{j}(a_{j},x_{i}-a_{0})\Vert ^{2}

где $\Vert \cdot \Vert$ евклидова норма, $\left(a_{j},x_{i}\right)$ — евклидово скалярное произведение, или в координатной форме:

\operatorname {dist} ^{2}(x_{i},L_{k})=\sum _{l=1}^{n}\left(x_{il}-a_{0l}-\sum _{j=1}^{k}a_{jl}\sum _{q=1}^{n}a_{jq}(x_{iq}-a_{0q})\right)^{2}

Решение задачи аппроксимации для $k=0,1,\dots ,n-1$ даётся набором вложенных линейных многообразий $L_{0}\subset L_{1}\subset \dots L_{n-1}$ , $L_{k}=\{a_{0}+\beta _{1}a_{1}+\ldots +\beta _{k}a_{k}|\beta _{i}\in \mathbb {R} \}$ . Эти линейные многообразия определяются ортонормированным набором векторов $\left\{a_{1},...,a_{n-1}\right\}$ (векторами главных компонент) и вектором $a_{0}$ . Вектор $a_{0}$ ищется как решение задачи минимизации для $L_{0}$ :

a_{0}={\underset {a_{0}\in \mathbb {R} ^{n}}{\operatorname {argmin} }}\left(\sum _{i=1}^{m}\operatorname {dist} ^{2}(x_{i},L_{0})\right)

то есть

a_{0}={\underset {a_{0}\in \mathbb {R} ^{n}}{\operatorname {argmin} }}\left(\sum _{i=1}^{m}\Vert x_{i}-a_{0}\Vert ^{2}\right)

Это — выборочное среднее: $a_{0}={\frac {1}{m}}\sum _{i=1}^{m}x_{i}={\overline {X}}$ .

Фреше в 1948 году обратил внимание, что вариационное определение среднего (как точки, минимизирующей сумму квадратов расстояний до точек данных) очень удобно для построения статистики в произвольном метрическом пространстве, и построил обобщение классической статистики для общих пространств (обобщённый метод наименьших квадратов).

Векторы главных компонент могут быть найдены как решения однотипных задач оптимизации:

Централизуются данные (вычитанием среднего): $x_{i}:=x_{i}-{\overline {X}}$ . Теперь $\sum _{i=1}^{m}x_{i}=0$ ;
Отыскивается первая главная компонента как решение задачи:
$a_{1}={\underset {\Vert a_{1}\Vert =1}{\operatorname {argmin} }}\left(\sum _{i=1}^{m}\Vert x_{i}-a_{1}(a_{1},x_{i})\Vert ^{2}\right)$ .

если решение не единственно, то осуществляется выбор одного из них.
Из данных вычитается проекция на первую главную компоненту:
$x_{i}:=x_{i}-a_{1}\left(a_{1},x_{i}\right)$ ;
Отыскивается вторая главная компонента как решение задачи:
$a_{2}={\underset {\Vert a_{2}\Vert =1}{\operatorname {argmin} }}\left(\sum _{i=1}^{m}\Vert x_{i}-a_{2}(a_{2},x_{i})\Vert ^{2}\right)$ .

Если решение не единственно, то выбирается одно из них.

Далее процесс продолжается, то есть на шаге $2k-1$ вычитается проекция на $(k-1)$ -ю главную компоненту (к этому моменту проекции на предшествующие $(k-2)$ главные компоненты уже вычтены):

x_{i}:=x_{i}-a_{k-1}\left(a_{k-1},x_{i}\right)

;

и на шаге $2k$ определяется $k$ -я главная компонента как решение задачи:

a_{k}={\underset {\Vert a_{k}\Vert =1}{\operatorname {argmin} }}\left(\sum _{i=1}^{m}\Vert x_{i}-a_{k}(a_{k},x_{i})\Vert ^{2}\right)

(если решение не единственно, то выбирается одно из них).

На каждом подготовительном шаге $(2k-1)$ вычитается проекция на предшествующую главную компоненту. Найденные векторы $\left\{a_{1},...,a_{n-1}\right\}$ ортонормированы просто в результате решения описанной задачи оптимизации, однако чтобы не дать ошибкам вычисления нарушить взаимную ортогональность векторов главных компонент, можно включать $a_{k}\bot \{a_{1},...,a_{k-1}\}$ в условия задачи оптимизации.

Неединственность в определении $a_{k}$ помимо тривиального произвола в выборе знака ( $a_{k}$ и $-a_{k}$ решают ту же задачу) может быть более существенной и происходить, например, из условий симметрии данных. Последняя главная компонента $a_{n}$ — единичный вектор, ортогональный всем предыдущим $a_{k}$ .

Поиск ортогональных проекций с наибольшим рассеянием

Пусть нам дан центрированный набор векторов данных $x_{i}\in \mathbb {R} ^{n}\;(i=1,...,m)$ (среднее арифметическое значение $x_{i}$ равно нулю). Задача — найти такое ортогональное преобразование в новую систему координат, для которого были бы верны следующие условия:

Выборочная дисперсия данных вдоль первой координаты максимальна (эту координату называют первой главной компонентой);
Выборочная дисперсия данных вдоль второй координаты максимальна при условии ортогональности первой координате (вторая главная компонента);
…
Выборочная дисперсия данных вдоль значений $k$ -ой координаты максимальна при условии ортогональности первым $k-1$ координатам;
…

Выборочная дисперсия данных вдоль направления, заданного нормированным вектором $a_{k}$ , это

S_{m}^{2}\left[(X,a_{k})\right]={\frac {1}{m}}\sum \limits _{i=1}^{m}(a_{k},x_{i})^{2}={\frac {1}{m}}\sum \limits _{i=1}^{m}\left(\sum \limits _{j=1}^{n}x_{ij}a_{kj}\right)^{2}

(поскольку данные центрированы, выборочная дисперсия здесь совпадает со средним квадратом уклонения от нуля).

Решение задачи о наилучшей аппроксимации даёт то же множество главных компонент $\left\{a_{i}\right\}$ , что и поиск ортогональных проекций с наибольшим рассеянием, по очень простой причине: $\Vert x_{i}-a_{k}(a_{k},x_{i})\Vert ^{2}=\Vert x_{i}\Vert ^{2}-(a_{k},x_{i})^{2},$ и первое слагаемое не зависит от $a_{k}$ .

Поиск ортогональных проекций с наибольшим среднеквадратичным расстоянием между точками

Ещё одна эквивалентная формулировка следует из очевидного тождества, верного для любых $m$ векторов $x_{i}$ :

{\frac {1}{m(m-1)}}\sum _{i,j=1}^{m}(x_{i}-x_{j})^{2}={\frac {2m^{2}}{m(m-1)}}\left[{\frac {1}{m}}\sum _{i=1}^{m}x_{i}^{2}-\left({\frac {1}{m}}\sum _{i}^{m}x_{i}\right)^{2}\right].

В левой части этого тождества стоит среднеквадратичное расстояние между точками, а в квадратных скобках справа — выборочная дисперсия. Таким образом, в методе главных компонент ищутся подпространства, в проекции на которые среднеквадратичное расстояние между точками максимально (или, что то же самое, его искажение в результате проекции минимально)^[2]. Такая переформулировка позволяет строить обобщения с взвешиванием различных парных расстояний (а не только точек).

Аннулирование корреляций между координатами

Для заданной $n$ -мерной случайной величины $X$ найти такой ортонормированный базис, $\left\{a_{1},...,a_{n}\right\}$ , в котором коэффициент ковариации между различными координатами равен нулю. После преобразования к этому базису

\operatorname {cov} (X_{i},X_{j})=0

для

i\neq j

Здесь $\operatorname {cov} (X_{i},X_{j})=\operatorname {E} [(X_{i}-\operatorname {E} [X_{i}])(X_{j}-\operatorname {E} [X_{j}])]$ — коэффициент ковариации, где $\operatorname {E}$ — математическое ожидание.

Remove ads

Диагонализация ковариационной матрицы

Суммиров вкратце

Перспектива

Все задачи о главных компонентах приводят к задаче диагонализации ковариационной матрицы или выборочной ковариационной матрицы. Эмпирическая или выборочная ковариационная матрица, это

C=[c_{ij}],\ c_{ij}={\frac {1}{m-1}}\sum _{l=1}^{m}(x_{li}-{\overline {X_{i}}})(x_{lj}-{\overline {X_{j}}}).

Ковариационная матрица многомерной случайной величины $X$ , это

\Sigma =[\sigma _{ij}],\ \sigma _{ij}=\operatorname {cov} (X_{i},X_{j})=\operatorname {E} [(X_{i}-\operatorname {E} [X_{i}])(X_{j}-\operatorname {E} [X_{j}])].

Векторы главных компонент для задач о наилучшей аппроксимации и о поиске ортогональных проекций с наибольшим рассеянием — это ортонормированный набор $\left\{a_{1},...,a_{n}\right\}$ собственных векторов эмпирической ковариационной матрицы $C$ , расположенных в порядке убывания собственных значений ${\displaystyle \lambda$ Эти векторы служат оценкой для собственных векторов ковариационной матрицы $\operatorname {cov} (X_{i},X_{j})$ . В базисе из собственных векторов ковариационной матрицы она, естественно, диагональна, и в этом базисе коэффициент ковариации между различными координатами равен нулю.

Если спектр ковариационной матрицы вырожден, то выбирают произвольный ортонормированный базис собственных векторов. Он существует всегда, а собственные числа ковариационной матрицы всегда вещественны и неотрицательны.

Remove ads

Сингулярное разложение матрицы данных

Суммиров вкратце

Перспектива

Идея сингулярного разложения

Математическое содержание метода главных компонент — это спектральное разложение ковариационной матрицы $C$ , то есть представление пространства данных в виде суммы взаимно ортогональных собственных подпространств $C$ , а самой матрицы $C$ — в виде линейной комбинации ортогональных проекторов на эти подпространства с коэффициентами $\lambda _{i}$ . Если $\operatorname {X} =\left\{x_{1},...,x_{m}\right\}^{T}$ — матрица, составленная из векторов-строк (размерности $n$ ) центрированных данных, то $C={\frac {1}{m-1}}\operatorname {X} ^{T}\operatorname {X}$ и задача о спектральном разложении ковариационной матрицы $C$ превращается в задачу о сингулярном разложении матрицы данных $\operatorname {X}$ .

Число $\sigma \geq 0$ называется сингулярным числом матрицы $\operatorname {X}$ тогда и только тогда, когда существуют правый и левый сингулярные векторы: такие $m$ -мерный вектор-строка $b_{\sigma }$ и $n$ -мерный вектор-столбец $a_{\sigma }$ (оба единичной длины), что выполнено два равенства:

\operatorname {X} a_{\sigma }=\sigma b_{\sigma }^{T};\,\,b_{\sigma }\operatorname {X} =\sigma a_{\sigma }^{T}.

Пусть $p=\operatorname {rang} \operatorname {X} \leq \min\{n,m\}$ — ранг матрицы данных. Сингулярное разложение матрицы данных $\operatorname {X}$ — это её представление в виде

\operatorname {X} =\sum _{l=1}^{p}\sigma _{l}b_{l}^{T}a_{l}^{T};\;\operatorname {X} ^{T}=\sum _{l=1}^{p}\sigma _{l}a_{l}b_{l}\;\left(x_{ij}=\sum _{l=1}^{p}\sigma _{l}b_{li}a_{lj}\right),

где $\sigma _{l}>0$ — сингулярное число, $a_{l}=(a_{lj}),\,j=1,...n$ — соответствующий правый сингулярный вектор-столбец, а $b_{l}=(b_{li}),\,i=1,...m$ — соответствующий левый сингулярный вектор-строка ( $l=1,...p$ ). Правые сингулярные векторы-столбцы $a_{l}$ , участвующие в этом разложении, являются векторами главных компонент и собственными векторами эмпирической ковариационной матрицы $C={\frac {1}{m-1}}\operatorname {X} ^{T}\operatorname {X}$ , отвечающими положительным собственным числам $\lambda _{l}={\frac {1}{m-1}}\sigma _{l}^{2}>0$ .

Хотя формально задачи сингулярного разложения матрицы данных и спектрального разложения ковариационной матрицы совпадают, алгоритмы вычисления сингулярного разложения напрямую, без вычисления ковариационной матрицы и её спектра, более эффективны и устойчивы^[3].

Теория сингулярного разложения была создана Джеймсом Джозефом Сильвестром в 1889 году и изложена во всех подробных руководствах по теории матриц^[4].

Простой итерационный алгоритм сингулярного разложения

Основная процедура — поиск наилучшего приближения произвольной $m\times n$ матрицы $X=(x_{ij})$ матрицей вида $b\otimes a=(b_{i}a_{j})$ (где $b$ — $m$ -мерный вектор, а $a$ — $n$ -мерный вектор) методом наименьших квадратов:

F(b,a)={\frac {1}{2}}\sum _{i=1}^{m}\sum _{j=1}^{n}(x_{ij}-b_{i}a_{j})^{2}\to \min

Решение этой задачи даётся последовательными итерациями по явным формулам. При фиксированном векторе $a=(a_{j})$ значения $b=(b_{i})$ , доставляющие минимум форме $F(b,a)$ , однозначно и явно определяются из равенств $\partial F/\partial b_{i}=0$ :

{\frac {\partial F}{\partial b_{i}}}=-\sum _{j=1}^{n}(x_{ij}-b_{i}a_{j})a_{j}=0;\;\;b_{i}={\frac {\sum _{j=1}^{n}x_{ij}a_{j}}{\sum _{j=1}^{n}a_{j}^{2}}}\,.

Аналогично, при фиксированном векторе $b=(b_{i})$ определяются значения $a=(a_{j})$ :

a_{j}={\frac {\sum _{i=1}^{m}b_{i}x_{ij}}{\sum _{i=1}^{m}b_{i}^{2}}}\,.

B качестве начального приближения вектора $a$ берётся случайный вектор единичной длины, вычисляем вектор $b$ , далее для этого вектора $b$ вычисляем вектор $a$ и т. д. Каждый шаг уменьшает значение $F(b,a)$ . В качестве критерия остановки используется малость относительного уменьшения значения минимизируемого функционала $F(b,a)$ за шаг итерации ( $\Delta F/F$ ) или малость самого значения $F$ .

В результате для матрицы $X=(x_{ij})$ получается наилучшее приближение матрицей $P_{1}$ вида $b^{1}\otimes a^{1}=(b_{i}^{1}a_{j}^{1})$ (здесь верхним индексом обозначен номер приближения). Далее, из матрицы $X$ вычитается полученная матрицу $P_{1}$ , и для полученной матрицы уклонений $X_{1}=X-P_{1}$ вновь ищется наилучшее приближение $P_{2}$ этого же вида и т. д., пока, например, норма $X_{k}$ не станет достаточно малой. В результате получили итерационную процедуру разложения матрицы $X$ в виде суммы матриц ранга 1, то есть $X=P_{1}+P_{2}+\ldots +P_{q}\;(P_{l}=b^{l}\otimes a^{l})$ . Полагаем $\sigma _{l}=\|a^{l}\|\|b^{l}\|$ и нормируем векторы $a^{l}\,,\,b^{l}$ : $a^{l}:=a^{l}/\|a^{l}\|;\,\,b^{l}:=b^{l}/\|b^{l}\|.$ В результате получена аппроксимация сингулярных чисел $\sigma _{l}$ и сингулярных векторов (правых — $a^{l}$ и левых — $b^{l}$ ).

К достоинствам этого алгоритма относится его исключительная простота и возможность почти без изменений перенести его на данные с пробелами^[5], а также взвешенные данные.

Существуют различные модификации базового алгоритма, улучшающие точность и устойчивость. Например, векторы главных компонент $a^{l}$ при разных $l$ должны быть ортогональны «по построению», однако при большом числе итерации (большая размерность, много компонент) малые отклонения от ортогональности накапливаются, и может потребоваться специальная коррекция $a^{l}$ на каждом шаге, обеспечивающая его ортогональность ранее найденным главным компонентам.

Для квадратных симметричных положительно определённых матриц описанный алгоритм превращается в метод прямых итераций для поиска собственных векторов (см. статью Собственные векторы, значения и пространства).

Сингулярное разложение тензоров и тензорный метод главных компонент

Часто вектор данных имеет дополнительную структуру прямоугольной таблицы (например, плоское изображение) или даже многомерной таблицы — то есть тензора: $x_{i_{1}i_{2}...i_{q}}$ , $1\leq i_{j}\leq n_{j}$ . В этом случае также эффективно применять сингулярное разложение. Определение, основные формулы и алгоритмы переносятся практически без изменений: вместо матрицы данных имеем $q+1$ -индексную величину $\operatorname {X} =(x_{i_{0}i_{1}i_{2}...i_{q}})$ , где первый индекс $i_{0}$ -номер точки (тензора) данных.

Основная процедура — поиск наилучшего приближения тензора $x_{i_{0}i_{1}i_{2}...i_{q}}$ тензором вида $a_{i_{0}}^{0}a_{i_{1}}^{1}a_{i_{2}}^{2}...a_{i_{q}}^{q}$ (где $a^{0}=(a_{i_{0}}^{0})$ — $m$ -мерный вектор ( $m$ — число точек данных), $a^{l}=(a_{i_{l}}^{l})$ — вектор размерности $n_{l}$ при $l>0$ ) методом наименьших квадратов:

F={\frac {1}{2}}\sum _{i_{0}=1}^{m}\sum _{i_{1}=1}^{n_{1}}...\sum _{i_{q}=1}^{n_{q}}(x_{i_{0}i_{1}...i_{q}}-a_{i_{0}}^{0}a_{i_{1}}^{1}...a_{i_{q}}^{q})^{2}\to \min

Решение этой задачи даётся последовательными итерациями по явным формулам. Если заданы все векторы-сомножители кроме одного $a_{i_{k}}^{k}$ , то этот оставшийся определяется явно из достаточных условий минимума.

a_{i_{k}}^{k}={\frac {\sum _{i_{0}=1}^{m}\sum _{i_{1}=1}^{n_{1}}...\sum _{i_{k-1}=1}^{n_{k-1}}\sum _{i_{k+1}=1}^{n_{k+1}}...\sum _{i_{q}=1}^{n_{q}}x_{i_{0}i_{1}...i_{k-1}i_{k}i_{k+1}...i_{q}}a_{i_{0}}^{0}a_{i_{k-1}}^{k-1}a_{i_{k+1}}^{k+1}...a_{i_{q}}^{q}}{\prod _{j\neq k}\|a^{j}\|^{2}}}\,.

B качестве начального приближения векторов $a^{l}=(a_{i_{l}}^{l})$ ( $l>0$ ) берутся случайные векторы единичной длины, вычислим вектор $a^{0}$ , далее для этого вектора $a^{0}$ и данных векторов $a^{2},a^{3},...$ вычисляется вектор $a^{1}$ и так далее (циклически перебирая индексы). Каждый шаг уменьшает значение $F(b,a)$ . Алгоритм, очевидно, сходится. В качестве критерия остановки используется малость относительного уменьшения значения минимизируемого функционала $F$ за цикл или малость самого значения $F$ . Далее, из тензора $\operatorname {X}$ вычитается полученное приближение $a_{i_{0}}^{0}a_{i_{1}}^{1}a_{i_{2}}^{2}...a_{i_{q}}^{q}$ и для остатка вновь ищется наилучшее приближение этого же вида и т. д., пока, например, норма очередного остатка не станет достаточно малой.

Это многокомпонентное сингулярное разложение (тензорный метод главных компонент) успешно применяется при обработке изображений, видеосигналов, и, шире, любых данных, имеющих табличную или тензорную структуру.

Remove ads

Матрица преобразования к главным компонентам

Суммиров вкратце

Перспектива

Матрица $A$ преобразования данных к главным компонентам состоит из векторов главных компонент, расположенных в порядке убывания собственных значений:

A=\left\{a_{1},...,a_{n}\right\}^{T}

(

{\,}^{T}

означает транспонирование),

причём

AA^{T}=1.

То есть матрица $A$ является ортогональной.

Большая часть вариации данных будет сосредоточена в первых координатах, что позволяет перейти к пространству меньшей размерности.

Remove ads

Остаточная дисперсия

Суммиров вкратце

Перспектива

Пусть данные центрированы, ${\overline {X}}=0$ . При замене векторов данных $x_{i}$ на их проекцию на первые $k$ главных компонент $x_{i}\mapsto \sum _{j=1}^{k}a_{j}(a_{j},x_{i})$ вносится средний квадрат ошибки в расчёте на один вектор данных:

{\frac {1}{m}}\sum _{i=1}^{m}\left\Vert x_{i}-\sum _{j=1}^{k}a_{j}(a_{j},x_{i})\right\Vert ^{2}=\sum _{l=k+1}^{n}\lambda _{l},

где $\lambda _{1}\geq \lambda _{2}\geq \ldots \geq \lambda _{n}\geq 0$ собственные значения эмпирической ковариационной матрицы $C$ , расположенные в порядке убывания, с учётом кратности.

Эта величина называется остаточной дисперсией. Величина

{\frac {1}{m}}\sum _{i=1}^{m}\left\Vert \sum _{j=1}^{k}a_{j}(a_{j},x_{i})\right\Vert ^{2}={\frac {1}{m}}\sum _{i=1}^{m}\sum _{j=1}^{k}(a_{j},x_{i})^{2}=\sum _{l=1}^{k}\lambda _{l}

называется объяснённой дисперсией. Их сумма равна выборочной дисперсии. Соответствующий квадрат относительной ошибки — это отношение остаточной дисперсии к выборочной дисперсии (то есть доля необъяснённой дисперсии):

\delta _{k}^{2}={\frac {\lambda _{k+1}+\lambda _{k+2}+\ldots +\lambda _{n}}{\lambda _{1}+\lambda _{2}+\ldots +\lambda _{n}}}.

По относительной ошибке $\delta _{k}$ оценивается применимость метода главных компонент с проецированием на первые $k$ компонент.

Замечание: в большинстве вычислительных алгоритмов собственные числа $\lambda _{i}$ с соответствующими собственными векторами — главными компонентами $a_{i}$ вычисляются в порядке «от больших $\lambda _{i}$ — к меньшим». Для вычисления $\delta _{k}$ достаточно вычислить первые $k$ собственных чисел и след эмпирической ковариационной матрицы $C$ , $\operatorname {tr} C$ (сумму диагональных элементов $C$ , то есть дисперсий по осям). Тогда

\delta _{k}^{2}={\frac {1}{\operatorname {tr} C}}\left(\operatorname {tr} C-\sum _{i=1}^{k}\lambda _{i}\right).

Remove ads

Отбор главных компонент по правилу Кайзера

Суммиров вкратце

Перспектива

Целевой подход к оценке числа главных компонент по необходимой доле объяснённой дисперсии формально применим всегда, однако неявно он предполагает, что нет разделения на «сигнал» и «шум», и любая заранее заданная точность имеет смысл. Поэтому часто более продуктивна иная эвристика, основывающаяся на гипотезе о наличии «сигнала» (сравнительно малая размерность, относительно большая амплитуда) и «шума» (большая размерность, относительно малая амплитуда). С этой точки зрения метод главных компонент работает как фильтр: сигнал содержится в основном в проекции на первые главные компоненты, а в остальных компонентах пропорция шума намного выше.

Вопрос: как оценить число необходимых главных компонент, если отношение «сигнал/шум» заранее неизвестно?

Простейший и старейший метод отбора главных компонент даёт правило Кайзера (англ. Kaiser's rule): значимы те главные компоненты, для которых

\lambda _{i}>{\frac {1}{n}}\operatorname {tr} C,

то есть $\lambda _{i}$ превосходит среднее значение $\lambda$ (среднюю выборочную дисперсию координат вектора данных). Правило Кайзера хорошо работает в простых случаях, когда есть несколько главных компонент с $\lambda _{i}$ , намного превосходящими среднее значение, а остальные собственные числа меньше него. В более сложных случаях оно может давать слишком много значимых главных компонент. Если данные нормированы на единичную выборочную дисперсию по осям, то правило Кайзера приобретает особо простой вид: значимы только те главные компоненты, для которых $\lambda _{i}>1.$

Remove ads

Оценка числа главных компонент по правилу сломанной трости

Суммиров вкратце

Перспектива

Одним из наиболее популярных эвристических подходов к оценке числа необходимых главных компонент является правило сломанной трости (англ. Broken stick model)^[6]. Набор нормированных на единичную сумму собственных чисел ( $\lambda _{i}/\operatorname {tr} C$ , $i=1,...n$ ) сравнивается с распределением длин обломков трости единичной длины, сломанной в $n-1$ -й случайно выбранной точке (точки разлома выбираются независимо и равнораспределены по длине трости). Пусть $L_{i}$ ( $i=1,...n$ ) — длины полученных кусков трости, занумерованные в порядке убывания длины: $L_{1}\geq L_{2}\geq ...L_{n}$ . Нетрудно найти математическое ожидание $L_{i}$ :

l_{i}=\operatorname {E} (L_{i})={\frac {1}{n}}\sum _{j=i}^{n}{\frac {1}{j}}.

По правилу сломанной трости $k$ -й собственный вектор (в порядке убывания собственных чисел $\lambda _{i}$ ) сохраняется в списке главных компонент, если

{\frac {\lambda _{1}}{\operatorname {tr} C}}>l_{1}\;and\;{\frac {\lambda _{2}}{\operatorname {tr} C}}>l_{2}\;and\;...{\frac {\lambda _{k}}{\operatorname {tr} C}}>l_{k}.

На Рис. приведён пример для 5-мерного случая:

l_{1}

=(1+1/2+1/3+1/4+1/5)/5;

l_{2}

=(1/2+1/3+1/4+1/5)/5;

l_{3}

=(1/3+1/4+1/5)/5;

l_{4}

=(1/4+1/5)/5;

l_{5}

=(1/5)/5.

Для примера выбрано

{\frac {\lambda _{1}}{\operatorname {tr} C}}

=0.5;

{\frac {\lambda _{2}}{\operatorname {tr} C}}

=0.3;

{\frac {\lambda _{3}}{\operatorname {tr} C}}

=0.1;

{\frac {\lambda _{4}}{\operatorname {tr} C}}

=0.06;

{\frac {\lambda _{5}}{\operatorname {tr} C}}

=0.04.

По правилу сломанной трости в этом примере следует оставлять 2 главных компоненты:

{\frac {\lambda _{1}}{\operatorname {tr} C}}>l_{1}\;;\;{\frac {\lambda _{2}}{\operatorname {tr} C}}>l_{2}\;;\;{\frac {\lambda _{3}}{\operatorname {tr} C}}<l_{3}\;.

По оценкам пользователей, правило сломанной трости имеет тенденцию занижать количество значимых главных компонент.

Remove ads

Оценка числа главных компонент по числу обусловленности

И правило Кайзера, и правило сломанной трости весьма чувствительны к наличию иррелевантных атрибутов. Это легко демонстрируется на примере удвоения атрибутов. В работе Миркеса с соавторами^[7] был предложен простой тест на устойчивость оценки размерности: если просто продублировать атрибуты в базе данных, то оценка размерности увеличиться не должна. Ни правило Кайзера, ни правило сломанной трости этот тест не проходят из-за того, что «шлейф» компоненты с малыми собственными числами сдвигает оценку и пропрорционально увеличивает размерность. Этим недостатком не обладает оценка по числу обусловленности.^[7]^[8] Число обусловленности корреляционной матрицы, это отношение ее максимального собственного числа, $\lambda _{1}$ к минимальному $\lambda _{n}$ : $\kappa =\lambda _{1}/\lambda _{n}$ . Большое значение $\kappa$ означает плохую обусловленность и мультиколлинеарность. Для определение числа оставляемых компонент выбирается некоторое значение порога мультиколлинеарности $\kappa _{0}>1$ и оставляются те компоненты, для которых $\lambda _{i}>{\frac {\lambda _{1}}{\kappa _{0}}}$ . Таким образом, в оставшихся компонентах мультиколлинеарность отсутствует. Размерность данных оценивается как число собственных значений ковариационной матрицы, превышающее фиксированную долю ( $1/{\kappa _{0}}$ ) от ее наибольшего собственного значения. Выбор порога $\kappa _{0}$ определяется спецификой задачи. Многочисленные численные эксперименты показывают, что выбор $\kappa _{0}=10$ соответствует диапазону от малой до «умеренной» мультиколлинеарности в сохраняемых компонентах и приемлем для многих задач обработки данных. ^[7]^[9]

Remove ads

Нормировка

Суммиров вкратце

Перспектива

Нормировка после приведения к главным компонентам

После проецирования на первые $k$ главных компонент с $\lambda _{1}\geq \lambda _{2}\geq \ldots \geq \lambda _{k}>0$ удобно произвести нормировку на единичную (выборочную) дисперсию по осям. Дисперсия вдоль $i$ й главной компоненты равна $\lambda _{i}>0\;(1\leq i\leq k$ ), поэтому для нормировки надо разделить соответствующую координату на ${\sqrt {\lambda _{i}}}$ . Это преобразование не является ортогональным и не сохраняет скалярного произведения. Ковариационная матрица проекции данных после нормировки становится единичной, проекции на любые два ортогональных направления становятся независимыми величинами, а любой ортонормированный базис становится базисом главных компонент (напомним, что покоординатная нормировка меняет отношение ортогональности векторов). Отображение из пространства исходных данных на первые $k$ главных компонент вместе с нормировкой задаётся матрицей

K=\left\{{\frac {a_{1}}{\sqrt {\lambda _{1}}}},{\frac {a_{2}}{\sqrt {\lambda _{2}}}},...,{\frac {a_{k}}{\sqrt {\lambda _{k}}}}\right\}^{T}

Именно это преобразование чаще всего называется преобразованием Кархунена — Лоэва. Здесь $a_{i}$ — векторы-столбцы, а верхний индекс $T$ означает транспонирование.

Нормировка до вычисления главных компонент

Предупреждение: не следует путать нормировку, проводимую после преобразования к главным компонентам, с нормировкой и «обезразмериванием» при предобработке данных, проводимой до вычисления главных компонент. Предварительная нормировка нужна для обоснованного выбора метрики, в которой будет вычисляться наилучшая аппроксимация данных, или будут искаться направления наибольшего разброса (что эквивалентно). Например, если данные представляют собой трёхмерные векторы из «метров, литров и килограммов», то при использовании стандартного евклидового расстояния разница в 1 метр по первой координате будет вносить тот же вклад, что разница в 1 литр по второй, или в 1 кг по третьей. Обычно системы единиц, в которых представлены исходные данные, недостаточно точно отображают наши представления о естественных масштабах по осям, и проводится «обезразмеривание»: каждая координата делится на некоторый масштаб, определяемый данными, целями их обработки и процессами измерения и сбора данных.

Есть три существенно различных стандартных подхода к такой нормировке: на единичную дисперсию по осям (масштабы по осям равны средним квадратичным уклонениям — после этого преобразования ковариационная матрица совпадает с матрицей коэффициентов корреляции), на равную точность измерения (масштаб по оси пропорционален точности измерения данной величины) и на равные требования в задаче (масштаб по оси определяется требуемой точностью прогноза данной величины или допустимым её искажением — уровнем толерантности). На выбор предобработки влияют содержательная постановка задачи, а также условия сбора данных (например, если коллекция данных принципиально не завершена и данные будут ещё поступать, то нерационально выбирать нормировку строго на единичную дисперсию, даже если это соответствует смыслу задачи, поскольку это предполагает перенормировку всех данных после получения новой порции; разумнее выбрать некоторый масштаб, грубо оценивающий стандартное отклонение, и далее его не менять).

Предварительная нормировка на единичную дисперсию по осям разрушается поворотом системы координат, если оси не являются главными компонентами, и нормировка при предобработке данных не заменяет нормировку после приведения к главным компонентам.

Remove ads

Механическая аналогия и метод главных компонент для взвешенных данных

Если сопоставить каждому вектору данных единичную массу, то эмпирическая ковариационная матрица $C$ совпадёт с тензором инерции этой системы точечных масс (делённым на полную массу $m$ ), а задача о главных компонентах — с задачей приведения тензора инерции к главным осям. Можно использовать дополнительную свободу в выборе значений масс для учёта важности точек данных или надёжности их значений (важным данным или данным из более надёжных источников приписываются бо́льшие массы). Если вектору данных $x_{l}$ придаётся масса $w_{l}$ , то вместо эмпирической ковариационной матрицы $C$ получим

C^{w}=[c_{ij}^{w}],\ c_{ij}^{w}={\frac {1}{\sum _{l}w_{l}}}\sum _{l=1}^{m}w_{l}(x_{li}-{\overline {X_{i}}})(x_{lj}-{\overline {X_{j}}}).

Все дальнейшие операции по приведению к главным компонентам производятся так же, как и в основной версии метода: ищется ортонормированный собственный базис $C^{w}$ , упорядочивается по убыванию собственных значений, оценивается средневзвешенная ошибка аппроксимации данных первыми $k$ компонентами (по суммам собственных чисел $C^{w}$ ), проводится нормировка и так далее.

Более общий способ взвешивания даёт максимизация взвешенной суммы попарных расстояний^[10] между проекциями. Для каждых двух точек данных, $x_{l},\ x_{q}$ вводится вес $d_{lq}$ ; $d_{lq}=d_{ql}$ и $d_{l}=\sum _{q=1}^{m}d_{lq}$ . Вместо эмпирической ковариационной матрицы $C$ используется

C^{d}=[c_{ij}^{d}],\ c_{ij}^{d}=\sum _{l=1}^{m}d_{l}(x_{li}-{\overline {X_{i}}})(x_{lj}-{\overline {X_{j}}})-\sum _{l\neq q,\ l,q=1}^{m}d_{lq}(x_{li}-{\overline {X_{i}}})(x_{qj}-{\overline {X_{j}}}).

При $d_{lq}>0$ симметричная матрица $C^{d}$ положительно определена, поскольку положительна квадратичная форма:

\sum _{ij}c_{ij}^{d}a_{i}a_{j}={\frac {1}{2}}\sum _{lq}d_{lq}\left(\sum _{i}a_{i}(x_{li}-x_{qi})\right)^{2}.

Далее ищем ортонормированный собственный базис $C^{d}$ , упорядочиваем его по убыванию собственных значений, оцениваем средневзвешенную ошибку аппроксимации данных первыми $k$ компонентами и т. д. — в точности так же, как и в основном алгоритме.

Этот способ применяется при наличии классов: для $x_{l},\ x_{q}$ из разных классов вес $d_{lq}$ вес выбирается бо́льшим, чем для точек одного класса. В результате, в проекции на взвешенные главные компоненты различные классы «раздвигаются» на большее расстояние.

Другое применение — снижение влияния больших уклонений, так называемых аутлайеров (en.:outlier), которые могут искажать картину из-за использования среднеквадратичного расстояния: если выбрать $d_{lq}=1/\|x_{l}-x_{q}\|$ , то влияние больших уклонений будет уменьшено. Таким образом, описанная модификация метода главных компонент является более робастной, чем классическая.

Remove ads

Специальная терминология

Суммиров вкратце

Перспектива

В статистике при использовании метода главных компонент используют несколько специальных терминов.

Матрица данных — $\mathbf {X} =\{x_{1},...x_{m}\}^{T}$ ; каждая строка — вектор предобработанных данных (центрированных и правильно нормированных), число строк — $m$ (количество векторов данных), число столбцов — $n$ (размерность пространства данных);
Матрица нагрузок (англ. loadings) — $\mathbf {P} =\{a_{1},...a_{k}\}$ ; каждый столбец — вектор главных компонент, число строк — $n$ (размерность пространства данных), число столбцов — $k$ (количество векторов главных компонент, выбранных для проецирования);
Матрица счетов (англ. scores) — $\mathbf {T} =[t_{ij}];\;t_{ij}=(x_{i},a_{j})$ ; каждая строка — проекция вектора данных на $k$ главных компонент; число строк — $m$ (количество векторов данных), число столбцов — $k$ (количество векторов главных компонент, выбранных для проецирования);
Матрица $Z$ -счетов (англ. $Z$ -scores) — $\mathbf {Z} =[z_{ij}];\;z_{ij}={\frac {(x_{i},a_{j})}{\sqrt {\lambda _{j}}}}$ ; каждая строка — проекция вектора данных на $k$ главных компонент, нормированная на единичную выборочную дисперсию; число строк — $m$ (количество векторов данных), число столбцов — $k$ (количество векторов главных компонент, выбранных для проецирования);
Матрица ошибок (или остатков) (англ. errors или residuals) — $\mathbf {E} =\mathbf {X} -\mathbf {T} \mathbf {P} ^{T}$ .
Основная формула: $\mathbf {X} =\mathbf {T} \mathbf {P} ^{T}+\mathbf {E}$ .

Remove ads

Границы применимости и ограничения эффективности метода

Суммиров вкратце

Перспектива

Метод главных компонент применим всегда. Распространённое утверждение о том, что он применим только к нормально распределённым данным (или для распределений, близких к нормальным), неверно: в исходной формулировке Пирсона ставится задача об аппроксимации конечного множества данных и отсутствует даже гипотеза об их статистическом порождении, не говоря уж о распределении.

Однако метод не всегда эффективно снижает размерность при заданных ограничениях на точность $\delta _{k}$ . Прямые и плоскости не всегда обеспечивают хорошую аппроксимацию. Например, данные могут с хорошей точностью следовать какой-нибудь кривой, а эта кривая может быть сложно расположена в пространстве данных. В этом случае метод главных компонент для приемлемой точности потребует нескольких компонент (вместо одной) или вообще не даст снижения размерности при приемлемой точности. Для работы с такими «кривыми» главными компонентами изобретён метод главных многообразий^[12] и различные версии нелинейного метода главных компонент^[13]^[14]. Больше неприятностей могут доставить данные сложной топологии. Для их аппроксимации также изобретены различные методы, например, самоорганизующиеся карты Кохонена, нейронный газ^[15] или топологические грамматики^[11]. Если данные статистически порождены с распределением, сильно отличающимся от нормального, то для аппроксимации распределения полезно перейти от главных компонент к независимым компонентам^[16], которые уже не ортогональны в исходном скалярном произведении. Наконец, для изотропного распределения (даже нормального) вместо эллипсоида рассеяния получаем шар, и уменьшить размерность методами аппроксимации невозможно.

Примеры использования

Суммиров вкратце

Перспектива

Визуализация данных

Визуализация данных — представление в наглядной форме данных эксперимента или результатов теоретического исследования.

Первым выбором в визуализации множества данных является ортогональное проецирование на плоскость первых двух главных компонент (или 3-мерное пространство первых трёх главных компонент). Плоскость проецирования является по сути плоским двумерным «экраном», расположенным таким образом, чтобы обеспечить «картинку» данных с наименьшими искажениями. Такая проекция будет оптимальна (среди всех ортогональных проекций на разные двумерные экраны) в трёх отношениях:

Минимальна сумма квадратов расстояний от точек данных до проекций на плоскость первых главных компонент, то есть экран расположен максимально близко по отношению к облаку точек.
Минимальна сумма искажений квадратов расстояний между всеми парами точек из облака данных после проецирования точек на плоскость. (Это означает, что максимальна сумма квадратов расстояний между проекциями.)
Минимальна сумма искажений квадратов расстояний между всеми точками данных и их «центром тяжести». (Это означает, что максимальна сумма квадратов расстояний между проекциями и их центром тяжести.)

Визуализация данных является одним из наиболее широко используемых приложений метода главных компонент и его нелинейных обобщений^[2].

Компрессия изображений и видео

Для уменьшения пространственной избыточности пикселей при кодировании изображений и видео используется линейное преобразование блоков пикселей. Последующие квантования полученных коэффициентов и кодирование без потерь позволяют получить значительные коэффициенты сжатия. Использование преобразования PCA в качестве линейного преобразования является для некоторых типов данных оптимальным с точки зрения размера полученных данных при одинаковом искажении^[17]. На данный момент этот метод активно не используется, в основном из-за большой вычислительной сложности. Также сжатия данных можно достичь, отбрасывая последние коэффициенты преобразования.

Подавление шума на изображениях

Основная суть метода^[18] — при удалении шума из блока пикселей представить окрестность этого блока в виде набора точек в многомерном пространстве, применить к нему PCA и оставить только первые компоненты преобразования. При этом предполагается, что в первых компонентах содержится основная полезная информация, оставшиеся же компоненты содержат ненужный шум. Применив обратное преобразование после редукции базиса главных компонент, мы получим изображение без шума.

Индексация видео

Основная идея — представить при помощи PCA каждый кадр видео несколькими значениями, которые в дальнейшем будут использоваться при построении базы данных и запросам к ней. Столь существенная редукция данных позволяет значительно увеличить скорость работы и устойчивость к ряду искажений в видео.

Биоинформатика

Метод главных компонент интенсивно используется в биоинформатике для сокращения размерности описания, выделения значимой информации, визуализации данных и др. Один из распространённых вариантов использования — анализ соответствий^[19]^[20]^[21]. На иллюстрациях (Рис. А, Б) генетический текст^[22] представлен как множество точек в 64-мерном пространстве частот триплетов. Каждая точка соответствует фрагменту ДНК в скользящем окне длиной 300 нуклеотидов (ДНК-блуждание). Этот фрагмент разбивается на неперекрывающиеся триплеты, начиная с первой позиции. Относительные частоты этих триплетов во фрагменте и составляют 64-мерный вектор. На Рис. А представлена проекция на первые 2 главные компоненты для генома бактерии Streptomyces coelicolor. На Рис. Б представлена проекция на первые 3 главные компоненты. Оттенками красного и коричневого выделены фрагменты кодирующих последовательностей в прямой цепи ДНК, а оттенками зелёного выделены фрагменты кодирующих последовательностей в обратной цепи ДНК. Чёрным помечены фрагменты, принадлежащие некодирующей части. Анализ методом главных компонент большинства известных бактериальных геномов представлен на специализированном сайте^[23].

Хемометрика

Метод главных компонент — один из основных методов в хемометрике. Позволяет разделить матрицу исходных данных X на две части: «содержательную» и «шум».

Психодиагностика

Психодиагностика является одной из наиболее разработанных областей приложения метода главных компонент^[24]. Стратегия использования основывается на гипотезе об автоинформативности экспериментальных данных, которая подразумевает, что диагностическую модель можно создать путём аппроксимации геометрической структуры множества объектов в пространстве исходных признаков. Хорошую линейную диагностическую модель удаётся построить, когда значительная часть исходных признаков внутренне согласованна. Если эта внутренняя согласованность отражает искомый психологический конструкт, то параметры линейной диагностической модели (веса признаков) даёт метод главных компонент.

Эконометрика

Метод главных компонент — один из ключевых инструментов эконометрики, он применяется для наглядного представления данных, обеспечения лаконизма моделей, упрощения счёта и интерпретации, сжатия объёмов хранимой информации. Метод обеспечивает максимальную информативность и минимальное искажение геометрической структуры исходных данных.

Социология

В социологии метод необходим для решения первых двух основных задач^[25]:

анализ данных (описание результатов опросов или других исследований, представленных в виде массивов числовых данных);
описание социальных явлений (построение моделей явлений, в том числе и математических моделей).

Политология

В политологии метод главных компонент был основным инструментом проекта «Политический атлас современности»^[26] для линейного и нелинейного анализа рейтингов 192 стран мира по пяти специально разработанным интегральным индексам (уровня жизни, международного влияния, угроз, государственности и демократии). Для картографии результатов этого анализа разработана специальная геоинформационная система, объединяющая географическое пространство с пространством признаков. Также созданы карты данных политического атласа, использующие в качестве подложки двумерные главные многообразия в пятимерном пространстве стран. Отличие карты данных от географической карты заключается в том, что на географической карте рядом оказываются объекты, которые имеют сходные географические координаты, в то время как на карте данных рядом оказываются объекты (страны) с похожими признаками (индексами).

Сокращение размерности динамических моделей

Проклятие размерности затрудняет моделирование сложных систем. Сокращение размерности модели — необходимое условие успеха моделирования. Для достижения этой цели создана разветвлённая математическая технология. Метод главных компонент также используется в этих задачах (часто под названием истинное или собственное ортогональное разложение — англ. proper orthogonal decomposition (POD)). Например, при описании динамики турбулентности динамические переменные — поле скоростей — принадлежат бесконечномерному пространству (или, если представлять поле его значениями на достаточно мелкой сетке, — конечномерному пространству большой размерности). Можно набрать большую коллекцию мгновенных значений полей и применить к этому множеству многомерных «векторов данных» метод главных компонент. Эти главные компоненты называются также эмпирические собственные векторы. В некоторых случаях (структурная турбулентность) метод даёт впечатляющее сокращение размерности^[27]. Другие области применения этой техники сокращения динамических моделей чрезвычайно разнообразны — от теоретических основ химической технологии до океанологии и климатологии.

Сенсорная оценка пищевых продуктов

Своё применение метод главных компонент получил при проведении сенсорной (органолептической) оценки свойств пищевых продуктов^[28]. Метод главных компонент позволяет проводить классификации пищевых продуктов в тех случаях, когда для характеристики их свойств используется одновременно большое число дескрипторов, например при оценке свойств вина,^[29] мармелада,^[30] экструдированных пищевых продуктов,^[31] сыра,^[32] и других.

Альтернативы и обобщения

Метод главных компонент — наиболее распространённый подход к снижению размерности, однако существуют и другие способы, в частности, метод независимых компонент, многомерное шкалирование, а также многочисленные нелинейные обобщения: метод главных кривых и многообразий, метод упругих карт, поиск наилучшей проекции (англ. Projection Pursuit), нейросетевые методы «узкого горлышка», самоорганизующиеся карты Кохонена.

См. также

SSA (метод)

Примечания

Loading content...

Литература

Loading content...

Ссылки

Loading content...

Loading related searches...

Wikiwand - on

Seamless Wikipedia browsing. On steroids.

Remove ads