當前位置：首頁 > 编程资源 > 编程问答 >内容正文

编程问答

基于EM的多直线拟合实现及思考

發布時間：2024/4/14 编程问答 39 豆豆

生活随笔收集整理的這篇文章主要介紹了基于EM的多直线拟合实现及思考小編覺得挺不錯的,現在分享給大家,幫大家做個參考.

作者：桂。

時間:2017-03-22 ?06:13:50

鏈接：http://www.cnblogs.com/xingshansi/p/6597796.html?

聲明：歡迎被轉載，不過記得注明出處哦~

前言

分布擬合與曲線擬合系列本想簡單梳理，卻啰嗦的沒完沒了。本文主要介紹：多直線的擬合，多曲線可以依次類推。全文主要包括：

　　1）背景介紹

　　2）理論推導

　　3）代碼實現

　　4）關于擬合的思考

內容多有借鑒他人，最后一并附上鏈接。

一、背景介紹

對于單個直線，可以借助MLE或者最小二乘進行求參，對于多條直線呢？

假設一堆數據點（$x_j,l_j$），它由兩個線性模型產生：

其中$n_{1j}、n_{2j}$分別為對應的隨機噪聲。

在分析最小二乘與最大似然聯系的時候，知道二者可相互轉化；另外在分析混合模型（GMM,LMM）時，都是借助最大似然函數。同樣，多直線擬合問題是含有隱變量的最小二乘擬合，也就可以轉化為最大似然問題，故求解與混合模型（GMM,LMM）方法類似。

二、理論推導

假設誤差服從高斯分布，故可借助GMM來解決該問題（誤差服從拉普拉斯分布，則借助LMM來解決）。

?　　A-E-Step

1）求解隱變量，轉化為完全數據

${{Z_j} \in {\Upsilon _k}}$表示第$j$個觀測點來自第$k$個分模型。

2）構造Q函數

$Q\left( {\Theta ,{\Theta ^{\left( i \right)}}} \right) = \sum\limits_{j = 1}^N {\sum\limits_{k = 1}^K {\log \left( {{w_k}} \right)P\left( {{Z_j} \in {\Upsilon _k}|{Y_j},{\Theta ^{\left( i \right)}}} \right)} } ?+ \sum\limits_{j = 1}^N {\sum\limits_{k = 1}^K {\log \left( {{f_k}\left( {{Y_j}|{Z_j} \in {\Upsilon _k},{\theta _k}} \right)} \right)} } P\left( {{Z_j} \in {\Upsilon _k}|{Y_j},{\Theta ^{\left( i \right)}}} \right)$

其中${{\theta _k}} = [\mu_k,\sigma_k，a_k, b_k]$為分布$k$對應的參數，$\Theta$ ?= {$\theta _1$,$\theta _2$,...,$\theta _K$}為參數集合，$N$為樣本個數，$K$為混合模型個數。

得到$Q$之后，即可針對完全數據進行MLE求參，可以看到每一個分布的概率（即權重w）與該分布的參數在求參時，可分別求解。由于表達式為一般形式，故該性質對所有混合分布模型都適用。所以對于混合模型，套用Q并代入分布具體表達式即可。

　　B-M-Step

1）利用MLE求參

首先對${{w_k}}$進行優化

由于$\sum\limits_{k = 1}^M {{w_k}} ?= 1$，利用Lagrange乘子求解：

${J_w} = \sum\limits_{j = 1}^N {\sum\limits_{k = 1}^K {\left[ {\log \left( {{w_k}} \right)P\left( {\left. {{Z_j} \in {\Upsilon _k}} \right|{Y_j},{{\bf{\Theta }}^{\left( i \right)}}} \right)} \right]} } ?+ \lambda \left[ {\sum\limits_{k = 1}^K {{w_k}} ?- 1} \right]$

求偏導：

$\frac{{\partial {J_w}}}{{\partial {w_k}}} = \sum\limits_{J = 1}^N {\left[ {\frac{1}{{{w_k}}}P\left( {{Z_j} \in {\Upsilon _k}|{Y_j},{{\bf{\Theta }}^{\left( i \right)}}} \right)} \right] + } \lambda ?= 0$

?得

對各分布內部參數$\theta_k$進行優化

給出準則函數：

${J_\Theta } = \sum\limits_{j = 1}^N {\sum\limits_{k = 1}^K {\log \left( {{f_k}\left( {{Y_j}|{Z_j} \in {\Upsilon _k},{\theta _k}} \right)} \right)} } P\left( {{Z_j} \in {\Upsilon _k}|{Y_j},{\Theta ^{\left( i \right)}}} \right)$

對于多直線擬合問題，$Y_j$為擬合殘差，假設其服從高斯分布：

可以認為${{l_j} - {a_k}{x_j}}$就是GMM中的$Y_j$，$b_k$就是$\mu_k$。直接套用GMM中的迭代結果：

所不同的是，多了一個對$a_k$的求解，容易得出：

至此，理論推導完成。

三、代碼實現

仍然是在之前GMM代碼基礎上，修改幾句指令：

function [u,sig,a,t,iter] = fit_mix_line( X,l,M ) % % fit_mix_line - fit parameters for a mixed-line using EM algorithm % % format: [u,sig,t,iter] = fit_mix_line( X,M ) % % input: X - input samples, Nx1 vector % M - number of gaussians which are assumed to compose the distribution % % output: u - fitted mean for each gaussian % sig - fitted standard deviation for each gaussian % t - probability of each gaussian in the complete distribution % iter- number of iterations done by the function %% initialize and initial guesses N = length( X ); Z = ones(N,M) * 1/M; % indicators vector P = zeros(N,M); % probabilities vector for each sample and each model t = ones(1,M) * 1/M; % distribution of the gaussian models in the samples u = linspace(min(X),max(X),M); % mean vector sig2 = ones(1,M) * var(X) / sqrt(M); % variance vector C = 1/sqrt(2*pi); % just a constant Ic = ones(N,1); % - enable a row replication by the * operator Ir = ones(1,M); % - enable a column replication by the * operator a = ones(1,M); Q = zeros(N,M); % user variable to determine when we have converged to a steady solution thresh = 1e-9; step = N; last_step = 10; % step/last_step iter = 0; min_iter = 3000; % main convergence loop, assume gaussians are 1D while ((( abs((step/last_step)-1) > thresh) & (step>(N/5*eps)) ) & (iter<min_iter) ) % E step% ========Q = Z; P = C ./ (Ic*sqrt(sig2)) .* exp( -(((l*Ir-X*a) - Ic*u).^2)./(2*Ic*sig2) );for m = 1:MZ(:,m) = (P(:,m)*t(m))./(P*t(:));end% estimate convergence step size and update iteration numberprog_text = sprintf(repmat( '\b',1,(iter>0)*12+ceil(log10(iter+1)) ));iter = iter + 1;last_step = step * (1 + eps) + eps;step = sum(sum(abs(Q-Z)));fprintf( '%s%d iterations\n',prog_text,iter );% M step% ========Zm = sum(Z); % sum each columnZm(find(Zm==0)) = eps; % avoid devision by zero sig2 = sum((((l*Ir-X*a) - Ic*u).^2).*Z) ./ Zm;u = sum((l*Ir-X*a).*Z) ./ Zm; a = sum((l*Ir - Ic*u).*(X*Ir).*Z) ./ (sum((X*Ir).^2.*Z)); % a (isnan(a)) = 0.001;t = Zm/N; end sig = sqrt( sig2 );

給出測試程序：

clc;clear all;close all set(0,'defaultfigurecolor','w') %generate data x = linspace(-40,40,200); y = zeros(1,length(x)); y1 = zeros(1,length(x)/2); y2 = zeros(1,length(x)/2); k1= 0;k2=0; for i =1 :length(x)if mod(i,2)==0k1=k1+1;y(i) = 5*x(i)-3 + 3*rand;%分別取0.5 和5y1(k1)=y(i);elsek2=k2+1;y(i)= -7*x(i)+2 + 3*rand;y2(k2)=y(i);end end [u,sig,a] = fit_mix_line(x',y',2); yo=[y1,y2]; [uo,sigo,ao] = fit_mix_line(x',yo',2); %figure subplot 211 scatter(x,y,'k.'); hold on; t = -20:20; l1 = t*a(1)+u(1); l2 = t*a(2)+u(2); plot(t,l1,'r','linewidth',2);hold on; plot(t,l2,'g--','linewidth',2);hold on; grid on; subplot 212 scatter(x,yo,'k.'); hold on; l1 = t*ao(1)+uo(1); l2 = t*ao(2)+uo(2); plot(t,l1,'r','linewidth',2);hold on; plot(t,l2,'g--','linewidth',2);hold on; grid on;

這里分別針對兩種多線性進行擬合：

分段多條直線
混合多條直線

理論上二者都適用，但運行卻發現二者往往只有一個理想，記錄此處，暫時未找出原因。

代碼中?y(i) = 5*x(i)-3 + 3*rand;%分別取0.5 和5這一句取0.5時，結果圖：

取5時，對應結果圖：

理論上應該二者都適用。

四、關于擬合的思考

　　A-以正態分布為例

上面分析的多直線擬合，其實是$ax+b$的形式，由此構造混合分布，對于：

更一般的：

$g$為一般表達式，（如GMM就是$g = ax+b$，且a=0的情況,上文分析的為a不等于0的情況），更一般的$g$理論上可以為任意表達式：

只要將g的具體表達式代入EM求解過程即可。

　　B-其他分布

上文的討論基于噪聲是正態分布，如果是拉普拉斯分布呢？只要將上面更一般表達式提到的外殼換成拉普拉斯分布模型即可。

事實上，EM的混合模型到此可以看出：混合模型理論上可以實現各類形狀的聚類，而噪聲同樣可以基于不同的分布假設:

1)Kmeans是對于 ?中心點（聚類中心）的分布假設；

2）GMM/LMM是對于斜率為0的直線（GMM的均值）的分布假設；

3）更一般地，斜線/二次曲線....以此類推。

參考：

李航：《統計學習方法》

轉載于:https://www.cnblogs.com/xingshansi/p/6597796.html

總結

以上是生活随笔為你收集整理的基于EM的多直线拟合实现及思考的全部內容，希望文章能夠幫你解決所遇到的問題。

如果覺得生活随笔網站內容還不錯，歡迎將生活随笔推薦給好友。

直线
EM