非线性最小二乘法

非线性最小二乘法是非线性形式的最小二乘法,用包含个未知参数的非线性模型拟合个观测值(m\ge n),可用于某些形式的非线性回归。该方法的基础是使用线性模型近似并通过连续迭代来优化参数。它与线性最小二乘法既有相同之处、也有一些显著差异。

理论
考虑一组(x_1, y_1), (x_2, y_2), \dots, (x_m, y_m)共m个数据点以及曲线(模型函数)\hat{y} = f(x, \boldsymbol \beta)。该曲线同时取决于与\boldsymbol \beta = (\beta_1, \beta_2, \dots, \beta_n)共个参数(满足m\ge n)。目标是找到在最小二乘意义上与数据点拟合最好的曲线所对应的参数\boldsymbol \beta,即最小化平方和
S = \sum_{i=1}^{m} r_i^2,

其中残差的定义为
r_i = y_i - f(x_i, \boldsymbol \beta),\qquad (i=1, 2,\dots, m).

取最小值时的梯度为零。由于模型包含个参数,因此可得到个梯度方程:

\frac{\partial S}{\partial \beta_j} = 2 \sum_i r_i\frac{\partial r_i}{\partial \beta_j} = 0 \quad (j=1,\ldots,n).

在非线性系统中,偏导数\frac{\partial r_i}{\partial \beta_j}
同时是自变量和参数\boldsymbol \beta的函数,因此这些梯度方程通常没有封闭解。因而必须为参数选择初始值用以迭代求解。迭代表达式为

\beta_j \approx \beta_j^{k+1} =\beta^k_j+\Delta \beta_j.

其中,是迭代次数,\Delta \boldsymbol \beta则是偏移向量。每次迭代时,使用关于 \boldsymbol \beta^k的一阶泰勒级数展开以线性化模型:

f(x_i,\boldsymbol \beta)\approx f(x_i,\boldsymbol \beta^k) +\sum_j \frac{\partial f(x_i,\boldsymbol \beta^k)}{\partial \beta_j} \left(\beta_j -\beta^{k}_j \right) = f(x_i,\boldsymbol \beta^k) +\sum_j J_{ij} \,\Delta\beta_j.

雅可比矩阵是常数、自变量与参数的函数,因此每次迭代时的并不固定。对线性化模型而言,
\frac{\partial r_i}{\partial \beta_j} = -J_{ij},

残差的表达式则为
\Delta y_i = y_i- f(x_i,\boldsymbol \beta^k),
r_i = y_i - f(x_i, \boldsymbol \beta) = \left(y_i- f(x_i,\boldsymbol \beta^k)\right)+ \left(f(x_i,\boldsymbol \beta^k) - f(x_i, \boldsymbol \beta)\right)\approx\Delta y_i- \sum_{s=1}^{n} J_{is} \Delta \beta_s .

将上述表达式代入梯度方程,可以得到
-2\sum_{i=1}^{m} J_{ij} \left( \Delta y_i - \sum_{s=1}^{n} J_{is}\ \Delta \beta_s \right) = 0,

以上方程可化简为个联立的线性方程,称为正规方程(normal equations):
\sum_{i=1}^{m} \sum_{s=1}^{n} J_{ij}J_{is}\ \Delta \beta_s=\sum_{i=1}^{m} J_{ij}\ \Delta y_i \qquad (j=1,\dots,n).

正规方程可用矩阵表示法写成
\left(\mathbf{J}^\mathsf{T}\mathbf{J}\right) \Delta \boldsymbol \beta = \mathbf{J}^\mathsf{T}\ \Delta \mathbf{y}.

上述方程是使用求解非线性最小二乘问题的的基础。

需要注意的是雅可比矩阵定义中导数的符号约定。某些文献中的可能与此处的定义相差一个负号。

权重扩展
不同数据点(观测结果)的可靠性并不一定相同,此时可使用加权平方和
S = \sum_{i=1}^m W_{ii} r_i^2.

权重矩阵是一个对角矩阵,理想情况下每个权重系数应等于观测误差方差的倒数。此时,正规方程可扩展为
\left(\mathbf{J}^\mathsf{T}\mathbf{WJ}\right) \Delta \boldsymbol \beta = \mathbf{J}^\mathsf{T}\mathbf{W}\ \Delta \mathbf{y}.

参见

  • 曲线拟合
  • 灰箱模型
  • 非线性规划
  • 非线性回归
  • 最优化
  • 莱文伯格-马夸特方法

注释
参考文献
*
*

评论 (0)

  • 还没有评论,来抢沙发吧。