标签:#回归分析

共 23 篇文章

交互作用 (统计学)

关注的交互作用]] 在统计学中,当考虑三个或更多变量之间的关系时,就可能出现交互作用(),它是指其中一个原因变量对结果的影响依赖于第二个原因变量的状态(即两者的影响原因不是简单累加的)。尽管通常根据因果关系来考虑,但交互作用也可用来描述非因果关联。交互作用常在迴歸分析或析因实验的背景下予以考虑。 交互作用的存在对统计模型的解释具有重要意义。如果两个感兴趣变量有交互作用,则每个交互作用变量与第三个“因变量”之间的关系取决于另一个交互作用变…

设计矩阵

设计矩阵()在统计学和机器学习中,是一组观测结果中的所有解释变量的值构成的矩阵,常用X表示。设计矩阵常用于一些统计模型,如一般线性模型,方差分析中。 定义 通常情况下,设计矩阵的第i行代表第i次观测的结果,第j列代表第j种解释变量。如此一来,线性回归模型就可以用矩阵乘法表达为 : y = X \beta 其中X是设计矩阵,\beta是对应每一种解释变量的系数组成的系数向量,y是每一个观测对应的预测值构成的向量。 例子 算数平均 算数平均…

吉洪诺夫正则化

吉洪诺夫正则化得名于安德烈·尼古拉耶维奇·吉洪诺夫,是在自变量高度相关的情景下估计多元回归模型系数的方法。它已被用于许多领域,包括计量经济学、化学和工程学。总的来说,这种方法提高了参数估计的效率,但也有可容忍的偏差(见偏差-方差权衡)。 该理论于 1970 年由 Hoerl 与 Kennard 发表在《技术计量学》上的文章《岭回归:非正交问题的偏估计》及《岭回归:非正交问题中的应用》中首次提出。 岭回归是通过创建岭回归估计量(RR)实现…

偏最小二乘回归

偏最小二乘回归(, PLS回归)是一种统计学方法,与主成分回归有关系,但不是寻找响应和独立变量之间最小方差的超平面,而是通过投影预测变量和观测变量到一个新空间来寻找一个线性回归模型。因为数据X和Y都会投影到新空间,PLS系列的方法都被称为双线性因子模型。當Y是分类數據時有「偏最小二乘判别分析(, PLS-DA)」,是PLS的一个变形。 偏最小二乘用于查找两个矩阵(X和Y)的基本关系,即一个在这两个空间对协方差结构建模的隐变量方法。偏最小…

非线性回归

的详细信息图像 ]] 在统计学中, 非线性回归是回归分析的一种形式,其中观测数据由函数建模,该函数是模型参数的非线性组合并且取决于一个或多个独立变量。 通过逐次逼近的方法拟合数据。 一般 在非线性回归中,形式的统计模型 , : \mathbf{y} \sim f(\mathbf{x}, \boldsymbol\beta) 关联自变量 x的向量及其相关的观察到的因变量 y 。函数f在参数β的矢量的分量中是非线性的,但在其他方面是任意的。例…

异方差

異質變異數(),指的是一系列的随机变量間的方差不相同,相對於同質變異數(Homoscedasticity)。 当我们利用普通最小平方法进行回归估计时,常应用高斯-马尔可夫定理。其中假设误差项的變異數是不变的,而异方差是违反这个假设的。如果普通最小平方法应用于异方差模型,会导致估计出的方差值是真实方差值的偏误估计量,但是估計值是无偏的。解决方法包括对数处理、修改模型、、异方差稳健的等。 计量经济学家罗伯特·F·恩格尔因他对存在异方差的迴歸…

多重共线性

多重共線性(Multicollinearity)是指多變量線性回歸中,變量之間由於存在高度相關關係而使回歸估計不准確。在該情況下,多元回歸的係數可能會因為模型或數據的微小變化發生劇烈改變。在樣本數據集中,多重共線性不會影響模型整體的預測能力或信度,它只會影響單個預測子(predictor)的参数。簡而言之,一個包含有共線預測值的多元回歸模型可以指示出模型整體的預測可靠程度,但可能無法對單個預測值給出有效結果,也可能無法判斷哪些預測值是冗…

Lasso算法

在统计学和机器学习中,Lasso算法(,又译最小绝对值收敛和选择算子、套索算法)是一种同时进行特征选择和正则化(数学)的回归分析方法,旨在增强统计模型的预测准确性和可解释性,最初由斯坦福大学统计学教授罗伯特·蒂布希拉尼于1996年基于Leo Breiman的非负参数推断(Nonnegative Garrote, NNG)提出。Lasso算法最初用于计算最小二乘法模型,这个简单的算法揭示了很多估计量的重要性质,如估计量与岭回归(Ridge…

RATS

RATS,全称是Regression Analysis of Time Series(意思是“时间序列的回归分析”),是一种统计程序包。可应用于统计分析和多种计量经济模型的估计。 另见 Gretl EViews 外部链接 * [http://www.estima.com/ Estima]

迴歸分析

迴歸分析()是一種統計學上分析數據的方法,目的在於了解兩個或多個變數間是否相關、相關方向與強度,並建立數學模型以便觀察特定變數來預測研究者感興趣的變數。更具体的来说,迴归分析可以帮助人们了解在只有一个自变量变化时因变量的变化量。一般来说,通过迴归分析我们可以由给出的自变量估计因变量的条件期望。 迴歸分析是建立被解釋變數Y(或稱應變數、依變數、反應變數)與解釋變數X(或稱自變數、獨立變數)之間關係的模型。簡單線性迴歸使用一個自變量X,複迴…

转移熵

转移熵()是测量两个随机过程之间有向(时间不对称)信息转移量的一种非参数统计量。过程X到另一个过程Y的转移熵可定义为:在已知Y过去值的情况下,了解X的过去值所能减少Y未来值不确定性的程度。更具体地说,假定 X_t 和 Y_t ( t\in \mathbb{N} )表示两个随机过程,并用香农熵来度量信息量,则转移熵可定义为: : T_{X\rightarrow Y} = H\left( Y_t \mid Y_{t-1:t-L}\right…

可解释变异

可解释变异()在统计学中是指给定数据中的变异能被数学模型所解释的部分。通常会用方差来量化变异,故又称为可解释方差()。 除可解釋变异外,总变异的剩余部分被称为未解释变异()或残差()。 线性回归中的决定系数即为可解释变异占总变异的比率。 参考文献 [https://web.archive.org/web/20170622003127/http://www.documentingexcellence.com/stat_tool/varia…

多项式回归

在统计学中, 多项式回归是回归分析的一种形式,其中自变量 x 和因变量 y 之间的关系被建模为关于 x 的 n 次多项式。多项式回归拟合x的值与 y 的相应条件均值之间的非线性关系,表示为 E(y|x),并且已被用于描述非线性现象,例如组织的生长速率、湖中碳同位素的分布以及沉积物和流行病的发展。虽然多项式回归是拟合数据的非线性模型,但作为统计估计问题,它是线性的。在某种意义上,回归函数 E(y|x) 在从数据估计到的未知参数中是线性的。…

分位數迴歸

分位數迴歸()是迴歸分析的方法之一。最早由Roger Koenker和Gilbert Bassett於1978年提出。 一般地,传统的回归分析研究自变量与因变量的条件期望之间的关系,相应得到的回归模型可由自变量的估计因变量的条件期望;分位数回归研究自变量与因变量的条件分位数之间的关系,相应得到的回归模型可由自变量估计因变量的条件分位数。相較於傳統迴歸分析仅能得到因变量的中央趨勢,分量迴歸可以進一步推論因变量的条件概率分布。分量迴歸屬於無…

工具变量

工具变量(,简称“IV”),又稱仪器变量或辅助变量,是经济学、计量经济学、流行病学和相关学科中无法实现可控实验的时,用于估计模型因果关系的方法。 在回归模型中,当解釋變數与误差项存在相关性(内生性问题),使用工具变量法能够得到一致的估计量。内生性问题一般产生于被忽略变量问题或者测量误差问题。当内生性问题出现时,常见的线性回归模型会出现不一致的估计量。此时,如果存在工具变量,那么人们仍然可以得到一致的估计量。根据定义,工具变量应该是一个不…

曲線擬合

曲線擬合(),簡稱擬合,俗稱拉曲線,是一種構建一個函数曲線,使之最佳地吻合現有的過程,該過程可能附加若干條件限制。通俗地說,科学和工程问题通过诸如采样、实验等方法获得了若干离散的数据点。根据这些数据,我们往往希望得到一个连续的函数(也就是曲线)或者更加密集的离散方程与已知数据相吻合,该过程就叫做“拟合”,而得到的曲线方程就称为“拟合函数”。曲线拟合又译为:曲線配適、曲線貼合、曲線適插法,均有助理解其选择曲线方程(解析函数)来“模拟吻合”…

双重差分

双重差分(英文:Difference in differences,缩写:DID或者DD)是运用在计量经济学和定量研究领域下的一种统计学方法。它通过对自然实验中的数据进行观察性研究,研究“实验组”和“对照组”(带引号的)之间数据的差分来模拟一个实验的效果,但其本身并不是真正的实验。具体而言,此方法把实验组的因变量的平均变化率与对照组相比较,来计算实验(自变量)的效果(因变量)。虽然这个方法可以减少一些外部因素和选择偏差的干扰,但是却不能…

径向基函数网络

在数学建模领域,径向基函数网络(Radial basis function network,縮寫 RBF network)是一种使用径向基函数作为激活函数的人工神经网络。径向基函数网络的输出是输入的径向基函数和神经元参数的线性组合。径向基函数网络具有多种用途,包括包括函数近似法、时间序列预测、分类和系统控制。他们最早由布魯姆赫德(Broomhead)和洛維(Lowe)在1988年建立。 径向基函数网络通常有三层:输入层、隐藏层和一个非线…

非线性最小二乘法

非线性最小二乘法是非线性形式的最小二乘法,用包含个未知参数的非线性模型拟合个观测值(m\ge n),可用于某些形式的非线性回归。该方法的基础是使用线性模型近似并通过连续迭代来优化参数。它与线性最小二乘法既有相同之处、也有一些显著差异。 理论 考虑一组(x_1, y_1), (x_2, y_2), \dots, (x_m, y_m)共m个数据点以及曲线(模型函数)\hat{y} = f(x, \boldsymbol \beta)。该曲线同…

主成分回归

统计学中,主成分回归(PCR)是一种基于主成分分析(PCA)的回归分析方法。更确切地说,PCR用于估计标准线性回归模型中的未知参数。 PCR不是直接将因变量与解释变量进行回归,而是将解释变量的主成分作为回归量。一般只使用所有主成分的一个子集用于回归,因此PCR是一种正则化过程,也是一种收缩估计量。 方差更高的主成分(基于解释变量样本方差-协方差矩阵对应更大特征值的特征向量)被选为回归量。不过,要预测结果,低方差的主成分可能也很重要,在某…