标签:#多變量統計

共 21 篇文章

最小平方頻譜分析法

最小平方頻譜分析法()是一種利用最小平方法尋找適配於資料點之最佳正弦曲線,以估算頻譜的方法。其數學原理與科學界中最常用的傅立葉分析相似。 最小平方頻譜分析法也稱為凡尼切克法(Vaníček method)、隆布法(Lomb method)或隆布—史卡構法(Lomb–Scargle method),分別取名自對其有所貢獻的、尼可拉斯·隆布(Nicholas R. Lomb)。然而,大多數以上述理論為基礎開發的方法僅適用於取樣間距相等的訊號…

聚类分析

聚类分析()亦称-{集群}-分析,是对于统计数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集(subset),这样让在同一个子集中的成员对象都有相似的一些属性,常见的包括在坐标系中更加短的空间距离等。 一般把数据聚类归纳为一种非監督式學習。 定义 聚类(clustering)的概念不能精确定义,这也是为什么聚类算法众多的原…

匹配追蹤

匹配追蹤(matching pursuit, MP)最早是時頻分析的分析工具,目的是要將一已知訊號拆解成由許多被稱作為原子訊號的加權總和,而且企圖找到與原來訊號最接近的解。其中原子訊號為一極大的原子庫中的元素。以數學式子表示可以得到: : f(t) = \sum_{n=0}^{+\infty} a_n g_{\gamma_n}(t) 其中,a_n是權重,g_{\gamma_n}是由字典D中獲得的原子訊號。 如同傅立葉級數將一訊號拆解成一…

非线性降维

)中的1000个点组成的3维数据集,中间有矩形孔。右上:用于生成3维数据集的原始2维数据集。左下和右下:分别使用模块化数据处理(Modular Data Processing)工具箱实现的LLE(邻近线性嵌入)和黑塞LLE,对流形进行的2维复原。]] 非线性降维也称作流形学习,为各种相关技术中的一种,是将高维数据投射到低维潜流形上,目的是在低维空间中实现数据可视化,或学习映射(高维到低维嵌入或反之)本身。下面介绍的技术可理解概括用于降维…

威沙特分佈

{{Noteta |1=zh-hans:沙特;zh-hant:沙特; |d1=防止「沙-{特}-」-「沙-{烏}-地」(Saudi)过度转换 }} {{機率分佈 |name =威沙特 |type =密度 |pdf_image = |cdf_image = |parameters = n > 0\! 自由度 (實數) \mathbf{V} > 0\, 尺度矩陣 (正定) |support =\mathbf{W}\!是正定的 |pdf =\…

耦合 (概率)

耦合,或稱关联结构(),為处理统计中随机变量相关性问题的一种方法,由一组随机变量的邊際分布来确定它们的联合分布。通过关联结构来确定一个联合分布的方法是基于如下思想,一个简单转换可以通过分别将每个边缘分布都转换为平均分布的转换组成。这样,一个关联结构(dependence structure)就可以表达为一个基于上述所得平均分布之上的联合分布,而关联结构(copula)即是边缘均匀随机变量之上的一个联合分布。在实际应用中,上述的转换可能被…

马哈拉诺比斯距离

马哈拉诺比斯距离(Mahalanobis distance)是由印度统计学家提出的,表示数据的协方差距离。它是一种有效的计算两个未知样本集的相似度的方法。与欧氏距离不同的是它考虑到各种特性之间的联系(例如:一条关于身高的信息会带来一条关于体重的信息,因为两者是有关联的)并且是尺度无关的(scale-invariant),即独立于测量尺度。 对于一个均值为\mu = ( \mu_1, \mu_2, \mu_3, \dots , \mu_p…

多元变量统计

多元变量统计(Multivariate statistics,或作Multivariate statistical analysis、Multivariate analysis,多因素分析、多重变量分析)是社会学、医学、金融、量化心理研究、市场营销等常用的一系列在一个时点观察并分析多个统计变量的实证分析方法的总称,目前在应用和理论研究上十分活跃,常用软件是有MATLAB、SAS、R、SPSS等等。 内容 主要包括以下分析方法: 标准相关…

主成分分析

,平均值為(1, 3),標準差在(0.878, 0.478)方向上為3、在其正交方向上為1的主成分分析。黑色的兩個向量是此分布的共變異數矩陣的特征向量,其長度為對應的特征值之平方根,並以分布的平均值為原點。]] 在多變量分析中,主成分分析(,縮寫:)是一種統計分析、簡化數據集的方法。它利用正交变换来对一系列可能相关的变量的观测值进行线性变换,从而投影为一系列线性不相关变量的值,这些不相关变量称为主成分(Principal Compone…

線性判別分析

线性判别分析(,縮寫:LDA)是对费舍尔的线性鉴别方法的归纳,这种方法使用统计学,模式识别和机器学习方法,试图找到两类物体或事件的特征的一个线性组合,以能够特征化或区分它们。所得的组合可用来作为一个线性分类器,或者,更常见的是,为后续的分类做降维处理。 LDA与變異數分析(ANOVA)和迴归分析紧密相关,这两种分析方法也试图透过一些特征或测量值的线性组合来表示一个因变量。然而,變異數分析使用类别型的自变量和连续型的因变量,而判别分析則使…

對撞因子

對撞因子(),有時又稱為反向分叉(),在統計學和圖模式中,是指同時被兩個以上的變數影響的變數,而這些影響對撞因子的變數之間不見得有因果關係。因為在環路圖上會顯示為有兩個以上箭頭指入的節點,所以稱為對撞因子。 對撞因子不會直接造成影響它的變數之間出現相關,以或環路圖的術語來說,對撞因子會「阻斷」兩個變數間的路徑。然而,想要了解變數間的因果關係時,對撞因子非常重要,因為在設計實驗、挑選樣本或統計分析時,如果有意或無意間控制了對撞因子,會造成…

信息瓶颈

信息瓶颈()是信息论中的一种方法,由、费尔南多·佩雷拉(Fernando C. Pereira)与威廉·比亚莱克于1999年提出。对于一随机变量X,假设已知其与观察变量Y之间的联合概率分布p(X,Y)。此时,当需要概括(聚类)X时,可以通过信息瓶颈方法来分析如何最优化地平衡准确度与复杂度(数据压缩)。该方法的应用还包括分布聚类(distributional clustering)与降维等。此外,信息瓶颈也被用于分析深度学习的过程。 信息…

一般线性模型

一般线性模型(general linear model, multivariate regression model)是一个统计学上常见的。这个模型在计量经济学的应用中十分重要。不要与多元线性回归,广义线性模型或一般线性方法相混淆。 其公式一般写为: : \mathbf{Y} = \mathbf{X}\mathbf{B} + \mathbf{U}, 其中Y是一个包含反应变量的矩阵。X是一个包含独立自变量的设计矩阵。B是一个包含多个估计参…

独立成分分析

在统计学中,独立成分分析或独立分量分析(Independent components analysis,缩写:ICA) 是一种利用统计原理进行计算的方法。它是一个线性变换。这个变换把数据或信号分离成统计独立的非高斯的信号源的线性组合。独立成分分析是盲信号分离(Blind source separation)的一种特例。 定义 独立成分分析的最重要的假设就是信号源统计独立。这个假设在大多数盲信号分离的情况中符合实际情况。即使当该假设不满足…

多線性主成分分析

多線性主成分分析方法(,MPCA),可將高維度空間映射到低維空間中去,降維的過程就是捨棄不重要的特徵向量縮減維度,相較於一般的主成分分析,多線性主成分分析保留了資料的結構性且有較佳的解釋比例。 多線性主成分分析(MPCA)是主成分分析(PCA)到多維的一個延伸。PCA是投影向量(Vector)到向量,而MPCA是投影張量(Tensor)到張量,投影的結構相對簡單,另外運算在較低維度的空間進行,因此處理高維度數據時有低運算量的優勢。舉例來…

多變量分析

多變量統計分析(),簡稱多變量分析,又称多元统计分析,為統計學的一支,常用於管理科學、社會科學和生命科學等领域。 多變量分析的基礎是多變量統計,也就是同時/一次觀察與分析超過一個變數。多變量分析一般用於一個實驗中有多個測量結果時,探討資料彼此之間的關聯性或是釐清資料的結構。分類大致如下: 常態多變量分布理論與模型 研究與測量變數之間的關係 多維度機率計算 探討資料構造與模式 常見分析方法 主成分分析(Principal Componen…

干擾因素

干擾因素(英語:、或),又稱為干擾因子、干擾變量、混淆變量、共變因等,在统计学和因果關係中是指會同時影響自变量和因变量,導致出現偽關係的一種變量。在不嚴謹的語境下,干擾因子也可以指所有未知變數(),包括中介變因和對撞變因。干擾因子會造成偽關係,是相關不蘊涵因果的原因之一。 參見 * 參考文獻

双标图

的双标图]] 双标图()是一类统计学的统计图形。双标图可以同时把抽样和资料矩阵变量中的数据用图表表示出来。抽样样本可以用向量、线性轴和非线性轨迹表达。在类别变量的案例中,类别水平点()可以用来代表其类别变量的水平值。一类广义的双标图可以适用呈现序数标量和区间标量。 相关资料 Gower, J.C., Hand, D.J, 1996. Biplots. Chapman & Hall, London, UK. ISBN 0412716305…

集中趋势

在統計學中,集中趨勢(central tendency)或中央趨勢,在口語上也經常被稱為平均,表示一個機率分佈的中間值。最常見的幾種集中趨勢包括算數平均數、中位數及眾數。集中趨勢可以由有限的數組(如一群樣本)中或理論上的機率分配(如常態分佈)中求得。有些人使用集中趨勢(或集中性)這個詞以表示「數量化的資料之中央值的趨勢」。在這種意義下,我們可以利用資数据的離散程度(例如標準偏差或四分差等相似的統計量)判別其集中趨勢的程度。 集中趨勢(*…

邻里成分分析

邻里成分分析()是一种监督式学习的方法,根据一种给定的距离度量算法对样本数据进行度量,然后对多元变量数据进行分类。在功能上其和k近邻算法的目的相同,直接利用随即近邻的概念确定与测试样本临近的有标签的训练样本。 定义 邻里成分分析是一种距离度量学习方法,其目的在于通过在训练集上学习得到一个线性空间转移矩阵,在新的转换空间中最大化平均留一(LOO)分类效果。该算法的关键是与空间转换矩阵相关的的一个正定矩阵A,该矩阵A可以通过定义A的一个可微…