推論統計學

中变色鸢尾花萼片宽度数据的分布直方图]]

推論統計學,或稱統計推斷(),是利用資料分析推斷機率分布特性的過程。推論統計分析對母體的特性進行推斷,例如通過檢定假設和導出估計量。通常假定觀測到的數據集是從較大母體中抽樣所得。

推論統計可與描述統計相對照。描述統計僅關注觀測數據本身的特性,並不以數據來自更大母體為前提。在機器學習中,「推斷」一詞有時被用來指「通過評估已訓練的模型進行預測」;在此語境下,對模型特性的推斷稱為「訓練」或「學習」(而非「推斷」),而利用模型進行預測則稱為「推斷」(而非「預測」);另見預測推斷。

統計推斷的結果常用來決定下一步的做法,可能是進行更深入的試驗或問卷,或決定是否實施某項方案。

引言
統計推斷依據從母體中以某種抽樣方式抽取的數據,對母體做出命題。對於希望進行推斷的某個母體假設,統計推斷包含(一)選取描述數據生成過程的統計模型,以及(二)從模型推導出命題。

Konishi 與 Kitagawa 指出:「統計推斷中的大多數問題,都可視為與統計建模相關的問題。」與此相關,大衛·考克斯爵士曾說:「如何將實質問題轉化為統計模型,往往是分析中最關鍵的環節。」

統計推斷的結論是一個統計命題。常見的統計命題形式包括:

  • 點估計,即最佳近似某參數的特定值;
  • 區間估計,例如信賴區間(或集合估計)。信賴區間是利用樣本數據構建的區間,使得若重複進行許多次獨立抽樣(在數學上取極限),則固定比例(例如95%信賴區間對應95%)的結果區間會包含參數的真實值;
  • 可信區間,即包含例如95%後驗信念的值的集合;
  • 拒絕假設;
  • 將數據點聚類或分類成若干組別。

模型與假設
任何統計推斷都需要若干假設。統計模型是一組關於觀測數據及類似數據生成方式的假設集合。統計模型的描述通常強調感興趣的母體量,即我們希望進行推斷的對象。描述統計通常作為更正式推斷之前的初步步驟。

模型/假設的層次
統計學家將建模假設區分為三個層次:

  • 完全參數型:描述數據生成過程的機率分布,假設可由只含有限個未知參數的機率分布族完全描述。例如,每個連續機率分布都有中位數,可用樣本中位數或來估計,後者在數據來自簡單隨機抽樣時具有良好性質。
  • 半參數型:這一術語通常意指介於完全參數型與非參數型之間的假設。例如,可以假設母體分布具有有限均值,並進一步假設母體中均值響應水準與某共變量呈真正線性關係(參數假設),但不對均值周圍的變異數作任何參數假設(即不對任何異方差性的存在或可能形式作假設)。更一般地,半參數模型通常可分為「結構」與「隨機變異」兩個分量,一個以參數方式處理,另一個以非參數方式處理。著名的 Cox 模型即為一套半參數假設。

有效模型/假設的重要性
無論採用何種層次的假設,正確校準的推斷通常要求這些假設是正確的,即數據生成機制確實已被正確指定。

「簡單」隨機抽樣的錯誤假設可能使統計推斷失效。更複雜的半參數和完全參數假設同樣值得警惕。例如,錯誤地假設 Cox 模型在某些情況下可能導致錯誤結論。對母體常態性的錯誤假設也會使某些基於迴歸的推斷失效。大多數人口抽樣專家對使用任何參數模型都持懷疑態度:「大多數抽樣統計學家在涉及信賴區間時,僅對基於非常大樣本的估計量作出陳述,因為中央極限定理保證這些估計量的分布近似常態。」尤其是,常態分布「若用於任何類型的經濟學母體,將是一個完全不切實際且極為危險的假設」。然而在許多實際應用中,根據模擬研究和統計學家的經驗,當有 10 個或更多獨立樣本時,常態近似已能很好地逼近樣本均值的分布。

對於無限大的樣本,極限結果(如中央極限定理)描述樣本統計量在極限存在時的極限分布。極限結果並非關於有限樣本的陳述,對有限樣本確實毫無意義。然而,對極限分布的漸近理論常被援引於有限樣本的研究。例如,極限結果常被援引以為廣義矩估計法和廣義估計方程提供正當性,後兩者在計量經濟學和生物統計學中廣受使用。極限分布與真實分布之差異(即近似的「誤差」)的量級可通過模擬進行評估。將極限結果以啟發式方式應用於有限樣本,在許多應用中是常見做法,尤其是對具有對數凹概似函數的低維統計模型(如單參數指數族)。

基於隨機化的模型
對於由隨機化設計產生的給定數據集,統計量的隨機化分布(在虛無假設下)定義為:對隨機化設計可能生成的所有方案評估檢定統計量。在頻率論推斷中,隨機化使推斷能夠基於隨機化分布而非主觀模型,這在調查抽樣和實驗設計中尤為重要。來自隨機化研究的統計推斷也比許多其他情境更為直接。在貝氏推斷中,隨機化同樣重要:在調查抽樣中,使用無放回抽樣確保樣本與母體的可交換性;在隨機化實驗中,隨機化為共變量資訊提供隨機缺失假設。

客觀隨機化允許適當的歸納程序。許多統計學家偏好對由明確隨機化程序生成的數據進行基於隨機化的分析。(然而,在具有成熟理論知識和實驗控制的科學領域中,隨機化實驗確實可能在不提升推斷質量的情況下增加實驗成本。)類似地,主要統計權威機構推薦隨機化實驗的結果,認為其比觀察性研究更具可靠性。然而,一個良好的觀察性研究可能優於一個糟糕的隨機化實驗。

隨機化實驗的統計分析可以基於實驗方案中規定的隨機化方案,而不需要主觀模型。

然而,某些假設在任何時候都無法使用能準確描述隨機化實驗或隨機樣本的客觀統計模型來檢驗。在某些情況下,此類隨機化研究不經濟或不符合倫理。

隨機實驗的模型分析
在分析隨機化實驗的數據時,標準做法是援引統計模型,例如線性模型或邏輯斯迴歸模型。然而,隨機化方案指導統計模型的選擇,若不了解隨機化方案,便無法選擇適當的模型。

無模型隨機化推斷
無模型技術為基於模型的方法提供補充,後者採用簡化現實的還原論策略。前者結合、演化、整合並動態訓練演算法,以適應過程的情境相似性,並學習觀測值的內在特徵。

例如,無模型簡單線性迴歸基於以下兩種設計之一:

  • 隨機設計:觀測值對 (X_1,Y_1), (X_2,Y_2), \cdots , (X_n,Y_n) 獨立同分布(iid);
  • 確定性設計:變數 X_1, X_2, \cdots, X_n 為確定性的,但對應的響應變量 Y_1,Y_2, \cdots, Y_n 是隨機且獨立的,具有共同的條件分布,即 P\left (Y_j \leq y | X_j =x\right ) = D_x(y),與指標 j 無關。

在任一情況下,對共同條件分布 D_x(.) 特徵的無模型隨機化推斷依賴某些正則條件,例如函數光滑性。例如,對母體特徵「條件均值」 \mu(x)=E(Y | X = x) 的無模型隨機化推斷,在 \mu(x) 光滑的假設下,可通過局部平均或局部多項式擬合進行一致估計。此外,依靠漸近常態性或重抽樣,可以構建母體特徵——即條件均值 \mu(x)——的信賴區間。

推斷範式
不同的統計推斷流派已各自確立。這些流派——或稱「範式」——並非互斥的,在一種範式下運作良好的方法,在其他範式下往往也有吸引人的詮釋。

Bandyopadhyay 與 Forster 描述了四種範式:古典(即頻率論)範式、貝氏範式、概似論者範式,以及基於赤池資訊量準則的範式。

頻率論推斷
此範式通過考慮對母體分布的(假想)重複抽樣(以生成類似於當前數據集的數據集)來校準命題的可信度。通過考察重複抽樣下數據集的特徵,可以量化統計命題的頻率論性質——儘管在實踐中,這種量化可能具有挑戰性。

頻率論推斷的例子

  • p
  • 信賴區間
  • 虛無假設顯著性檢定

頻率論推斷、客觀性與決策理論
頻率論推斷(或古典推斷)的一種詮釋是:它僅適用於頻率機率的情境,即對母體進行重複抽樣的情境。然而,Neyman 的方法是在實驗前機率的框架下發展這些程序的。也就是說,在進行實驗之前,先確定一個得出結論的規則,使得正確的機率受到適當控制:此類機率無需具有頻率論或重複抽樣的詮釋。相比之下,貝氏推斷使用條件機率(即以觀測數據為條件的機率),而頻率論方法使用邊際(但以未知參數為條件的)機率。

顯著性檢定和信賴區間的頻率論程序可以在不考慮效用函數的情況下構建。然而,頻率論統計的某些部分(如統計決策理論)確實涵蓋效用函數。特別是,最優推斷的頻率論發展(如最小方差無偏估計量或一致最強力檢定)使用損失函數,損失函數起到(負)效用函數的作用。統計學家無需明確陳述損失函數即可證明統計程序具有最優性。然而,損失函數在陳述最優性時往往很有用:例如,中位數無偏估計量在絕對值損失函數下是最優的(它使期望損失最小),而最小平方估計量在平方誤差損失函數下是最優的。

使用頻率論推斷的統計學家必須自行選擇感興趣的參數及所用的估計量/檢定統計量,而缺乏明顯的顯式效用和先驗分布,使頻率論程序被廣泛視為「客觀的」。

貝氏推斷
貝氏演算使用機率的「語言」描述信念的程度;信念為正值,積分為一,並遵循機率公理。貝氏推斷使用可得的後驗信念作為提出統計命題的基礎。使用貝氏方法有幾種不同的正當性理由。

貝氏推斷的例子

  • 用於區間估計的可信區間
  • 用於模型比較的貝氏因子

貝氏推斷、主觀性與決策理論
許多非正式貝氏推斷基於後驗的「直觀合理」摘要。例如,後驗均值、中位數和眾數、最高後驗密度區間以及貝氏因子都可以這種方式引入。雖然用戶無需陳述效用函數即可進行此類推斷,但這些摘要都在某種程度上依賴所陳述的先驗信念,通常被視為主觀結論。(無需外部輸入的先驗構建方法已被提出,但尚未完全發展。)

正式的貝氏推斷以明確陳述的效用函數或損失函數為校準標準;「貝氏規則」是使後驗不確定性下期望效用最大化的規則。因此,正式貝氏推斷在決策理論意義上自動提供最優決策。給定假設、數據和效用,幾乎任何問題都可以進行貝氏推斷,儘管並非每個統計推斷都需要具有貝氏詮釋。非正式貝氏分析在邏輯上可能是不一致的;使用適當先驗(即可積分為一的先驗)的貝氏程序的一個特徵是,它們保證是一致的。貝氏推斷的一些倡導者主張,推斷必須在此決策論框架內進行,且貝氏推斷不應以後驗信念的評估和總結作為結論。

基於概似函數的推斷
基於概似函數的推斷是一種用於根據觀測數據估計統計模型參數的範式。概似論通過使用概似函數來處理統計問題,概似函數記為 L(x | \theta),量化在特定參數值集 \theta 下觀測到給定數據 x 的機率。在基於概似函數的推斷中,目標是找到使概似函數最大化的參數值集,等效地,最大化觀測到給定數據的機率。

基於概似函數的推斷過程通常涉及以下步驟:

建立統計模型:根據所面對的問題定義統計模型,指定分布假設以及觀測數據與未知參數之間的關係。模型可以是簡單的(如已知變異數的常態分布),也可以是複雜的(如具有多層隨機效應的層次模型)。

構建概似函數:給定統計模型,通過將觀測數據的聯合機率密度函數或質量函數作為未知參數的函數來構建概似函數。此函數表示在不同參數值下觀測到數據的機率。

最大化概似函數:下一步是找到使概似函數最大化的參數值集,可使用數值最優化演算法等技術實現。估計的參數值(通常記為 \bar{y})即為最大概似估計量(MLE)。

評估不確定性:獲得最大概似估計量後,必須量化與參數估計相關的不確定性,可通過計算標準誤、信賴區間,或基於漸近理論或拔靴法等模擬技術進行假設檢定來實現。

模型檢驗:在獲得參數估計量並評估其不確定性之後,需要評估統計模型的適切性,包括檢查模型中的假設,以及使用擬合優度檢定、殘差分析或圖形診斷來評估模型對數據的擬合程度。

推斷與詮釋:最後,根據估計的參數和模型評估進行統計推斷,包括對母體參數得出結論、進行預測,或根據估計的模型檢定假設。

基於 AIC 的推斷
赤池資訊量準則(AIC)是對給定數據集的統計模型相對質量的估計量。給定一組數據的模型集合,AIC 估計每個模型相對於其他各模型的質量,從而提供模型選擇的手段。

AIC 建立在資訊理論的基礎上:它提供一個估計量,衡量在使用給定模型表示生成數據的過程時,相對損失的資訊量。(在此過程中,它處理模型擬合優度與模型簡潔性之間的權衡。)

其他推斷範式
最短描述長度
最短描述長度(MDL)原則的發展源於資訊理論和科爾莫哥洛夫複雜度理論的思想。MDL 原則選取能最大程度壓縮數據的統計模型;推斷過程無需假設反事實或不可證偽的「數據生成機制」或數據的機率模型,而這在頻率論或貝氏方法中可能會發生。

然而,若現實中確實存在某「數據生成機制」,則根據夏農的信源編碼定理,它平均且漸近地提供了數據的 MDL 描述。在最小化描述長度(或描述複雜性)方面,MDL 估計類似於最大概似估計和最大後驗概率估計(使用最大熵貝氏先驗)。然而,MDL 避免假設已知底層機率模型;MDL 原則也可以在不假設(例如)數據源自獨立抽樣的情況下應用。

MDL 原則已被應用於資訊理論中的通信編碼理論、線性迴歸

信念推斷
信念推斷是一種基於信念機率(又稱「信念分布」)的統計推斷方法。在後續研究中,這一方法被批評為定義不清、適用範圍極為有限,甚至是謬誤的。然而,這一論點與以下論證相同:所謂的信賴分布並非有效的機率分布,但這並未使信賴區間的應用失效,因此也不必然使從信念論據得出的結論失效。有人曾嘗試將費雪早期信念論據的工作重新詮釋為使用上下機率的推斷理論的特例。

結構推斷
喬治·巴納德在 1938 年至 1939 年間基於費雪和皮特曼的思想,發展了「結構推斷」或「樞軸推斷」,這是一種在群族上使用不變機率的方法。巴納德在信念推斷程序「定義明確且有用」的受限模型類上重新整理了信念推斷的論據。基於群論為結構推斷建立了一套一般理論,並將其應用於線性模型。弗雷澤所建立的理論與決策理論和貝氏統計有密切聯繫,若最優頻率論決策規則存在,則能提供該規則。

推斷主題
以下主題通常被涵蓋在統計推斷的範疇之中。

統計假設

統計決策理論

估計理論

統計假設檢定

統計學中的意見修正

實驗設計、變異數分析與迴歸分析

調查抽樣

統計數據摘要

預測推斷
預測推斷是一種統計推斷方法,強調根據過去觀測值對未來觀測值的預測。

最初,預測推斷基於可觀測的參數,是研究機率的主要目的,但在二十世紀由於布魯諾·德菲內蒂所開創的新參數方法而失去青睞。這一方法將現象建模為帶有誤差的物理系統(例如天體力學)。德菲內蒂關於可交換性的思想——未來觀測應與過去觀測表現相似——隨著其 1937 年法文論文於 1974 年被譯成英文而引起英語世界的關注,此後,這一思想由等統計學家加以倡導。

注释
参考文献

  • .

*

  • Cox, D. R. (2006). Principles of Statistical Inference, Cambridge University Press. .
  • Fisher, R. A. (1955), “Statistical methods and scientific induction”, Journal of the Royal Statistical Society, Series B, 17, 69—78. (criticism of statistical theories of Jerzy Neyman and 沃德·亚伯拉罕)

*

  • Freedman, D. A. (2010). Statistical Models and Causal Inferences: A Dialogue with the Social Sciences (Edited by David Collier, Jasjeet S. Sekhon, and Philip B. Stark), Cambridge University Press.

*
*
*

  • Reprinted as
  • Konishi S., Kitagawa G. (2008), Information Criteria and Statistical Modeling, Springer.

*

  • Le Cam, Lucian. (1986) Asymptotic Methods of Statistical Decision Theory, Springer.
  • Moore, D. S.; McCabe, G. P.; Craig, B. A. (2015), Introduction to the Practice of Statistics, Eighth Edition, Macmillan.
  • (reply to Fisher 1955)
  • Peirce, C. S. (1877–1878), “Illustrations of the logic of science” (series), Popular Science Monthly, vols. 12-13. Relevant individual papers:

* (1878 March), “The Doctrine of Chances”, Popular Science Monthly, v. 12, March issue, pp. [https://books.google.com/books?id=ZKMVAAAAYAAJ&jtp=604 604] –615. Internet Archive* [https://archive.org/stream/popscimonthly12yoummiss#page/612/mode/1up Eprint].
* (1878 June), “The Order of Nature”, Popular Science Monthly, v. 13, pp. [https://books.google.com/books?id=u8sWAQAAIAAJ&jtp=203 203] –217. Internet Archive* [https://archive.org/stream/popularsciencemo13newy#page/203/mode/1up Eprint].
* (1878 August), “Deduction, Induction, and Hypothesis”, Popular Science Monthly, v. 13, pp. [https://books.google.com/books?id=u8sWAQAAIAAJ&jtp=470 470] –482. Internet Archive* [https://archive.org/stream/popularsciencemo13newy#page/470/mode/1up Eprint].

*
*
*
*
*

延伸阅读

  • Casella, G., Berger, R.L. (2001). Statistical Inference. Duxbury Press.

*

  • Held L., Bové D.S. (2014). Applied Statistical Inference—Likelihood and Bayes (Springer).

*
*

*

  • Young, G.A., Smith, R.L. (2005). Essentials of Statistical Inference, CUP.

相关条目

  • 統計學
  • 獨立性檢定
  • 描述統計
  • 機率
  • 假說檢定
  • 贝叶斯推断
  • 估計理論
  • 實驗設計

外部連結

评论 (0)

  • 还没有评论,来抢沙发吧。