的雙尾檢定。]]
在統計顯著性檢定,單雙尾檢定(One- and two-tailed tests)是數據集推斷數學參數的兩種統計顯著性方法。
當我們想要驗證一組數據集的結果是否具有意義時,會計算出一個。此時,單尾檢定(one-tailed test)與雙尾檢定(two-tailed test)就是兩種用來判斷數學參數是否具備統計顯著性的核心方法。簡單來說,這兩種方法都是用來幫助確認數據呈現的結果,是真的有明顯差異,還是只是碰巧。
這兩種方法也常被稱為單雙側檢定;使用「尾」(tail)這個術語是因為分佈的極端部分(即導致拒絕虛無假說的觀察值所在位置)面積很小,並且通常像呈黃色的常態分佈或右圖呈綠色的鐘形曲線那樣,朝著零的方向逐漸收斂(tail off)。
雙尾檢定
雙尾檢定或雙側檢定(Two-tailed test)尋找兩個方向的差異。
如果估計值大於或小於某個數值範圍,則適合雙尾。這個只關心估計值是否與標準值不同,可能變大,也可能變小。
例如,想知道甲教學法是否會影響應試者的成績。不在乎成績是退步還是進步,只要得分明顯高於或低於特定的分數範圍,都算是有影響。在虛無假說(假設沒有差異)的檢定中,極端結果的「臨界區」會平均分配在鐘形曲線的左右兩端。如果估計值落入這兩側的任何一個臨界區內,就會拒絕虛無假說,接受對立假說(即確認有顯著差異)。
單尾檢定
單尾檢定或單側檢定(One-tailed test)尋找一個方向的差異。
如果估計值僅可能在一個方向(向左或向右,但不會同時)偏離參考值,則適合使用單尾。例如,甲生產的瑕疵品比例是否超過百分之一;或新藥是否比舊藥更有效。如果新藥比舊藥更差,在我們的研究中並沒有實質意義。在這情況,如果估計值落入其中一個單側臨界區內(取決於感興趣的方向是大於還是小於),則接受對立假說並拒絕虛無假說。
應用
單尾檢定適用於具有單側尾部的不對稱分佈,例如在測量擬合優度時常見的卡方分佈;或者適用於具有雙尾之分佈的其中一側,例如在估計位置時常見的常態分佈
;這對應於指定一個特定的方向。雙尾檢定僅適用於存在兩個尾部的情況,例如在常態分佈中,這對應於將任一方向皆視為具有顯著性。
在羅納德·愛爾默·費雪(Ronald Fisher)的方法中,當的p值足夠極端(相對於該檢定統計量的抽樣分佈)以至於被認為不太可能是偶然的結果時,將會拒絕虛無假說 H0。在計算參數的統計顯著性時,這通常是透過將算出的 p 值與指定的顯著水準(以 \alpha 表示)進行比較來完成的。
在單尾檢定中,「極端」會被預先判定為代表「足夠小」或「足夠大」——而另一個方向的數值則被認為不具顯著性。人們可以將左尾或右尾機率報告為單尾的 p 值,這最終對應於檢定統計量偏離 H0 的方向。
在雙尾檢定中,「極端」意味著「足夠小或足夠大」,且任一方向的數值都會被認為具有顯著性。 對於給定的檢定統計量,存在一個雙尾檢定以及兩個單尾檢定(分別對應兩個方向)。
給定顯著水準 \alpha 時,對於雙尾檢定,臨界區將存在於分佈的兩個尾端,每個尾端的面積為 \alpha/2。
相對地,對於單尾檢定,臨界區將僅存在於單一尾端,其面積為 \alpha。對於一個檢定統計量在雙尾檢定中的給定顯著水準,其對應的單尾檢定會出現以下情況:如果資料落在檢定所指定的方向上,將被認為具有兩倍的顯著性(即 p 值減半);但如果資料落在與檢定所指定的臨界區相反的方向上,則完全不具顯著性(p 值大於 \alpha)。
例如,在擲硬幣時,檢定硬幣是否偏向正面是一種單尾檢定,獲得「全為正面」的數據將被視為具有高度顯著性,而獲得「全為反面」的數據則完全不具顯著性(p = 1)。相比之下,檢定硬幣是否在任一方向上存在偏差則是一種雙尾檢定,此時無論是「全為正面」或「全為反面」,都會被視為高度顯著的數據。
在醫學試驗中,通常關心某種療法的結果是否優於隨機機率(這暗示應使用單尾檢定);但更差的結果對科學領域來說同樣具有研究價值,因此應該使用雙尾檢定,以檢定該療法的結果是否與隨機機率不同(無論是更好還是更差)。 在經典的女士品茶實驗中,費雪(Fisher)檢定的是該位女士分辨兩種茶水沖泡方式的能力是否優於隨機猜測,而非她的能力是否與隨機猜測不同,因此他使用的是單尾檢定。
擲硬幣範例
在擲硬幣的例子中,虛無假說是一連串機率為 0.5 的伯努利試驗,產生一個隨機變數 X(正面為 1,反面為 0),而常見的(正面次數的平均)為檢定統計量 \bar X. 如果要檢定硬幣是否偏向正面,將使用單尾檢定——只有出現大量的正面才具顯著性。在這種情況下,五次皆為正面(HHHHH)且樣本平均數為 1 的數據集,發生的機率為 1/32 = 0.03125 \approx 0.03(連續 5 次擲硬幣,每次有 2 種結果 - ((1/2)^5 = 1/32))。這表示 p \approx 0.03,如果在顯著水準 \alpha = 0.05(對應於截斷邊界的顯著水準)下分析該檢定,此結果將具有顯著性(拒絕虛無假說)。
然而,如果要檢定硬幣是偏向正面還是反面,則會使用雙尾檢定,此時五次皆為正面(樣本平均數為 1)的數據集與五次皆為反面(樣本平均數為 0)的數據集同樣極端。因此,p 值將為 2/32 = 0.0625 \approx 0.06;如果在顯著水準 \alpha = 0.05 下分析該檢定,此結果將不具顯著性(不拒絕虛無假說)。
歷史
的 p 值]]
p 值是由卡爾·皮爾森(Karl Pearson)在皮爾森卡方檢定中引入的,他將 P(原始符號)定義為統計量等於或大於給定水準的機率。這是一個單尾的定義,且卡方分佈是不對稱的,僅取正值或零,並且只有一個尾部(即上尾)。它衡量了數據與理論分佈的擬合優度,其中零對應於與理論分佈完全一致;因此,p 值衡量的是擬合結果達到這種糟糕程度或更糟情況的可能性。
,顯示兩個尾部]]
單尾與雙尾檢定之間的區別是由羅納德·費雪(Ronald Fisher)在其深具影響力的著作《》(Statistical Methods for Research Workers)中普及的, 在書中他特別將其應用於常態分佈,這是一種具有兩個相等尾部的對稱分佈。常態分佈是位置(location)的常見測量方式,而非擬合優度(goodness-of-fit),且具有兩個尾部,對應於位置估計值高於或低於理論位置的情況(例如,樣本平均數與理論平均數的比較)。在常態分佈等對稱分佈的情況下,單尾的 p 值恰好是雙尾 p 值的一半: 他解釋道,這是因為一組「特定」的數據(在虛無假說下)發生的機率可能很低,但更極端的結果卻是有可能發生的;因此,從這個角度來看,特定但非極端且低機率的數據不應被視為具有顯著性。
特定檢定
如果檢定統計量在虛無假說下服從司徒頓t分佈——這在潛在變數服從具有未知尺度參數的常態分佈時很常見——則該檢定被稱為單尾或雙尾t檢定。如果檢定是使用實際的母體平均數和變異數,而不是使用來自樣本的估計值來進行,則它被稱為單尾或雙尾Z檢定。
t 和 Z 的統計表提供了單尾與雙尾檢定的臨界值。也就是說,它們提供了在抽樣分佈的某一端截斷一整塊區域的臨界值,以及在抽樣分佈的兩端截斷區域(面積各為一半)的臨界值。
另見
- ,用於比較兩個樣本。
- 型一錯誤與型二錯誤
- 方差分析
- 假說檢定
- A/B測試
*
- 多重比較謬誤
- 样本量确定
- 德州神槍手謬誤
- 對立假說
- 信息檢索
- 零假设
- ROC曲线
- 靈敏度和特異度
- 偽陽性和偽陰性
- 假說檢定
- 檢定力
- 拒絕域
- 映襯
*
- 司徒頓t檢定
參考
评论 (0)