標準差是什麼?
標準差衡量一組數據離平均值有多分散。標準差小,代表數據都靠近平均值;標準差大,代表數據分布得很廣。
算法:一步一步拆開
以 2, 4, 4, 4, 5, 5, 7, 9 這八個數為例:
- 先求平均值:(2+4+4+4+5+5+7+9) ÷ 8 = 5
- 每個數減平均後平方:9, 1, 1, 1, 0, 0, 4, 16
- 加總得離差平方和 = 32
- 除以 8(母體)得變異數 4,開根號得母體標準差 2
- 若當成樣本,改除以 7 得變異數 4.571,開根號得樣本標準差 2.14
母體還是樣本:除以 n 還是 n−1
這是最常算錯的一步,而且兩個答案都會「看起來合理」,所以錯了不容易發現。
判斷方式很單純:你手上的資料就是你想描述的全部,用母體(除以 n);資料只是從更大的一群裡抽出來的一部分,用樣本(除以 n−1)。
例如算全班 30 個人的段考成績分散程度,你要描述的就是這 30 人,用母體標準差。但如果是從全校抽 30 人來推估全校的分散程度,就要用樣本標準差。除以 n−1 是為了修正抽樣造成的低估——樣本裡剛好沒抽到極端值的機會不小,直接除以 n 會讓估出來的分散程度偏小。
資料量大的時候兩者差距很小(n=1000 時幾乎看不出來),但 n 只有十幾筆時差得很明顯,上面的例子就差了 7%。報告或論文裡務必寫清楚用的是哪一種。
Excel 和 Google 試算表的函數對照
| 要算什麼 | 函數 | 備註 |
|---|---|---|
| 樣本標準差 | STDEV.S() | 舊版寫 STDEV(),多數情況用這個 |
| 母體標準差 | STDEV.P() | 舊版寫 STDEVP() |
| 樣本變異數 | VAR.S() | 標準差的平方 |
| 母體變異數 | VAR.P() |
順帶一提,STDEV() 這個舊名稱算的是樣本標準差。很多人以為沒有後綴就是「一般的」標準差而直接用,結果報告裡混用了兩種算法。
68–95–99.7 法則
如果資料接近常態分布,約 68% 的數值落在平均值 ±1 個標準差內、95% 落在 ±2 個、99.7% 落在 ±3 個。這條法則的實用之處在於快速判斷「這個數字算不算異常」。
舉例:某產品的重量平均 500 公克、標準差 5 公克,那麼量到 490 公克是 −2 個標準差,還在 95% 的範圍內,屬正常波動;量到 480 公克就是 −4 個標準差,已經超出 99.7%,該去查是不是製程出問題,而不是當成運氣不好。
但要記得前提是「接近常態分布」。收入、房價這類右偏嚴重的資料不適用,用標準差去判斷異常會得到誤導的結論。