重點速覽 6 分鐘閱讀
  • 效果量0.7、8萬人看起來漂亮,但沒對照組就只能講相關
  • 用單題自評換到8萬人規模,代價是測量很粗、易受期待影響
  • 大樣本只讓估計更準,治不了迴歸均值和選擇偏誤
目錄

如果你在新聞上看到「8 萬人實測,某 App 顯著減壓,效果量 0.7」,你的第一反應應該是什麼?

正確答案不是「太好了我要載」,也不是「一定是業配」,而是:先看研究設計。2025 年 12 月 npj Digital Medicine 一篇關於自我催眠 App 的論文,正好是練習這件事的好教材——數字很漂亮,但漂亮的數字底下藏著一整排該打的問號。

TL;DR

  • 研究對象:自我催眠 App Reveri(Stanford 的 David Spiegel 是共同創辦人/科學顧問)的 84,395 名使用者、282,893 次 減壓 session,期間 2021/11–2025/01
  • 結果:每次 session 前後用 單題 10 分 Likert 自評壓力,前 10 次 session 的下降效果量 Cohen’s d = −0.71~−0.78(統計上屬「大」效果),平均降 1.45–1.62 分
  • 但它是回溯性觀察研究、沒有對照組、自陳單題測量——這幾點讓它只能停在「相關」,證明不了是催眠造成的
  • 對工程師/讀數據的人:這是「大樣本 ≠ 嚴謹」「大效果量 ≠ 因果」的經典案例

研究到底做了什麼

它不是隨機對照試驗(RCT),而是回溯性觀察研究:直接拿 App 累積的真實使用資料來分析。使用者在每次減壓 session 前後各自評一次壓力(1=最低、10=最高),研究就看「後 − 前」降了多少。

作者明講選單題 Likert 而非多題標準量表的理由:為了最大化參與率與資料量。這是個誠實但關鍵的取捨——你用最低摩擦的測量換到 8 萬人的規模,代價是測量本身很粗。

數字本身

前 10 次 session,效果量 Cohen’s d 落在 −0.71 到 −0.78。照慣例 d≈0.2 小、0.5 中、0.8 大,所以這是接近「大」的效果。平均壓力下降 1.45–1.62 分(滿分 10)。

幾個有意思的 moderator:

  • 可被催眠程度(hypnotizability)越高,降得越多——但相關其實很弱(ρ 約 −0.11~−0.15)
  • 互動式/標準長度 session 效果是簡短版的 1.8 倍(−2.02 vs −1.13)
  • 年輕人第一次降得多、年長者「累積」效果較好
  • 付費會員前 10 次降得比較多
  • 重複做並不會讓效果越疊越高(沒有長期累積效應)

安全性看起來很好:8 萬多人裡只有 10 人 回報症狀變差或其他問題,且都輕微。

為什麼「數字漂亮」還是不能下結論

這才是重點。下面每一條都是讓 d=0.7 失去說服力的理由:

1. 沒有對照組。 這是最致命的。你只知道「做完 session 後使用者自評壓力降了」,但你不知道如果他們什麼都不做、或只是閉眼坐 5 分鐘,會不會也降一樣多。作者自己也承認這限制了因果推論。

2. 迴歸均值(regression to the mean)。 人通常在壓力高的時候才打開減壓 App。而「特別高」的狀態,下一次量本來就傾向回到平均——就算什麼都沒做。前後測設計天生會把這個自然回落算進「效果」裡。

3. 自陳 + 單題測量 + 期望效應。 使用者知道自己在用減壓工具、知道這題在問壓力、剛花了時間「應該要有效」。這種情境下自評分數下降,有多少是真的生理放鬆、多少是「我期待它有效所以給低分」?單題 Likert 分不出來。

4. 選擇偏誤。 樣本是「會自己去下載付費自我催眠 App、而且願意填前後測」的人——高度自我選擇,不能代表一般人。付費會員效果較好,很可能也只是「更投入的人本來就更容易感受到效果」。

5. 大樣本治不了上面這些。 很多人看到 N=84,395 就覺得「這麼多人總可信吧」。但樣本大只會讓你的估計更精準,不會讓有偏的設計變無偏。8 萬人的迴歸均值,還是迴歸均值;只是你會非常有信心地測到一個被污染的數字。作者說大樣本「有助於緩解」混淆,這話對隨機誤差成立,對系統性偏誤不成立。

那這篇研究是廢的嗎?

不是。把它擺回它該在的位置就很有價值:

  • 它證明了真實世界的使用資料可以被系統性地收集與分析(digital therapeutics 的資料基礎)
  • 它給了後續 RCT 一個值得驗證的訊號與效果量範圍
  • 安全性資料(10/84,395)在這種規模下很有參考價值
  • moderator(互動性、hypnotizability)對產品設計有實際啟發

它只是不能被讀成「催眠 App 經實證能減壓」。它能讀成「在自我選擇的使用者中,做完 session 後自評壓力會下降,值得用對照組進一步驗證」。

學到的事(資料素養版)

下次看到「N 很大、效果量很漂亮」的健康/行為研究,照順序問:

  1. 有對照組嗎? 沒有 → 大概只能講相關。
  2. 是前後測嗎? 是 → 警惕迴歸均值與期望效應。
  3. 怎麼測的? 自陳單題 → 主觀、易受期待影響。
  4. 樣本怎麼來的? 自我選擇 → 不能外推。
  5. 大樣本是在解決隨機誤差,還是被拿來掩蓋設計問題?

工程上其實同一套直覺:A/B test 沒有 control 就不叫 A/B test;觀測指標漂亮但沒有對照、沒有隨機分流,你看到的常常是迴歸均值和選擇效應,不是你那個改動的功勞。讀論文和讀 dashboard,要小心的是同一件事。

參考資料

問這篇文章

AI 只根據這篇文章內容回答。點下方任一問題,或直接開右下對話框。

相關標籤

相關文章