- 效果量0.7、8萬人看起來漂亮,但沒對照組就只能講相關
- 用單題自評換到8萬人規模,代價是測量很粗、易受期待影響
- 大樣本只讓估計更準,治不了迴歸均值和選擇偏誤
目錄
如果你在新聞上看到「8 萬人實測,某 App 顯著減壓,效果量 0.7」,你的第一反應應該是什麼?
正確答案不是「太好了我要載」,也不是「一定是業配」,而是:先看研究設計。2025 年 12 月 npj Digital Medicine 一篇關於自我催眠 App 的論文,正好是練習這件事的好教材——數字很漂亮,但漂亮的數字底下藏著一整排該打的問號。
TL;DR
- 研究對象:自我催眠 App Reveri(Stanford 的 David Spiegel 是共同創辦人/科學顧問)的 84,395 名使用者、282,893 次 減壓 session,期間 2021/11–2025/01
- 結果:每次 session 前後用 單題 10 分 Likert 自評壓力,前 10 次 session 的下降效果量 Cohen’s d = −0.71~−0.78(統計上屬「大」效果),平均降 1.45–1.62 分
- 但它是回溯性觀察研究、沒有對照組、自陳單題測量——這幾點讓它只能停在「相關」,證明不了是催眠造成的
- 對工程師/讀數據的人:這是「大樣本 ≠ 嚴謹」「大效果量 ≠ 因果」的經典案例
研究到底做了什麼
它不是隨機對照試驗(RCT),而是回溯性觀察研究:直接拿 App 累積的真實使用資料來分析。使用者在每次減壓 session 前後各自評一次壓力(1=最低、10=最高),研究就看「後 − 前」降了多少。
作者明講選單題 Likert 而非多題標準量表的理由:為了最大化參與率與資料量。這是個誠實但關鍵的取捨——你用最低摩擦的測量換到 8 萬人的規模,代價是測量本身很粗。
數字本身
前 10 次 session,效果量 Cohen’s d 落在 −0.71 到 −0.78。照慣例 d≈0.2 小、0.5 中、0.8 大,所以這是接近「大」的效果。平均壓力下降 1.45–1.62 分(滿分 10)。
幾個有意思的 moderator:
- 可被催眠程度(hypnotizability)越高,降得越多——但相關其實很弱(ρ 約 −0.11~−0.15)
- 互動式/標準長度 session 效果是簡短版的 1.8 倍(−2.02 vs −1.13)
- 年輕人第一次降得多、年長者「累積」效果較好
- 付費會員前 10 次降得比較多
- 重複做並不會讓效果越疊越高(沒有長期累積效應)
安全性看起來很好:8 萬多人裡只有 10 人 回報症狀變差或其他問題,且都輕微。
為什麼「數字漂亮」還是不能下結論
這才是重點。下面每一條都是讓 d=0.7 失去說服力的理由:
1. 沒有對照組。 這是最致命的。你只知道「做完 session 後使用者自評壓力降了」,但你不知道如果他們什麼都不做、或只是閉眼坐 5 分鐘,會不會也降一樣多。作者自己也承認這限制了因果推論。
2. 迴歸均值(regression to the mean)。 人通常在壓力高的時候才打開減壓 App。而「特別高」的狀態,下一次量本來就傾向回到平均——就算什麼都沒做。前後測設計天生會把這個自然回落算進「效果」裡。
3. 自陳 + 單題測量 + 期望效應。 使用者知道自己在用減壓工具、知道這題在問壓力、剛花了時間「應該要有效」。這種情境下自評分數下降,有多少是真的生理放鬆、多少是「我期待它有效所以給低分」?單題 Likert 分不出來。
4. 選擇偏誤。 樣本是「會自己去下載付費自我催眠 App、而且願意填前後測」的人——高度自我選擇,不能代表一般人。付費會員效果較好,很可能也只是「更投入的人本來就更容易感受到效果」。
5. 大樣本治不了上面這些。 很多人看到 N=84,395 就覺得「這麼多人總可信吧」。但樣本大只會讓你的估計更精準,不會讓有偏的設計變無偏。8 萬人的迴歸均值,還是迴歸均值;只是你會非常有信心地測到一個被污染的數字。作者說大樣本「有助於緩解」混淆,這話對隨機誤差成立,對系統性偏誤不成立。
那這篇研究是廢的嗎?
不是。把它擺回它該在的位置就很有價值:
- 它證明了真實世界的使用資料可以被系統性地收集與分析(digital therapeutics 的資料基礎)
- 它給了後續 RCT 一個值得驗證的訊號與效果量範圍
- 安全性資料(10/84,395)在這種規模下很有參考價值
- moderator(互動性、hypnotizability)對產品設計有實際啟發
它只是不能被讀成「催眠 App 經實證能減壓」。它能讀成「在自我選擇的使用者中,做完 session 後自評壓力會下降,值得用對照組進一步驗證」。
學到的事(資料素養版)
下次看到「N 很大、效果量很漂亮」的健康/行為研究,照順序問:
- 有對照組嗎? 沒有 → 大概只能講相關。
- 是前後測嗎? 是 → 警惕迴歸均值與期望效應。
- 怎麼測的? 自陳單題 → 主觀、易受期待影響。
- 樣本怎麼來的? 自我選擇 → 不能外推。
- 大樣本是在解決隨機誤差,還是被拿來掩蓋設計問題?
工程上其實同一套直覺:A/B test 沒有 control 就不叫 A/B test;觀測指標漂亮但沒有對照、沒有隨機分流,你看到的常常是迴歸均值和選擇效應,不是你那個改動的功勞。讀論文和讀 dashboard,要小心的是同一件事。
參考資料
AI 只根據這篇文章內容回答。點下方任一問題,或直接開右下對話框。
相關標籤
相關文章
科學家發現 AI Agent 之間有更好的溝通語言——不是自然語言
研究發現 AI Agent 之間用「湧現語言」(emergent language)比用自然語言溝通更有效率——更短、更省計算資源,但也更不透明
AlphaFold 團隊的真心話:當結果好到讓你懷疑「是不是洩漏了測試集」
AlphaFold 團隊回顧開發過程:當各種想法一個接一個奏效、成績直線上升時,他們沒有慶祝,反而開始懷疑自己是不是犯了機器學習最經典的錯——洩漏測試集。這篇整理這段自述,以及他們如何看待 AlphaFold 對健康與科學的真實影響。
NVIDIA Lyra 2.0:一張照片生成「不會崩壞」的可探索 3D 世界
Lyra 2.0 用『逐幀 3D 幾何快取』記住場景骨架,讓從單張照片生成的可探索世界在你回頭看時也不會崩壞;核心生成器是類似 Sora 的 diffusion transformer,而且模型與程式碼免費釋出。