對照組怎麼切、樣本要多大?增量測試的結論,在開跑前就決定了
增量測試的成敗,多數不在分析階段,而在開跑前的三個設計決定:對照組切在哪一層、留多少比例、觀察窗開多長。這篇把三個決定各自的算法、可查證的門檻數字、以及最常見的污染來源整理成可以照著做的順序,並且說明測完看到「沒有顯著差異」時,正確的讀法是什麼。
想看 10% 的提升,跟想看 1% 的提升,樣本量差 92 倍
ASOS 與 Imperial College London 的研究者在 2018 年 AdKDD 研討會發表過一份增量測試的實驗設計論文,把「想偵測多小的提升」跟「需要多少樣本」的對應關係算了出來。
在檢定力 80%、顯著水準 5% 單尾、基準轉換率假設 5%、測試組與對照組各半的條件下,想看出 10% 的相對提升(轉換率從 5.0% 變成 5.5%),總受眾大約需要 54,068 人;想看出 1% 的相對提升,總受眾要 4,978,355 人。
同一場測試,只因為你想看的差異從 10% 縮到 1%,需要的人數多了 92 倍。
這個倍率不是線性的,這是整件事最反直覺的地方。多數品牌規劃增量測試時,會先問「要跑多久」「要花多少錢」,很少人先問「這個名單規模最小能看出多大的差異」。而那個問題的答案,決定了跑完之後你能不能得到一個看得懂的結論。這不是統計學的細節問題,是預算分配的問題:一場算不出最小可偵測效果就開跑的測試,花掉真實的營收機會,換回一個無法解讀的數字。
會議室裡那句「跑完沒有顯著差異」,通常不只一種解釋
我們最近跟幾個品牌的行銷團隊討論增量測試,聽到最多的一句話是:「我們有切對照組,跑完沒有顯著差異,所以這檔活動應該沒效。」
我們每次聽到都會擔心。因為「沒有顯著差異」至少對應到好幾種情況:這檔活動真的沒有帶來額外的購買、它有效但效果比這個樣本量能分辨的下限還小、對照組被別的活動污染了、隨機分派本身出了問題、或是主要指標的變異大到蓋掉訊號。會議室裡的報表分不出這些,投影幕上只會顯示一個灰色的 p 值。
分辨它們的方法,多數不在分析階段,在開跑之前。
對照組切法、比例與觀察窗會一起改變答案
拆開來看,一場增量測試在設計階段要決定的事情不多,但每一個決定都直接乘進最後的結論品質。
| 你要決定的事 | 它實際在改變什麼 |
|---|---|
| 對照組切在哪一層 | 決定同一個人會不會同時出現在兩邊,也決定污染從哪個縫隙進來 |
| 對照組留多少比例 | 決定檢定力,同時決定你主動放棄多少預期的增量貢獻 |
| 觀察窗開多長 | 決定延遲發生的訂單算不算數,也決定其他活動有多少時間滲進來 |
這三件事都可以在按下開始之前先算過一輪。算不出來,就代表這場測試還不該開跑。以下逐一拆。
決定一:切分層級決定污染從哪裡進來
「切在哪一層」聽起來像技術選項,實際上是在選你願意接受哪一種污染。三種主流切法各有各的破口。

從會員名單層切
這是台灣零售品牌最常用、也最容易自己動手的一種:從要發送的名單裡隨機抽出一部分,這批人這一檔不發,其餘照常發,檔期結束後比兩群人的購買行為。推播、EDM、LINE 訊息都適用,這種做法把送達、歸屬與增量三本帳分開記,能回答的問題很具體:這一則訊息本身帶來多少額外的訂單。
它的破口有兩個。一個是同一個人這週還會被別的活動打到:對照組沒收到這則 LINE,卻收到另一檔的簡訊、看到正在跑的再行銷廣告,於是對照組並不是真正的「什麼都沒發生」。另一個是跨通路的歸戶落差:線上把人擋掉,那個人週末走進門市買了東西,這筆訂單本來就該算在對照組頭上,問題是你歸不歸得回同一個會員。會扭曲結果的是兩組歸戶完整度不一樣,不是有人在線下買東西這件事本身。
隨機分派也有講究。Google 在地理實驗的方法論文(Vaver & Koehler, 2011)裡驗證過一個做法:與其純粹亂數分派,不如先照基準期表現把單位排序、切成一組一組,再從每組各隨機抽一個進實驗組。在他們的地理實驗資料上,這種帶限制的隨機分派讓信賴區間的估計低了約 10%。同樣邏輯用在會員名單上方向是通的,照近期消費金額或購買頻率排序再分層抽樣,比整份名單直接亂數切,兩邊起跑點會齊得多。但那個約 10% 是特定資料與設計下的結果,不能當成會員名單也拿得到的改善幅度,想知道自己能收窄多少,要用自己的前測資料把分派重跑幾次來看。
從受眾層切,交給平台
第二種是把切分交給廣告平台,跑平台自己的 lift study。好處是隨機分派由平台執行,不會有你自己 SQL 寫錯的風險;代價是門檻與規則由平台定。
Google 在使用者層 Conversion Lift 的官方說明裡把數字寫得很清楚(以下為 2026 年 8 月查核的版本,官方文件會更新):預算低於 5,000 美元的研究無法儲存;預算高於 5,000 美元且累積 1,000 筆轉換以上,可取得方向性結果;holdback 比例可在 1% 到 50% 之間自訂;研究最短允許 7 天,但官方建議超過 14 天,並指出在轉換延遲較長的情況下,跑不到 14 天的研究絕對提升最多會少掉 17%。確定性以 50% 到 95%、每 5% 一階呈現,官方建議以 90% 為目標。
Google 在比較各種 lift 類型的說明中也把兩種切法的取捨講明白:使用者層依賴 opt-in 流量,可能受量測缺口影響;地理層以地區為分組單位,雜訊較大、結果無法依人口統計切分,預算需求通常更高。
受眾層還有一個容易被忽略的變異來源。前面那份 AdKDD 論文指出,平台的 lift study 跟標準 A/B 測試有結構性差異:測試組裡並不是每個人都真的看到廣告,有人競價全輸、有人廣告出現在螢幕外。這群「未觸及受眾」的行為會帶進標準 A/B 測試裡不存在的變異,計算檢定力與樣本量時必須算進去。這也是為什麼平台上的測試,需要的名單規模往往比一般 A/B 測試計算機估出來的更大。
對照組要怎麼「不投放但仍可比較」,學術上有解法。Johnson、Lewis 與 Nubbemeyer 在 2017 年《Journal of Marketing Research》提出的 ghost ads 方法,是讓平台對對照組不投放廣告,但把「這次競價本來會贏」的紀錄留下來,用它標定對照組裡與曝光組真正對應的那群人。
從地理層切
第三種是把整個地理區塊當成實驗單位:某些地區照常投放,某些地區關掉或減量,比較兩群地區的業績走勢。這種切法能同時涵蓋線上與線下,也不受單一平台的識別能力限制。
它有兩個硬條件:要能按地理準確投放廣告,要能在地區層級追蹤廣告支出與反應指標。缺一個,方法就不成立。Vaver 與 Koehler 也點出污染來源:消費者會跨區移動,而且地理單位不能切得太細,郵遞區號等級通常不可行。美國的實務做法是用 Nielsen 定義的 210 個 DMA 當單位;台灣的行政區劃能提供的可分派單位比美國少很多,會直接壓縮隨機分派的平衡度,這是台灣品牌用地理實驗的真實限制。另外要留意,用歷史資料模擬設計時,模擬用的前測段與測試段長度要分別對應你打算實跑的期間;論文舉 14 天配 14 天只是例子,兩段不必等長。
完全無法隨機分派時還有一條退路。Google 團隊在 2015 年《The Annals of Applied Statistics》發表的 CausalImpact 方法,用貝氏結構時間序列從一組未受影響的對照序列建構反事實。門檻在假設:對照序列沒被這次介入影響、介入前建立的關係在介入後仍延續、期間沒有其他結構性衝擊。對照地區也被同一波電視廣告掃到,或同期碰上改版與缺貨,假設就破了。
決定二:對照組留多少比例,是精度與成本的取捨
先看樣本量。前面那份 AdKDD 論文的表,在檢定力 80%、顯著水準 5% 單尾、基準轉換率 5%、測試組與對照組各半的條件下,給出四個座標:
- 想看 10% 的相對提升(5.0% 到 5.5%):對照組 1,352 筆轉換,總受眾約 54,068 人
- 想看 5% 的相對提升:對照組 5,107 筆轉換,總受眾約 204,271 人
- 想看 2% 的相對提升:對照組 31,571 筆轉換,總受眾約 1,262,848 人
- 想看 1% 的相對提升:對照組 124,459 筆轉換,總受眾約 4,978,355 人

在這組條件下,想偵測的相對差異每縮小一半,需要的樣本大約變成四倍。要注意這是近似關係,前提是基準轉換率、顯著水準、檢定力、分組比例與檢定方法都固定不動;換了任何一項,倍率就會跟著變。
為什麼會這麼難?Randall Lewis 與 Justin Rao 在 2015 年《The Quarterly Journal of Economics》發表的廣告成效衡量研究給了答案:問題出在訊噪比。他們分析 25 個大型田野實驗,多數觸及數百萬名顧客,合計 280 萬美元的數位廣告支出,得到的 ROI 信賴區間中位數寬度超過 100 個百分點。
原因不難懂。他們的中位數活動要達到 25% 的 ROI,只需要讓人均銷售提高 0.35 美元,而這個變數的平均值是 7 美元、標準差是 75 美元。要在標準差 75 的雜訊裡抓出 0.35 的位移,本來就極困難。他們的結論是,個人層級的銷售相對於廣告的人均成本非常波動,變異係數為 10 是常見的情況,因此有資訊量的廣告實驗動輒需要超過 1,000 萬 person-weeks。
最值得記住的是那個對照:200 萬名不重複使用者對半分派時,實驗大約有 95% 的機率抓得到效果;降到 20 萬人,即使這檔廣告真的帶來 25% 的 ROI,也有 74% 的機率會告訴你「沒有顯著差異」。
口徑要說清楚:這是 2015 年美國市場、低強度人均投放的展示型廣告實驗,人均銷售基準跟台灣零售差距很大,這些數字是「訊噪比決定樣本量」的方向證據,不能直接搬來當台灣的門檻。方向倒是通用的:客單價變異越大、投放的人均強度越低,需要的樣本就越多。
五五分檢定力最大,但代價要自己算
那份 AdKDD 論文直接算過比例這件事。在總受眾規模固定、觸及率 100%、單一二元處理的前提下,測試組與對照組各半時檢定力最大。純粹從「看得出差異」的角度,五五分是最有效率的配置。
實務上很少人這樣做,因為五五分代表這一檔有一半的名單你主動不發。但這個成本要算得誠實:你損失的不是那半份名單的全部營收,而是這檔活動在那半份名單上「本來會多帶來」的增量貢獻毛利。這筆帳只在活動真的有正向增量時才存在,而且它假設每位被留白的會員預期貢獻相近;切的若是平台 lift study,測試組本來就有一部分人沒被觸及,還要再調整。
所以決策的形狀是:先算出五五分能偵測到多小的效果,再估出你能接受的犧牲上限對應多大的對照組,看兩者有沒有交集。有交集就開跑,沒有就代表這個題目用這個名單規模測不動,該換題目或累積名單。跨品牌通用的比例並不存在,能決定比例的只有你自己的基準轉換率、名單規模與可接受成本。
論文另外提到一件值得警惕的事:想在同一場測試裡同時比較兩種策略(多 cell 設計),要達到同樣 80% 的檢定力,每個對照組需要兩倍以上的轉換數,總受眾超過四倍。極端的例子是,要偵測兩個 cell 之間 1% 的相對 lift 差距,需要 cell A 的對照組累積約 1.06 億筆轉換。
決定三:觀察窗開多長,取決於你賣什麼

觀察窗的長度不該用「大家都跑兩週」來決定,該用你的商品決定。快消品的購買決策以天為單位,家電、家具、精品的決策週期可能拉到數週。Google 官方那句「跑不到 14 天、轉換延遲又長的研究,絕對提升最多會少掉 17%」,講的就是這件事:你太早關掉觀察窗,晚到的訂單被算成沒發生,測出來的效果會系統性偏低。
但觀察窗拉長有代價。窗開得越久,對照組被別的檔期、別的通路打到的機率就越高。本文建議的取捨方式是:以「分派或送達那一刻」為起算點,看你這個品類的轉換延遲分布,取涵蓋八成轉換的天數當觀察窗下限(八成是本文提出的操作門檻,不是產業標準,可依品類調整),並在這段期間盡量凍結其他會打到同一群人的活動;凍結不了的至少完整記錄,分析時當成已知的污染來源寫清楚。
要注意起算點的定義。用日曆期間去算「這個月的訂單累積曲線」會混進非本次活動帶來的自然訂單,算出來的天數通常偏長。要看的是分派之後這群人的轉換何時發生。
「沒有顯著差異」的正確讀法
有了這些,回頭看會議室裡那句話就清楚了。「沒有顯著差異」的意思是「在這個樣本量、這個觀察窗、這種切法之下,證據不足以排除效果為零的可能」。它沒有說效果是零。
正確的讀法要配著三樣東西看:點估計、信賴區間的兩端、以及這場設計的最小可偵測效果。假設你的設計最小只能看出 15% 的提升,而真實效果是 8%,這場測試抓到效果的機率會低於你設定的檢定力,但不是抓不到,偶爾仍會因抽樣波動落在顯著區。這時候該寫進報告的結論是「證據不足」,既不能宣稱活動無效,也不能反過來宣稱有效。
信賴區間怎麼落,決定你能下什麼結論。
| 信賴區間的位置 | 可以下的結論 |
|---|---|
| 完全落在零以上 | 有正向增量,可以用區間下界當保守估計去算投報 |
| 跨過零,但兩端都在可忽略的範圍內 | 效果就算存在也小到不影響決策,可以收掉這個題目 |
| 跨過零,且兩端分別是明顯的正效果與負效果 | 這場測試沒有回答問題,樣本或設計要重來,不要當成無效的證據 |
| 完全落在零以下 | 要認真看待負向效果的可能,而非直接歸因為雜訊 |
還有幾件開跑前要講定的事。單尾還是雙尾先定死:前面引用的論文案例用 5% 單尾,那是它的設定,若負向效果對你也重要就該用雙尾。分派比例是否如預期、有沒有重複的會員 ID 被算成兩個人、中途有沒有偷看結果就提前收手,這些都會讓最後那個 p 值失去意義,要在分析腳本裡先設好檢查。
同樣的邏輯適用在受眾標籤上。用行為標籤圈出來的名單值不值得投,跟平台回報的增幅歸因與標籤自身的 LIFT 差在哪,都要看樣本量撐不撐得起你想下的判斷;廣告演算法每週需要一定數量的最佳化事件才學得穩,實驗要看得出差異也需要類似量級的轉換累積,瓶頸是同一個。
這個系列的前一篇談這一切的前提,為什麼廣告後台算出來的成效,取代不了一組真正沒被打到的人;而增量測試的結果跟歸因報表兜不起來的時候該信哪一邊,我們另外單獨處理。
分派紀錄要留在會員身上,不是留在活動報表裡
前面所有的設計,最後都會卡在同一個工程問題:你有沒有辦法在檔期結束後,把「這個人當初被分到哪一組」跟「這個人後來在哪裡買了什麼」對得起來。
多數品牌的困難不在切名單,那是一行 SQL 的事,困難在後面三件。分派結果只留在這一檔活動的報表裡,下一檔就查不到這個人上次在哪一組,你沒辦法管理同一群人被反覆抽進對照組。跨通路的訂單沒有歸到同一個會員身上,兩組的歸戶完整度就不一致,測出來的差距有一部分是資料串接的落差。名單重疊查不出來,同一個人可能同時是 A 活動的測試組跟 B 活動的對照組,兩邊的結論都會被污染。
91APP CDMP 在這裡承擔的是資料層的工作:把線上線下的消費歸到同一個會員 ID,讓觀察窗內不管在哪個通路發生的訂單都回得到同一個人;把每次的分派結果寫成會員層標籤留存,讓下一檔查得到誰最近被抽走過;在名單圈選階段就算出不同活動的受眾重疊。
這些能力不會讓你的實驗變得顯著,樣本量不夠就是不夠。它們處理的是另一件事:讓你算出來的那個數字,是在量真實發生的事情,而不是在量資料串接的誤差。一份設計嚴謹但歸戶錯誤的實驗,跟一份沒做實驗的報表,可信度是一樣的。
把最小可偵測效果算出來,再決定要不要切這個對照組
給準備開跑的團隊四件可以照著做的事,順序不要換。
- 先把實驗規格寫成一頁紙,再談預算:這頁要寫滿七件事,分派與分析的單位(通常是會員,不是訂單)、主要指標(會員轉換率、人均訂單數還是人均營收)、基準值、想偵測的相對提升幅度、顯著水準與單雙尾、檢定力、預估的未觸及或未送達比例。二元的會員轉換率可以用兩組比例的樣本量算法,人均營收這種高偏態的連續指標不行,要改用歷史資料模擬或 bootstrap 估變異(預期效果:省下一次注定無解的測試;建議週期:每次規劃新測試都跑一次)。
- 分層抽樣,不要純亂數:照近期消費金額或購買頻率排序後切組,每組各抽一個進實驗組。改善幅度沒有通用值,用自己的前測資料把分派重跑幾十次,看信賴區間收窄多少再決定要不要導入(預期效果:同樣樣本量換到更窄的區間;建議週期:確認有效後寫進圈選腳本長期沿用)。
- 觀察窗照轉換延遲分布設,不照習慣設:以分派或送達那一刻起算,看這群人的轉換何時發生,取涵蓋八成轉換的天數當下限,期間內盡量凍結其他會打到同一群人的活動(預期效果:避免延遲訂單被漏算導致效果低估;建議週期:每個品類算一次,商品結構改變時複查)。
- 分派規則先定好,不要事後手動排除:實驗組別要留成會員層標籤而不只是報表的一欄,並在開跑前選定輪替方式,例如固定一群人長期當對照組、或設定被抽中後幾檔內不再抽。事後才把「上次被抽過的人」挑掉會改變樣本母體,讓這次的隨機性失效(預期效果:多檔實驗之間的污染查得出來,也不會有人長期承擔對照組成本;建議週期:每檔測試結束後立刻回寫標籤)。
這四件事都不需要新工具,需要的是在按下開始之前,把規格寫完再動手。
測不出來,和沒有效果,是兩件事
回到那間會議室。投影幕上那個灰色的 p 值本身沒有說謊,它只是回答了一個比大家以為的更狹窄的問題:在這個樣本量、這個觀察窗、這種切法之下,我們有沒有足夠的證據排除「效果為零」。
把這句話寫進報告,跟寫「本次活動無效」,是兩份完全不同的文件。前者會讓下一次的設計變好,後者會讓一檔可能有效的活動被砍掉。
決定你拿到哪一份的,是開跑前那段規劃時間。名單規模、對照組比例、觀察窗長度全都在你手上,也全都算得出來。台灣品牌的名單常常測不出很小的效果,這是現實,但知道自己測不出小效果,本身就是可以拿去做決策的資訊:它會讓你把測試留給值得測的大題目,把小題目交給經驗判斷。
品牌最常問的增量測試設計問題
Q1:增量測試的對照組跟一般 A/B 測試的對照組一樣嗎?
A1:不一樣。一般 A/B 測試比較的是兩個版本(例如 A 素材與 B 素材)誰表現好,兩組人都會收到訊息。增量測試的對照組是完全不接收這次行銷動作的一群人,比較的是「有做」跟「什麼都不做」的差別,回答的是這檔活動帶來多少本來不會發生的購買。另外在廣告平台上跑的 lift study 還有一個結構差異:測試組裡並不是每個人都真的看到廣告,這群未觸及的人會帶進額外的變異,計算樣本量時必須算進去。
Q2:對照組要留多少比例才對?
A2:沒有跨品牌通用的比例。從純統計角度,在總受眾規模固定、觸及率 100%、單一二元處理的前提下,測試組與對照組各半時檢定力最大。但各半代表你有一半的名單這一檔不發,要付出的是這半份名單上本來會多出來的增量貢獻。所以實務上要做取捨:先算出各半能偵測到多小的效果,再看你能接受的增量貢獻犧牲上限對應多大的對照組,兩者有交集才開跑。廣告平台通常也有自己的區間,例如 Google 使用者層的 Conversion Lift 允許 holdback 設在 1% 到 50% 之間(2026 年 8 月查核)。
Q3:樣本要多少才夠?有沒有快速的判斷方法?
A3:有,把它倒過來算。與其問「多少人才夠」,不如先問「這份名單規模最小能看出多大的相對提升」。在檢定力 80%、顯著水準 5% 單尾、基準轉換率 5%、測試組與對照組各半的條件下,偵測 10% 的相對提升需要總受眾約 5.4 萬人,偵測 1% 則需要約 498 萬人。同一組條件下,想偵測的差異每縮小一半,樣本大約要變成四倍。用自己的基準轉換率與名單規模代進去重算,就知道這個題目測不測得動。要注意計算單位是會員而不是訂單,同一個會員可以下多筆訂單,訂單並不是彼此獨立的樣本。
Q4:預算不大的品牌還能做增量測試嗎?
A4:能做,但要換題目跟換方法。名單小代表你只能誠實地測「大效果」的題目,例如整個檔期做與不做、某個高強度優惠發與不發,不要拿去測素材微調這種預期效果只有幾個百分點的差異。方法上,平台的 lift study 通常有預算門檻,例如 Google 使用者層的 Conversion Lift 要求研究預算至少 5,000 美元(2026 年 8 月查核)。預算不到的品牌可以改從自己的會員名單層切對照組,這條路成本低,前提是分派紀錄與跨通路歸戶要做得起來。
Q5:測試要跑多久?延遲發生的訂單怎麼處理?
A5:觀察窗要照你的商品轉換延遲設,不是照習慣設。以分派或送達那一刻起算,看這群人的轉換何時發生,取涵蓋八成轉換的天數當下限。用日曆期間去看訂單累積曲線會混進自然訂單,算出來通常偏長。Google 在官方說明中指出,研究最短允許 7 天但建議超過 14 天,並且在轉換延遲較長的情況下,跑不到 14 天的研究絕對提升最多會少掉 17%。窗開太短,晚到的訂單會被當成沒發生,效果被低估;窗開太長,其他活動污染進來的機會又變高,兩邊都要權衡。
Q6:對照組被別的活動打到怎麼辦?測出來的數字還能用嗎?
A6:先分清楚是哪一種污染,它們讓結果偏的方向不一樣,不能一律當成低估。對照組收到同一波活動,會讓兩組互相靠近,通常讓你低估效果,診斷方式是核對對照組的實際接觸紀錄。跨通路訂單漏接,方向取決於兩組漏接率是否相同,一樣時影響小、不一樣時兩個方向都可能,診斷方式是分組比對歸戶率。多檔活動名單重疊可能高估也可能低估,要看重疊的人落在哪一組,診斷方式是開跑前先算受眾交集。地理實驗裡的跨區移動,方向取決於人流走向與投放外溢的程度。能凍結的活動先凍結,不能凍結的至少完整記錄,並在報告中寫明這一項偏的可能方向。如果連對照組本身都被同一波大型媒體活動掃到,那已經不是污染程度的問題,是對照組不成立,這種情況下不該硬算增量。跨通路的部分,能完成會員識別與訂單歸戶可以減少遺漏,但減少多少仍取決於兩組的歸戶完整度是否一致。
延伸閱讀
- GA4 顯示 140 筆,Meta 後台說 320 筆?三本帳對帳法,先分清楚是真下滑還是口徑差
- 廣告微轉換(Micro Conversions):電商老闆真正該看的數字,不是只有訂單
- 行銷自動化工具怎麼選?先確認資料、分群、旅程與衡量是否到位
想知道自己的會員名單規模能測出多大的效果、或是怎麼把實驗分派結果留在會員層,歡迎與 91APP 團隊聊聊你目前的資料狀況。