免費諮詢

想了解更多?留下您的資訊

我們的專業團隊將在 1 個工作日內與您聯繫

請填寫姓名
請填寫職稱
請填寫公司名稱
請填寫公司統編
請填寫有效的電子郵件地址
請填寫公司電話
請填寫公司網站
請選擇預算範圍
請選擇需求類別
請簡述您的需求

感謝您的諮詢

我們已收到您的資訊,專業團隊將在 1 個工作日內與您聯繫。

行銷成效沒有對照組,算出來的多半是本來就會買的人

活動結束後那張漂亮的報表,回答的是誰買了,不是誰因為這檔活動才買。eBay 停掉品牌關鍵字廣告,99.5% 的付費點擊立刻被自然搜尋接走;同一批資料用迴歸法算報酬率 4,173%,用隨機實驗算是負 63%。本文拆解增量思維:沒有對照組,報表就會把大量本來就會發生的成交算成活動的功勞。

行銷成效沒有對照組,算出來的多半是本來就會買的人

活動結束後那張漂亮的報表,回答的是「誰買了」這個問題。「誰因為這檔活動才買」則是另一個問題,兩邊的答案可以差到讓整份預算配置反過來。

eBay 停掉品牌關鍵字廣告,流量自己走回來了

eBay 做過一件多數品牌不敢做的事:在 Yahoo! 與 MSN 上把自家品牌關鍵字的付費搜尋廣告整組關掉,然後看流量會怎麼樣。

Blake、Nosko 與 Tadelis 2015 年發表於《Econometrica》的研究記錄下答案(免費全文見 NBER 工作論文版本)。廣告停掉之後,原本那些付費點擊有 99.5% 立刻被同一個搜尋平台的自然搜尋點擊接走。使用者本來就打算找 eBay,付費連結消失,他們往下滑一格點免費的那條進來。這筆預算買到的,幾乎全是本來就會發生的到站。

這個結果之所以不舒服,在於它推翻的不是某一檔廣告的成績,而是一整套判斷成績的方法。廣告後台會誠實地把那些點擊和後續成交記在廣告帳上,報表因此漂亮,帳目也對得起來,它只是沒辦法告訴你這些人如果沒看到廣告會不會照樣買。

台灣市場的規模讓這個問題的代價不小。根據 DMA 台灣數位媒體應用暨行銷協會的《台灣2024全年度數位廣告量統計報告》,2024 年台灣數位廣告總量 636.83 億元,其中電子商務產業投放 103.67 億元,首度突破百億。這些錢裡面有多少落在本來就會買的人身上,目前沒有一個產業層級的答案,多數品牌連自己那份都答不出來。

我們在成效檢討會上最常聽到的一句話

我們陪品牌看成效報告時,常常出現同一個畫面:投影幕上是這檔檔期的廣告投報率,數字漂亮,會議室裡氣氛也不錯。接著有人問了一句,如果這檔沒做,業績會少多少。

那一刻通常會安靜幾秒。報表上有轉換數、有歸戶後的成交金額、有各通路貢獻占比,唯獨沒有「沒做會怎樣」這一欄。負責投放的同事會有點尷尬,他知道自己拿不出這個數字,也知道這不能怪他,整套工具從一開始就沒有為這個問題設計過。

你看到的成交數字,混著三種來源

一檔活動結束後被算進成效的那些成交,性質其實不同。以下三分法是本文為了說明而整理的,用意在於讓討論有共同語言。

來源 一句話定義
自然成交 沒有這檔活動也會發生,只是剛好落在活動期間
活動造成的淨變化 因為這檔活動才發生,或才提早、才變多
記帳位移 本來會從別條路徑成交,被這檔活動的追蹤標記攔下來認列

這裡要先講清楚一件容易誤會的事:這三者是成交的來源,不是可以逐一指認的三種顧客。同一位客人可能因為活動提早三天買、順手多買一件、又剛好從電子報連結進來,一個人身上同時帶著三種成分。隨機實驗能給的是群體層級的平均差額,它不會告訴你「這位就是增量客」。

增量(incrementality)指的就是這個平均差額:同一批人在「有辦活動」與「沒辦活動」兩種情況下的業績落差。一群人不可能同時經歷兩種情況,所以只能找一組替身。可信的做法是從同一批符合活動資格的人裡面,隨機保留一組不接觸活動,讓兩組的差異只剩下有沒有被活動碰到。隨機分派是關鍵,光是「條件看起來相近」並不夠,本文後面引用的研究正好證明了這一點。

Google 官方對 Conversion Lift 的說明把這件事講得很直接:把受眾分成看得到廣告的實驗組,與被保留住、不會看到廣告的對照組,兩組轉換的差額才是廣告帶來的轉換;由此再算出每一筆增量轉換的成本(iCPA),以及每一塊錢廣告費換到的增量營收(iROAS)。沒有對照組這一半,後面的算式全部不成立。

對照組要保留多少人、怎麼隨機分派、觀察期要多長才不會失真,是另一個需要獨立處理的題目,我們在對照組要保留多少人、怎麼切才不會失真裡專門談。這裡先把觀念確認清楚:沒有這組人,成效數字就只是一份出席名單。

在還沒有對照組之前,有幾個訊號可以幫你判斷成效數字裡可能混了多少水分。它們是值得檢查的線索,不能當成結論。

  1. 用「近 90 天有下單」這種條件圈出來的名單,成效通常漂亮,因為這群人下個月本來就有相當比例會回購,自然成交的占比可能偏高。條件如果鎖的是沉睡客,情況就不同,值得逐案看。
  2. 檔期成效遠高於平日,但當季整體業績沒有同幅度成長,值得檢查買氣是不是只被搬動了時間點。當季業績也受其他因素影響,這個訊號不能單獨下判斷。
  3. 各通路回報的成交金額加總起來超過實際營收,代表至少存在重複歸因。重複歸因跟真正的通路替代是兩回事,要分開查,但兩者都會讓單一通路的成效被高估。

這幾個訊號都不能替代對照組,只是讓你在開始做實驗以前,先知道自己離真相有多遠。

一筆成效數字裡混著自然成交、活動造成的淨變化與記帳位移三種來源

同一批資料,觀察法跟實驗法算出來的差距有多大

「差一點」跟「差一個量級」是完全不同的問題。以下研究都做了同一件事:在同一批資料上,同時用觀察方法與隨機實驗方法各算一次,然後把兩個答案並排。

eBay:報酬率從正 4,173% 到負 63%

還是前面那份 2015 年的 eBay 研究。前面提到的 99.5% 替代率來自品牌關鍵字暫停投放的前後觀察,屬於自然實驗;研究團隊另外在非品牌關鍵字上做了隨機的地理實驗,把美國分成測試區與對照區,用來估算營收效果。

在非品牌關鍵字這一組,研究團隊用業界最常見的迴歸方法計算投資報酬率,沒有加時間與地理控制變數時算出來是 4,173%,加上控制變數之後仍有 1,632%。同一批資料改用隨機分組的實驗方法來算,答案是負 63%,95% 信賴區間落在負 124% 到負 3% 之間。

一份報表可以讓同一檔廣告看起來報酬率超過 40 倍,也可以讓它看起來在虧錢。關鍵在於有沒有一組隨機保留、沒被廣告碰過的人拿來比。

研究團隊還進一步拆了使用者。在 eBay 這個情境裡,新客與不常來的使用者確實受廣告影響而多買;常來的老顧客幾乎不受影響,偏偏這群人吃掉了大部分的廣告預算。

這裡浮現一個值得警戒的可能性,但它是假設而非定律:如果廣告平台只依觀察到的轉換率做最佳化,又沒有排除高自然購買傾向的人,預算就有可能持續流向基準線最高的族群。這條鏈成不成立、會不會真的壓低整體增量,得各自的品牌用自己的資料去測。

對台灣品牌來說,這個結構最值得檢查的地方在品牌關鍵字。品牌字的搜尋量通常來自已經知道你、正在找你的人,自然搜尋結果又幾乎必然把官網排在前面。eBay 的 99.5% 不見得會在每個品牌身上重演,品牌知名度、競品是否在你的品牌字上出價、自然搜尋結果的完整程度都會影響替代率,但這是一個可以用相對小的成本驗證的問題,不去測就永遠只能猜。

Facebook 的大規模實驗:越接近成交,高估的倍數越大

Gordon、Moakler 與 Zettelmeyer 分析了 663 場 Facebook 廣告實驗,動用 5,000 個以上的使用者層級特徵,資料比多數品牌與第三方衡量廠商能拿到的都豐富。這份研究 2022 年線上發表、2023 年收錄於《Marketing Science》,測試了雙重機器學習與分層傾向分數配對兩種進階方法,看它們能不能還原隨機實驗的答案。在這 663 場實驗的中位數上,結果依漏斗位置分開看:

  1. 認知端結果:隨機實驗的提升中位數 29%,雙重機器學習估 83%,分層傾向分數配對估 173%。
  2. 中段結果:實驗 18%,兩種方法分別估 58% 與 176%。
  3. 接近成交的結果:實驗 5%,兩種方法分別估 24% 與 64%。

越下層的實驗提升越小,觀察方法相對高估的倍數卻越大,而這正好落在品牌最在意、也最常拿來分配預算的那一段。這是這 663 場實驗的中位數排序,不代表每一檔活動都照這個梯度走。研究者的收尾很不客氣:即使握有大規模實驗與豐富的使用者資料,他們依然無法可靠地估出一檔廣告的因果效果。

更早的研究已經指向同一個方向。Gordon 與 Zettelmeyer 等人 2019 年發表在《Marketing Science》的研究用了 15 場美國廣告實驗、5 億筆使用者實驗觀測與 16 億次廣告曝光,得到的結論是:在一半的研究裡,觀察方法估出的購買提升幅度跟隨機實驗差了三倍,而且這是在已經控制大量人口與行為變數之後的結果。其中一場實驗的對比特別具體,實際看過廣告的人轉換率 0.061%、沒看過的人 0.019%,直接相比得到 316% 的提升;同一場實驗用隨機分派識別出來的真實提升只有 73%。要特別注意,那個 316% 裡的「沒看過的人」並不是隨機控制組,只是同一批受眾裡剛好沒被投放到的人。兩個數字的落差,就是把「看過與沒看過」當成實驗的代價。

663 場 Facebook 實驗顯示越接近成交,觀察法高估的倍數越大

偏誤的源頭:兩群人先天就不一樣

這幾份研究指向同一個機制。這並非單純的計算誤差或追蹤精度問題,而是拿來比較的兩群人打從一開始就不同質。以下是本文整理的三個零售實務最常遇到的來源,它們會疊加,也不是完整清單。

使用者自己就在製造相關性

Lewis、Rao 與 Reiley 在 2011 年把這個現象命名為活動偏誤(activity bias):一個人在網路上活躍的那幾天,同時更容易看到廣告,也更容易做各式各樣的事,包括搜尋品牌、逛官網、下單。曝光與購買因此高度相關,中間卻沒有因果。用他們論文裡的三組實驗來看,光是這一段相關性就足以讓觀察法把廣告效果算得離譜。

平台的定向與競價機制會先幫你挑走高意願的人

廣告系統的工作就是找出最可能轉換的人,然後把廣告送到他們面前。定向、競價與投放最佳化都會讓實際被曝光的人跟沒被曝光的人先天不同,系統做得越好,這個差距就越大。演算法越聰明,觀察法的偏誤越嚴重,這是同一枚硬幣的兩面。

圈名單這個動作本身就在挑會買的人

圈受眾的時候挑近期活躍會員、挑加過購物車的、挑高消費級距的名單,這些都是合理的操作。合理歸合理,這些人的基準購買率本來就高於全站平均,把他們的成交整批算進活動貢獻,等於先挑出最會買的人,再回頭邀功。

三個來源疊在一起,會產生一個很難察覺的結果:報表上的成效越好,越有可能反映的是選人選得準,至於活動本身做得如何,仍然沒有人知道。

曝光組與未曝光組的基準購買傾向分布在投放前就已經不同

相對優勢跟因果增量是兩把不同的尺

這裡要分清楚兩個常被混用的概念。相對優勢說的是「這群人比其他人更會買」,因果增量說的是「這檔活動讓這群人多買了」。前者是排序用的,能幫你決定先打誰;後者是記帳用的,能決定這筆錢值不值得花。

把這兩把尺混用,會導出一個聽起來合理、其實站不住腳的推論。某個標籤族群的購買傾向是大盤平均的三倍,這只證明他們本來就容易買,並沒有證明廣告讓他們多買了三倍。用相對優勢去計算活動功勞,等於把這群人原生的購買力整批算進行銷績效裡。

反過來推同樣不成立。相對優勢高,不代表增量就低,基準購買率 3% 的族群一樣可能因為活動再多出 1 個百分點。這個數字對增量高低完全沉默,它唯一能確定的是:在同樣的增量效果之下,基準線越高的族群,觀察到的成交裡自然成交占比越大,把整批成交算成功勞的誤差也越大。標籤分數高的名單通常真的比較會買,這件事本身沒有錯,它只是無法回答錢有沒有花對。我們在Meta 增幅歸因跟 CDMP 受眾標籤的 LIFT 差在哪裡把這兩把尺分開講過。

順帶一提,這也是為什麼平台歸因改版後 CPA 上升時,不必第一時間認定投放變差。有時候是數據變得比較誠實,把原本被寬鬆歸因記進來的成交還了回去。至於當歸因報表與增量測試給出相反結論時該信哪一邊,那是另一個要獨立處理的判斷

第一方數據幫得上什麼,幫不上什麼

看到這裡,很容易得出一個消極結論:既然什麼都測不準,那就別測了。這個結論走得太遠,但反方向也要小心,資料多不等於答案會自己出現。

前面那份 663 場實驗的研究握有 5,000 個以上的使用者特徵,仍然還原不了隨機實驗的答案。這直接劃出了第一方數據的能力邊界:歷史資料再完整,也無法單獨生出「沒做會怎樣」這個反事實,那只能由隨機保留組提供。

在這個前提下,第一方數據能做的事其實很具體。它讓實驗分組更平衡,因為你知道每位會員的購買節奏,可以在分派前先分層,避免兩組的體質一開始就歪掉。它讓結果觀測更完整,對照組的人跑去門市買,你看得到,不會誤記成沒買。它也讓分析更有精度,同樣的樣本量可以測出更小的效果。

91APP CDMP 在這件事上做的,是把線上與門市的消費歸到同一個會員身分底下。要分層再隨機分派,前提是你判斷得出誰跟誰相似;要確認對照組真的沒買,前提是你看得到他所有的成交通路。歸戶沒做完,這兩件事都談不上。

CDMP 的 LIFT 標籤在這個框架裡的位置也需要說清楚。它算的是某個標籤族群相對於大盤的購買傾向,屬於相對優勢的語言,用來排序名單、決定先打誰很有效。它不宣稱因果增量,也不能直接換算成「這檔活動會多帶來多少新客」,當成效證明用就超出它能保證的範圍了。實務上比較穩的做法,是用 LIFT 決定圈誰,再用隨機保留組驗證這一輪到底帶來多少。

另一個容易被忽略的地方,是不同通路的成效要分開記帳。推播、電子報、廣告、門市活動各有各的基準線,混在一起算會讓彼此的功勞互相吃掉,我們在推播與電子報成效怎麼算裡拆過送達、歸屬與增量這三本帳。品牌導入顧客數據平台後常覺得無感,多半也是因為價值指標沒有跟著重排

這套思維在哪些情況下要調整

本文引用的研究集中在知名平台的付費搜尋與社群廣告。把結論當成「所有行銷的增量都很低」會走過頭,以下幾種情況要另外判斷。

  1. 品牌知名度低的時候,廣告承擔的是告知功能,自然成交的基數本來就小,增量占比通常高得多。eBay 的結果之所以極端,正因為它是幾乎人人都知道的平台。
  2. 純新客獲取的活動,受眾裡沒有既有購買紀錄,基準線接近零,難處會從「扣掉自然成交」變成「事件太稀少、樣本不夠」。
  3. 購買週期很長的品類,觀察期蓋不住一個完整週期時會把真實增量算得偏低,這種情況要拉長觀察窗。
  4. 品牌認知類的投放,效果不會在短期成交上顯現,用成交型的對照組去測會系統性低估它。
  5. 對照組的人如果從朋友、門市店員或其他管道接觸到活動訊息,兩組的界線就模糊了,測出來的差額會偏小。

這幾種情況仍然需要對照,只是不能預設「觀察到的成交裡自然需求占大宗」,判斷要回到品類與活動的性質。

把基準線先算出來,成效數字才開始有意義

不必一步到位建立完整的實驗制度,從能立刻改的地方開始就好。

  1. 先把各族群在沒有活動時的自然成交率算出來。這個數字的用途是設計測試的輸入,讓你知道要偵測多小的差異、大概需要多少人,它本身不是「沒做會怎樣」的答案(預期效果:讓後續的測試設計有依據;建議週期:每季更新一次)。
  2. 挑一檔常態性、低承諾的活動做隨機保留組。定期發的內容型會員訊息、沉睡喚醒這類活動比較適合,因為它們每期都跑,而且不涉及對會員的權益承諾。保留比例、樣本量與觀察期要另外計算,別憑感覺抓(預期效果:第一組可信的增量數字;建議週期:連續累積幾期到樣本足夠為止)。
  3. 在成效報表裡加一欄「這一檔的增量估計」,並標明它是怎麼來的:隨機對照、準實驗,還是暫時空著。這一欄留白久了團隊會習慣不去想它,一旦有了欄位,討論的品質會立刻不一樣(預期效果:把對話從「這檔賺了多少」轉成「這檔多賺了多少」;建議週期:下一檔活動的報表就加)。
  4. 把預算討論的主詞從投報率換成增量營收與增量毛利。只看增量成交數會忽略客單與毛利的差異,不同通路的一筆成交價值不同。Google 官方在增量指標上也把增量轉換價值、iCPA 與 iROAS 分開列(預期效果:預算流向確實創造利潤的地方;建議週期:每半年檢視一次通路配置)。
  5. 對只做品牌關鍵字的搜尋預算安排一次可信的對照測試。做法上通常是隨機地理實驗,把區域隨機分成投與不投兩組同時觀察,而非單純比較暫停前後(預期效果:釐清這筆錢買的是新到站還是既有到站;建議週期:一次性,先在單一平台試)。

這五件事的共同點是,它們都不需要先買新工具,只需要先承認一件事:現在報表上那個數字,回答的是另一個問題。

成效報告真正要回答的問題只有一個

回到會議室那安靜的幾秒鐘。

當有人問「如果這檔沒做,業績會少多少」,那不是在質疑誰的專業,而是在把行銷從一份出席紀錄拉回一門生意。能回答這個問題的團隊,預算談判的立場會完全不同,因為他們手上的數字經得起追問。

答案不需要精確到小數點,但要撐得住基本的品質條件:隨機分派、同期觀察、兩組用一致的結果定義,並把不確定區間一起講出來。一組隨便切出來、被其他活動污染過的對照組,比沒有對照組更容易誤導人。這件事的門檻很少落在技術上,多半落在願不願意留一小群人不發那封信、不投那則廣告,然後好好看看他們做了什麼。

品牌最常問的行銷增量衡量問題

Q1:增量(incrementality)跟一般說的廣告成效差在哪裡? A1:廣告成效通常回答「看過廣告的人裡有多少人買了」,增量回答「這些購買裡有多少是廣告造成的」。前者只需要追蹤工具,後者需要一組隨機保留、不接觸活動的對照組。兩者可能差到一個量級:Gordon 等人 2019 年在《Marketing Science》發表的 Facebook 實驗資料顯示,直接比較看過與沒看過廣告的人會得到 316% 的提升,用隨機分派識別出來的真實提升只有 73%。

Q2:我們的廣告後台已經有歸因報表了,為什麼還需要對照組? A2:歸因解決的是「這筆成交要記在哪個通路帳上」的分帳問題,它假設這筆成交本來就會發生。增量解決的是「這筆成交會不會發生」。歸因做得再細,也無法區分自然成交與活動造成的成交,因為兩者在資料裡長得一樣。

Q3:預算有限的中小品牌也做得起增量測試嗎? A3:做得起,但要換個入口。不必從付費廣告的平台級實驗開始,改從自有通路的隨機保留組做起:定期發送的會員訊息,從符合資格的名單裡隨機留一小組不發,比較兩組的購買率。這不需要額外花錢,只需要在發送設定裡多一個步驟。至於保留比例要抓多少、樣本要多大、觀察期多長才不會失真,需要另外計算,那是設計層面的題目。

Q4:做一次增量測試要多久才看得到可用的結果? A4:取決於基準轉換率、樣本量與想偵測的效果大小,通常需要跨越一個完整的購買週期。單次大檔期的測試可以估出那一檔的因果效果,因為同時期的隨機對照會一起承受節慶帶來的購買動能;它的限制在於未必能外推到平日或下一次檔期。把測試綁在會重複跑的活動上,比較容易累積可比較的答案。

Q5:資料要準備到什麼程度才能開始做? A5:最低門檻是會員的購買紀錄能歸到同一個身分底下,讓兩組的成交都被完整看見。線上與門市尚未歸戶的品牌,會遇到對照組的人跑去門市買卻被記成沒買的狀況;這會讓增量估計出現偏誤,偏高或偏低取決於兩組的跨通路漏記是否對稱。歸戶完成度直接影響測量的可信度。

Q6:測出來的增量比想像中低很多,是不是代表行銷白做了? A6:多數情況下改變的是衡量方式終於誠實,行銷本身並沒有突然失效。該調整的是預算配置。在 eBay 那份研究的情境裡,付費搜尋對新客與不常來的使用者有效果,對高頻老顧客效果有限;這是該研究在該情境下的發現,不是所有媒體與所有品類的通則,你的品牌適用與否要用自己的測試回答。

延伸閱讀

  1. GA4 顯示 140 筆,Meta 後台說 320 筆?三本帳對帳法,先分清楚是真下滑還是口徑差
  2. 78% 品牌說 Email 重要,46% 卻證明不了 EDM ROI:第一方數據時代的歸因鴻溝
  3. 第一方資料才是 AI 代理的燃料:受眾標籤品質決定 Meta 廣告自動化的成效上限
  4. Meta 廣告成效不好?別再照抄 AI問答給的資訊,根本問題要看這 3 層

想知道自己的會員資料能不能撐起一次像樣的增量測試,歡迎與 91APP 團隊聊聊資料現況。

☆ 在 Google 新聞中設為偏好來源