RFM 分群放到 OMO 就會失真:同一個人在門市和線上沒歸戶,你會把最好的客人排到後面
RFM 的三個值都是對「一位顧客的一條交易序列」做統計。門市加線上的同一個人沒歸戶時,購買次數會被除散成多個低頻身分,累計金額被拆開,還會多出好幾個過時身分,讓同一個真人同時進活躍名單與喚醒名單。要修,順序是先歸戶、在新母體上重算、再補狀態與意圖。
一位顧客一年內買了 6 次、累計消費 18,000 元。在你的會員分群報表上,他可能是三個各買 2 次、各花五、六千元的普通會員,而其中一個還被標成流失客。這組數字是為了說明機制而虛構的示意值,但這個情形在門市加線上的零售品牌身上並不罕見。
原因要回到 RFM 的定義本身。Fader、Hardie 與 Lee 在 2005 年《Journal of Marketing Research》的〈RFM and CLV: Using Iso-Value Curves for Customer Base Analysis〉裡寫得很直白:recency 是最近一次購買的時間,frequency 是過去購買的次數,monetary value 是每筆交易的平均金額。
三個定義都預設了同一件事:你手上有「一位顧客的一條完整交易序列」。這個前提在只有單一線上通路的環境裡大致成立,因為顧客通常只有一個帳號、一條軌跡。放到門市加線上的生意上,它就不成立了。同一個人可能在門市刷過三次會員卡、在 App 買過兩次、用另一組手機號在官網買過一次。
這些軌跡沒有歸到同一個人身上的時候,RFM 的失真不是均勻地少算一點。它有方向性,而且方向對品牌不利。
名單裡找不到那位每週都來的客人
我們最近陪一個品牌挑高價值會員名單,會議室裡出現一段安靜。門市主管指著螢幕說,某位每週都來、店員都認得的熟客不在名單上。往下翻了三頁還是沒有。後來發現那個人在系統裡有三筆資料,每一筆都像個買不多的普通會員。尷尬的不是少發一張券,是這份名單已經照著發了好幾個檔期。
沒歸戶的時候,R、F、M 各自往哪個方向錯
先講清楚這篇不談什麼。多套系統的識別碼怎麼接成同一個人,我們在談 OMO CRM 整合分析的那篇裡已經拆過四套系統怎麼產生四個不同的「你」,這裡不重複。系統之間誰負責什麼、蒐集會員資料的法律依據,也各自是另外的題目。這篇只處理一件事:假設歸戶還沒做好,RFM 這三個值會被算成什麼樣子。
本文把偏誤拆成三個方向來看,這是本文為了說明失真機制而提出的整理方式,產業並沒有這樣一套公認框架。
- Frequency 被除散,這一項最確定。一個人在三個影子檔案裡各買兩次,真實次數是六次,RFM 看到的是三位各買兩次的顧客。六次會落在高頻群,兩次通常落在偶爾買的那一段。這位顧客不只被低估,他還同時以三個低分身分佔著名單。
- Monetary 要看你用哪個定義。原始文獻裡的 monetary 是每筆交易的平均金額,這個值在拆分後不必然變小,可能持平、也可能因為某個影子剛好只含高價訂單而變高。真正會被必然拆散的是實務上更常用的那個版本:累計消費金額或期間貢獻度。用累計金額排序的名單,會把他往後排;用平均客單排序的名單,反而可能把他排得莫名其妙地前面。兩種定義混用是很多分群報表對不上的原因。
- Recency 的錯法跟直覺不同。含有最新那筆交易的影子檔案,Recency 其實是正確的。拆分真正造成的後果是多出好幾個過時身分:同一個真人會同時以「一個正確的活躍身分」和「數個看起來很久沒買的沉睡身分」存在系統裡。於是他一邊被算進活躍客,一邊又進了喚醒名單,收到一張叫他回來的折價券。

把三個方向並排看,錯的方式很具體:
| 值 | 沒歸戶時實際發生的事 |
|---|---|
| Frequency 購買次數 | 必然被除散成多個低頻身分 |
| Monetary 金額 | 累計版被拆分;平均客單版方向不定 |
| Recency 最近一次購買 | 多出數個過時身分,真人同時進活躍與喚醒名單 |
偏誤不是隨機的,它跟顧客價值同方向
如果這些偏誤隨機散布,問題還不算太大,統計上多少會互相抵消。真正決定嚴重程度的,是它有沒有方向性。
一位顧客的影子檔案有幾個,取決於他用過幾個通路、留過幾組聯絡資料。只在官網買過一次的人通常只有一筆資料,他的 RFM 完全正確。會在門市逛也會在 App 買、參加過線下活動又綁過官方帳號的人,才會累積出多個身分。
推論到這裡要放一個保留:影子數量可能隨跨通路活躍度增加,因此跨通路活躍的會員存在較高的被錯分風險。這是一個合理的假設,不是已經被證明的定律,而且分位切點會在歸戶後重新分布,個別會員的等級不保證單調往上移。要確認你的會員庫是不是這樣,唯一可靠的方法是比較歸戶前後同一批人的分群,這件事本文最後一段有具體做法。
不過就算只看已經確定的那一項,Frequency 被除散對名單的殺傷力已經夠大。而且你很難從報表上看出來,因為報表本身是自洽的,每個影子的分數都算得沒錯。
這也是為什麼加大折扣通常救不了這個問題。名單的排序基礎已經失效,提高力道只是把預算更快花掉。
把 RFM 放回原始文獻,這個問題其實被寫過
上面的推論不是經驗談,幾份公開研究早就處理過相近的結構。
資料怎麼切,就決定 RFM 是多少
Fader、Hardie 與 Lee 那篇論文有一段話值得逐字讀。研究者指出,觀察到的 RFM 變數只是潛在行為特質的不完美指標,而且資料的不同切片會產生不同的 RFM 變數值,因此也產生不同的模型參數。
這句話原本講的是觀察窗的選擇,但它同樣適用於歸戶:歸戶前與歸戶後,是同一批人的兩種切法。兩種切法會得到兩組不一樣的 R、F、M,也就得到兩份不一樣的名單。研究者的提醒是不要把觀察到的 RFM 值當成顧客的真實特質,而實務上多數品牌恰好是這樣用的。
同一篇論文還說了一句更根本的話:要忠於顧客終身價值這個概念,衡量指標應該看向未來,而非過去。用一份連過去都沒算對的資料去推未來,落差只會被放大。
「這個人還在嗎」在影子檔案上會全部誤判
RFM 實務裡最常見的一條規則是拿 Recency 設門檻,超過某個天數沒買就標流失。Schmittlein、Morrison 與 Colombo 在 1987 年《Management Science》的〈Counting Your Customers: Who Are They and What Will They Do Next?〉裡指出,顧客是否仍然活躍應該用交易的次數與時點去估機率,因為在非合約關係裡,沒有人會來通知品牌他不買了。
把這個模型放到影子檔案上,問題會加倍。模型看到的是一條稀疏、中斷的交易序列,於是給出很高的流失機率。真人的序列其實是連續的,只是被切成了三段。演算法沒有錯,它看到的資料就是這樣。這也是為什麼喚醒活動的名單常常混了大量根本沒睡著的人。
分群的目的是決定要對誰花錢
Bult 與 Wansbeek 在 1995 年《Marketing Science》的〈Optimal Selection for Direct Mail〉裡提出的方法,核心是把利潤函數放進名單選擇:要決定哪些家戶該收到這次的郵寄,目標是讓期望利潤最大化。
這一份我們不引它的數字,它提供的東西是一個目標函數,不必當成成效佐證。它把「該寄給誰」定義成一道最佳化題目,題目的目標是利潤。若這道題目的輸入是被拆散的身分,算法對了,答案還是錯的。
沒有交易的那些行為,門市客身上一筆都沒有
購物車行為是另一個缺口。Baymard Institute 彙整的購物車放棄率清單把 2006 到 2025 年間 50 份研究整理起來,得到的平均放棄率是 70.22%。這是把 50 份研究平均起來的彙整值,宜視為區間中心,不宜當精確基準。
方向仍然清楚:站上多數加入購物車的動作沒有變成訂單。這些行為在 RFM 的三個欄位裡沒有位置,因為它們還沒構成購買。而在跨通路情境下這個缺口更深:一位主要在門市消費的顧客,線上瀏覽軌跡可能根本接不到他身上,於是他在任何以行為訊號排序的名單裡都是空的,同時又因為 Recency 被推遠而掉出交易型名單。兩邊都撈不到他。
一組示意算式

回到開頭那組示意值,把它攤開看會更清楚。這組數字是為了說明機制而虛構的,不是任何品牌的實際資料。
假設一位顧客一年內在門市買 3 次共 9,000 元、在 App 買 2 次共 6,000 元、用舊手機號在官網買 1 次 3,000 元,最近一次消費在上週的門市。
| 同一位顧客 | 系統看到的樣子 |
|---|---|
| 歸戶後 | 年購 6 次、累計 18,000 元、上週剛買,多數品牌歸為主力客 |
| 沒歸戶 | 三位顧客:6 次變成 2+2+1+1 的分散身分,累計金額拆成 9,000/6,000/3,000,其中官網那筆最近一次在十個月前 |
同一個人、同一年的行為,兩種完全不同的經營判斷。
充分統計量,不等於算在對的人身上
那篇 2005 年的論文裡還有一個技術性說法值得翻成白話。研究者說,在他們採用的機率模型架構下,recency、frequency、monetary value 對單一顧客的購買歷史而言是充分統計量(sufficient statistics,意思是要估計模型參數時,這三個數字已經夠用,不必再回頭看完整的交易明細)。
這句話成立的前提是那組特定的模型與分布假設,而且它還有一個更前面的前提:那段「單一顧客的購買歷史」要真的屬於同一位顧客。充分統計量說的是壓縮不損失估計所需的資訊,它沒有保證你壓縮的對象是對的人。前提一破,後面每一步的精細度都只是把錯誤算得更精確。
這也解釋了一個常見現象:品牌換了更好的分群工具、加了更多維度,名單成效卻沒改善,因為工具處理的還是同一份被拆散的母體。
資料品質的壓力在產業調查裡也看得到,以下數字是背景旁證,並不直接驗證前面那三種偏誤。Twilio Segment 2024 年第五版《State of Personalization》報告指出,61% 的企業擔心不準確的資料會拖累他們用 AI 驅動的個人化;同一份報告裡,89% 的企業領導者認為個人化對未來三年的業務成功很關鍵,73% 的品牌同意 AI 的導入會根本改變個人化與行銷策略。多數決策者認為個人化重要、也準備用 AI 去做,但六成企業心裡清楚底下的資料撐不住。
讓 RFM 在跨通路母體上算對,要補的是狀態與意圖
修正的順序比工具重要,而且要動的地方不在 RFM 裡面。
首先要把人認出來。這是整件事的前提,也是本篇刻意不展開的部分,識別碼設計與各系統怎麼對接,前面連出去的那篇寫得比這裡細。這裡只強調一件事:歸戶不是資料工程的內部作業,它直接決定你的 RFM 是不是算在真人身上。合法蒐集與告知同意是這一切的前提,屬於另一個題目。
接著要在歸戶後的母體上重算,別把舊分數直接搬過來,這件事常被跳過。歸戶會改變母體的分佈,五等分的切點會移動,原本的高分低分定義都要重訂。同時回望窗也要重新想:門市與線上的購買週期本來就不同,用同一條天數門檻切所有通路,會把節奏本來就稀疏的門市客誤判成沉睡。
再往上,要在分數之外補上它沒有的東西。

一層是狀態層。與其只給一個分數,改成問這個人現在處在生命週期的哪個位置、正往哪個方向移動。91APP CDMP 用的 NAPL(正式名稱 NAPLRS)走的是這條路:把會員分成註冊未購、新客、活躍、主力預備、流失、沉睡六個狀態。這套邏輯跟 RFM 的三軸評分是兩種不同的分群方式,一個看分數高低,一個看狀態位置,並非同一套東西換名字。狀態層的價值不在單期分布,而在遷移方向:上個月的活躍客這個月流去哪裡,比這個月各群佔比多少更能讀出訊號。狀態標籤通常比即時訊號穩定,多以月為單位移動,但它會往返:流失客回頭下單、沉睡客被大檔喚醒,都是實務上看得到的路徑。
另一層是意圖層。依 91APP 對這幾個模型的公開說明,CDMP 的 DCIU 觀測近 30 天的線上行為,把會員按未來 14 天的購買機率排成四群(Deciding、Considering、Inquiring、Uninterested),標籤變化很快而且會循環。狀態層回答這個人值得投多少,意圖層回答現在是不是時候。同一群沉睡客裡,近期有站上活動的人跟連品牌都想不起來的人,喚回成本差很多,跨通路健康度本身就是可以拿來分群經營的維度。這幾層要怎麼交叉,我們在解析 CDMP 幾個數據模型的那篇裡列了組合方式。
要先說清楚:上面那幾份研究證明的是 RFM 的限制與機率模型的價值,它們沒有直接驗證這套產品設計的成效。這是我們從研究邏輯推導出來的實務做法,讀者可以照下一段的方式自己驗,不必先相信它。
這兩層也有明確的適用邊界。剛註冊還沒有任何交易的新客,狀態層幾乎沒有資訊可用;還沒登入的匿名訪客連歸戶都做不到;月訂單量太小的品牌,任何機率估計的信賴區間都會寬到不值得據以分配預算;跨裝置或跨通路歸不到同一個 ID 的會員,兩層都會失真,而且失真方向不容易察覺。這幾種情況,多數品牌的會員庫裡同時都有。
歸戶率沒量出來,後面的步驟都只是參考
執行的順序大致是這樣。
- 先量一個數字:可歸戶會員佔全體會員的比率。這是所有後續分析的地基,也是最容易被跳過的一步。負責的人是資料端的窗口,主要指標就是這個比率本身,週期是每季盤點一次。這個比率沒到可接受的水準之前,下面幾項的數字都只能當參考。
- 抓一批門市店員認得的熟客,回去對名單。挑十到二十位店員說得出名字的常客,看他們落在你現有分群的哪一格。負責的人是行銷企劃加門市主管,主要指標是這批人裡有幾位被分到跟直覺明顯不符的群,週期是每半年做一次。這個土法煉鋼的檢查比任何資料品質報表都更快讓人相信問題存在,但它是診斷用的,樣本不具代表性,不能拿來推估母體的偏誤幅度。
- 歸戶之後重算分數,不要沿用舊切點。重跑一次分群,並且比較歸戶前後同一個人的分數變化。負責的人是做分群的分析人員,主要指標是分數上移的會員人數與其貢獻佔比,週期是每次歸戶規則調整後都重算一次。若前後分數幾乎沒變,先確認歸戶是否真的生效,而不是直接宣告沒問題。
- 把回望窗按購買週期分開設定,通路是第一刀,品類是第二刀。門市與線上的節奏不同,家電與日用品的節奏差得更多,一條天數門檻服務不了這麼多種節奏。負責的人是分析人員,主要指標是喚醒名單裡「其實近期有消費」的誤入比率,週期是每季檢視。這個誤入比率降不下來,就先別擴大喚醒檔期的預算。
- 分群結果要有能實際使用的出口。名單算得再準,門市端拿不到就只能在線上打,而標籤要怎麼決定溝通的力道與優先序,是另一段要做的功。負責的人是行銷企劃,主要指標是名單被實際使用的比例,週期是每個檔期回顧。
這五件事沒有一件需要先買新工具。第 1、2 項用現有報表加一份人工清單就能開始。
還有一件值得順手做:把這套說法當成假設去驗,先別當結論收下。同一個檔期切兩組名單,一組用歸戶前的分數排序,一組用歸戶後重算的分數排序,預算與素材保持一致,另留一組完全不溝通當保留組。分派要互斥,同一位會員只能進一組,否則兩組會互相污染而讀不出結果。兩到三個檔期之後,要比的是相對於保留組的增量營收。成本只有多切兩份名單,而它會告訴你在你自己的會員結構上,重算這件事值多少錢。
名單上的每一列,應該剛好對應一個人
回到那位每週都來、卻不在高價值名單上的客人。
他的問題跟分群方法夠不夠精細無關。RFM 的三個值都算對了,只是算在三個不存在的人身上。一份名單的每一列如果沒有剛好對應一個真人,後面所有的排序、預算分配與成效檢討,都會在一個看起來合理的地方持續出錯。
台灣零售品牌手上的資料其實不缺,門市消費、App 訂單、官網瀏覽都在,缺的是把它們接回同一個人的那一步。分群的精細度可以慢慢調,母體對不對得起來,得先解決。
品牌最常問的 OMO 會員分群問題
Q1:整合線上線下數據及 CRM,對會員分群到底有什麼實際差別? A1:差別在分群算出來的數字是不是可信。RFM 這類方法都預設一位顧客只有一條交易序列;門市與線上沒歸戶時,同一個人會變成多個身分,購買次數被除散、累計金額被拆分、最近一次購買被推遠。整合的價值在於讓名單上的每一列剛好對應一個真人,後面的排序與預算分配才有意義。
Q2:RFM 跟 NAPL 是同一套分群嗎? A2:不是。RFM 是給每位顧客的三個歷史指標打分數,通常再組合成宮格或等級。NAPL(正式名稱 NAPLRS)是把會員放進生命週期的六個狀態,包括註冊未購、新客、活躍、主力預備、流失、沉睡,重點在顧客處在哪個位置、以及在狀態之間怎麼移動。一個是分數邏輯,一個是狀態邏輯,兩者可以並存,但定義與用法都不同,混著講會讓團隊在解讀報表時對不上。
Q3:想串接門市與線上數據,是不是要先把系統都換掉? A3:多數情況下不需要。歸戶要解的是識別碼怎麼對應的問題,不是把系統統一成一套。實務上的起點是盤點現有各系統各用什麼當識別碼、哪些欄位可以互相比對、比對得上的比率有多少,這個比率本身就是最值得先量的指標。系統各自負責什麼、要不要都買,是另一個題目,不必和歸戶綁在一起決定。
Q4:怎麼知道自家的會員分群有沒有因為沒歸戶而失真? A4:有一個不需要工具的檢查方式:請門市同事列出十到二十位他們叫得出名字的常客,回去對你現有的高價值名單。如果有明顯比例的人不在名單上、或落在偏低的分群,通常就是歸戶沒做好的訊號。另一個訊號是喚醒名單發出去之後,收到「我上週才剛買」這類回覆的比例偏高。
Q5:預算有限的品牌,這件事要做到什麼程度? A5:可以分階段,順序比投入金額重要。起點是量出可歸戶會員的比率,知道問題有多大。接著把最容易比對的識別碼先接起來,通常是手機號或會員卡號,先把大部分的人合併掉,不必追求百分之百。等母體穩了再重算分群、重訂回望窗。狀態層與意圖層屬於後面的階段,前面兩步幾乎不需要額外的工具投資。
Q6:關於跨通路的會員分群,最常見的誤解是什麼? A6:最常見的是以為分群不準要靠更細的切法或更好的模型來補。實際上母體裡的人若是被拆散的,切得越細只會把錯誤算得越精確。另一個誤解是把歸戶當成資料工程的內部作業、跟行銷無關。歸戶決定的是每一份名單的排序基礎,它的影響會出現在每一個檔期的成效上,只是不容易從報表看出來。