A/B 測試入門:用數據決定,不用開會吵
「按鈕要用橘色還是綠色?」這種問題在會議室裡可以吵一下午,而且通常是職位最高的人贏。A/B 測試就是為了終結這種會議而存在的:把訪客隨機分成兩組,一組看 A 版、一組看 B 版,用實際的轉換數據決定誰留下。我們自己的電商與工具平台常態性在跑實驗,這篇把入門該懂的觀念講清楚——包括那些教科書不太願意說的限制。
A/B 測試的原理:隨機分組,其餘不變
A/B 測試的力量來自「隨機」:訪客被隨機分到兩個版本,兩組在時段、來源、裝置上的分布理論上相同,所以轉換率的差異可以歸因於版本本身。這比「上週改版、這週比較」可靠得多——因為上週跟這週的流量本來就不一樣,可能有檔期、有廣告波動、有星期效應,你根本分不清楚是改版有效還是環境變了。
執行上的鐵律:一次只測一個假設。同時改了標題、圖片、價格呈現,就算 B 版贏了,你也不知道是哪個改動的功勞,這次實驗等於沒學到東西。
該測什麼:按鈕顏色不重要,提案才重要
A/B 測試最有名的都市傳說都是「換個顏色轉換率暴增」,但我們的實際經驗與業界共識一致:版面微調的影響通常很小,真正會動到數字的是訊息與提案層級的改動。值得優先測的,按影響力排序:
- 價值主張與主標題:你到底承諾了什麼。「AI 自動剪片」對上「一小時影片十分鐘變短影音」,是完全不同的溝通。
- 提案結構:免費試用 vs 低價體驗、月繳 vs 年繳優先、要不要先收信用卡。
- 證據與疑慮處理:見證擺前面還是規格擺前面、退費保證要不要放大。
- 流程步驟:結帳三步併兩步、註冊先玩後填資料。
- 最後才是按鈕文案、顏色、圖片這類表層元素。
不知道該從哪個假設下手?先看行為數據找線索——訪客在哪一段大量離開、哪個欄位放棄率最高,熱圖與錄影分析就是產生假設的好工具。熱圖負責提出假設,A/B 測試負責審判假設,兩者是上下游關係。
A/B 測試買的不是「這次改對了」,而是一個讓組織停止用嗓門做決策的機制。
樣本數:小流量網站的誠實課題
這是入門者最常踩的坑:流量不夠,測了也是白測。統計上要偵測的差異越小,需要的樣本越大。粗略的直覺是:如果你的頁面一個月只有幾百個轉換事件,你只測得出「很大的差異」;想驗證百分之幾的細微改善,需要的樣本會多到你等不起。
務實建議:
- 開跑前用免費的樣本數計算器估一下要跑多久,如果答案是「四個月」,就換一個更大膽的假設——小流量就該測大改動,不要測按鈕顏色。
- 事先決定測試期與樣本量,時間到才看結果。每天偷看、一領先就宣布獲勝,是最常見的自欺:數據在樣本不足時本來就會劇烈波動,提早收割等於擲硬幣。
- 測試期至少涵蓋完整的一到兩週,平日與週末的訪客行為經常不同。
- 流量真的太小的頁面,與其硬跑 A/B,不如做用戶訪談或五人次的易用性測試,收穫更實在。
常見誤區清單
- 指標選錯:點擊率上升不代表訂單上升。盡量用最接近營收的指標當主指標,點擊率當參考。
- 贏了就無限外推:在廣告流量上贏的版本,對自然流量不一定成立。結論的適用範圍就是實驗的流量範圍。
- 輸的實驗不記錄:沒有差異也是知識——它告訴你這個因素不重要,別再花時間。把每次實驗的假設與結果留檔,才會累積成團隊的判斷力。
- 忘了確認追蹤正確:實驗開跑前,先驗證兩個版本的轉換事件都有正確回報。追蹤基礎建設可參考GA4 與 Search Console 的設定重點。
從第一個實驗開始
不需要昂貴工具才能起步:挑一個流量集中、離錢近的頁面(落地頁、定價頁、結帳頁),寫下一個明確的假設——「我認為把退費保證放進首屏,能提高註冊率,因為訪客的主要疑慮是怕被綁約」——然後讓數據說話。測試文化的價值不在單次實驗的輸贏,而在於團隊從此習慣問:「這是你的意見,還是數據?」
這類問題,我們每天都在自己的產品上解
免費 30 分鐘線上諮詢・先釐清方向,不推銷・一個工作天內回覆