如果你正在看一份 AI 能見度報告,上面寫著「本月品牌提及率 32%,較上月上升 4 個百分點」—— 在相信那個「上升」之前,你應該先問一個問題:這個數字是量了幾次得到的?
如果答案是「一次」,那個 4 個百分點很可能什麼都不是。
先看一個數字:65%
聖加侖大學(University of St. Gallen)在 2026 年 4 月發表的研究, 橫跨 ChatGPT、Gemini、Google AI Mode、Perplexity 四個引擎, 對四個產業連續觀測 45 至 46 天。他們算了一件很基本、卻幾乎沒人算過的事: 同一個問題,連續兩天問,AI 引用的來源有多少是重複的?
來源相似度以 Jaccard 係數量測,四個產業活動的日對日數值落在 0.34–0.42 之間。[1]
這份研究特別指出,這種不穩定性不是短暫的系統異常,而是 AI 搜尋的持續特性。 換句話說,它不會自己好起來,你只能把它算進量測方法裡。
所以要量幾次?研究給了確切的數字
研究團隊做了一組「同時執行 10 次」的資料集, 然後逐步減少次數,看標準誤差什麼時候才穩定下來。結果是:
| 量測層級 | 目標精度 | 每題每天需要執行 |
|---|---|---|
| 品牌是否被提及 | 標準誤差 < 0.10 | 7 次(95% CI ±0.158) |
| 品牌是否被提及 | 標準誤差 < 0.08 | 8 次(95% CI ±0.121) |
| 引用了哪些來源 | 標準誤差 < 0.10 | 8 次 |
研究的原話是:實務工作者應該每題每天至少執行 7 次。
而市面上大多數 AI 監測工具的報表,是跑一次就產出的。
這裡要先澄清一件常被搞混的事:7 次講的是量測頻率,不是報告頻率。 量測是機器在背景跑,收報告的人不會因此收到七封信。 報告要多久看一次,是另一個問題——而且該由收報告的人決定。
我們的做法是把兩件事分開:量測照方法學的需要跑, 報告頻率讓客戶自己選(每日/三日/每週/每月), 而且每份報告都標明它涵蓋的量測期間。 沒有標期間的數字,讀者無從判斷那是一次抽樣還是一段區間的彙總。
為什麼「來源」比「品牌」更不穩
同一份研究裡,品牌層的日對日 Jaccard 落在 0.45–0.59,來源層是 0.34–0.42。 品牌比來源穩定,但兩者都遠遠稱不上可靠。
觀測窗要拉多長
除了「一天內量幾次」,研究也算了「要連續看幾天」。 同樣以標準誤差為標準:
- 10 天的滾動窗,才能讓單一品牌的偵測率標準誤差降到 0.10 以下
- 24 天降到 0.05 以下
- 34 天降到 0.02 以下
這解釋了為什麼研究建議以 2 至 4 週的滾動區間彙總, 而不是比較兩個單點。少於一週的觀測,沒有能力區分訊號與雜訊。
還有一件事:各引擎不能共用同一個門檻
研究另外量了各引擎的引用集中度,用的是 Gini 係數—— 原本是經濟學衡量所得分配不均的指標,0 代表完全平均、1 代表完全集中。 套在這裡,數值越高代表引用越集中在少數網域,新進者越難擠進去:
| 引擎 | Gini | 意義 |
|---|---|---|
| Google AI Mode | 0.782 | 最集中,新品牌最難擠進去 |
| Gemini | 0.723 | |
| ChatGPT | 0.684 | |
| Perplexity | 0.671 | 最分散,最容易取得首次引用 |
四家的差距不小。用同一個「及格線」去評斷三、四個引擎, 等於把難度完全不同的考試放在一起打平均。 基準線應該各引擎分別建立。
這對你收到的報告代表什麼
如果你正在買、或已經在收 AI 能見度報告,這裡有四個可以直接問的問題:
- 每題每個平台跑了幾次?如果是一次,月對月的小幅變化不應該被解讀成趨勢。
- 零事件有沒有附信賴區間?「0% 被引用」在 n=30 和 n=150 下的意義天差地遠。
- 各引擎是分開呈現還是合併平均?合併會掩蓋掉引擎之間的結構差異。
- 「AI 從某某頁抓資料」這種說法,驗證過幾次?來源層的單次觀察不足以下因果結論。
- 這份報表涵蓋的量測期間是哪一段?沒寫期間,就分不出那是一次抽樣還是一段區間的彙總。
這四個問題不需要技術背景就能問,而且答案會很快告訴你, 對方是在做量測,還是在做簡報。
我們自己也還沒做到
誠實揭露:Mediflow 目前的標準月度量測,是每題每平台執行一次—— 正是這份研究點名的做法。
我們的標準配置是每月 54 題 × 3 個平台 = 162 次檢測。 在一位在地服務業客戶的量測中,品牌提及率是 30 次提問全數提及(100%), 內容正確度 49%——這個平均值底下,五個面向的分數從 98.3 一路散到 3.3: 公司名稱幾乎每次都對,公司地址幾乎每次都錯。
這裡面哪些數字禁得起單次量測? 提及率 100% 與地址 3.3 分別貼著天花板與地板,多量幾次也不會差太多。 但「內容正確度 49%」落在中間—— 中間值正是最容易被單次抽樣推來推去的區間, 也正是這份研究警告不該拿來做月對月比較的那一類指標。
所以我們在報告裡定了一條規則:月對月變化低於 10 個百分點,一律標為雜訊, 不寫成改善或退步。
結論
重複量測改善的是對現況的理解,不是商家的能見度。 重複測量七次不會讓 AI 更常提到商家——但是會讓你知道,AI 有多常提到你。
但在一個來源每天換掉三分之二的環境裡, 知道自己在哪裡,本身就是稀缺的。