// 量測方法學

AI 能見度要量幾次
才算準?

2026-09-09 約 6 分鐘

如果你正在看一份 AI 能見度報告,上面寫著「本月品牌提及率 32%,較上月上升 4 個百分點」—— 在相信那個「上升」之前,你應該先問一個問題:這個數字是量了幾次得到的?

如果答案是「一次」,那個 4 個百分點很可能什麼都不是。

先看一個數字:65%

聖加侖大學(University of St. Gallen)在 2026 年 4 月發表的研究, 橫跨 ChatGPT、Gemini、Google AI Mode、Perplexity 四個引擎, 對四個產業連續觀測 45 至 46 天。他們算了一件很基本、卻幾乎沒人算過的事: 同一個問題,連續兩天問,AI 引用的來源有多少是重複的?

35% 連續兩日之間,引用來源的重疊比例
65% 也就是說,每天約有三分之二的來源被換掉
45–46 連續觀測天數,非單點抽樣

來源相似度以 Jaccard 係數量測,四個產業活動的日對日數值落在 0.34–0.42 之間。[1]

這份研究特別指出,這種不穩定性不是短暫的系統異常,而是 AI 搜尋的持續特性。 換句話說,它不會自己好起來,你只能把它算進量測方法裡。

所以要量幾次?研究給了確切的數字

研究團隊做了一組「同時執行 10 次」的資料集, 然後逐步減少次數,看標準誤差什麼時候才穩定下來。結果是:

量測層級目標精度每題每天需要執行
品牌是否被提及標準誤差 < 0.107 次(95% CI ±0.158)
品牌是否被提及標準誤差 < 0.088 次(95% CI ±0.121)
引用了哪些來源標準誤差 < 0.108 次

研究的原話是:實務工作者應該每題每天至少執行 7 次。
而市面上大多數 AI 監測工具的報表,是跑一次就產出的。

這裡要先澄清一件常被搞混的事:7 次講的是量測頻率,不是報告頻率。 量測是機器在背景跑,收報告的人不會因此收到七封信。 報告要多久看一次,是另一個問題——而且該由收報告的人決定。

我們的做法是把兩件事分開:量測照方法學的需要跑, 報告頻率讓客戶自己選(每日/三日/每週/每月), 而且每份報告都標明它涵蓋的量測期間。 沒有標期間的數字,讀者無從判斷那是一次抽樣還是一段區間的彙總。

為什麼「來源」比「品牌」更不穩

同一份研究裡,品牌層的日對日 Jaccard 落在 0.45–0.59,來源層是 0.34–0.42。 品牌比來源穩定,但兩者都遠遠稱不上可靠。

觀測窗要拉多長

除了「一天內量幾次」,研究也算了「要連續看幾天」。 同樣以標準誤差為標準:

這解釋了為什麼研究建議以 2 至 4 週的滾動區間彙總, 而不是比較兩個單點。少於一週的觀測,沒有能力區分訊號與雜訊。

還有一件事:各引擎不能共用同一個門檻

研究另外量了各引擎的引用集中度,用的是 Gini 係數—— 原本是經濟學衡量所得分配不均的指標,0 代表完全平均、1 代表完全集中。 套在這裡,數值越高代表引用越集中在少數網域,新進者越難擠進去:

引擎Gini意義
Google AI Mode0.782最集中,新品牌最難擠進去
Gemini0.723
ChatGPT0.684
Perplexity0.671最分散,最容易取得首次引用

四家的差距不小。用同一個「及格線」去評斷三、四個引擎, 等於把難度完全不同的考試放在一起打平均。 基準線應該各引擎分別建立。

這對你收到的報告代表什麼

如果你正在買、或已經在收 AI 能見度報告,這裡有四個可以直接問的問題:

  1. 每題每個平台跑了幾次?如果是一次,月對月的小幅變化不應該被解讀成趨勢。
  2. 零事件有沒有附信賴區間?「0% 被引用」在 n=30 和 n=150 下的意義天差地遠。
  3. 各引擎是分開呈現還是合併平均?合併會掩蓋掉引擎之間的結構差異。
  4. 「AI 從某某頁抓資料」這種說法,驗證過幾次?來源層的單次觀察不足以下因果結論。
  5. 這份報表涵蓋的量測期間是哪一段?沒寫期間,就分不出那是一次抽樣還是一段區間的彙總。

這四個問題不需要技術背景就能問,而且答案會很快告訴你, 對方是在做量測,還是在做簡報。

我們自己也還沒做到

誠實揭露:Mediflow 目前的標準月度量測,是每題每平台執行一次—— 正是這份研究點名的做法。

我們的標準配置是每月 54 題 × 3 個平台 = 162 次檢測。 在一位在地服務業客戶的量測中,品牌提及率是 30 次提問全數提及(100%), 內容正確度 49%——這個平均值底下,五個面向的分數從 98.3 一路散到 3.3: 公司名稱幾乎每次都對,公司地址幾乎每次都錯。

這裡面哪些數字禁得起單次量測? 提及率 100% 與地址 3.3 分別貼著天花板與地板,多量幾次也不會差太多。 但「內容正確度 49%」落在中間—— 中間值正是最容易被單次抽樣推來推去的區間, 也正是這份研究警告不該拿來做月對月比較的那一類指標。

所以我們在報告裡定了一條規則:月對月變化低於 10 個百分點,一律標為雜訊, 不寫成改善或退步。

外部效度但書 這份研究在瑞士德語市場執行,四個受測產業為電信、房仲、運動用品與消費電子。 研究作者自己在結論寫明,這些不穩定性是否適用於其他語言與區域市場,有待後續研究。 繁體中文與台灣市場目前沒有同等規模的公開驗證。

結論

重複量測改善的是對現況的理解,不是商家的能見度。 重複測量七次不會讓 AI 更常提到商家——但是會讓你知道,AI 有多常提到你。

但在一個來源每天換掉三分之二的環境裡, 知道自己在哪裡,本身就是稀缺的。

// 參考文獻

  1. Schulte, J., Bleeker, M. & Kaufmann, P. Don't Measure Once: Measuring Visibility in AI Search (GEO). University of St. Gallen, 2026-04-08. arXiv:2604.07585

// 延伸閱讀

想知道 AI 現在怎麼描述你的品牌?
我們每月用固定題組實測,把實際變化如實回報,包含沒有變化的月份

聯絡我們 →