// 量測方法學

AI 能見度要量幾次
才算準?

2026-09-09 約 6 分鐘

如果你正在看一份 AI 能見度報告,上面寫著「本月品牌提及率 32%,較上月上升 4 個百分點」—— 在相信那個「上升」之前,你應該先問一個問題:這個數字是量了幾次得到的?

如果答案是「一次」,那個 4 個百分點很可能什麼都不是。

先看一個數字:65%

聖加侖大學研究團隊在 2026 年 4 月發表的研究, 橫跨 ChatGPT、Gemini、Google AI Mode、Perplexity 四個引擎, 對四個產業連續觀測 45 至 46 天。他們算了一件很基本、卻幾乎沒人算過的事: 同一個問題,連續兩天問,AI 引用的來源有多少是重複的?

35% 連續兩日之間,引用來源的重疊比例
65% 也就是說,每天約有三分之二的來源被換掉
45–46 連續觀測天數,非單點抽樣

來源相似度以 Jaccard 係數量測,四個產業活動的日對日數值落在 0.34–0.42 之間。[1]

在這份 45–46 日資料中,這種不穩定性沒有隨觀測時間消失。 這不代表未來永遠不會改善,但量測時應把不穩定性納入解讀。

研究如何估計重複次數?

研究團隊做了一組「同時執行 10 次」的資料集, 然後逐步減少次數,看標準誤差什麼時候才穩定下來。以下門檻只適用於該研究的資料、排除條件與誤差定義:品牌比較排除了從未被偵測的品牌,部分品牌層分析只保留偵測率至少 70% 的活動。

量測層級目標精度每題每天需要執行
品牌是否被提及標準誤差 < 0.107 次(95% CI ±0.158)
品牌是否被提及標準誤差 < 0.088 次(95% CI ±0.121)
引用了哪些來源標準誤差 < 0.108 次

研究的原話是:在這組資料與條件下,實務工作者應該每題每天至少執行 7 次。
若工具每題只執行一次,月對月的小幅變化不宜直接解讀為趨勢。

這裡要先澄清一件常被搞混的事:論文中的重複次數是研究結論,不是醫流 Mediflow 對外公開的執行配方。 對外報告會標明資料期間、樣本數與必要限制;量測細節於簽約後提供。

為什麼「來源」比「品牌」更不穩

同一份研究裡,品牌層的日對日 Jaccard 落在 0.45–0.59,來源層是 0.34–0.42。 品牌比來源穩定,但兩者都遠遠稱不上可靠。

觀測窗要拉多長

除了「一天內量幾次」,研究也算了「要連續看幾天」。 同樣以標準誤差為標準:

論文文字另稱 10 天已低於 0.10,與表格數值不一致。因此保守說法是:約兩週才低於 0.10。 無論採何種區間,都不宜只比較兩個單點。

還有一件事:各引擎不能共用同一個門檻

研究另外量了各引擎的引用集中度,用的是 Gini 係數—— 原本是經濟學衡量所得分配不均的指標,0 代表完全平均、1 代表完全集中。 套在這裡,數值越高代表觀察期內引用越集中在少數網域;這個指標不能直接推論新品牌取得首次引用的難易:

引擎Gini意義
Google AI Mode0.782觀察期內最集中
Gemini0.723
ChatGPT0.684
Perplexity0.671觀察期內最分散

四家的差距不小。用同一個「及格線」去評斷三、四個引擎, 等於把難度完全不同的考試放在一起打平均。 基準線應該各引擎分別建立。

這對你收到的報告代表什麼

如果你正在買、或已經在收 AI 能見度報告,這裡有四個可以直接問的問題:

  1. 每題每個平台跑了幾次?如果是一次,月對月的小幅變化不應該被解讀成趨勢。
  2. 零事件有沒有附信賴區間?「0% 被引用」在 n=30 和 n=150 下的意義天差地遠。
  3. 各引擎是分開呈現還是合併平均?合併會掩蓋掉引擎之間的結構差異。
  4. 「AI 從某某頁抓資料」這種說法,驗證過幾次?來源層的單次觀察不足以下因果結論。
  5. 這份報表涵蓋的量測期間是哪一段?沒寫期間,就分不出那是一次抽樣還是一段區間的彙總。

這四個問題不需要技術背景就能問,而且答案會很快告訴你, 對方是在做量測,還是在做簡報。

一個台灣在地服務業案例

醫流 Mediflow 在 2026 年 8 月為一位在地服務業客戶量測:30 次直接指名品牌的提問全數提及, 但介紹內容的正確度為 49%。其中公司名稱得分 98.3,地址得分 3.3: 公司名稱幾乎每次都對,公司地址幾乎每次都錯。

這些是單一客戶、單一量測期間的聚合結果,只能說明「被提及」與「內容正確」是兩件事。 即使數字接近量尺邊界,仍不能據此假定重測會穩定;單次結果不宜直接解讀為趨勢。

外部效度但書 這份研究在瑞士德語市場執行,四個受測產業為電信、房仲、運動用品與消費電子。 研究作者自己在結論寫明,這些不穩定性是否適用於其他語言與區域市場,有待後續研究。 繁體中文與台灣市場目前沒有同等規模的公開驗證。

結論

重複量測改善的是對現況的理解,不是商家的能見度。 重複測量七次不會讓 AI 更常提到商家——但是會讓你知道,AI 有多常提到你。

但在一個來源每天換掉三分之二的環境裡, 知道自己在哪裡,本身就是稀缺的。

// 參考文獻

  1. Julius Schulte, Malte Bleeker & Philipp Kaufmann. Don't Measure Once: Measuring Visibility in AI Search (GEO). arXiv, 2026-04-08. arXiv:2604.07585

// 延伸閱讀

想知道 AI 現在怎麼描述你的品牌?
我們依約定範圍持續追蹤,把實際變化與必要限制如實回報。量測細節於簽約後提供。

免費健檢 →