返回
Chiwa 洞察由 Chiwa AI 編輯團隊發佈 · 2026年8月18日

AI 答案會波動:品牌可見度基線應該怎樣設計?

一次 AI 答案只是觀察值。品牌需要用固定問題組、重複運行、來源記錄與變化範圍,建立可比較、可重建的 AI 可見度基線。

如果同一個問題問 AI 五次,答案、品牌名單、引用來源甚至排序都可能不同,管理層究竟應該把哪一次當作「品牌可見度」?

很多團隊的第一反應是截圖:今天問一次「香港最值得信賴的數碼營銷公司有哪些?」看到品牌出現,就把它存進簡報;隔天再問一次,品牌沒有出現,團隊又判斷「可見度下降」。這種做法的問題不是截圖沒有用,而是一次觀察沒有說明它在一組問題、一次運行週期和一個地區條件中代表甚麼。

AI 搜尋不是一張固定的排名表。它可能根據問題拆出多個子問題,按照當下可取得的資料、平台、模型、語言、地區、時間和答案格式,重新組合品牌與來源。若企業用一張漂亮截圖代表整個市場,管理層看到的往往只是一次抽樣,不是趨勢。

本篇的核心判斷很簡單:

一次 AI 答案是觀察值;固定問題組加上重複運行,才有機會形成可比較的基線。

文章不會製造一個看似精準的「AI 排名分數」,而是把測量拆成問題設計、重複抽樣、變化範圍及管理判斷四個部分。

一、先分清楚:你要量的是甚麼?

「品牌可見度」至少可以拆成四種不同問題,不能放在同一欄用一個百分比解決。

1. 品牌有沒有被提及?

這是最基本的 inclusion/exclusion 問題:在固定問題下,某品牌是否出現在答案文字中?如果一次出現、四次沒有,不能簡化為「品牌可見度 20%」而不說明問題數量、平台、時間和重複次數。

2. 品牌是否被列為可考慮選項?

被提及不等於被推薦。企業應另記錄品牌在答案中的語境:是第一個建議、比較對象、例子、免責說明,還是負面情境中的被提及。對聲譽管理而言,單純的 mention count 太粗糙。

3. 答案引用了甚麼來源?

AI 答案可能提及品牌,但沒有引用企業官網;也可能引用第三方評論、舊新聞或合作夥伴頁面。品牌提及與來源集合是兩種不同的測量對象。若目標是提升可核實性,引用來源的組成和更新日期可能比一張總分更有管理價值。

4. 不同平台是否說法一致?

ChatGPT、Gemini、Google AI Mode、Perplexity 或其他答案面未必使用相同資料及流程。跨平台一致性低,不必然代表某個平台「錯」,但一定提醒團隊不要把一個平台的結果當成整個 AI 搜尋市場的代表。

二、外部研究告訴我們:波動不是偶發故障

本日選用的外部 PDF 研究是 Julius Schulte、Malte Bleeker 和 Philipp Kaufmann 的《Don’t Measure Once: Measuring Visibility in AI Search (GEO)》。研究於 2026 年 4 月提交至 arXiv,PDF 為 19 頁,使用四個 AI 搜尋引擎、四個 Swiss-German campaign,並分別分析跨日變化和同日重複運行。

研究的時間資料涵蓋 2026 年 1 月 24 日至 3 月 20 日的 45–46 天。四個 campaign 每個使用八條提示詞,輸入 ChatGPT、Gemini、Google AI Mode 和 Perplexity。研究者用 Jaccard similarity 比較兩次答案的來源集合重疊程度;數值越高,兩次集合越相似。

跨日來源集合:平均 Jaccard 約 0.34–0.42

在四個 campaign 的跨日比較中,引用來源集合的 Jaccard 平均約為 0.34–0.42。換句話說,研究觀察到相鄰日期之間的來源集合重疊並不接近完全一致。這不是說每個問題每天都會換掉大部分來源,而是提醒我們:如果只保存今天的一次答案,明天的不同答案可能並非內容團隊突然失誤,也可能是生成搜尋本身的波動、索引更新、模型或答案流程造成。

同日重問:平均來源 Jaccard 約 0.32–0.43

研究更重要的一步,是把同一提示詞在相近時間內重複運行,盡量減少跨日索引更新的干擾。每個 campaign 有八條提示詞,每條最多運行十次;在同日/24 小時條件和引用過濾後,留下 3,409 組來源比較。來源 Jaccard 平均約為 0.32–0.43,顯示即使相隔不久,答案來源也可能出現明顯不同。

研究同時提醒,這個數字不能被當成所有 AI 平台的固定波動率。資料來自瑞士伺服器和 Swiss-German 語境,平台只包括四個引擎,並且對沒有引用的回答、模型資料和 images.openai.com 偽來源作了特定處理。

品牌提及比來源稍穩定,但仍非固定排名

在符合其 70% 品牌偵測門檻的 campaign 中,同日重複運行的品牌集合 Jaccard 約為 0.33–0.48;跨日品牌分析則約為 0.45–0.59。這表示品牌名單有時比單個引用來源稍穩定,但仍然遠未達到「一次截圖就可以代表結果」的程度。

研究的結論不是「品牌不值得測量」,而是應把可見度理解為在固定條件下被提及的機率,並同時記錄不確定性、提示詞差異及時間窗口。

三、Google 的產品邊界:可以量到一部分,不等於量完整

Google Search Console 現已提供 Generative AI performance report(Search)說明頁。Google 表示,相關報告包括 AI Overviews 和 AI Mode 的連結展示印象,並可按頁面、國家、日期和裝置查看;最新數據可能仍是 preliminary,且圖表和表格的聚合方式可能不同。這對管理團隊很有用,因為它至少提供一個官方的 Google generative feature 曝光觀察入口。

但這個報告不是完整的跨平台品牌聲譽測量:

  • 它主要反映你的網站連結在 Google generative features 中出現的印象,不等同於所有 AI 平台的品牌提及率。
  • 它不能直接告訴你每個答案用了哪段內容、品牌被如何描述、第三方來源是否準確,或使用者是否因為答案完成轉化。
  • 報告仍在向部分網站逐步推出,資料可能受時間範圍、行數限制、聚合方式和初步數據影響。

因此,企業可以把 Search Console 的 generative impressions 與自建的固定問題組分開管理:前者是 Google 的站點曝光觀察,後者是跨平台、跨語言或跨地區的可見度抽樣。兩者可以互相對照,但不能硬加成一個「AI 總分」。

Google 在 2025 年 8 月的官方文章亦表示,AI features 讓使用者提出更長、更複雜的問題,並稱整體自然搜索網站點擊量同比相對穩定、平均點擊質量上升。這是 Google 對自身產品和流量的說明,頁面沒有提供完整公開樣本、分行業拆分或獨立原始數據;管理層可把它當作產品方的立場,不應把它寫成所有市場都已證明的因果關係。

四、受眾已在多個中介層之間移動

Reuters Institute 的《Digital News Report 2026》研究涵蓋 48 個市場,雖然它不是品牌 AI 可見度研究,但對聲譽管理有一個重要提醒:受眾接觸資訊的入口正在平台化。報告指出,社交媒體和視頻網絡首次成為全球最常見的在線新聞獲取方式,平均 54%;使用 AI chatbot 獲取新聞的比例為 10%,上一年為 7%,35 歲以下為 16%。

這些數字不代表「AI 一定會推薦你的品牌」,也不是香港 SME 的 benchmark。它們反映的是資訊被發現、解釋和信任的中介層變多。品牌聲譽的公開證據因此不能只放在一個網站頁面:產品事實、作者/團隊、案例日期、第三方驗證、影片說明、來源和更新記錄,應在企業可控的公開頁面保持一致。

五、中小企的最小可行基線:先控制方法,再擴大樣本

外部研究的 7 次/8 次建議,是在特定研究設計下由 bootstrap convergence 推導出的起點,不是所有公司都必須遵守的神奇門檻。中小企可以先用以下最小流程開始,把每一次測量變成可重建資料,而不是一張散落在群組裡的截圖。

Step 1:建立固定問題組

先寫 8–12 條真正與業務相關的問題,不要只寫品牌名稱。可以包括:

  • 類別問題:香港中小企怎樣選擇網絡聲譽管理服務?
  • 情境問題:當品牌在 AI 答案中被錯誤描述,管理層應先查甚麼?
  • 比較問題:不同 ORM/Social Intelligence 方案應比較哪些治理欄位?
  • 證據問題:哪些公開來源可以支持一家數碼服務公司的可信度?

問題組的重點不是漂亮,而是固定。每條問題應有 Prompt ID、語言、地區、意圖、版本和建立日期。要改問法時,另開版本,不要把新舊問題混在同一條時間線。

Step 2:每次運行保存上下文

至少記錄平台、模型/產品名稱、日期及時間、地區、語言、登入/匿名條件、完整答案、品牌是否被提及、品牌在甚麼語境出現、引用 URL、引用日期、異常及人工判斷。若某個平台沒有顯示模型版本或引用,記錄「未顯示」,不要猜測。

Step 3:把「提及」和「引用」分成兩欄

品牌提及率回答「有沒有出現」;來源集合回答「答案依據甚麼」。…281 tokens truncated…。

六、管理層應如何閱讀一張基線圖?

一張有用的基線圖不必很複雜,至少可以有五欄:

欄位管理問題
Prompt ID這次測量與上次是否是同一條問題?
平台/模型/地區不同答案是否只是環境條件不同?
品牌提及出現、沒有出現,還是出現在負面語境?
引用集合來源是否可靠、最新、可訪問及與主張相符?
變化範圍變化是否超過已有觀察中的自然波動?

如果團隊只看「今天有沒有出現」,它會把自然波動誤讀成內容成果或危機;如果只看「來源數量」,它又可能忽略來源是否真的支持主張。基線的價值,是讓決策者知道哪一個欄位變了、變化是否可重複、下一步應由內容、SEO、品牌、法務還是客戶服務負責。

七、不要忽略測量本身的限制

第一,研究樣本不等於香港市場。Swiss-German 資料不能直接代表繁體中文、粵語、香港 IP 或本地平台的結果。

第二,平台結果會更新。模型、搜尋索引、產品介面、引用規則和內容可見性都可能變化。固定問題組只是讓比較更有秩序,不會凍結 AI 平台。

第三,品牌識別有誤差。研究使用固定 lexicon,而企業實務可能遇到簡稱、別名、中文/英文名稱、同名詞、子品牌和不同公司實體;人工覆核仍然需要。

第四,提及不等於信任、點擊、商機或收入。即使品牌在答案中出現,也不能單獨證明使用者相信它或完成轉化。要連結業務結果,必須另用網站分析、CRM、客服、銷售和客戶研究核對。

第五,外部研究的數字必須保留範圍。今天引用的 0.32–0.43、0.33–0.48、7 次和 8 次,都只屬該研究設計下的觀察或建議,不能改寫成 Chiwa 對所有企業的保證。

結語:可見度不是一張截圖,而是一個有誤差的管理訊號

當 AI 答案會變,企業真正要建立的不是一個永遠不變的排名,而是一套知道自己怎樣問、何時問、在哪裡問、答案引用甚麼、變化是否重複,以及何時需要採取行動的測量系統。

對中小企而言,最合理的起點不是一次購買複雜工具,而是先把最重要的問題、地區、語言、平台、來源、日期和人工判斷記錄清楚,再逐步擴大樣本和觀察窗口。當資料可以重建,團隊才有能力回答管理層最關心的問題:這次差異是自然波動、內容問題、來源問題,還是真正值得處理的聲譽訊號?

來源、日期、範圍與限制

  1. Don’t Measure Once: Measuring Visibility in AI Search (GEO)原始 PDF,Julius Schulte、Malte Bleeker、Philipp Kaufmann;submitted 2026-04-08,PDF date 2026-04-10;四個 Swiss-German campaign、四個 AI 引擎、2026-01-24 至 2026-03-25 的時間/重複運行資料;限制包括 Swiss server/locale、四引擎範圍、模型/介面變化、固定 lexicon、引用過濾及 ChatGPT 偽來源清理。
  2. Google|AI in Search is driving more queries and higher quality clicks,2025-08-06;Google 官方自有產品說明;限制為頁面未提供完整公開樣本、分行業數據或獨立原始資料。
  3. Google Search Console|Generative AI performance report (Search),現行官方支援頁;AI Overviews/AI Mode 的站點印象、頁面/國家/日期/裝置維度;限制為逐步推出、最新數據可能 preliminary,且不等於跨平台品牌提及率。
  4. Reuters Institute|Digital News Report 2026: Key Findings,2026 年報告、48 個市場;54% 社交/視頻新聞入口、10% AI chatbot news use、35 歲以下 16%;限制為新聞消費研究,不是品牌 AI 可見度 benchmark。
  5. SearchIntel|2026 AI Search Visibility Benchmarks,Edition 1 July 2026;100 個 UK 中性購買問題、六個平台、十個 verticals、1,198 個推薦;作交叉參考,不是本日文章的主要研究報告。

本文為一般品牌聲譽、搜尋及內容營運知識分享,不構成法律、監管、投資、醫療或平台結果保證。

AI 搜尋品牌可見度GEO聲譽管理內容治理基線測量