「真係多謝晒」是讚還是鬧?廣東話情緒分析的人手覆核方法
香港品牌做 ORM/網上口碑管理,分析廣東話留言時應覆核反話、混合意見及上下文,再決定客戶行動。情緒標籤只能輔助判斷,不能直接當成客人的真正意圖。
沿用 Chiwa AI 原有 AI 概念配圖;非真實個案、工具介面或成效數據。 審閱及發布批准:Codex(編輯核對);Jones Ng(發布流程授權,非逐字審閱)|2026-09-14。
先分清語意誤判,才決定是否換工具
已收到留言卻判錯態度,屬於情緒分類問題;根本沒有收到留言,則是資料覆蓋問題。香港品牌做網上口碑管理,應把兩類錯誤分開記錄,否則換了分類模型,仍可能漏掉原本沒有被收集的投訴。
Microsoft 在情緒分析透明度說明指出,反話可能需要更多上下文;訓練資料較少涵蓋的方言,也可能有較低準確度。文件亦說明,信心分數不是情緒強度。這些是該產品的限制,不是所有工具的共同準確率,更不是廣東話一定無法分析的證明。來源:Microsoft 情緒分析透明度說明,2026年4月1日更新
對品牌而言,風險不只是報表顏色錯了。若一則反話被標成讚賞,客服可能跳過真正需要跟進的人。相反,把輕鬆玩笑當成危機,也會耗用處理能力。
逐句標註對象,不用一個標籤蓋住整段留言
同一段留言可以讚產品、批評送貨,兩者不應互相抵銷。本文提供一張供團隊採用的「語句—對象—上下文—行動」覆核表,屬編輯設計的工作方法,並非經驗證的模型成效。
| 原句:以下全為虛構例子 | 評論對象 | 尚欠上下文 | 建議處理 |
|---|---|---|---|
| 真係多謝晒,等到我放工都未到 | 到貨時間 | 承諾時段及完整對話 | 標記疑似不滿,查送貨紀錄 |
| 件貨好,但客服冇覆我 | 產品與客服 | 客戶何時及經何渠道聯絡 | 分開產品正面、客服負面 |
| 又係咁,服咗你 | 未明 | 指的是品牌、其他留言者還是自己 | 暫列待確認,不強行定性 |
| 今次終於快返 | 今次與過去的服務 | 是稱讚改善還是仍有問題 | 保留混合語意,再看後文 |
覆核人應留下理由,例如「不滿的是等候時間,不是產品質素」,而不是只把紅色改綠色。後續同事才知道標籤背後的判斷。
建立固定測試集,避免只挑容易判的例子
測試集應反映實際收到的語言、平台和問題,包括中英夾雜、反話、無主語短句及同句褒貶。挑選時保留抽樣期間和來源範圍,去除不需要的個人資料,並把真實授權樣本與自行編寫例子分開。
先讓覆核人獨立判斷,再討論分歧。若人也無法可靠判斷,就把「上下文不足」保留成正式結果,不要為了方便計算而硬塞進正面或負面。用來修改規則的例子,也不應全部同時當成獨立驗收樣本。
比較工具版本時,使用同一批保留樣本及同一判斷標準。另加新語境的補充集,但不要混在一起,令報告看似進步卻無法比較。
覆核優先次序要看後果,而不是只看信心
會觸發對外回覆、刪除內容或管理決定的分類,應比單純報表標籤更審慎。本文建議先覆核影響客戶處理的錯誤,再抽查普通留言;不要因模型「很有信心」就跳過原文。
記錄可分成:漏掉需要跟進的留言、錯誤升級普通留言、混合意見被壓成單一類別,以及資料不足。各項都應列出檢查數、錯誤數、期間和分類版本。沒有足夠樣本時,寫樣本不足,不公布籠統準確率。
AMEC 的評估框架區分傳播輸出與成果。套用到本篇,完成多少分類只是工作量;是否減少錯派個案、是否讓需要協助的客戶得到處理,才是另一層待驗證成果。來源:AMEC 計劃與評估框架
常見問題
廣東話一定要全部人工讀嗎?
不一定。工具可以協助排序和初步分類,但抽樣比例及覆核範圍應由風險、樣本表現與人手決定。本文沒有一個適用所有品牌的固定比例。
正面留言也需要抽查嗎?
需要。反話可能被放入正面或中性類別,只抽查負面留言會看不到這類錯誤。抽查時亦要留意同一句是否評價不同對象。
先改收集關鍵詞還是先改分類?
先看留言是否已在系統內。未收集到的問題,可參考社交聆聽漏報與誤報檢查;已收集卻判錯,才進入本文的語意覆核流程。
下一步:帶一份可匿名化的誤判清單來討論
先整理原句、分類結果、覆核理由及真正需要的客戶行動,不要只截取情緒百分比。你可以與 Chiwa AI 討論如何把覆核結果接回ORM 網上口碑管理流程。
WhatsApp 諮詢:6826 5126|WeChat:jonesnghk
資料查閱:2026-09-14。本文為一般營運方法;例子並非真實客戶,亦不代表工具測試結果。
