AI 會亂講話怎麼辦?幻覺防護的工程做法
每個導入 LLM 的團隊,遲早會遇到那個時刻:模型用無比流暢、無比自信的語氣,講了一件完全不存在的事。查了一個不存在的訂單、引用了一條沒有的條款、發明了一個你們從來沒賣過的方案。這叫幻覺(hallucination),而多數人的第一反應——「換個更聰明的模型」——是錯的。更聰明的模型只會胡說得更有說服力。
好消息是,幻覺不是玄學,是工程問題。我們自己的產品線每天都有 AI 輸出面對真實用戶,靠的是四層防線,一層一層講。
第一層:檢索——讓模型「看著資料回答」,不是「憑記憶回答」
幻覺的根源,是模型在沒有依據時仍然會生成「看起來合理」的內容。所以第一層防線是釜底抽薪:所有需要事實的回答,先從你的知識庫檢索出相關資料,連同問題一起餵給模型,並在提示詞裡明確要求「只根據提供的資料回答,資料裡沒有的就說不知道」。這就是 RAG(檢索增強生成)的核心邏輯。
兩個實務重點:第一,檢索品質決定一切,知識庫過期或互相矛盾,模型只能在爛資料裡挑一個講——AI 講錯話,病灶常常在文件,不在模型(這也是我們在 AI 客服評估框架 裡把知識庫成熟度列為硬門檻的原因)。第二,要求模型在回答裡標注引用了哪段資料,這讓第二層防線有東西可以驗。
第二層:輸出驗證——不要相信,要檢查
模型的輸出在送到用戶眼前之前,先過一道程式化的檢查:
- 格式驗證:要求 JSON 就檢查 schema,欄位缺漏或型別錯誤直接重試,不放行。
- 事實錨點驗證:回答裡出現的訂單編號、商品名稱、金額、連結,拿去跟資料庫比對——查無此物就攔下。我們的鐵律之一是「連結不准 404」,AI 生成的內容也一樣適用:模型很愛發明看起來很像真的網址。
- 規則掃描:該領域的紅線詞與紅線語意(我們做保健食品電商,這條是法規等級的必要)在這層擋掉。
這層的本質是把「AI 說的」降級為「待驗證的草稿」,用便宜的傳統程式碼把關昂貴的錯誤。
第三層:信心門檻——讓模型學會說「我不確定」
比講錯更危險的,是永遠不承認不知道。我們的做法是讓模型對自己的回答評估信心,並在流程上分流:檢索結果相關度低、模型自評信心不足、或問題落在知識庫範圍外——這三種情況不強行回答,改走「我幫你轉給真人」或「目前資料不足」的路徑。
要注意模型的自評分數本身不可盡信(它可能自信地打高分),所以實務上我們把「檢索相關度」這種客觀訊號的權重放得比模型自評更高。門檻設多少沒有標準答案,原則是:寧可多轉幾件給人,不要少攔一件錯的——尤其在導入初期,信任還沒建立的時候。
幻覺防護的目標,不是讓 AI 永不犯錯,而是讓錯誤在抵達用戶之前就被攔下,或至少留下人的位置。
第四層:人工升級路徑——最後的防線,也是設計的一部分
前三層都是機器攔機器,第四層是承認機器攔不完:高風險操作(退款、改訂單、法規相關回覆)一律「AI 擬稿、人按送出」;用戶明確表達不滿或重複追問時主動轉真人;所有 AI 對話留存記錄、定期抽樣審查,把發現的錯誤案例回頭補進知識庫和驗證規則——這個回饋循環,才是系統會隨時間變好的原因。
四層防線聽起來工程量不小,但它們可以漸進建置:先有檢索和人工審核就能上線,驗證和信心分流隨著流量長出來。真正不該省的是心態:把 LLM 當成一個很有才華但需要編輯的實習生,而不是一個全知的神諭。想替你的 AI 應用做一次幻覺風險體檢,或從頭把防線設計對,歡迎看看 AI 應用開發服務,或直接 來聊聊。
這類問題,我們每天都在自己的產品上解
免費 30 分鐘線上諮詢・先釐清方向,不推銷・一個工作天內回覆