你問 AI 一個問題,它回答得很完整,句尾還整齊地掛了三個來源。這時候很容易產生一種直覺:既然都有 citation 了,內容應該已經被查證過。但如果真的點開來源,可能會碰到幾種不同情況:連結確實存在,卻只談到同一個主題;文章裡有類似數字,但年份不同;來源支持前半句,後半句卻是模型自己延伸;甚至引用的是一篇看起來正式、實際上品質很差的二手整理。
Citation,可以先理解成「把一段回答指向某個來源或來源片段的連結」。 它最大的價值是 traceability,也就是可追查性。沒有 citation 時,你只拿到一句話;有 citation 時,你至少有機會回到原始材料,檢查模型到底從哪裡得到這個資訊。
先記一句:有 citation 代表「這句話被連到一個來源」;不代表「這個來源已經證明這句話一定是真的」。
第一關:這個來源真的存在嗎?
最基本的問題,是引用本身能不能被找到。純文字生成模型如果只是被要求「幫我附參考文獻」,有可能生成一篇格式很像真的論文、作者和期刊名稱也很合理,實際上卻不存在。這種情況連第一關都沒有通過。
有些 AI 產品會把 citation 功能和實際檢索到的網頁、文件或搜尋結果綁在一起,風險就會小很多。例如 Anthropic 的 citations 功能,是讓模型在回答提供的文件時附上可追查的引用片段,官方文件也直接把用途描述成幫助使用者追蹤與驗證回答背後的來源。這和單純叫模型「自己寫一串參考資料」是不同機制。
但來源存在,只是最低門檻。一篇真的文章、一個真的官方網站,仍然可能沒有說 AI 聲稱它說過的事情。
第二關:來源真的支持這個 claim 嗎?
這是 citation 最重要、也最容易被忽略的一層。假設 AI 寫:「研究顯示 A 方法可以讓準確率提升 40%,而且已經在所有年齡層驗證。」句尾放了一篇研究。你點進去後發現,論文確實研究 A 方法,也確實看到 40% 這個數字,但那是某個特定子群的相對改善,研究根本沒有涵蓋所有年齡層。這個 citation 不是完全無關,卻沒有支持整個 claim。
因此真正要問的不是「有沒有引用」,而是來源中的哪一段文字、哪一個表格或哪一組數據,能支持回答裡的哪一個敘述。 這種關係常被叫作 attribution、supportiveness 或 entailment:回答做出的主張,是否真的能從被引用的材料中推出來。
2025 年發表於 Nature Communications 的 SourceCheckup 研究,就把「來源是否相關」和「來源是否支持回答中的敘述」分開評估。研究使用醫療問答資料,發現受測模型即使附上來源,回答中的敘述仍可能沒有被來源完整支持,甚至和來源矛盾。這個結果不能直接外推成所有領域、所有模型的固定錯誤率,但它很清楚地示範:citation existence 和 citation correctness 是兩個不同問題。
第三關:來源本身適合拿來證明這件事嗎?
就算 citation 完全支持那句話,還要看來源品質。你要查某個 API 參數現在怎麼用,官方文件通常比兩年前的教學文章更直接;你要確認法律條文,原始法規或主管機關資料通常比論壇留言更合適;你要判斷某項研究的結果,原始論文通常比轉述它的社群貼文更接近證據本身。
這不表示「只有 primary source 才能看」。新聞、評論、百科和教學文章都可能很有用,它們常常更容易讀,也可以提供背景。但如果一句話會影響重要決策,來源最好越接近原始資料越好,而且要知道這個來源到底是原始證據、二手整理,還是作者的分析。
來源的可信度也不是單純看網址長得多正式。有官方網域不代表每個頁面都是最新規範;有 DOI 不代表研究設計一定適合你現在的問題;有很多引用數也不代表某個特定結論沒有爭議。Citation 讓驗證變得可能,但判斷證據品質仍然需要看內容。
第四關:它現在還適用嗎?
一個 citation 可以完全真實,也完全支持當時的敘述,卻在今天失去適用性。軟體版本會更新、API 會改、價格會變、法規會修、統計數字會有新的年度資料。這時候問題不是 hallucination,而是 freshness:來源本身已經過期。
因此遇到「現在」「最新」「目前支援什麼」這類問題,除了看 citation,也要看來源日期和它描述的版本。2023 年的官方文件可能非常可信,但如果你問的是 2026 年的 API 行為,它仍然可能不是正確答案。對統計資料也是一樣:同一個數字如果來自不同年份、不同地區或不同樣本,就不能直接互換。
Grounding 和 Citation 不是同一件事
Grounding 比較接近「讓模型回答時依據指定的外部資料」;citation 則是把回答中的敘述顯式連回來源。兩者常常一起出現,但不是同一件事。一個系統可以先用 RAG 找到資料、把內容放進 context,卻不把來源顯示給使用者;也可以顯示來源,但模型實際生成的某一句話超出了來源能支持的範圍。
這條流程每一段都可能出錯。搜尋可能撈到不相關資料;資料庫裡可能放著舊版本;模型可能把兩個來源混在一起;citation 可能掛在整段後面,卻只支持其中一句。所以「系統有 grounding」和「每一個 claim 都被正確引用」仍然需要分開評估。
一個 citation 掛在整段後面,也不一定支持整段
這是閱讀 AI 答案時很實用的一個檢查方式。段落裡如果同時有日期、百分比、原因分析和一個總結,但只有最後放一個 citation,不要預設那個來源一次證明了全部內容。比較好的 citation granularity,是讓來源盡量靠近它真正支持的 claim,必要時甚至精確到句子或資料片段。
這也解釋了為什麼「引用很多」不一定比較可靠。十個來源如果都只是同一篇報導的轉載,證據並沒有真的增加;一個直接指向原始數據表格的來源,反而可能更有用。Citation 的數量是表面特徵,真正重要的是 coverage 和 support:重要的敘述有沒有來源,以及那個來源到底支不支持它。
所以看到 AI 引用,最值得做的是什麼?
不用因為有 citation 就全信,也不用因為 AI 可能引用錯誤就把所有來源都當成沒用。比較好的做法,是把 citation 當成一個「可以開始驗證的位置」。先看連結是不是真的來源,再看來源內容是否支持附近的 claim;重要資訊再檢查來源品質、日期、版本與適用範圍。
這和上一篇談的 hallucination 其實是同一件事的下一層。沒有來源時,你只能判斷答案看起來像不像真的;有來源後,你終於可以回頭看證據。但citation 提供的是可驗證性,不是自動驗證完成的證書。
資料來源