跳到主要內容
台灣 AI 法規指南EVIDENCE WORKBENCH / TAIWAN
搜尋
企業制度工具查證 2026-09-03
回範本總覽
實務檢查表

RAG 驗收檢查表:來源、引用、權限與拒答怎麼測

給企業與機關驗收 RAG 知識庫、文件問答或內部搜尋:逐項測來源版本、引用支持、權限越界、查無資料、過期文件、拒答與上線後維運。

更新
2026-09-03
來源狀態
台灣現行與部分待生效法源 + 數發部公部門參考手冊 + NIST 自願性 GenAI Profile;非官方核定格式

欄位

  • 範圍:使用者、問題、資料來源、不可回答事項與轉人工條件
  • 資料:文件所有人、版本、授權、個資、機密、排除與刪除清單
  • 檢索:命中來源、排序、片段、版本與權限過濾
  • 答案:引用支持、正確性、完整性、不確定性、拒答與提醒
  • 安全:權限越界、提示注入、敏感資料外洩與異常查詢
  • 維運:文件更新、索引重建、回歸測試、品質抽查與事故處理
  • 移交:資料清單、索引設定、提示詞、測試集、日誌與操作手冊

應留下的紀錄

  • 資料來源清單與排除清單
  • 資料分級與權限對照表
  • 測試題集、預期來源、可接受答案、拒答條件與錯誤案例
  • 每題檢索片段、引用來源、文件版本與實測結果
  • 低權限、停權、跨部門、惡意提示與查無資料測試紀錄
  • 查詢日誌、人工覆核紀錄與轉人工紀錄
  • 上線門檻、例外核准、回歸測試、知識庫更新與移交文件

怎麼用這份表

RAG 常見問題不是「回答不好聽」,而是它把不該看的資料拿來答、引用過期文件、查無資料卻硬回答,或讓使用者以為 AI 的答案就是正式結論。

所以驗收時要先問:

這套 RAG 的答案,能不能回到正確來源?使用者是不是有權看這份來源?來源更新後,答案會不會跟著更新?

先寫清楚驗收範圍

同一套 RAG 對不同使用者,風險可能完全不同。內部查公開 SOP、查客戶合約、查人事資料與對外回答法律問題,不能共用一張模糊的「準確率 90%」驗收單。

驗收前先固定這些條件:

  • 使用者與帳號角色:一般員工、主管、客服、外包、客戶或匿名訪客。
  • 可查資料:文件集合、資料所有人、版本、有效期間與排除範圍。
  • 可回答事項:可直接回答、只能摘要、必須附來源、必須轉人工或不得回答。
  • 技術版本:模型、embedding、檢索策略、切塊、重排序、提示詞與權限過濾版本。
  • 上線門檻:哪些指標必須通過、誰核准例外、什麼情況要停用或回退。

這些條件沒固定,今天的測試結果就無法代表明天換文件、換權限或換模型後的系統。

可複製欄位

為了在手機上也能直接選取與複製,下面改用直式欄位。每一組都要填完,不要把「未定」直接當成通過。

## 01 範圍:可回答事項
檢查:
- RAG 用在哪些情境?
- 哪些問題不能回答?
負責:
- 業主
- 知識管理
證據:
- 使用情境
- 不可回答清單
門檻:未定
實測:未測

## 02 範圍:例外處理
檢查:
- 查無資料時如何處理?
- 來源衝突時如何處理?
- 高風險問題如何處理?
負責:
- 業主
- 法務
證據:
- 拒答規則
- 提醒與轉人工規則
門檻:未定
實測:未測

## 03 資料:文件清單
檢查:
- 納入哪些文件?
- 來源與所有人能否追查?
- 版本與有效日期能否追查?
負責:
- 業主
- 資料負責人
證據:
- 文件清單
- 版本紀錄
門檻:未定
實測:未測

## 04 資料:權利與限制
檢查:
- 是否含個資或機密?
- 是否含營業秘密或合約?
- 是否含第三方著作?
負責:
- 法務
- 資安
- 業主
證據:
- 資料分級
- 授權與排除清單
門檻:未定
實測:未測

## 05 檢索:來源與版本
檢查:
- 每題是否找到正確來源?
- 是否找到正確版本?
負責:
- 廠商
- IT
證據:
- 預期來源
- 檢索片段
- 排序紀錄
門檻:未定
實測:未測

## 06 答案:引用支持
檢查:
- 引用是否真的支持答案?
- 是否只放連結卻沒有支持?
負責:
- 業主
- 廠商
證據:
- 逐題答案
- 引用與人工判讀
門檻:未定
實測:未測

## 07 答案:拒答與衝突
檢查:
- 查無資料時是否拒答?
- 來源衝突時是否說明?
負責:
- 業主
- 廠商
證據:
- 負向題
- 衝突題與實測結果
門檻:未定
實測:未測

## 08 權限:帳號阻擋
檢查:
- 低權限帳號是否被阻擋?
- 停權帳號是否被阻擋?
- 跨部門帳號是否被阻擋?
負責:
- IT
- 資安
- 廠商
證據:
- 帳號矩陣
- 權限測試紀錄
門檻:必須通過
實測:未測

## 09 安全:惡意提示
檢查:
- 能否誘出隱藏文件?
- 能否誘出提示詞?
- 能否誘出機敏資料?
負責:
- IT
- 資安
- 廠商
證據:
- 攻擊題集
- 日誌與阻擋結果
門檻:必須通過
實測:未測

## 10 維運:文件更新
檢查:
- 文件新增後多久更新?
- 文件刪除後多久移除?
- 文件改版後多久重建?
負責:
- IT
- 知識管理
證據:
- 更新流程
- 索引重建紀錄
- 回歸測試
門檻:未定
實測:未測

## 11 維運:品質抽查
檢查:
- 是否抽查錯誤答案?
- 是否整理熱門與無答案問題?
- 是否檢查異常查詢?
負責:
- 業主
- 廠商
證據:
- 抽查報告
- 改善單
門檻:未定
實測:未測

## 12 移交:文件與設定
檢查:
- 是否交付資料清單?
- 是否交付索引設定?
- 是否交付提示詞與測試集?
- 是否交付操作手冊?
負責:
- 廠商
- IT
證據:
- 移交清單
- 版本與保存位置
門檻:必須齊全
實測:未測

資料來源驗收

RAG 的資料來源要比一般聊天機器人更嚴格,因為它看起來像在「查公司資料」或「查官方文件」。

  • 文件來源:
  • 文件負責單位:
  • 文件版本:
  • 最後更新日期:
  • 是否可被 AI 檢索:
  • 是否含個資:
  • 是否含機密或營業秘密:
  • 是否含第三方著作或外部授權資料:
  • 是否需要排除:
  • 誰可以查:

引用與答案驗收

答案不只要像人話,還要能被追。

  • 是否顯示來源文件:
  • 是否顯示段落、章節或頁碼:
  • 是否顯示文件版本或日期:
  • 是否避免把來源沒有寫的內容補成結論:
  • 查無資料時是否明確說查不到:
  • 來源衝突時是否提醒使用者:
  • 是否保留原始查詢、檢索來源與答案:

驗收指標要分開,不要只寫一個準確率

至少把下面幾件事分開算,否則問題會被平均數蓋掉:

指標 在看什麼 常見誤判
檢索命中 是否找到預期文件與正確版本 找到同主題文件,不代表找到能回答該題的段落
引用支持 引用內容是否真的支持答案 有引用連結,不代表答案沒有補寫或扭曲
答案正確與完整 是否忠於來源並回答必要事項 文字流暢可能掩蓋漏答、過度推論或過期資訊
拒答正確 查無資料或不得回答時是否停止 全部回答看似方便,實際可能提高亂編與外洩風險
權限阻擋 不同帳號是否只能看到原本可看的資料 前端藏住連結,不代表檢索層沒有拿到文件
更新時效 文件改版、撤回或刪除後多久反映 重新建索引成功,不代表舊片段已從所有位置移除

門檻要由業主、資料所有人、IT、資安與需要時的法務共同設定。低風險內部 FAQ 和會影響員工、客戶權益或對外承諾的系統,不應共用同一門檻。

權限驗收

RAG 最危險的地方之一,是使用者透過 AI 查到自己原本不該看的文件。

  • 是否串接既有身分驗證:
  • 是否依部門、職務、專案或資料等級控權:
  • 是否測試低權限帳號:
  • 是否測試離職或停權帳號:
  • 是否避免共用高權限帳號:
  • 是否保留查詢者、時間、文件來源與答案紀錄:

測試題集

驗收測試題不要只放「標準答案題」,至少要混入這幾種:

題型 目的
標準答案題 看系統能不能找到正確文件
查無資料題 看系統會不會亂編
權限不足題 看使用者能不能越權查文件
過期文件題 看是否會引用舊版資料
來源衝突題 看是否能提醒來源不一致
模糊問題 看系統會不會先釐清問題
高風險問題 看是否轉人工或拒答
惡意提示題 看能否誘使系統越權、洩漏隱藏內容或忽略規則
改版回歸題 看文件、模型或檢索設定變更後,原本通過的功能是否退步

每一題至少保存:題目、測試帳號、預期來源、可接受答案、不得出現內容、預期拒答或轉人工條件、實際檢索片段、實際答案、人工判定與缺陷編號。只留下總分,日後很難重現問題。

上線前的四個停止條件

下面任一項未完成,就不應只靠平均分數放行:

  1. 低權限或停權帳號仍能取得不該看的文件或答案。
  2. 查無資料、來源衝突或高風險問題會穩定亂編,且沒有拒答或轉人工。
  3. 無法追到答案使用的文件、版本、檢索片段或系統設定。
  4. 文件刪除、權限變更或事故發生後,沒有更新、回退、停用與通知流程。

上線後維運

RAG 上線後,真正的工作才開始。文件會改、權限會變、熱門問題會變,錯誤答案也會被使用者慢慢問出來。

  • 文件更新週期:
  • 索引重建頻率:
  • 錯誤答案回報方式:
  • 熱門查詢檢查方式:
  • 無答案問題整理方式:
  • 權限複查週期:
  • 模型或檢索策略變更紀錄:
  • 重新驗收條件:

不要這樣驗收

不夠好的驗收 問題
回答看起來合理 可能沒有來源或來源錯誤
有引用來源就好 可能引用過期文件或越權文件
測 20 題都答對 題集可能太乾淨,沒有查無資料與陷阱題
之後文件再慢慢補 沒有版本與更新流程,答案會很快失真
權限用部門共用帳號 出事時查不到實際使用者

現在不能講太滿

台灣目前沒有一張由法律統一核定、適用所有 RAG 專案的驗收表。個資法官方頁明確標示 2025 年修正的部分條文尚未生效,不能把整批修正當成現行義務;資通安全管理法也不是不分產業適用所有民間公司。數發部手冊是公部門參考文件,NIST AI 600-1 是自願性風險管理 Profile,兩者都不是台灣企業的法定及格線。

這份表是 RAG 專案的實務檢查表。若系統涉及大量個資、醫療、金融、政府機敏資料、營業秘密、第三方著作、跨境服務,或會影響人的權益與對外承諾,驗收前應把法務、資安、資料所有人與目的事業主管規範一起納入。

讀完後通常還會問

01

RAG 驗收是不是看答案有沒有引用來源就好?

不夠。引用來源只是其中一項,還要看資料能不能合法使用、文件是否最新、使用者權限是否正確、答案是否忠於來源、查無資料時是否會亂編。

02

RAG 可以直接吃公司所有文件嗎?

不建議。要先做資料分級、權限盤點與排除清單。尤其是個資、營業秘密、合約、未公開財務、人事資料或原始碼,不應直接丟進一般知識庫。

03

RAG 測試題要怎麼準備?

至少要包含標準問題、模糊問題、查無資料問題、跨文件問題、權限不足問題、過期文件問題與容易誤導的陷阱問題。

04

RAG 準確率要到多少才能上線?

沒有一個適合所有公司的固定百分比。應先按使用情境拆成檢索命中、引用支持、答案正確、拒答正確、權限阻擋與更新時效,再依錯誤後果設定門檻;涉及人事、醫療、金融、法律或對外承諾時,還要加人工覆核與停用條件。

05

數發部手冊或 NIST Profile 是 RAG 的強制驗收標準嗎?

不是。數發部頁面把公部門人工智慧應用參考手冊定位為供機關參考運用;NIST AI 600-1 是自願性 GenAI 風險管理 Profile。兩者可補測試與治理方法,但不能寫成所有台灣 RAG 專案的法定及格標準。

回到官方原始頁面

6 筆來源
  1. 01個人資料保護法全國法規資料庫 / 查證 2026-09-03開啟
  2. 02資通安全管理法全國法規資料庫 / 查證 2026-09-03開啟
  3. 03營業秘密法全國法規資料庫 / 查證 2026-09-03開啟
  4. 04著作權法全國法規資料庫 / 查證 2026-09-03開啟
  5. 05公部門人工智慧應用參考手冊數位發展部 / 查證 2026-09-03開啟
  6. 06NIST AI 600-1 Generative Artificial Intelligence ProfileNational Institute of Standards and Technology / 查證 2026-09-03開啟