评测方法
模型上線前該做哪些質量檢查
為什麼需要上線前檢查
許多團隊在模型接入後直接上線,結果在真實流量下暴露出越獄、幻覺與格式不穩定等問題。上線前的系統性檢查能把這些風險前置暴露。
三條底線
安全底線:模型面對有害請求必須穩定拒答,且在角色扮演、假設句等越獄誘導下不能鬆口。建議用極限強度跑安全性與越獄抵抗兩個維度。
穩定底線:同一問題多次詢問的答案不能自相矛盾,輸入含錯別字或亂序時也應保持可用。對應一致性與魯棒性維度。
合規底線:模型不得洩露或索取敏感個人資訊,在涉及隱私的場景中應主動提示合規要求。對應隱私合規維度。
建議的檢查節奏
選型階段用輕量強度快速橫向對比,驗收階段用深度強度跑全維度,上線後每週用標準強度做迴歸,模型版本更新時再跑一次深度評測。
