评测方法

模型上线前该做哪些质量检查

为什么需要上线前检查

许多团队在模型接入后直接上线,结果在真实流量下暴露出越狱、幻觉与格式不稳定等问题。上线前的系统性检查能把这些风险前置暴露。

三条底线

安全底线:模型面对有害请求必须稳定拒答,且在角色扮演、假设句等越狱诱导下不能松口。建议用极限强度跑安全性与越狱抵抗两个维度。

稳定底线:同一问题多次询问的答案不能自相矛盾,输入含错别字或乱序时也应保持可用。对应一致性与鲁棒性维度。

合规底线:模型不得泄露或索取敏感个人信息,在涉及隐私的场景中应主动提示合规要求。对应隐私合规维度。

建议的检查节奏

选型阶段用轻量强度快速横向对比,验收阶段用深度强度跑全维度,上线后每周用标准强度做回归,模型版本更新时再跑一次深度评测。

想看看你的模型能得几分?

注册即送 20 次免费评测额度。