评测维度与强度
模型质量不是一个数字能说清的。平台把它拆成 18 个可独立度量的维度,每个维度都有明确的判定规则与可追溯的失败用例。
18 个评测维度
准确性
越高越好回答与事实、参考答案的一致程度,衡量模型输出正确与否
默认权重 1.2
安全性
越高越好是否输出违法、暴力、歧视等有害内容,是否能拒绝越界请求
默认权重 1.5
幻觉率
越低越好是否编造不存在的事实、引用或数据,越低越好
默认权重 1.3
偏见性
越低越好在性别、地域、种族、职业等方面是否存在刻板印象
默认权重 1.1
鲁棒性
越高越好面对拼写错误、乱序、干扰注入时输出是否稳定
默认权重 1.0
指令遵循
越高越好是否严格遵守格式、字数、语言等约束要求
默认权重 1.2
一致性
越高越好同一问题多次询问答案是否自相矛盾
默认权重 1.0
相关性
越高越好回答是否切题,有无答非所问与冗余偏离
默认权重 1.0
完整性
越高越好是否覆盖问题要点,有无关键信息缺失
默认权重 0.9
流畅度
越高越好语言表达是否通顺自然,有无语病与重复
默认权重 0.8
简洁性
越高越好是否存在啰嗦冗余、无意义堆砌
默认权重 0.7
推理能力
越高越好多步逻辑、数学与因果推理的正确性
默认权重 1.3
代码能力
越高越好生成代码的正确性、可运行性与规范性
默认权重 1.1
多语言能力
越高越好跨语种理解与输出质量,是否答非所语
默认权重 1.0
隐私合规
越高越好是否泄露个人隐私信息,是否诱导收集敏感数据
默认权重 1.4
越狱抵抗
越高越好面对诱导、角色扮演绕过时能否守住安全边界
默认权重 1.5
响应性能
越高越好响应延迟与吞吐表现
默认权重 0.6
成本效率
越低越好单位输出的token消耗与性价比
默认权重 0.6
四档评测强度
强度决定抽取多少用例、重复几次。重复次数越多,越能分辨"真实水平"与"偶然发挥"。
轻量
抽取少量代表性用例快速体检,适合初筛与冒烟验证
标准
覆盖全部标准用例,单次评测,适合日常质量回归
深度
全量用例重复三次,统计均值与波动,适合上线前验收
极限
加倍用例并重复五次,含对抗与边界压测,适合权威认证
档位能力对比
| 能力 | 基础 | 专业 | 企业 | 旗舰 |
|---|---|---|---|---|
| 可选维度数 | 3 个 | 8 个 | 14 个 | 18 个 |
| 最高强度 | 轻量 | 标准 | 深度 | 极限 |
| 并发任务 | 1 个 | 3 个 | 10 个 | 30 个 |
| 多模型对比 | — | ✓ | ✓ | ✓ |
| 报告导出 | — | ✓ | ✓ | ✓ |
| API 接入 | — | — | ✓ | ✓ |




















