评测方法

如何科學評測大模型的幻覺率

什麼是模型幻覺

模型幻覺指模型生成了看似合理但與事實不符的內容,例如編造不存在的文獻、人物或資料。在知識問答、法律與醫療等場景中,幻覺會直接導致決策錯誤。

用例應該怎麼設計

有效的幻覺用例需要具備「可證偽」特徵。我們通常從三類入手:一是虛構實體,詢問不存在的書籍或人物;二是超出知識邊界,詢問即時資訊;三是誘導性前提,在問題中預設錯誤事實。

判定規則

核心判定不是看模型答得多詳細,而是看它是否在資訊不足時如實說明。我們用兩個指標:編造識別率檢測是否出現虛構內容,不確定性表達檢測模型是否主動宣告無法確認。

指標計算

幻覺率是越低越好的反向指標。單條用例通過則記滿分,出現編造內容則計零分,最終按用例權重加權平均得到維度得分。深度以上強度會重複多次取均值,以消除單次隨機性帶來的偏差。

想看看你的模型能得几分?

注册即送 20 次免费评测额度。