P? alt=)
如何用 OpenCompass 一致性評測檢驗?zāi)P汀久赓M下載鏈接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100 datasets.項目地址: https://gitcode.com/gh_mirrors/op/opencompassOpenCompass 是開源大模型評測平臺它的一致性評測功能把選擇題按打亂選項的順序重新測一遍能識別出模型偏愛 A/B 選項蒙對答案的情況幫你驗證評測分?jǐn)?shù)是否真實穩(wěn)定。新手跟著下面的步驟用現(xiàn)成示例就能完成第一次模型穩(wěn)定性檢驗。做模型一致性評測時的常見痛點 一道題換種選項順序模型答案跟著變——分?jǐn)?shù)看著高其實是選項字母偏好結(jié)論不可用 兩次跑分結(jié)果不一樣你無法判斷模型是真理解還是蒙對的?? 多模型對比時高分模型輸出波動反而最大單一 accuracy 數(shù)字暴露不了這個問題最短上手路徑三步完成第一次一致性評測獲取項目并裝依賴git clone https://gitcode.com/gh_mirrors/op/opencompass cd opencompass pip install -r requirements.txt改一處配置直接復(fù)用官方示例 examples/eval_circular.py它已把 MMLU、C-Eval 等 9 個選擇題數(shù)據(jù)集換成了循環(huán)評測版本只需把其中的模型配置換成你手上的模型即可。運(yùn)行看結(jié)果python run.py examples/eval_circular.py跑完后匯總報告會多出acc_origin和perf_circular兩列兩列差值就是模型選項偏好的直觀證據(jù)。OpenCompass 一致性評測的核心能力拆解循環(huán)評測一道題變四道題把一道題按選項順序增廣成 4 道變體題全部答對才算對蒙對和偏好的水分會被擠掉。做法是讓數(shù)據(jù)集類帶上CircularDatasetMeta元類自動生成選項模式circular是 4 次輪換all_possible是 24 種全排列評測器換成CircularEvaluator。實現(xiàn)見 opencompass/datasets/circular.py。攻擊評測看輸入擾動下的分?jǐn)?shù)變化自動對題目做同義詞級別擾動量化模型判斷在輕微改動下改變多少。做法是把任務(wù)設(shè)為OpenICLAttackTask指定攻擊方式示例用 textfooler和查詢預(yù)算。示例見 examples/eval_attack.py。匯總報表一眼看出偏好程度報告把a(bǔ)cc_origin單次答題正確率和perf_circular所有順序都答對才計對并排展示差距越大說明選項偏好越明顯。用CircularSummarizer并通過metric_types選擇展示哪些指標(biāo)即可實現(xiàn)位于opencompass/summarizers/circular.py。一致性評測組合怎么選三種典型配置對比場景推薦配置適合人群注意事項快速穩(wěn)定性檢查circular模式 acc_origin/perf_circular新手、小規(guī)模抽檢推理量增至 4 倍注意計算資源嚴(yán)格全排列評測all_possible模式發(fā)論文、做嚴(yán)格對比推理量增至 24 倍只建議小樣本題目輸入魯棒性O(shè)penICLAttackTask textfooler紅隊測試、魯棒性檢查用NaivePartitioner整數(shù)據(jù)集一次跑完跑一致性評測的常見疑問? 問循環(huán)評測分?jǐn)?shù)為什么比常規(guī)分?jǐn)?shù)低 答判對更嚴(yán)4 種順序全對才計分差距大說明模型有選項偏好不是能力下降。? 問示例里的模型我本地沒有怎么辦 答示例預(yù)置了 Qwen、InternLM 等開源模型把配置里的模型換成你已有的即可。? 問指標(biāo)口徑細(xì)節(jié)在哪查 答見 循環(huán)評測文檔逐項說明 acc、perf、more_num 的差別。兩列指標(biāo)的差值能告訴你模型成色更多評測組合請看docs/zh_cn/advanced_guides/與examples/目錄?!久赓M下載鏈接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models (Llama3, Mistral, InternLM2,GPT-4,LLaMa2, Qwen,GLM, Claude, etc) over 100 datasets.項目地址: https://gitcode.com/gh_mirrors/op/opencompass創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考