怎么判断好坏

排行榜不是唯一真相;要看任务是否匹配、会不会胡说、安不安全。

基准(Benchmark)与公开榜

偏好榜

LMSYS Chatbot Arena (lmarena.ai)

人类盲测偏好对战排行:两模型匿名回答,用户投票。

适合:想看「真人更爱用哪个」而不是死记硬考题
原 LMSYS Arena;榜单会变,以官网当前为准。
整体评测

HELM (Stanford CRFM)

Holistic Evaluation of Language Models:多场景、多指标的整体评测框架。

适合:研究者与要严肃对比模型能力的人
经典基准

MMLU

Massive Multitask Language Understanding:多学科选择问答基准(经典参考)。

适合:看通用知识/考试型能力的粗指标
实现与污染问题多,分数勿神化;以论文/仓库说明为准。

幻觉与人工抽检 checklist

安全与产品体感