怎么判断好坏
排行榜不是唯一真相;要看任务是否匹配、会不会胡说、安不安全。
基准(Benchmark)与公开榜
- 公开榜方便横向对比,但可能被针对性优化;更好的办法是用你自己的 20–50 条真实任务做小评测集。
- 下面三个入口常被引用——点进官网看方法与局限,不要只记一个分数。
幻觉与人工抽检 checklist
- □ 关键事实(人名、数字、日期、法规条文)是否可在原文/官网核对?
- □ 引用的论文/链接是否真实存在?DOI / URL 能否打开?
- □ 是否要求模型「只根据给定材料回答」,并标出不确定处?
- □ 同一问题问两遍,结论是否大幅摇摆?
- □ 高风险领域(医疗/法律/财经)是否有人终审与免责声明?
- □ 密钥与隐私数据是否从未进入公有模型对话?
安全与产品体感
- 别把密钥、隐私数据、未授权客户资料贴进公有模型。
- 准不准、稳不稳、快不快/贵不贵(计价以官网为准)——三项分开记,别被 Demo 带跑。