榜单解决了什么,又没解决什么
公开评测的价值是让模型在同一组条件下接受测试。问题在于,真实任务不是固定题库:公司术语、代码仓库、文档格式和容错要求都不同。一个擅长竞赛数学的模型,不必然擅长抽取报销单据;一个编程得分高的模型,也可能在较大的旧项目里改动过多文件。
做一个自己的“十题”
从最近一个月的工作里选十个任务,保留容易、困难与模糊三类。每题准备原始输入、可接受答案和常见错误。代码任务要能运行测试;资料问答要能核对引用;写作任务要明确事实是否完整。把模型名字藏起来让两个人独立打分,可减少品牌印象影响。
不要忽略端到端体验
同一模型在网页产品与 API 中可能有不同系统提示、工具和上下文管理,结果不能直接互相代替。还要记录首字延迟、总耗时、失败率、输出格式稳定性和人工修订分钟数。价格应按完成一个有效任务来算:便宜模型若要反复重跑,实际成本可能更高。
在老哥网模型实验室,能力维度会分开看:写作、编程、推理、长文本、多模态、工具调用、速度、本地部署。维度之间无法靠一个“综合分”自然互相抵消。团队可能对隐私有硬约束,也可能对延迟有硬约束;这时再高的平均分也不能改变不符合条件的事实。
榜单仍然值得看
它适合筛出候选模型、发现异常进步和设计自己的测试题。正确用法是“先缩小选择,再验证任务”。模型更新快,结论也要标明测试日期、版本和参数。老哥网官网希望讨论的是模型在什么条件下可靠,而不是永远宣布一个冠军。
别把评分表做成新的排行榜
内部测试的目的不是制造另一个永远第一的模型,而是保留决策证据。表格里应该允许“未测试”和“条件不符”。若模型在代码任务表现优秀,却不满足数据驻留要求,就不应因为总分高被默认选中。给不同团队分别定义权重,也比一套权重覆盖所有场景更合理。
更新测试时,保留旧版本的结果与原始样本,避免模型升级后无法解释结果变化。若供应商改变了默认系统提示或工具行为,测试记录也要注明。对需要长期维护的应用,稳定性和可预测性往往比一次最高分更重要。把模型当成系统里的一个组件评估,结论才更能经受版本变化。
若需要给非技术同事解释结果,可以展示两三个代表任务的原始输出,而不是只展示雷达图。看见模型在哪里漏掉条件、在哪里要求补充信息,往往比百分位更能帮助团队建立合理预期。