新模型出来了,怎么判断值不值得换
公开跑分回答的是"它在标准题上表现如何",而你想知道的是"它在我的代码库上表现如何"。这两个问题的答案经常不一样。
四条原则
用你自己的任务
从你近期真实处理过的任务里抽 20 条,比任何公开榜单都更能预测它对你的价值。
同一批题跑所有候选
不同模型用不同题目对比,得出的结论没有意义。题目必须固定。
看结果时别看名字
知道哪个输出来自哪个模型,会显著影响你的判断。把名字遮住再打分。
一次结果不算数
同一道题跑三次。如果三次结果差异很大,那"它更强"这个结论本身就不稳。
为什么公开跑分帮不上忙
公开基准测试解决的是可比性问题:一批固定题目、固定评分方式,让不同模型能放在同一个坐标里。这对研究有价值,但对选型帮助有限,原因有三:题目通常与你的代码库和领域无关;评分方式未必对应你在意的质量维度;而且模型在广泛使用后,基准题目泄漏进训练数据的可能性会随时间上升。换句话说,跑分高不能推出"对你更好用"。
关于新模型发布
新模型发布后的头几天,公开评价往往波动很大:早期使用者的样本小、任务分布偏斜,而且发布期的容量紧张会让人把速度问题误判成质量问题。如果不是急着换,等一两周再评估,你会拿到稳定得多的信息。
评估步骤
抽 20 条真实任务并固定下来。这一步的质量决定整个评估的价值。
所有候选跑同一批题,每题三次,记录成本与耗时。
遮名盲评,按你在意的维度打分,再把成本放回来一起看。
榜单用来缩小范围,自评用来做决定
本页能确认的
自建评测的方法论是通用的,与具体是哪个模型无关:固定题目、同题对比、遮名盲评、重复取样、成本一并记录。这几条对任何一次模型选型都成立。
本页不写的
我们没有对 Ornith-1.5 做过系统评测,因此本页不给任何跑分数字、排行位次或"强于某模型"式的结论。这类数字在转述中极易失真,而选型是要花钱和时间的决定,不该建立在没验证过的数字上。
两种选型依据
看公开榜单
成本为零,能快速缩小候选范围。但它回答不了"对我的活好不好用",也容易受发布期噪声影响。
自建小规模评测
两小时左右可完成,结论直接对应你的场景,还能复用于下一次选型。代价是要先花时间整理题目。
一套两小时能跑完的自评估
第一步,从你最近两周真实处理过的任务里抽 20 条,覆盖你日常的分布——不要只挑难题,日常任务占比更高。第二步,把这 20 条固定下来,所有候选模型跑同一批。第三步,输出去掉模型名后打分,评分维度用你真正在意的那几个,比如是否需要返工、是否改坏了别处、是否读懂了上下文。第四步,每题跑三次,看稳定性。第五步,把成本一起记下来——质量相近时,成本和速度就是决定因素。
QCode 目前是否提供 Ornith-1.5
明确说清楚:QCode 目前不提供 Ornith-1.5。我们提供的是 Claude、GPT/Codex、Gemini、GLM、Kimi、DeepSeek、Qwen 七大家族,一把密钥通用。如果你想评估的正是 Ornith-1.5,需要走它自己的官方渠道;本页给出的方法同样适用。如果你评估后决定留在上述家族里,我们能提供的是按每日固定额度计费、成本可预期的接入方式。
常见问题
QCode 能用 Ornith-1.5 吗?
目前不能。QCode 提供 Claude、GPT/Codex、Gemini、GLM、Kimi、DeepSeek、Qwen 七大家族,不含 Ornith-1.5。
为什么这页不给跑分?
因为我们没有自己跑过。给出未经验证的数字,对做选型决定的人是有害的——那是要花钱和时间的决定。
20 条任务够吗?
对个人选型通常够用,前提是这 20 条真实反映你的日常分布。如果结论在几个候选之间非常接近,可以扩到 50 条再看。
为什么要遮住模型名字?
因为知道来源会显著影响打分。对新发布的模型尤其明显,期待本身就会让人给出更高的分数。
每题跑三次是不是太浪费?
这一步恰恰是最省的。如果三次结果差异很大,说明"它更强"这个结论不稳定,据此做的迁移决定会更贵。
评估下来发现现有模型够用怎么办?
那就是一个有价值的结论。选型评估的常见产出不是"该换",而是"不用换"——这同样为你省下了迁移成本。
信息来源
模型能力与可用性以其发布方的官方说明为准。本页只提供评估方法,不复述第三方的评测数值。
相关阅读
第三方模型的能力与可用性以其发布方官方说明为准。本页不提供跑分数值,仅提供可自行执行的评估方法。QCode 当前提供的模型家族以站内模型页为准。