评测方法 · 选型

新模型出来了,怎么判断值不值得换

公开跑分回答的是"它在标准题上表现如何",而你想知道的是"它在我的代码库上表现如何"。这两个问题的答案经常不一样。

#Ornith-1.5#模型评估#选型方法#自建评测

四条原则

自建

用你自己的任务

从你近期真实处理过的任务里抽 20 条,比任何公开榜单都更能预测它对你的价值。

同题

同一批题跑所有候选

不同模型用不同题目对比,得出的结论没有意义。题目必须固定。

盲评

看结果时别看名字

知道哪个输出来自哪个模型,会显著影响你的判断。把名字遮住再打分。

重复

一次结果不算数

同一道题跑三次。如果三次结果差异很大,那"它更强"这个结论本身就不稳。

为什么公开跑分帮不上忙

公开基准测试解决的是可比性问题:一批固定题目、固定评分方式,让不同模型能放在同一个坐标里。这对研究有价值,但对选型帮助有限,原因有三:题目通常与你的代码库和领域无关;评分方式未必对应你在意的质量维度;而且模型在广泛使用后,基准题目泄漏进训练数据的可能性会随时间上升。换句话说,跑分高不能推出"对你更好用"。

关于新模型发布

新模型发布后的头几天,公开评价往往波动很大:早期使用者的样本小、任务分布偏斜,而且发布期的容量紧张会让人把速度问题误判成质量问题。如果不是急着换,等一两周再评估,你会拿到稳定得多的信息。

评估步骤

准备

抽 20 条真实任务并固定下来。这一步的质量决定整个评估的价值。

执行

所有候选跑同一批题,每题三次,记录成本与耗时。

判读

遮名盲评,按你在意的维度打分,再把成本放回来一起看。

榜单用来缩小范围,自评用来做决定

本页能确认的

自建评测的方法论是通用的,与具体是哪个模型无关:固定题目、同题对比、遮名盲评、重复取样、成本一并记录。这几条对任何一次模型选型都成立。

本页不写的

我们没有对 Ornith-1.5 做过系统评测,因此本页不给任何跑分数字、排行位次或"强于某模型"式的结论。这类数字在转述中极易失真,而选型是要花钱和时间的决定,不该建立在没验证过的数字上。

两种选型依据

看公开榜单

成本为零,能快速缩小候选范围。但它回答不了"对我的活好不好用",也容易受发布期噪声影响。

自建小规模评测

两小时左右可完成,结论直接对应你的场景,还能复用于下一次选型。代价是要先花时间整理题目。

一套两小时能跑完的自评估

第一步,从你最近两周真实处理过的任务里抽 20 条,覆盖你日常的分布——不要只挑难题,日常任务占比更高。第二步,把这 20 条固定下来,所有候选模型跑同一批。第三步,输出去掉模型名后打分,评分维度用你真正在意的那几个,比如是否需要返工、是否改坏了别处、是否读懂了上下文。第四步,每题跑三次,看稳定性。第五步,把成本一起记下来——质量相近时,成本和速度就是决定因素。

QCode 目前是否提供 Ornith-1.5

明确说清楚:QCode 目前不提供 Ornith-1.5。我们提供的是 Claude、GPT/Codex、Gemini、GLM、Kimi、DeepSeek、Qwen 七大家族,一把密钥通用。如果你想评估的正是 Ornith-1.5,需要走它自己的官方渠道;本页给出的方法同样适用。如果你评估后决定留在上述家族里,我们能提供的是按每日固定额度计费、成本可预期的接入方式。

常见问题

QCode 能用 Ornith-1.5 吗?

目前不能。QCode 提供 Claude、GPT/Codex、Gemini、GLM、Kimi、DeepSeek、Qwen 七大家族,不含 Ornith-1.5。

为什么这页不给跑分?

因为我们没有自己跑过。给出未经验证的数字,对做选型决定的人是有害的——那是要花钱和时间的决定。

20 条任务够吗?

对个人选型通常够用,前提是这 20 条真实反映你的日常分布。如果结论在几个候选之间非常接近,可以扩到 50 条再看。

为什么要遮住模型名字?

因为知道来源会显著影响打分。对新发布的模型尤其明显,期待本身就会让人给出更高的分数。

每题跑三次是不是太浪费?

这一步恰恰是最省的。如果三次结果差异很大,说明"它更强"这个结论不稳定,据此做的迁移决定会更贵。

评估下来发现现有模型够用怎么办?

那就是一个有价值的结论。选型评估的常见产出不是"该换",而是"不用换"——这同样为你省下了迁移成本。

信息来源

模型能力与可用性以其发布方的官方说明为准。本页只提供评估方法,不复述第三方的评测数值。

评估完了,想要成本可预期的接入

一把密钥覆盖七大模型家族,按每日固定额度计费。

相关阅读

第三方模型的能力与可用性以其发布方官方说明为准。本页不提供跑分数值,仅提供可自行执行的评估方法。QCode 当前提供的模型家族以站内模型页为准。