官方原话与自家指标 · 2026-09-29 核对

递归自我改进(RSI)是什么:Anthropic 的定义、它自己测到的数字,以及 2026 年 9 月各家的官方口径

Anthropic 把 RSI 定义为模型完全自主地构建它的继任者,并在测量页写明截至 2026 年 8 月没有任何被测量子集完全自主;OpenAI 于 2026-09-06 称已达成「自动化研究实习生」目标,下一节点是 2028 年 3 月的自动化研究员;Sakana AI 官宣设立 RSI Lab,Schmidhuber 于 2026-09-24 加入。所有数字都是厂商自家统计,本页逐条标出处与核对日。

更新于 2026-09-29

#递归自我改进#RSI#Anthropic 26%#OpenAI 2028

官方自述里的四个数

26%

Claude 主导份额

Anthropic 自家指标:26% 的 AI 研发工作由 Claude「主导」(截至 2026 年 8 月,自测)。

90%+

协作级及以上

同页原句:"The share of work at or above “AI collaborates” is above 90%"(处于或高于「AI 协作」档的工作份额超过 90%),同一数据窗。

8x

代码量对比

Anthropic 自述工程师人均每季度合入的代码为 2021-2025 年的 8 倍(厂商自述)。

2028-03

OpenAI 下一目标

OpenAI 称正强劲推进 2028 年 3 月的自动化研究员 —— 这是目标日,不是达成日。

RSI 到底指什么

Anthropic 官网的原句是 "recursive self improvement (a model fully autonomously building its successor)",意思是模型完全自主地构建它的继任者。按这个口径,人类还在监督、AI 只是主导部分环节都还不算。争议在定义本身:据 AP 2026-09-19 报道,有的公司把 AI 对模型改进有任何反馈就算 RSI,有的要求完全自主 —— 先确认口径,再看任何「已实现」的说法。

2026 年 9 月各家说了什么

Anthropic(数据截至 2026 年 8 月):Claude 主导其 AI 研发工作的 26%,90% 以上在「AI 协作」及以上档位,没有任何被测量子集完全自主。OpenAI(2026-09-06):称已达成「自动化研究实习生」目标,指向 2028 年 3 月的自动化研究员。Sakana AI:官宣设立 RSI Lab,Schmidhuber 于 2026-09-24 以首席科学顾问加入。

官方口径时间线

2026-08

Anthropic 测量页的数据窗(截至本月,页内未印发布日期):Claude 主导 26% 的 AI 研发,90% 以上达协作级及以上,无任何完全自主子集。

2026-09-06

OpenAI 同日发两篇官方文章:称已达成「自动化研究实习生」目标、强劲推进 2028 年 3 月自动化研究员;首席科学家 Pachocki 撰文《An Alien Mind》,预期这一速度可能延续到 RSI,也担忧没人准备好其后果。

2026-09-24

Sakana AI 官宣 Jürgen Schmidhuber 以首席科学顾问身份加入(与现职兼任),并将参与其 Recursive Self-Improvement (RSI) Lab。

已确认 vs 未证实

已确认(官方原句,可逐字核对)

已确认:Anthropic 官网给出 RSI 定义,并在测量页写下原句 "Claude is not operating fully autonomously for any measured subset of AI R&D work"(时间点为 2026 年 8 月);OpenAI 于 2026-09-06 官方称已达成自动化研究实习生目标,下一节点是 2028 年 3 月;Sakana 官方页官宣设立 RSI Lab(未印成立日),Schmidhuber 于 2026-09-24 加入并参与该实验室。

未证实 / 官方没说过

未证实:「RSI 已经实现」「AI 已能自己造下一代」—— 这类说法目前只以传闻形式流传,没有任何官方声明支持,Anthropic 的口径恰好相反;「2028 年 3 月的自动化研究员就是 RSI」是推测,OpenAI 原话只到 "strong progress";Sakana RSI Lab 的成立日官方页没有印,本页不猜。X 上的个人警告帖不采信、不收录。

两套定义,两种「进展」

严格口径:完全自主

按 Anthropic 的定义(模型完全自主地构建继任者),其官方测量的结论是没有任何被测量子集完全自主 —— 26% 是「主导」,不是「自主」。

宽口径:任何反馈

据 AP 2026-09-19 报道,另一类口径把 AI 对模型改进的任何反馈都算 RSI —— 按它「已实现」的说法满天飞。同一个词,两套真话。

这些数字还不是审计结果

Anthropic 在测量文里的原句是 "we should do everything possible to minimize the gap between what frontier labs know and what the public knows" —— 它自己点明实验室知道的与公众知道的之间有差距,并主张把这个差距缩到最小。OpenAI 的首席科学家也把自己的判断写成 "Based on internal results"(基于内部结果)。两边的百分比与倍数都是各家自己测、自己发布,截至 2026-09-29 没有任何一项通过第三方审计。

在 QCode 上

本页不对任何「自我改进系统」作可用性承诺 —— 没有任何厂商公布过这样的产品,没有型号 ID,也没有定价。与这场讨论直接相关的现实是:实验室自己就是编码代理的重度用户,而驱动它们的同款前沿型号截至 2026-09-29 在 QCode 可调:claude-opus-5-5 与 gpt-6-sol。

RSI 常见问题

递归自我改进是什么意思?

最严的官方定义来自 Anthropic:模型完全自主地构建它的继任者。宽的口径(据 AP 2026-09-19 报道)把任何 AI 对模型改进的反馈也算进去 —— 两个口径下的「进展」不是一回事,先看定义再看结论。

RSI 已经实现了吗?

没有任何官方这样宣布。Anthropic 在测量页写下原句 "Claude is not operating fully autonomously for any measured subset of AI R&D work"(截至 2026 年 8 月);据 CNBC 2026-09-11 报道,OpenAI 与 Anthropic 近月都说自主改进快于预期 —— 但「快于预期」不等于「已经做到」。

Anthropic 的 26% 指什么?

是 Anthropic 自家测量里 AL4「主导」档的份额,那一页的原句是 "In AL4, AI “leads”: it can complete most of the task end-to-end from a high-level prompt, while the human supervises."(能从高层指令端到端完成大部分任务,人类在旁监督)。数字出自 Anthropic 自家测量,截至 2026-09-29 未经第三方审计。

OpenAI 说到哪一步了?

官方 2026-09-06 称已达成「自动化研究实习生」目标:系统能在人类指令下完成定义清晰、需熟练研究员数天的任务;对 2028 年 3 月的自动化研究员只说「强劲推进」。首席科学家 Pachocki 同文判断 RSI 将位于未来科学发现的最核心 —— 均出自 OpenAI 自己的文章,未见第三方核验。

Sakana 的 RSI Lab 是哪天成立的?

官方页只写了「今天宣布正式设立 Sakana AI RSI Lab」,没有印成立日期,本页不猜。能确认的是 2026-09-24 的公告:Schmidhuber 以首席科学顾问身份加入 Sakana AI 并参与该实验室(与现职兼任)。

这跟开发者今天有什么关系?

实验室自己先成了重度用户:OpenAI 称截至 2026 年 8 月中旬,其研究组织每一个人类工作日对应 3.1 个智能体工作日;Anthropic 给的是研发工作的自动化份额 —— 26% 在「主导」档、90% 以上在「协作」档及以上,同样是自己测自己报。同款玩法今天就能在你的编码代理里复现。

来源与核对日

Anthropic 官网:研发自动化测量文(数据截至 2026 年 8 月)与同站谈自我改进的另一篇(8 倍自述出自后者);OpenAI 官方博客 2026-09-06 两篇(Wayback 存档);Sakana AI 官方 RSI Lab 页与 2026-09-24 公告;据 CNBC 2026-09-11 与 AP 稿(Fortune、ABC 刊发)2026-09-19 报道;价格与默认模型核于 Anthropic 价表、OpenAI 模型文档与 Claude Code 变更日志,均核于 2026-09-29。

把实验室在用的前沿型号接进你的编码代理

截至 2026-09-29:claude-opus-5-5($4 / $20)与 gpt-6-sol($2 / $10)均可在 QCode 用一把 key 调用,Claude Code 与 Codex 直接换用。

相关阅读

本页分三档写:官方原话(带日期)、媒体报道(标出处)、未证实(只列不采)。26%、90%、8x、3.1 均为厂商自家统计,未经第三方审计;厂商自述的速度与成本不代表你的实际负载。「QCode 可调」仅指 claude-opus-5-5、gpt-6-sol 等现行型号 ID,不构成任何自我改进能力的承诺。

先体验,再决定

不确定选哪档?先买体验版(¥60/月),满意再升级,旧套餐剩余价值按比例退回余额。