在训练 27B 大模型的过程中,上海原点星辉科技有限公司(StartLux)展示了一个惊人的数据:约 70% 的研发工作可以完全交给 AI 完成。在其本地 Agent 模型 StartLux-V1.0-27B-Preview 的后训练阶段,AI 不仅负责生成或筛选数据,还能自主提出实验假设、启动训练、进行评估分析,并根据结果决定下一轮的实验方向。人类研究员的角色被精简为对研究方向和关键取舍的把控。
这套方法训练出的模型成绩单十分亮眼。根据中国信通院发布的可信 AI 大模型基准测试 MCP 专项报告,StartLux-V1.0-27B-Preview 综合性能排名第二,综合得分 39.25。这一成绩超越了参数量达 284B 的 DeepSeek-V4-Flash-0731 和 198B 的 Step-3.7-Flash。在同参数规模下,其得分比 Qwen-3.6-27B 高出 5.34 个百分点,成为参测 27B 模型中的最优者,仅次于参数量高达 1.6T 的 DeepSeek-V4-Pro。在位置导航、浏览器自动化及金融分析等单项任务上,该模型更是包揽或并列第一,这意味着其 Agent 能力已进入万亿参数模型所代表的能力区间。
这套被称为“Auto Research”的方法,正指向全球 AI 研发的前沿方向——RSI(递归式自我改进)。StartLux 联合创始人兼 CTO 郭权玮解释道,真正的 Auto Research 不是简单的批量生成合成数据或搜索超参数,而是让 AI 形成从“假设—实验—验证—新假设”的闭环。例如在金融分析中,面对数据不一致的失败,Auto Research 会自动归纳问题并补充“回查原始数据—确认条件—再计算”的流程,而非凭空发明算法。
目前,传统研发路径正面临数据、算力及高水平人才稀缺的瓶颈。全球头部实验室如 OpenAI 和 Anthropic 已开始探索这一领域:OpenAI 内部已形成“自动化研究实习生”体系,人类研究日与 AI Agent 工作日之比约为 1:3.1;Anthropic 则称 Claude 编写了公司 80% 以上的生产代码。资本方面,Recursive Superintelligence 已完成 6.5 亿美元融资,Mirendil 获得种子轮 2 亿美元,谷歌资深专家 Jeff Dean 也离职创办了 Discovery Loop,聚焦让 AI 参与完整实验循环。
然而,目前行业尚未出现完整的 RSI,仍处于“弱 RSI”阶段。如何防止模型“自己出题、自己答题、自己阅卷”是当前难题。对此,StartLux 采取了“给流程装刹车”的策略:一旦模型出现钻评分漏洞或能力单一化倾向,研究员将立即介入。StartLux 认为,其核心竞争力在于围绕真实任务构建的数据、流程和评估体系,而非单一模型版本。未来,公司计划通过新架构、算法及本地参数更新机制,让模型具备在本地持续自我进化的能力,预计年内推出第一代本地智能解决方案。
