过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?

针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、“AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到8K时间步,相当于5分钟的“肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟

论文链接:https://arxiv.org/abs/2607.15275

这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时“自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。

研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:“很快,即使是 100 万上下文,也不再是幻想。”

面向机器人策略的长上下文建模

RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。

图|RoboTTT 的模型架构、训练和推理。

RoboTTT 主要包含三项设计,如下:

1.模型架构:RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度处理跨时间信息。为提高效率,模型不直接将所有视觉-语言 token 输入 TTT 中,而是使用少量 register token 在时间上传递视觉-语言信息。为保留预训练能力,TTT 输出经 Tanh Gating 后再加入注意力输出。

图|带有 Tanh Gating 的计算流程。

2.序列训练:为扩展训练上下文的长度,RoboTTT 结合了序列动作强制和截断反向传播算法。训练时,序列动作强制为每个动作块独立采样噪声水平,以稳定 flow-matching 训练;TBPTT 将长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,这样既能让 TTT 贯穿整条序列,又能把显存开销控制在片段长度范围内。

图|TBPTT。

3.长上下文约束:RoboTTT 会把部分时间步只作为上下文使用,这些时间步会写入快速权重,但不参与动作损失计算。基于这一机制,模型可以从两类上下文中学习:

  • 视频模仿:人类视频作为上下文,只更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
  • DAgger 蒸馏:完整 DAgger 轨迹都会更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失只在人类纠正动作上计算,把失败后的纠正方式写入快速权重。

图|DAgger 蒸馏。

上下文越长,性能越强

研究团队在三个长程双臂装配任务上评估了 RoboTTT。整体而言,RRoboTTT 能够利用自身更多的历史信息进行训练,除了上述更强的闭环性能之外,它仅需一段包含上下文信息的人类视频,即可进行一次性模仿、实时自我改进,以及对物理扰动鲁棒

图|评估任务。

1.在长程任务上持续优于基线

主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN。

图|主评估:三个装配任务上的任务完成分数。

此外,RoboTTT 也是完全成功次数最多的方法,尤其是在平均约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务上,RoboTTT 是唯一完整完成任务的方法。

图|主评估:三个装配任务上的完全成功试验次数。

简单拼接过去观测并不能可靠提升表现。在 Pup Go Car(玩具车装配)任务上,加入一个历史帧的 GR00T N1.7 Hist 得分为 39.5%,低于只看当前观测的 GR00T N1.7(57%)。GDN 将历史压缩为循环状态,但没有在所有任务上带来提升。

RoboTTT 更善于跟踪任务进度、恢复错误和完成细粒度操作。在视觉相似的多阶段装配中,RoboTTT 能更好地区分当前阶段;电钻未对准螺丝时,它也会重新对齐并再次尝试;在插入、扣紧电路组件等细粒度操作中,动作也更精确。

2. 预训练上下文越长,闭环表现就越好

研究团队将预训练上下文从 128 扩展到 8K 时间步后评估发现,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且没有出现饱和迹象。相比而言,上下文变长后,GDN 却没有获得同样的性能提升。

研究团队认为,这一差异来自更新机制,RoboTTT 通过梯度下降更新快速权重,并学习快速权重的初始化和更新方式;GDN 则使用线性关联状态,不具备这种元学习机制。

图|闭环性能随预训练上下文长度扩展而提升。

3.one-shot 模仿与扰动鲁棒

RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿。在 Circuit(电路装配任务中),机器人只能通过上下文中的人类视频判断该装配哪种电路配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为65%;GDN 没有取得完全成功,任务完成分数为 33%。

图|从上下文内人类视频进行一次性模仿。

长上下文约束也提升了扰动恢复能力。当人类在游戏过程中移除已安装的部件时,RoboTTT 会根据自身的部署情况返回并重新安装该部件。车顶被移除时,RoboTTT 的恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 的恢复率均达到 90%,也高于短上下文基线。

4.更强的即时恢复能力

RoboTTT 具备更强的即时恢复能力,并优于标准 DAgger。标准 DAgger 只在人类纠正动作上微调,平均提升9%;DAgger 蒸馏把完整轨迹作为上下文,包括次优机器人动作,但只在人类纠正动作上计算损失,平均提升 33%。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,并能在线从自身的错误中恢复,无需人工干预。

图|DAgger 蒸馏在 Pup Go Car 上的结果。

不足与未来方向

研究团队指出,尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 scaling 轴的潜力,但仍存在一些不足。

首先,扩展训练上下文长度会增加训练成本。虽然 RoboTTT 在推理时保持成本恒定,但训练更长上下文仍需要更多开销。未来,研究人员应采用更高效的 TTT 训练技术(如 TNT)来降低这一成本。

其次,TTT 层的目标函数仍有探索空间。当前工作提出了一种将 TTT 整合进机器人基础模型的方法,但面向机器人的 TTT 层目标(类似视觉领域中的相关探索)将是一个有潜力的方向。

此外,RoboTTT 仍未覆盖部署中可能出现的全部失败模式。研究团队表示,RoboTTT 与强化学习结合,直接优化任务成功率,有望进一步提升实际执行表现。

更多技术细节,详见原论文。

最新快讯

2026年08月27日

02:51
截至8月26日13时34分,中证新能源指数(399808)表现亮眼,报收2439.92点,涨幅达1.61%,成交额为556.89亿元。同期,新能源ETF南方(516160)成交额0.96亿元,市场交投十分活跃。 产业层面迎来多重核心催化: 第一,光伏行业“反内卷”掀起产业链涨价潮。多晶硅现货单日上调7500元/吨,涨幅23.81%;N型硅片单周涨幅超过40%...
02:51
截至14时05分,有色金属板块表现强劲,中证细分有色金属产业主题指数上涨2.3%,中证工业有色金属主题指数涨幅达2.9%。 消息面上,龙头股江西铜业交出了一份超预期的成绩单。2026年上半年,公司归母净利润达86.32亿元,同比增长106.77%,不仅超过了业绩预告的上限,其二季度单季净利润环比更是大幅增长106%。公司盈利增速显著高于营收增速,主要得益于铜...
02:51
美东时间8月25日,国际贵金属期货市场普遍收涨。COMEX黄金期货上涨0.39%,收于4715.90美元/盎司;COMEX白银期货微涨0.05%,报68.63美元/盎司。现货黄金盘中触及4696.55美元/盎司后回落,最终收于4658.67美元/盎司。8月26日亚盘时段,金价一度冲高至4673.33美元,随后回落至4641美元附近。 目前市场正密切关注美国P...
02:51
鼓狮财经8月27日讯,Meta公司已同意支付高达180亿美元,与美国多个州就一起具有里程碑意义的案件达成和解。此次和解旨在解决外界关于Meta故意将Facebook和Instagram设计成诱导年轻用户形成强迫性使用习惯的指控。 根据周三披露的法院文件,和解协议的关键条款要求Meta在平台上实施更严格的青少年保护措施。具体包括限制青少年连续浏览的时间,以及禁...
02:16
鼓狮财经8月26日报道,BMO Capital Markets发布研报开始覆盖博通,给予其“跑赢大盘”评级,目标价定为455美元。BMO分析师Harsh Kumar在报告中指出,博通在定制ASIC及网络领域处于领先地位,是全球仅次于英伟达的第二大AI芯片公司。 此外,市场消息称,博通正在洽谈一项规模超过600亿美元的债务融资计划,旨在为Anthropic等客...
02:16
鼓狮财经8月26日报道,国内商品期货夜盘收评显示,市场整体呈现多数上涨态势。 在涨幅居前的板块中,油脂油料表现强劲,大商所菜粕上涨1.97%;能源品板块全线飘红,大商所液化石油气上涨1.97%;农副产品板块普涨,郑商所白糖上涨0.54%。 相对而言,化工品板块领跌,大商所乙二醇跌2.12%,郑商所纯碱跌2.69%,甲醇跌1.06%,PTA跌0.93%;非金属...
02:16
鼓狮财经8月27日报道,伊朗外长阿拉格齐就美国针对伊朗的“经济恐怖主义”行动,致函联合国秘书长及安理会轮值主席。信函阐述了伊朗的严正立场,并强调联合国及国际社会肩负着法律与道义责任,必须谴责美国的“非法犯罪行径”。 信函指出,美国通过发动战争和实施制裁,胁迫其他主权国家参与其“经济恐怖主义”行动。美国公然无视多边主义与外交手段,奉行恐吓与恐怖主义政策。美方此...
01:01
鼓狮财经8月26日讯,山西省水利厅与气象局于当日18时联合发布山洪灾害气象风险预警。受强降雨影响,预计8月26日20时至8月27日20时,山西省部分地区发生山洪灾害的风险较高,具体预警情况如下: 橙色预警(可能性大):阳泉市南部、晋中市东北部、吕梁市南部、临汾市西北部,涉及4个市9个县。 黄色预警(可能性较大):阳泉市北部、太原市东北部、晋中市西北部、吕梁市...
01:01
8月26日,西安市发布《支持房地产市场高质量发展工作措施》。措施规定,企业若通过出让方式获得国有建设用地并持有不动产预告登记证明,可先行办理整宗土地的工程规划及施工许可,以及对应已缴清土地出让价款部分的预售许可等后续手续。 此外,新政在销售定价上赋予企业更大自主权。企业需在网签平台填报“一房一价”,住建部门不再进行价格审核。同时,企业须按规定在销售现场公示“...
01:01
据鼓狮财经8月26日报道,市场监管总局近日印发《国家质检中心提质优化三年行动方案(2026—2028年)》。该方案旨在通过明确11项预期成果,加速推动检验检测行业从传统的“事后把关”向“全程赋能”转变。 方案设定了明确的阶段性目标。在制度建设上,要求于2027年底前出台《国家产品质量检验检测中心管理办法》,同时建立健全评估指标体系和评审专家管理办法。此外,将...
00:31
鼓狮财经8月26日讯,面对西藏吉隆口岸突发泥石流灾情,国网西藏电力迅速行动,第一时间启动应急响应,紧急调集人员与物资装备,全力以赴开展抢险保电任务。目前,首批应急抢险力量已成功抵达现场。后续,应急供电及照明装备将持续向一线增援,全方位补强现场保电能力。与此同时,国网西藏电力紧急调配抢修物资,并派遣20名专业抢修人员火速奔赴现场,旨在全力保障受损线路的抢修与恢...