SimpleMemVLA 团队 投稿
量子位 | 公众号 QbitAI

不增加专用记忆模块,直接把带时间戳的视觉历史作为上下文,机器人能做到什么?
SimpleMemVLA给出的答案是:在论文比较范围内,四项记忆基准的总体成绩达到SOTA,并在不更新参数的情况下,表现出视觉上下文学习能力。它也是MiniCPM-RobotManip中上下文记忆和流式记忆的支撑技术。
这条路线的核心很直接:让机器人结合过去发生的事情,理解眼下该做什么。被遮住的物体在哪里、某个动作已经完成几次、任务进行到了哪一步,都可以从原生视觉历史中获得依据。
为什么现在可以这样做?按论文设置,60秒历史仅占约5.6k token,而主干模型支持262k token上下文。分钟级历史已经能够直接放入模型,不必一开始就将其压缩成另一套记忆表示。
该工作由面壁智能联合华中科技大学、中国人民大学、清华大学、北京大学、北京智源人工智能研究院和北京中关村学院共同提出。
原生视觉上下文,让机器人在长任务中记得更准
从遮挡、计数到长程交互,SimpleMemVLA在四项记忆基准上取得最佳总体成绩,同时在两项通用操控评测中保持高性能。
这些任务考验的不只是机器人能否看懂当前画面,还包括它能否记住已经消失的线索、区分重复发生的事件,并持续跟踪任务进度。

△四项记忆基准与两项通用操控评测。各基准分别比较;灰色条为参考结果,不参与排名。
在需要持续跟踪任务进度的长程交互中,这种记忆能力带来了明显收益。RoboMemArena包含26项任务,轨迹平均超过1000个控制步。使用126秒历史窗口时,SimpleMemVLA的全阶段任务成功率达到63.6%,比此前最强模型提高17.4个百分点。其中,计数任务从31.4%提升至71.4%,遮挡任务从39.1%提升至64.3%。
优势不仅来自主干模型,也来自模型在决策时仍能直接理解原生视觉历史。
一个细节是否重要,往往要到后续任务中才知道。提前筛选、压缩或覆盖历史,可能丢掉未来需要的信息。论文将这种限制称为“写入时承诺”:在存入记忆时,就必须决定保留什么。
SimpleMemVLA将历史视觉信息、时间顺序和时间戳保留在上下文中,让模型在理解当前任务时一并理解过去,而不是先把历史加工成固定的摘要,再据此行动。

△原生视觉上下文与专用记忆机制的区别。图中对应论文测试的具体实现。
具体来说,历史画面沿用视觉语言模型预训练时的视频格式,按时间顺序组织,并附上明文时间戳;当前腕部画面则单独输入。模型据此生成一句当前子任务,例如“揭开红色积木上的盖子”。
生成这句话时形成的上下文隐藏状态,会与词元嵌入、机器人本体状态一起传给动作头,生成下一段动作。消融实验表明,历史信息主要通过这份隐藏状态影响行为,而不只是通过子任务的字面文字。

△SimpleMemVLA架构及流式推理流程。
为了区分主干能力与记忆机制的影响,研究者固定训练数据、主干模型、子任务监督、动作头和优化器,只替换记忆机制。在RoboMME上,结果如下:


△相同模型与训练设置下,不同记忆机制的任务级成功率。
这组结果支持一个关键判断:在所测任务中,让模型结合当前任务理解仍然可读的历史,比提前决定哪些信息值得留下更有效。
进一步的消融说明,关键画面和时间顺序确实不可缺少。在RMBench的盖积木任务中,30秒窗口仍包含约25秒前的遮盖过程,模型能够完成任务;窗口缩短至15秒、关键画面移出后,任务失败。按键计数任务也会随着历史窗口缩短而逐步退化。只保留当前画面或打乱帧顺序时,两项任务均失败。

△原生上下文的消融实验。(a)(b)检验历史窗口、帧顺序与时间戳;(c)(d)检验子任务隐藏状态如何将历史信息传给动作头。
视觉上下文学习:不更新参数,跟随视觉上下文调整策略
SimpleMemVLA不仅能利用过去的事件,还能根据新提供的视觉上下文调整当前行为。
研究者将另一条执行轨迹中的片段接入原有历史:换掉积木被盖住的位置,模型就转向新位置;将颜色提示从品红换成红色,模型就选择红色物体;替换演示序列的开头动作,机器人也会随之改变下一步操作。
这些拼接后的历史并未在训练中出现,推理时也没有参数更新。模型仍能从新的视觉上下文中判断任务状态,并据此行动。这就是论文观察到的视觉上下文学习能力。

△遮蔽或替换历史片段,检验模型如何依据过去行动。
模型的行为变化也具有针对性:改变关键历史会影响决策,改变无关历史则不会。遮蔽积木被盖住位置的画面,会使模型选错盖子;遮蔽一次已经完成的抓取—放置事件,模型会少算一次,并追加执行。对等长度的无关片段进行遮蔽时,输出保持不变。
这些实验说明,在所测任务中,原生上下文既能承载记忆,也能让新的视觉信息直接影响模型行为。
流式推理优化,让分钟级记忆跟上实时控制
长历史不必意味着长时间等待。通过复用历史计算,SimpleMemVLA将60秒历史的决策延迟从1.02秒降至0.68秒,低于实测任务的0.96秒实时预算。
这一结果来自单张H100、bf16、batch size为1的设置。实现思路也很直接:连续两次决策共享大部分历史,机器人执行当前动作时,系统提前计算下一次仍会使用的历史前缀,并保存键值缓存。到下一次决策时,再处理新增内容并生成子任务。
这套精确流式推理流程与全量重算生成相同的子任务文本,但将共享历史的计算与动作执行重叠起来,减少了决策时的等待。

△共享历史的计算与动作执行重叠,缩短下一次决策的等待时间。
在更长上下文的延迟测试中,约45分钟历史对应245k token,全量重算需要32.1秒,而流式决策路径缩短至1.18秒。这展示了计算复用的收益;超长上下文下,后台预填充与缓存开销仍会随历史增长。
真机展示
在三次不同布局的自主执行中,SimpleMemVLA能依据遮挡前的视觉历史,按红→绿→蓝的顺序揭开盖子。
任务在真实双臂机器人上完成:机器人先用相同的黑盖遮住三块彩色积木,再按指定颜色顺序揭盖。此时当前画面已经看不到积木颜色,机器人必须根据之前的经历,判断每个盖子下是什么。


三次执行中,揭盖路径随颜色位置改变。第三段采用“中→远→近”的顺序,也说明机器人并非始终沿着固定方向扫描,而是在利用历史中的颜色与位置关系完成任务。
未来展望:从记住过去,走向从经历中学习
SimpleMemVLA将原生上下文作为记忆,并在这一过程中涌现出视觉上下文学习能力。
未来,团队将引入更丰富的上下文信息,包括人类第一视角(ego)数据、机器人示教视频和自主执行历史。充分发挥模型的上下文学习能力,让上下文不仅帮助机器人记住过去,也成为它学习和适应的重要来源。
论文:https://arxiv.org/abs/2609.05533
开源代码仓库:https://github.com/OpenBMB/SimpleMemVLA
开源模型仓库:https://huggingface.co/collections/yinchenghust/simplememvla
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目/主页链接,以及联系方式。
🌟 点亮星标 🌟