如果说大部分 VLA 论文都在比谁的模型更大、数据更多,清华大学联合正行创新、无问芯穹的这篇 Harness VLA(arXiv:2607.08448)走了一条相反的路:一行权重都不动,把现成的冻结 VLA「套上缰绳」,成绩反而大幅超过了重训的对手。

论文的核心思想可以用一句话概括:预训练 VLA 最擅长的是接触丰富(contact-rich)的短程操作,而它最不可靠的地方是长程任务的规划与记忆。那就让 VLA 只做它擅长的事,其余交给一个外挂的 Harness 层。

Harness 层:把 VLA 当作可重试的原语

具体做法是,在冻结 VLA 之上增加一个记忆增强的 Harness 层。它把整个 VLA 策略封装成一个「可重试的接触丰富原语」——就像函数调用一样:给定子目标,调用 VLA 执行;执行失败,检测后重试或换策略。

Harness VLA 系统框图:记忆增强的 Harness 层把冻结 VLA 当作可重试的接触丰富原语,与解析原语组合执行

与此同时,Harness 层还维护一组解析原语(parametric primitives)——移动、对齐这类可以用解析解直接算出来的动作,不需要劳驾神经网络。任务被拆解后,两类原语组合执行,各司其职。

记忆模块则负责跨步骤的状态追踪:哪些子目标已完成、哪些物体被移动过、上次失败的原因是什么。这恰好补上了当前 VLA 「金鱼记忆」的短板。

值得强调的是「可重试」这个设定的分量。端到端策略一旦在第 7 步抓空,后面的动作会在错误状态上继续滚雪球;而 Harness 层把每次 VLA 调用都变成有边界、可校验的事务——失败被就地捕获、就地重来,错误不再向下游传播。

零微调,成绩单却全面刷新

最有冲击力的是结果:不做任何微调,Harness VLA 把预训练 VLA 直接扩展到扰动 tabletop、厨房长程任务和双手协作任务上。在难度显著高于原版的 LIBERO-Pro 基准上拿到 82.4% 的成功率,大幅超过此前需要专门训练的 SOTA。

LIBERO-Pro 的「Pro」不是虚名:它在原版 LIBERO 之上加入了物体位置扰动、光照变化和干扰物,专治那些靠记忆训练场景刷分的策略。冻结模型能在这样的基准上领先,说明成绩来自框架的鲁棒性而不是过拟合。

Harness VLA 在 LIBERO-Pro 扰动任务中的执行示例

在 RoboCasa 厨房场景中,系统同样展现了长程任务的稳定执行能力——这类任务往往包含十几个相互依赖的子步骤,任何一步的失败都会让端到端策略全盘崩溃,而可重试机制让失败变成了局部事件。

Harness VLA 在 RoboCasa 厨房场景中的执行示例

双手协作任务的结果同样值得一提:两条机械臂的协调历来是端到端策略的重灾区,动作空间翻倍、时序约束更紧。Harness 框架把双手任务拆解为交替与同步的原语调用后,冻结 VLA 依然能稳定完成——这说明瓶颈更多在任务组织方式,而非模型本身的操作能力。

对产业的启示:算力不够,结构来凑

这篇论文对资源有限的团队是个好消息:不是每家公司都有十万小时真实数据和千卡集群,但一个设计得当的执行框架,可以把开源 VLA 的能力天花板再抬高一截。对正在评估「自研基础模型还是用开源模型」的机器人公司来说,这提供了第三个选项:把预算花在执行框架和任务工程上。

它也回应了一个行业争论——端到端与分层架构之争。Harness VLA 的答案是务实的折中:底层保留端到端 VLA 的灵巧性,上层用显式结构管住规划与记忆。类似思路正在越来越多的落地系统中出现,包括自动驾驶领域从纯端到端向「端到端 + 规则兜底」的回摆。

另一个容易被忽视的价值是可解释性与可维护性:当系统在客户现场出错时,工程师可以准确定位是哪个原语调用失败、记忆里记了什么,而不是面对一个端到端黑箱束手无策。对需要通过安全认证的商用场景,这种结构化的执行日志几乎是刚需。

当然,Harness 层本身的任务拆解仍依赖工程设计,能否泛化到完全开放的家庭环境还有待检验;记忆模块在超长时间跨度下的漂移问题,论文也只做了初步讨论。但至少在基准测试的牌桌上,「冻结大模型 + 聪明外挂」这条低成本路线,第一次正面赢了重训派。

论文全文可在 arXiv:2607.08448 查阅,任务演示视频与代码说明见 Harness VLA 官方项目主页,基准测试明细可对照 LIBERO-Pro 与 RoboCasa 官方榜单。本文基于公开报道整理。