从 “不明就里” 到 “明白是非 ”,机器人飞速进化 ,人大高瓴联合北京人形发布开源 Robo -ValueRL 技术框架
信息来源:人大高瓴人工智能学院 发布日期:2026年7月11日
在小说阅读器读本章去阅读在小说阅读器中沉浸阅读
7月9日,中国人民大学高瓴人工智能学院胡迪副教授团队与北京人形机器人创新中心联合宣布,双方深度产学研合作成果——Robo-ValueRL 技术框架正式发布并全面开源。该框架创新性地引入基于历史观测的价值估计机制,有效解决了传统 VLA(Vision-Language-Action)模型在数据质量评估、高精度操作及在线迭代稳定性方面的核心瓶颈,为人形机器人在半导体精密装配等高价值工业场景的产业化落地提供了新的技术路径。同时,Robo-ValueRL技术框架已实现全栈开源,覆盖论文、代码、模型权重、真实机器人数据与实验配置等核心资源。
项目链接:https://gewu-lab.github.io/Robo-ValueRL/
代码链接:https://github.com/Open-X-Humanoid/Robo-ValueRL
数据集与代码链接:https://huggingface.co/collections/X-Humanoid/robo-valuerl
引入价值估计机制突破人形机器人高精度工业操作瓶颈
一、行业背景:人形机器人面临核心落地瓶颈
当前,人形机器人具身智能赛道正面临关键发展瓶颈。多数模型仅能依靠人工轨迹进行被动模仿学习,缺乏对动作优劣和数据质量的有效判别能力。面对混杂劣质数据的盲目学习,不仅导致训练效率低下、算力资源严重浪费,更普遍存在在线迭代过程中的灾难性遗忘问题,陷入”学新忘旧、越练越弱”的恶性循环。
行业现状尤为突出:市面工业机器人大多局限于大件搬运、粗粒度放置等低精度场景,看似落地广泛,却始终无法适配半导体、精密装配等高价值精细化工业场景。缺乏数据质量评估、在线纠错和持续进化能力,已成为制约人形机器人高端产业化落地的关键痛点。
二、核心突破:价值评估能力赋能精准训练
传统具身 VLA 模型最大的技术短板,在于缺乏统一的动作质量评估体系。人工遥操作采集的轨迹质量参差不齐,往往同时包含优质动作、犹豫动作、纠偏动作、失败动作和无效操作。若模型无法区分这些片段的价值,只能全盘接收、混同训练,导致精细操作任务训练陷入僵局——数据量持续增加,但模型精度与稳定性提升有限,能力上限被低质量数据持续干扰。
针对上述行业痛点,Robo-ValueRL VLARL 框架创新性地引入基于历史观测的价值估计机制。该机制作为框架的核心模块,指导离线数据筛选、动作质量分层和在线数据选择。借助历史信息,价值估计器能够有效缓解视觉遮挡、单帧观测歧义、任务状态不可见等真实场景问题,进一步提升机器人在复杂工况中的数据评估能力。
通过该机制,Robo-ValueRL 可对轨迹数据进行质量判定,筛选高价值样本,降低低质量干扰数据对策略训练的影响,从底层优化模型训练逻辑,提升精细作业精度与训练效率,夯实高精度任务落地基础。
三、技术迭代:缓解灾难性遗忘,实现稳定进化
真机部署迭代中的”进化悖论”是行业长期面临的难题。传统模型在线交互微调时,会全局更新网络权重,可能覆盖前期习得的精密操作技能,出现严重的灾难性遗忘,导致模型难以实现稳定迭代升级。
本次联合研发方案采用冻结预训练主干与残差门控网络增量微调架构,探索一条更稳定的具身 AI 在线进化路径。模型在保留预训练阶段核心能力的基础上,仅通过真实环境交互、高质量样本筛选和轻量化精准微调,针对具体失败模式学习动作修正策略,从而有效缓解在线更新对原有能力的破坏,实现”学新尽量不丢旧、越练越稳”,持续拓宽能力边界。
四、技术体系:全链路离线转在线强化学习
区别于传统单一的离线模仿学习或简易在线 RL 方案,Robo-ValueRL VLARL 框架是一套完整、可靠、适配工业真机落地的离线预训练与在线自适应微调全链路强化学习系统,从价值估计、策略训练、数据获取到在线迭代,实现全流程技术闭环。
(一)基于历史信息的可靠价值估计机制
传统价值函数模型极易受画面遮挡、场景重复纹理、视觉歧义干扰,导致任务进展判断失真、训练信号不稳定。本次研发创新性设计基于历史信息的价值估计器,依托过往历史观测信息研判任务进度,有效规避单帧画面误判问题。
该机制具备对任务进展和动作质量的双重感知能力:任务平稳推进时,价值曲线整体上升;动作失误、任务偏差刚出现时,价值估计能够捕捉下降信号,辅助定位错误节点,为后续数据筛选和策略优化提供可靠依据。
(二)优劣动作分层筛选机制
框架将动作质量判定纳入策略训练核心条件,改变”全盘照搬数据”的低效训练模式。Robo-ValueRL 利用独立价值估计器对离线和在线轨迹进行质量评估,将动作质量信号作为策略训练条件,引导策略更加关注能够推动任务完成的高价值行为。价值估计器作为独立评估模块,为策略训练和在线数据选择提供质量信号。
实验验证表明:普通行为克隆(BC)会随混合质量数据增加出现性能饱和,而 Robo-ValueRL 价值引导方案具备更强的规模化学习能力,数据利用率与模型上限优于传统算法。
(三)人在回路高效数据获取与轻量化在线自适应迭代
针对真机在线训练成本高、数据低效的痛点,方案搭载人在回路数据采集机制,高效获取真实工况下的在线交互数据。同时采用主干冻结与轻量残差适配器微调架构,保留预训练模型通用能力,仅针对性学习动作细化、误差修正策略,有效缓解在线强化学习中的灾难性遗忘问题。
依托该架构,模型可在持续在线交互中稳步迭代,越练越稳、越练越强,实现更稳定的长期自主进化。
五、落地验证:真机实测数据印证高精度实力
依托全套 Robo-ValueRL VLARL 技术体系,研发团队在毫米级芯片精密插装、长时序积木拆解两大核心工业场景完成真机全流程迭代验证,用真实迭代数据印证技术有效性。
在毫米级芯片精密插装任务中,模型初始基础成功率仅为46%,经过在线交互迭代后,成功率提升至86%,提升幅度达40个百分点。在长时序积木拆解任务中,基础成功率为60%,迭代后提升至84%,提升幅度达24个百分点。
横向对比 DAGGER 等主流算法,Robo-ValueRL 在芯片、积木双任务中均取得更优表现,显著缓解传统算法精度不足、迭代不稳定的短板。
在作业效率方面,人类遥操作完成单次芯片插入通常需要2至3次尝试,而搭载 Robo-ValueRL 的机器人可一次完成毫米级精密插入,作业效率达到人类操作员的1.5倍。
此外,Robo-ValueRL 展示出较强的自主纠错与环境自适应能力,可应对抓取失败、插入偏差、目标托盘位移、积木掉落异常、操作策略失效等各类复杂突发工况,并通过在线交互和价值引导数据选择持续修正策略,在训练分布之外的复杂真实场景中保持稳定作业能力。
六、全栈开源:推动产业生态共建
为推动高精度机器人强化学习的可复现研究与产业落地,Robo-ValueRL 本次采用全栈开源方式发布,覆盖论文、代码、模型权重、真实机器人数据与实验配置等核心资源,完整开放从离线预训练、价值估计、在线数据筛选到策略适配的关键流程。
本次开源内容包括技术论文,系统阐述方法设计、模型架构、训练目标与真实机器人实验结果;完整训练与评估代码,覆盖历史条件价值估计器、价值引导策略训练、在线数据筛选与轻量残差适配模块;真实机器人任务数据,包括毫米级芯片精密插装与长时序积木拆解等任务轨迹;预训练模型与关键模块权重,便于研究者复现实验结果并开展二次开发;以及实验配置、任务说明和复现实用文档,降低真实机器人强化学习系统的使用门槛。
区别于仅开放演示视频或部分结果的发布方式,Robo-ValueRL 旨在开放一套可检查、可复现、可扩展的 VLA 离线到在线强化学习技术栈。项目组希望通过完整开源,让研究社区能够系统分析价值估计在机器人学习中的作用,也让产业研发团队能够基于真实数据和模型工具,进一步探索高精度机器人操作在半导体精密装配、3C 制造和柔性工业作业中的应用潜力。
七、技术价值与产业展望
Robo-ValueRL 技术框架的正式开源,补齐了具身智能领域”无数据判别、高精度难落地、在线迭代不稳定”三大核心短板。依托价值估计器的数据质量评估能力,框架能够更充分挖掘工业机器人数据价值,降低无效训练损耗;搭配防遗忘增量微调架构,让机器人在真实环境中持续迭代优化,不断拓宽精密作业高精度任务边界,形成可落地、可迭代、可复现的工业级具身智能方案。
未来,人大高瓴人工智能学院将联合各界持续深化产学研协同创新,依托本次技术突破,持续打磨高精度、高泛化、可进化的人形机器人核心算法,持续拓展半导体精密装配、3C 智能制造、柔性作业等多元工业场景,加速推进高端人形机器人国产化、产业化落地,为智能制造产业升级注入全新动能。
Copyright ©2016 中国人民大学科学技术发展部 版权所有
地址:北京市海淀区中关村大街59号中国人民大学明德主楼1121B 邮编:100872
电话:010-62513381 传真:010-62514955 电子邮箱: ligongchu@ruc.edu.cn
京公网安备110402430004号