Quaternion Factorization Machines: A Lightweight Solution to Intricate Feature Interaction Modelling
专题命中 VLA模型 :action model(title);分类 cs.LG
Comments Manuscript is under review
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :action model(title);分类 cs.LG
Comments Manuscript is under review
专题命中 VLA模型 :action model(title);分类 cs.AI
Comments AAAI 2021
专题命中 VLA模型 :action model(title);分类 cs.AI
Comments 39 Pages
专题命中 VLA模型 :action model(title);分类 cs.CV
专题命中 VLA模型 :action model(title);分类 cs.LG
Comments 5 pages, Conference paper
专题命中 VLA模型 :action model(title);分类 cs.RO
Comments accepted to 2019 International Conference on Robotics and Automation
专题命中 VLA模型 :action model(title);分类 cs.LG
Comments Workshop on Language and Robotics, IROS 2018
专题命中 VLA模型 :action model(title);分类 cs.LG
专题命中 VLA模型 :action model(title);分类 cs.CV
Comments 13 pages
专题命中 VLA模型 :action model(title);分类 cs.CV
专题命中 VLA模型 :action model(title);分类 cs.CV
Comments CVPR 2014
专题命中 VLA模型 :action model(title);分类 cs.CV
Comments 3 pages, 2 figures, submitted to ICLR2013 workshop
专题命中 VLA模型 :action model(title);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 28, pages 517-557, 2007
专题命中 VLA模型 :VLA(title,comments)
Comments To be published in the ASP Monograph Series, "Science with a Next-Generation VLA", ed. E. J. Murphy (ASP, San Francisco, CA)
结合世界模型的Q学习
机构 * Stanford University(斯坦福大学) ; Peking University(北京大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出QWM框架,将世界模型与标准Q学习结合,在真实环境训练中避免复合模型偏差,在Robomimic和LIBERO基准上的样本效率与性能均优于现有SOTA方法。
当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入
机构 * Wuhan University(武汉大学) ; University at Buffalo(布法罗大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI
AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。
Comments submitted to USENIX Security 2027
提示驱动的探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Improbable AI Lab(英普罗巴布尔人工智能实验室)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。
ProtoAct:将湿实验室协议转化为具身机器人动作
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。
Comments 15 pages, 13 figures
NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试
机构 * University of Michigan(密歇根大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV
AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。
ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统
机构 * AMAP CV Lab(AMAP计算机视觉实验室)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。
Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS
UR-VC:用于时间衍生进度代理的无监督机器人价值校正
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 研究针对机器人学习中时间衍生进度标签不准确问题,提出无监督机器人价值校正方法UR-VC,利用演示数据中相似状态不同时出现的规律校正标签,在真实双手布料操作任务中取得积极效果,还能用于构建优势标签。
端到端自动驾驶中的训练后处理
机构 * Northeastern University(东北大学) ; Purdue University(普渡大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV
AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。
PAC-ACT:用于动作分块变换器的训练后演员评论家方法
机构 * LeRobot
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI
AI总结 针对精密工业接触操纵问题,提出PAC-ACT框架,通过在块级别重新制定策略优化、构建特定架构并引入混合行为先验约束,提升了机器人策略在姿态扰动和接触力约束下的性能,实验验证了其有效性。
CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束
机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) ; National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
学习感知未来:DreamTacVLA用于接触丰富的 manipulation
机构 * Northwestern University(西北大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV
AI总结 DreamTacVLA通过结合高分辨率触觉图像与多尺度视觉信息,提升接触丰富任务的鲁棒性,实现95%的成功率。
翻译作为桥接动作:将操作技能从人类迁移到机器人
机构 * HKU-MMLab(香港大学多媒体实验室) ; ByteDance Seed(字节跳动Seed)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV
AI总结 提出以相对手腕平移作为桥接动作表示,结合π₀类视觉-语言-动作模型,从人类数据中迁移操作技能到双臂平行夹爪机器人,有效提升迁移效果并随数据量扩展。
Comments Project Page: https://translation-as-a-bridging-action.github.io/
E-TTS:一种新的机器人操作具身测试时缩放框架
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; FiveAges(五时代)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI
AI总结 提出E-TTS框架,通过历史感知迭代精炼和视觉语言验证器统一推理与动作缩放,解决具身任务中推理缩放和历史信息利用不足的问题,在仿真和真实场景中分别提升33.14%和26.62%的性能。
Comments Accepted to ECCV 2026. 44 pages, 11 figures. Project page: https://27yw.github.io/E-TTS-Web/
推进全模态具身智能体:从孤立技能到日常物理自主
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。
机器人安全的可验证基础模型
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG
AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。
你有一张金票:用单一噪声向量改进生成式机器人策略
机构 * Robotics and AI Institute(机器人与人工智能研究所) ; Arizona State University(亚利桑那州立大学) ; Northeastern University(东北大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 提出用固定初始噪声替换高斯采样,通过蒙特卡洛搜索找到“金票”,无需训练即可提升预训练扩散/流匹配策略在46/51个任务中的成功率,最高提升55%。
Comments 34 pages, 14 figures, 12 tables