Critical behavior of a one-dimensional monomer-dimer reaction model with lateral interactions
专题命中 VLA模型 :action model(title)
Comments 19 pages, 22 figures, to be published in Phys. Rev E
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :action model(title)
Comments 19 pages, 22 figures, to be published in Phys. Rev E
专题命中 VLA模型 :action model(title)
Comments 13 pages, preprint of Nankai Institute of Mathematics ( Theoretical Physics Division ), published in Physical Review E of 1995. For hard copy, write to Prof. Mo-lin GE directly. Do not send emails to this account
专题命中 VLA模型 :action model(title)
Comments 10p+5fig, LaTeX+fig in uuencoded PS
专题命中 VLA模型 :action model(title)
Comments 13 pages, RevTex, 2 EPS figures
Journal ref Eur.Phys.J.C14:179-184,2000
专题命中 VLA模型 :action model(title)
Comments 9 pages
专题命中 VLA模型 :action model(title)
Comments 10 pages including 3 figures in sprocl style, talk given at Workshop on "Particle Distributions in Hadronic and Nuclear Collisions", University of Illinois at Chicago, June 11-13, 1998
专题命中 VLA模型 :action model(title)
Comments 5 pages, 3 figures
通过世界模型扩展自动研究智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.LG
AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。
OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架
机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) ; Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) ; School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。
Comments Abstract: Added repository and contribution statement
机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; AMAP, Alibaba(阿里妈妈实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。
Comments Accepted at ACM Multimedia 2026
4D-WAM:面向自动驾驶的4D一致世界建模
专题命中 VLA模型 :action model(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出4D-WAM模型,通过几何基础模型的训练时监督与面向决策的时间步长采样策略,提升自动驾驶中世界-动作模型的4D场景一致性,在NAVSIM-v1、NAVSIM-v2基准上实现最优性能。
拉格朗日扰动扩散引导:用于生成策略的潜在强化学习
机构 * University of Michigan(密歇根大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG
AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。
Comments Accepted as a regular paper at ICML 2026
Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV
AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。
Comments Accepted by ACMMM 2026
TiPToP:一种用于机器人操作的模块化开放式词汇规划系统
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 TiPToP是一种模块化开放式词汇规划系统,结合预训练视觉模型与任务规划器,通过自然语言指令和RGB图像直接解决多步骤操作任务,实现实时高效的操作规划。
Comments Project website: https://tiptop-robot.github.io
通过物理智能解决通用机器人中的编排差距
机构 * Princeton University(普林斯顿大学) ; Together AI(联合人工智能)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。
RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。
Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973
TacRefineNet:用于边缘突出物体的目标条件触觉抓取优化
机构 * Xiaomi Robotics(小米机器人)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 研究针对边缘突出物体抓取对齐难的问题,提出TacRefineNet框架,利用连体策略网络预测手腕姿态增量,经交叉组合训练,在模拟样本上训练后部署到实际五指手,实验表明其在可见物体抓取上有一定成功率及误差控制,还有长期扰动校正等特点。
Comments 9 pages, 8 figures
视频 = 世界 + 事件流
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV
AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。
Comments website: https://wan-streamer.com/v0.3/
启动安全:通用机器人安全中缺失的维度
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 探讨通用机器人安全中缺失的启动授权维度,通过在人形机器人上实施PAS等方法进行研究,并提出包含三个条件的用户研究,涉及多方面开放性问题。
Comments 4 pages, 2 figures. Accepted to RSS 2026 Workshop on Rethinking Safety for Generalist Robots
SUREFlow:用于鲁棒机器人操作的状态空间不确定性感知残差流匹配
机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆尚国立大学电子与电气工程学院)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);分类 cs.RO
AI总结 研究针对机器人操作策略在复杂条件下的不稳定性问题,提出SUREFlow框架,基于Mamba主干联合预测动作速度与残差不确定性,能选择性细化动作维度,在LIBERO等平台实验中取得良好效果,提升了机器人操作的鲁棒性与效率。
Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots & Systems (IROS) 2026, Pittsburgh, PA, USA
EgoSteer:一个用于从第一人称视角视频实现可控灵巧操作的全栈系统
机构 * Institute for AI, PKU(北京大学人工智能研究院) ; PKU-PsiBot Joint Lab(北大-灵犀机器人联合实验室) ; UPenn(宾夕法尼亚大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 针对灵巧手系统因缺乏数据而无可控性的问题,提出全栈系统EgoSteer,集成EgoSmith数据管道等,通过人类数据预训练赋予语言引导操作先验,经机器人后训练强化,能执行多样任务,还开源相关内容。
TouchWorld:一种用于灵巧操作的预测性和反应性触觉基础模型
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; PHANES AI(PHANES人工智能公司)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 研究针对日常环境中灵巧操作需预测与反应的问题,提出TouchWorld模型。该模型采用分层策略,分离多项任务。通过将触摸用于预测和反馈,提升局部接触适应性。在六个相关任务中表现出色,超越最强基线。
基于分块的机器人策略的动态执行视界预测
机构 * University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Acceleration Consortium(加速联盟) ; Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) ; Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 提出DEHP方法,通过在线强化学习训练轻量级执行视界预测分支,在冻结预训练分块策略的情况下动态调整执行步数,显著提升高精度和长时域操作任务的成功率。
PhysMani:基于物理原理的动态物体操作3D世界模型
机构 * vLAR Group, The Hong Kong Polytechnic University(香港理工大学vLAR Group) ; Astribot
专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 提出PhysMani框架,结合物理原理的3D高斯世界模型与未来感知动作策略模型,通过在线优化学习无散度高斯速度场预测动态,在16个任务基准上超越基线方法。
Comments ECCV 2026. Code and data are available at: https://github.com/vLAR-group/PhysMani
构建可扩展、可复现、可评估、闭环的具身智能仿真环境基础:面向具身智能训练、评估和数据收集的云原生仿真基础设施
机构 * AI Infra Team at JDT(京东科技AI基础设施团队) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Beihang University(北京航空航天大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 提出一种云原生仿真基础设施框架,通过弹性资源调度、容器化仿真等技术,实现大规模、标准化、可复现的具身智能训练、评估与数据收集。
Chronos: 一种基于物理信息的全历史框架用于非马尔可夫长时域操作
机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 针对现有策略依赖马尔可夫假设导致记忆依赖任务失败的问题,提出Chronos框架,将观测历史作为策略潜状态,通过选择性状态空间模型传播因果历史状态,并利用二阶薛定谔桥预测加速度场,在16个模拟和4个真实任务中显著超越基线。
Comments 20 pages, 10 figures. Submitted to IEEE Transactions on Robotics
基于机械臂的光谱传感用于草莓定位与无损甜度测量
机构 * Postdoctoral Supervisor: Dr Mark Cardamis(博士后导师:Mark Cardamis) ; Supervisor: Professor Wen Hu(导师:Wen Hu)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 提出一种集成RGB-ToF感知与机械臂控制的闭环系统,实现草莓检测、定位、接近及无损甜度估计,实验成功率达88.10%。
Comments 51 pages, 23 figures
基于闭环VLM代理的文本引导的6D物体姿态重排
机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV
AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。
推理时通过物理感知的任务结构重配置实现机器人行为引导
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO
AI总结 提出ReStruct方法,利用神经自动机策略将视觉运动策略分解为高层状态机骨架和低层残差控制器,通过同步乘积将用户偏好融入骨架以重配置任务结构,实现无需重训练的推理时行为引导,在仿真和真实实验中优于现有方法。