arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-14 至 2026-04-14 共收录 115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 11 篇

2604.09519 2026-04-14 cs.LG 79%

Toward World Models for Epidemiology

迈向流行病学的世界模型

Zeeshan Memon, Yiqi Su, Christo Kurisummoottil Thomas, Walid Saad, Liang Zhao, Naren Ramakrishnan

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) Department of Electrical and Computer Engineering, Worcester Polytechnic Institute(伍斯特理工学院电气与计算机工程系) Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出流行病学世界模型的概念框架,探讨其在政策相关推理中的必要性,通过案例研究展示显式世界建模对处理流行病决策中的挑战的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08995 2026-04-14 cs.CV 79%

Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory

矩阵游戏3.0:具有长时程记忆的实时和流式交互世界模型

Zile Wang, Zexiang Liu, Jiaxing Li, Kaichen Huang, Baixin Xu, Fei Kang, Mengyin An, Peiyu Wang, Biao Jiang, Yichen Wei, Yidan Xietian, Jiangbo Pei, Liang Hu, Boyi Jiang, Hua Xue, Zidong Wang, Haofeng Sun, Wei Li, Wanli Ouyang, Xianglong He, Yang Liu, Yangguang Li, Yahui Zhou

机构 * Skywork AI(天工AI)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 矩阵游戏3.0通过改进数据、模型和推理方法,实现了720p实时长视频生成,支持长时程时空一致性,提升了生成效率和质量。

Comments Project page: https://matrix-game-v3.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 79%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10573 2026-04-14 cs.CV 57%

Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images

从未标注的多视角图像中学习3D表示以提升空间智能

Bo Zhou, Qiuxia Lai, Zeren Sun, Xiangbo Shu, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Communication University of China(中国传媒大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出UniSplat框架,通过双掩码策略、高斯溅射策略和姿态条件重校准机制,解决未标注多视角图像中3D表示学习的几何诱导弱、外观细节不足和几何语义不一致问题,实现鲁棒且通用的3D表示。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 2 篇

2604.09651 2026-04-14 cs.CV cs.LG cs.RO 67%

FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击

Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang

机构 * Zhejiang University(浙江大学) Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

专题命中 机器人基础模型 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09824 2026-04-14 cs.RO cs.CL cs.CV 62%

ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models

ProGAL-VLA: 通过前瞻性推理实现视觉-语言-动作模型中的 grounded 对齐

Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 ProGAL-VLA 通过构建 3D 实体中心图、使用慢速规划器生成符号子目标,并通过 Grounding Alignment Contrastive 损失对齐实体,提升机器人在扰动下的鲁棒性,减少语言忽略并提高实体检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 8 篇

2604.10165 2026-04-14 cs.RO 83%

MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks

MoRI:混合强化学习和模仿学习专家用于长 horizon � Manipulation 任务

Yaohang Xu, Lianjie Ma, Gewei Zuo, Wentao Zhang, Han Ding, Lijun Zhu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) DRAGON Lab, The University of Tokyo(东京大学DRAGON实验室) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 MoRI通过混合强化学习和模仿学习专家,动态切换处理粗略运动和精细操作,提高长horizon manipulation任务的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10962 2026-04-14 cs.RO 77%

ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching

ScoRe-Flow:通过基于分数的强化学习实现完整分布控制的流匹配

Xiaotian Qiu, Lukai Chen, Jinhao Li, Qi Sun, Cheng Zhuo, Guohao Dai

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出ScoRe-Flow方法,通过基于分数的强化学习微调,实现对流匹配中均值和方差的解耦控制,提升了训练效率和任务成功率。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10677 2026-04-14 cs.RO cs.CV 73%

LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment

LIDEA:通过隐式特征蒸馏和显式几何对齐的人机模仿学习

Yifu Xu, Bokai Lin, Xinyu Zhan, Hongjie Fang, Yong-Lu Li, Cewu Lu, Lixin Yang

专题命中 模仿学习与强化学习 :robot learning(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 LIDEA通过隐式特征蒸馏和显式几何对齐,解决人机交互中的表征对齐问题,提升机器人学习效率和域外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06540 2026-04-14 eess.SY cs.AI cs.LG cs.RO cs.SY math.OC 67%

Self-Organizing Dual-Buffer Adaptive Clustering Experience Replay (SODACER) for Safe Reinforcement Learning in Optimal Control

自组织双缓冲自适应聚类经验回放(SODACER)用于最优控制中的安全强化学习

Roya Khalili Amirabadi, Mohsen Jalaeian Farimani, Omid Solaymani Fard

机构 * Department of Applied Mathematics, Ferdowsi University of Mashhad(菲尔多西大学应用数学系) Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano(米兰理工大学电子、信息与生物工程系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出SODACER框架,结合自组织自适应聚类机制与控制屏障函数,实现非线性系统的安全高效控制,通过Sophia优化器提升收敛性和稳定性,验证了其在非线性HPV传播模型中的有效性。

Comments Published in Nature Scientific Reports (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO 62%

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 57%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10429 2026-04-14 cs.AI 57%

Safety Guarantees in Zero-Shot Reinforcement Learning for Cascade Dynamical Systems

在级联动力系统中零样本强化学习的安全保障

Shima Rabiei, Sandipan Mishra, Santiago Paternain

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文研究了级联动力系统中零样本安全保证问题,提出在简化模型上训练安全RL策略,并通过低层控制器跟踪RL策略的参考信号,理论分析了安全概率与内状态跟踪质量的关系。

Comments 8 pages, 2 figures; submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11019 2026-04-14 cs.LG 57%

Relative Entropy Pathwise Policy Optimization

相对熵路径策略优化

Claas Voelcker, Axel Brunnbauer, Marcel Hussing, Michal Nauman, Pieter Abbeel, Eric Eaton, Radu Grosu, Amir-massoud Farahmand, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) TU Wien(维也纳工业大学) University of Pennsylvania(宾夕法尼亚大学) University of Warsaw(华沙大学) UC Berkeley(加州大学伯克利分校) Polytechnique Montréal(蒙特利尔综合理工学院) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文提出REPPO算法,通过路径策略梯度结合在线学习,提升训练稳定性与效率,展现优越的样本效率和内存表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 1 篇

2604.05896 2026-04-14 cs.RO cs.HC 57%

Dialogue based Interactive Explanations for Safety Decisions in Human Robot Collaboration

基于对话的交互式解释用于人机协作中的安全决策

Yifan Xu, Xiao Zhan, Akilu Yunusa Kaltungo, Ming Shan Ng, Tsukasa Ishizawa, Kota Fujimoto, Clara Cheung

机构 * Department of Civil Engineering and Management, Faculty of Science and Engineering, The University of Manchester(曼彻斯特大学科学与工程学院土木工程与管理系) VRAIN, Universitat Politècnica de València(瓦伦西亚理工大学VRAIN研究所) Department of Engineering, University of Cambridge(剑桥大学工程系) Department of Mechanical and Aerospace Engineering, Faculty of Science and Engineering, The University of Manchester(曼彻斯特大学科学与工程学院机械与航空航天工程系) Center for the Possible Futures, Kyoto Institute of Technology(京都工艺纤维大学未来可能性中心) Institute of Industrial Science, The University of Tokyo(东京大学生产技术研究所) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种基于对话的交互式解释框架,用于人机协作中的安全决策,通过约束基础的安全评估实现解释与决策的紧密耦合,支持因果、对比和反事实查询,提升安全干预的透明度和协作效率。

Comments This paper has been accepted by the 2nd InterAI workshop, HRI conference 26'

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 29 篇

2604.11174 2026-04-14 cs.RO cs.AI 86%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 机器人数据与评测 :embodied agent(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10951 2026-04-14 cs.RO 85%

Fast-SegSim: Real-Time Open-Vocabulary Segmentation for Robotics in Simulation

Fast-SegSim: 仿真中机器人快速开放词汇分割

Xuan Yu, Yuxuan Xie, Shichao Zhai, Shuhao Ye, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出Fast-SegSim,基于2D高斯散射构建端到端框架,实现高保真且3D一致的开放词汇分割重建。通过优化渲染管线和Top-K硬选择策略,提升渲染速度至40FPS以上,用于仿真平台传感器输入和下游感知任务的多视图地面真实标签生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22153 2026-04-14 cs.CV cs.AI 81%

Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation

超越瓷砖匹配:连接不一致的航空和卫星视图以实现仅视觉UAV导航

Kejia Liu, Haoyang Zhou, Ruoyu Xu, Peicheng Wang, Mingli Song, Haofei Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出Bearing-UAV方法,通过联合预测UAV绝对位置和航向实现跨视图导航,提升在复杂环境下的定位精度和鲁棒性。

Comments Accepted as a conference paper by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11349 2026-04-14 cs.RO 79%

Learning Racket-Ball Bounce Dynamics Across Diverse Rubbers for Robotic Table Tennis

在多样橡胶下学习球拍-球碰撞动力学

Thomas Gossard

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出统一框架,通过10种不同橡胶类型的球拍配置,研究球拍-球碰撞动力学,利用高帧率多相机系统收集数据,建立基于冲击模型的参数估计方法,提升预测精度和不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11386 2026-04-14 cs.RO cs.CV 73%

ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation

ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成

Yiran Qin, Jiahua Ma, Li Kang, Wenzhan Li, Yihang Jiao, Xin Wen, Xiufeng Song, Heng Zhou, Jiwen Yu, Zhenfei Yin, Xihui Liu, Philip Torr, Yilun Du, Ruimao Zhang

机构 * CUHK-Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) USTC(中国科学技术大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。

Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11135 2026-04-14 cs.RO cs.LG 73%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05057 2026-04-14 cs.RO cs.CV 73%

StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

StaMo:从紧凑状态表示中无监督学习通用机器人运动

Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) HKUST(香港科技大学) Ant Group(蚂蚁集团)

专题命中 机器人数据与评测 :world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11793 2026-04-14 cs.RO 70%

Disentangled Point Diffusion for Precise Object Placement

解耦点扩散用于精确物体放置

Lyuxing He, Eric Cai, Shobhit Aggarwal, Jianjun Wang, David Held

机构 * Carnegie Mellon University(卡内基梅隆大学) ABB Inc.(ABB公司)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出TAX-DPD框架,通过解耦点扩散模型实现高精度物体放置,提升多模态覆盖与几何变化适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07209 2026-04-14 cs.CV 70%

INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling

INSPATIO-WORLD:通过时空自回归建模实现实时4D世界模拟器

InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao, Hongjia Zhai, Jialin Liu, Jing Guo, Nan Wang, Siji Pan, Weihong Pan, Weijian Xie, Xianbin Liu, Xiaojun Xiang, Xiaoyu Zhang, Xinyu Chen, Yifu Wang, Yipeng Chen, Zhenzhou Fan, Zhewen Le, Zhichao Ye, Ziqiang Zhao

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出INSPATIO-WORLD框架,通过时空自回归模型实现从单帧视频恢复和生成高保真动态交互场景,解决空间一致性和实时交互难题,实现在WorldScore-Dynamic基准中领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10125 2026-04-14 cs.CV 70%

PhyMix: Towards Physically Consistent Single-Image 3D Indoor Scene Generation with Implicit--Explicit Optimization

PhyMix:迈向物理一致的单图像3D室内场景生成的隐式-显式优化

Dongli Wu, Jingyu Hu, Ka-Hei Hui, Xiaobao Wei, Chengwen Luo, Jianqiang Li, Zhengzhe Liu

机构 * Lingnan University(岭南大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本文提出PhyMix,通过隐式-显式优化框架,结合物理评估器提升生成场景的物理一致性,实现视觉真实且物理合理的3D室内场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 67%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 62%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 62%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05342 2026-04-14 cs.CV cs.LG 62%

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17925 2026-04-14 cs.RO cs.CV 62%

Switch-JustDance: Benchmarking Whole Body Motion Tracking Controllers Using a Commercial Console Game

Switch-JustDance: 使用商业游戏机评估完整身体运动跟踪控制器的基准测试

Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Sehoon Ha, Tianyu Li

机构 * Georgia Tech(佐治亚理工学院) HKU(香港大学) ETH Zurich(苏黎世联邦理工学院) SCUT(华南理工大学) THU(清华大学) MIT(麻省理工学院) PNDbotics

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Switch-JustDance基准测试平台,利用Nintendo Switch上的Just Dance游戏评估机器人完整身体控制能力,验证其可靠性并对比三种先进控制器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏