Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling
物理原生世界模型:生成式世界建模的哈密顿视角
机构 * Tsinghua University(清华大学)
AI总结 提出哈密顿世界模型,通过结构化潜相空间和哈密顿动力学演化实现物理可靠、动作可控且长期稳定的未来预测,用于具身决策。
高校专区
物理原生世界模型:生成式世界建模的哈密顿视角
机构 * Tsinghua University(清华大学)
AI总结 提出哈密顿世界模型,通过结构化潜相空间和哈密顿动力学演化实现物理可靠、动作可控且长期稳定的未来预测,用于具身决策。
恢复VLA模型中的语言基础:无需训练的注意力重校准方法
机构 * Tsinghua University(清华大学) ; Singapore Management University(新加坡管理学院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)
AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。
OmniGAIA:迈向原生全模态AI代理
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司) ; Peking University(北京大学) ; Southeast University(东南大学) ; Tsinghua University(清华大学)
AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。
VLSA: 具有即插即用安全约束层的视觉-语言-动作模型
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能与机器人研究院) ; TetraBOT ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)
AI总结 提出AEGIS架构,通过控制屏障函数构建即插即用安全约束层,集成到VLA模型中保证安全性与任务性能,在SafeLIBERO基准上障碍物避免率提升超50%,任务成功率提升近10%。
Comments Accepted by IROS 2026
分而治之:多模态世界模型的解耦表示对齐
机构 * Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学) ; CSU(中南大学) ; ZJU(浙江大学) ; CUHK(香港中文大学) ; UCAS(中国科学院大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。
Comments Accepted to ECCV 2026
QuadLink: 通过点关系学习的自回归四边形主导网格生成
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tencent VISVISE(腾讯VISVISE) ; Peking University(北京大学) ; Technical University of Munich(慕尼黑技术大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Texas A&M University(德克萨斯大学) ; Macau University of Science and Technology(澳门科技大学)
AI总结 提出QuadLink框架,通过将点云链接成结构化面片,以自回归方式生成各向异性的四边形主导网格,实现高几何保真度和拓扑质量。
在部分可见性下联邦客户端选择:一种带有时空注意机制的POMDP方法
机构 * Dept. of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) ; Dept. of Electronic and Computer Engineering, HKUST(电子与计算机工程系,香港科技大学)
AI总结 本文提出一种基于POMDP的强化学习框架,通过整合历史全局模型和客户端身份嵌入,解决部分可见性下的联邦学习客户端选择问题,实验验证其在异构和部分可见场景下的有效性。
FCL-COD:基于频率感知和对比学习的弱监督伪装目标检测
机构 * Tsinghua University(清华大学) ; Soochow University(苏州大学)
AI总结 提出频率感知低秩适应(FoRA)和梯度感知对比学习,解决弱监督伪装目标检测中非伪装响应、局部/极端响应及边界模糊问题,在三个基准上超越现有弱监督和部分全监督方法。
Comments Accepted to CVPR 2026
VolumeDP: 用于操作策略学习的体积表示建模
机构 * IIIS, Tsinghua University(清华大学智能产业研究院) ; Galaxea AI
AI总结 提出VolumeDP策略架构,通过体积表示显式3D推理解决2D-3D不匹配问题,在LIBERO基准上达到88.8%平均成功率,比最强基线提升14.8%。
Comments Accepted to IROS 2026
RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试
机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) ; Zhongguancun Academy(中关村学院) ; Amap, Alibaba Group(阿里巴巴集团高德地图)
AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。
Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench
重新思考扩散模型中的鲁棒对抗性概念擦除
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
AI总结 针对扩散模型中概念擦除的对抗训练忽视概念语义导致拟合不足的问题,提出语义引导的鲁棒对抗概念擦除方法S-GRACE,显著提升擦除性能26%并减少90%训练时间。
OpenReward: 通过强化学习学习奖励长形式智能体任务
机构 * Leiden University(莱顿大学) ; Shandong University(山东大学) ; Tsinghua University(清华大学)
AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。
2DGH: 二维高斯-埃尔米特泼溅用于高质量渲染和更好的几何特征
机构 * Department of Physics, Tsinghua University(清华大学物理系) ; School of Software and BNRist, Tsinghua University(清华大学软件学院与北京信息科学与技术国家研究中心)
AI总结 提出高斯-埃尔米特核作为新基元,增强各向异性和变形能力,在几何重建和新视角合成上优于传统高斯泼溅。
Comments 12 pages, 11 figures
Journal ref IEEE Transactions on Visualization and Computer Graphics, vol. 32, no. 2, pp. 1513-1524, Feb. 2026
基于物理的机器人交互的遮挡鲁棒多对象解耦
机构 * Pengcheng Laboratory(鹏城实验室) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
AI总结 提出一种无掩码方法,从稀疏遮挡视角实现无损多对象3D重建,通过MPM模拟实现物理合理的机器人交互,核心是利用联合SDS过程结合扩散先验实现对象解耦。
Comments 7 pages, 6 figures
加速悖论:具身任务中推理速度与质量权衡的再思考
机构 * Tsinghua University(清华大学)
AI总结 提出TISED分析框架,揭示具身任务中推理加速技术对任务级性能的悖论效应:静态任务中可能延长完成时间,动态任务中适度优化可提升成功率,且效果受硬件配置影响。
Comments 23 pages
小波策略:基于世界先验记忆的尺度域模仿学习
机构 * Zhejiang University(浙江大学) ; Tsinghua University, DISCOVER Robotics(清华大学,DISCOVER机器人实验室) ; Hangzhou TaiWeave Robotics Co., Ltd.(杭州太 weave 机器人有限公司)
AI总结 本文提出小波策略,结合世界先验记忆与小波多尺度动作建模,通过编码静态背景图像中的持久物理场景结构,提升长周期机器人操作的效率与效果。
RPG: 为人类oid战斗中平滑多技能过渡的鲁棒策略门控
机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出RPG框架,通过动作过渡随机化和时间随机化训练统一策略,实现人类oid多技能平滑稳定过渡,并设计控制管道整合步行/跑步与战斗技能,实验证明其有效性与鲁棒性。
学习失重:在人形机器人上模仿非自稳定动作
机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University, China(人工智能与机器人中心,深圳国际研究生院,清华大学,中国) ; Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
AI总结 本文提出了一种基于生物机制的失重机制,用于在人形机器人上实现非自稳定动作的模仿与环境交互,通过动态确定放松关节及程度,提升环境适应性与动作稳定性。
MetricHMSR:基于单目图像的度量人体网格与场景恢复框架
机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学) ; Beihang University(北京航空航天大学)
AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
少样本合成图像溯源:有限样本下识别未见生成器
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peking University(北京大学)
AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。
Comments ECCV 2026
PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建
机构 * HKUST(香港科技大学) ; Southeast University(东南大学) ; Tsinghua University(清华大学) ; VAST
AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。
Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman
RateQuant: 通过率-失真理论实现最优混合精度KV缓存量化
机构 * BA TechWorks (BMW Group)(BA TechWorks(宝马集团)) ; National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学)
AI总结 RateQuant利用率-失真理论优化混合精度KV缓存量化,通过为不同重要性头部分配不同位宽,减少内存瓶颈,提升生成性能。
Comments 18 pages, 7 figures, 5 tables
SHIFT: 视频扩散模型中的运动对齐与对抗混合微调
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; University of Chinese Academy of Science(中国科学院大学)
AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。
Comments Accepted by ECCV2026
EXPLORE-Bench:具有长视距推理的自我中心场景预测
机构 * University of Science and Technology of China(中国科学技术大学) ; Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) ; Tsinghua University(清华大学)
AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。
RAE-NWM:密集视觉表示空间中的导航世界模型
机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) ; University of Rochester(罗切斯特大学) ; Beijing Information Science and Technology University(北京信息科技大学)
AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。
Comments Code is available at: https://github.com/20robo/raenwm
MobileManiBench:简化移动操作模型验证
机构 * Microsoft Research Asia(微软亚洲研究院) ; University of Sydney(悉尼大学) ; Tsinghua University(清华大学)
AI总结 提出仿真优先框架MobileManiBench,基于NVIDIA Isaac Sim和强化学习自动生成多样化移动操作轨迹,包含300K条轨迹,用于验证VLA模型在真实部署前的性能。
Comments Accepted to ECCV 2026
SciFig:面向科学论文的可编辑图形自动生成
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Zhejiang University(浙江大学) ; Independant Researcher(独立研究者) ; Tsinghua University(清华大学) ; University of Central Florida(佛罗里达中央大学) ; City University of Hong Kong(香港城市大学) ; Adobe Research(Adobe研究)
AI总结 提出SciFig多智能体框架,从科学文本自动生成可编辑的高质量方法图,通过分解规划、布局、渲染和迭代优化,在435个基准上优于基线,平均10分钟生成可编辑图形。
机器人操作模仿学习中的数据缩放定律
机构 * Tsinghua University(清华大学) ; Shanghai Qi Zhi Institute(上海期智研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 通过收集超过4万次演示和1.5万次真实机器人 rollout,发现策略泛化性能与环境和物体数量呈幂律关系,环境和物体多样性比演示数量更重要,据此提出高效数据收集策略。
超越独立操纵:具有同伴模仿的个体公平感知策略分类
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; School of Mathematical Sciences, Peking University(北京大学数学学院) ; Institute for Theoretical Computer Science, Shanghai University of Finance and Economics(上海财经大学理论计算机科学研究所) ; Information Technology Development, Aetos Capital Group, Sydney(悉尼Aetos资本集团信息技术部) ; Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
AI总结 提出个体公平感知策略分类(IFSC)框架,通过建模基于个体公平的同伴驱动操纵(模仿邻近被接受同伴),并采用鲁棒学习过程处理同伴可观测性不确定性,以改善个体公平一致性并减轻模仿引起的扭曲。
Comments Accepted by SIGKDD2026