arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 392
2605.24396 2026-08-11 cs.AI 版本更新

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28533 2026-08-11 cs.CL 版本更新

GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum

GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答

Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22213 2026-08-11 cs.LG cs.AI cs.CL 版本更新

SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection

SPA:一个简单但难以被击败的基线模型用于知识注入

Kexian Tang, Jiani Wang, Shaowen Wang, Kaifeng Lyu

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 本文提出SPA基线模型,通过精心设计的提示生成大规模合成数据以增强模型知识,实验表明其优于现有方法,并揭示了先前方法的两个关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20968 2026-08-11 cs.DC cs.AI 版本更新

Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality

Mesh-Attention: 一种新的通信高效分布式注意力机制,具有改进的数据本地性

Sirui Chen, Jingji Chen, Siqi Zhu, Ziheng Jiang, Yanghua Peng, Xuehai Qian

机构 * Tsinghua University(清华大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance Seed(字节跳动种子)

AI总结 Mesh-Attention通过改进的数据本地性,提高了分布式注意力的通信效率和可扩展性,实验显示在大规模GPU上实现了显著的加速和通信量减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15968 2026-08-11 cs.LG cs.AI cs.AR 版本更新

Self-Attention to Operator Learning-based 3D-IC Thermal Simulation

基于自注意力算子学习的三维集成电路热仿真

Zhen Huang, Hong Wang, Wenkai Yang, Muxi Tang, Depeng Xie, Ting-Jung Lin, Yu Zhang, Wei W. Xing, Lei He

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology(东部技术研究所) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) BTD Technology(BTD技术) University of Sheffield(谢菲尔德大学) University of California(加州大学)

AI总结 针对三维集成电路热管理难题,本文提出SAU-FNO框架,结合自注意力、U-Net与FNO,采用迁移学习微调低保真数据,实现最优热预测精度,较传统FEM加速842倍,为三维集成电路热仿真提供高效工具。

Journal ref DAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00803 2026-08-11 cs.LG 版本更新

ProPINN: Demystifying Propagation Failures in Physics-Informed Neural Networks

ProPINN:揭秘物理信息神经网络中的传播失效问题

Yuezhou Ma, Haixu Wu, Hang Zhou, Huikun Weng, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

AI总结 本文针对物理信息神经网络(PINNs)的传播失效问题,深入剖析其根本原因,提出新型ProPINN架构,可有效解决失效模式,相较基于Transformer的模型实现46%的相对性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04917 2026-08-10 cs.CV 版本更新

An active-learning framework for real-time depth perception from monocular vision streams

面向单目视觉流的实时深度感知主动学习框架

Xiaorong Zeng, Weiqiang Chen, Peng Shi, Liang Su, Zirui Wang, Xuewu Ji, Shuiwen Shen

机构 * School of Mechanical and Automotive Engineering, Xiamen University of Technology(厦门理工学院机械与汽车工程学院) Xiamen Innovative Centre for Automotive Electric Driving(厦门新能源汽车驱动创新中心) King Long United Automotive Industry Co. Ltd.(金龙联合汽车工业有限公司) School of Electrical and Electronic Engineering, The University of Adelaide(阿德莱德大学电气与电子工程学院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

AI总结 该研究针对边缘设备上单目深度感知的域偏移问题,提出带选择性可塑性的在线主动学习框架,以MobileNetV3-Small为骨干,在降75%计算量的同时实现高效深度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04527 2026-08-10 cs.RO 版本更新

Retrieve in Time, Correct in Frequency

及时检索,频率校正

Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

机构 * Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院) Everwise-Tech Co., Ltd.(恒智慧科技有限公司) Tongji University(同济大学) Fudan University(复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 该研究针对冻结 VLA 策略长 horizon 操作的误差问题,提出无需训练的 RTCF 框架,通过渐进式记忆对齐和低频残差转移,在 LIBERO 实验中提升了操作成功率且延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27924 2026-08-10 cs.LG cs.CV cs.RO 版本更新

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

ODEWorld:一种基于物理时间流的连续预测架构

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))

AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26799 2026-08-10 cs.CV 版本更新

PRISM-Net: Patient-specific reference-guided inter-breast symmetry matching for three-class breast DCE-MRI classification

PRISM-Net:用于三类乳腺DCE-MRI分类的患者特异性参考引导跨乳腺对称匹配

Boya Zhang, Shuaiwen Zhou, Di Kong, Mingxu Wang, Wenbiao Du, Yiman Zhong, Yuexin Duan, Xiawei Yue, Liuquan Cheng, Xiru Li

机构 * Nankai University(南开大学) Zhongguancun Academy(中关村学院) The First Medical Center of Chinese PLA General Hospital(中国人民解放军总医院第一医学中心) Beijing University of Posts and Telecommunications(北京邮电大学) The Six Medical Center of Chinese PLA General Hospital(中国人民解放军总医院第六医学中心) Tsinghua University(清华大学)

AI总结 该研究针对乳腺DCE-MRI分类中患者特异性背景变异性问题,提出PRISM-Net无配准双侧框架,利用对侧乳腺特征建模跨乳腺对应,在多数据集上优于基线,提升了乳腺病灶分类性能。

Comments 15 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06076 2026-08-10 cs.AI cs.CV 版本更新

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

通过模态差距感知自蒸馏从符号状态学习视觉空间规划

Haocheng Luo, Jiahui Liu, Ruicheng Zhang, Zhizhou Zhong, Jiaqi Huang, Zunnan Xu, Quan Shi, Jun Zhou, Shuiyang Mao, Wei Liu, Xiu Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。

Comments 18 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07327 2026-08-10 cs.CV 版本更新

Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations

教师特征漂移:基于预训练扩散表示的一步扩散蒸馏

Yuan Zhang, Chenyi Li, Haodong Yu, Guoqing Ma, Jiajun Zha, Yuanming Yang, Bo Wang, Wei Tang, Wenbo Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出通过单步扩散蒸馏简化模型,利用预训练扩散教师自身的特征空间,无需额外网络即可实现语义特征几何的漂移,同时引入轻量模式覆盖损失以提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-10 cs.SD cs.AI cs.CL 版本更新

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14299 2026-08-07 cs.CV cs.LG 版本更新

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

什么驱动了CLIP的测试时适应?从更新视角进行的受控实证研究

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

机构 * Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文通过受控实证研究,从更新视角分析了CLIP测试时适应方法的驱动因素,揭示了适应增益主要来自测试时证据和可靠代理,而非繁重优化,并指出无单一范式普遍最优。

Comments Benchmark and codes are available at https://github.com/walawalagoose/TTABC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12226 2026-08-07 cs.CV 版本更新

Ultrasound Tomography of Musculoskeletal Tissues with Generative Neural Physics

生成式神经物理实现组织力学的定量体积超声成像

Zhijun Zeng, Youjia Zheng, Chang Su, Qianhang Wu, Hao Hu, Zeyuan Dong, Yang Lv, Ligang Cui, Zhiyong Hou, Weijun Lin, Zuoqiang Shi, Yubing Li, He Sun

机构 * College of Future Technology, Peking University(未来技术学院,北京大学) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Physical Sciences, University of Chinese Academy of Sciences(中国科学院大学物理科学学院) School of EECE, University of Chinese Academy of Sciences(中国科学院大学电子工程与计算机科学学院) Department of Orthopedics, Peking University Third Hospital(北京大学第三医院骨科部) Department of Ultrasound, Peking University Third Hospital(北京大学第三医院超声科) Department of Orthopaedic Surgery, The Third Hospital of Hebei Medical University(河北医科大学第三医院骨科部) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期智数学科学中心) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京燕琦湖数学科学与应用研究院)

AI总结 该研究提出生成式神经物理框架,结合生成网络与物理信息神经模拟,实现了快速高保真三维超声断层成像,可在十分钟内重建组织参数三维图谱,分辨率媲美MRI,推动定量超声断层成像用于肌肉骨骼成像的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03556 2026-08-07 cs.CV cs.RO 版本更新

Afford-X: Generalizable and Slim Affordance Reasoning for Task-oriented Manipulation

Afford-X:面向任务型操作的通用且轻量化的可供性推理模型

Xiaomeng Zhu, Yuyang Li, Leiyao Cui, Pengfei Li, Huan-ang Gao, Yixin Zhu, Hao Zhao

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science, Tsinghua University(清华大学计算机科学系)

AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10804 2026-08-06 cs.CV 版本更新

SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning

SCAIL-2:通过端到端上下文条件统一受控角色动画

Wenhao Yan, Fengjia Guo, Zhuoyi Yang, Jie Tang

机构 * Z.ai Tsinghua University(清华大学)

AI总结 提出SCAIL-2框架,通过端到端上下文条件统一受控角色动画,绕过中间表示直接利用驱动视频,并合成MotionPair-60K数据集,采用上下文掩码和模式RoPE实现统一,结合Bias-Aware DPO减少误差,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15669 2026-08-06 cs.LG cs.AI cs.RO 版本更新

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

DeepThinkVLA: 提升视觉-语言-动作模型的推理能力

Cheng Yin, Yankai Lin, Wang Xu, Sikyuen Tam, Xiangrui Zeng, Zhiyuan Liu, Zhouping Yin

机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) Gaoling School of Artificial Intelligence, Renmin University of China, China(中国人民大学 Gallagher 人工智能学院) Beijing Zhongguancun Academy, China(北京中关村学院)

AI总结 本文通过系统实验发现,Co-T推理需满足解码对齐和因果对齐两个条件,提出DeepThinkVLA模型在LIBERO等任务中取得显著提升。

Comments 26 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17640 2026-08-06 cs.RO cs.AI cs.LG 版本更新

RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation

RESample:通过探索性采样构建鲁棒数据增强框架用于机器人操控

Yuquan Xue, Guanxing Lu, Zhenyu Wu, Chuanrui Zhang, Bofang Jia, Zhengyi Gu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出RESample框架,通过探索性采样机制提升VLA训练数据分布覆盖,有效解决分布外场景下的能力瓶颈问题,实验证明在LIBERO基准和真实机器人任务中性能提升12%。

Comments 8 pages, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03590 2026-08-06 cs.CV 版本更新

Beyond Boundary Frames: Talking-Head Inbetweening via Context-Aware Motion Modeling

超越边界框架:基于音频视觉语义的上下文中心视频插值

Yuchen Deng, Hai-Tao Zheng, Jie Wang, Xiaotian Li, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出BBF框架,通过解耦多模态条件,结合视觉上下文、文本语义和音频时间动态,提升视频插值的可控性和准确性,实验表明其在通用插值和音视频同步生成任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01679 2026-08-05 cs.AI 版本更新

When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary

当记忆成为权威:在记忆整合边界处对权威崩溃进行基准测试

Qiuyang Zhan, Rui Zhang, Sheng Guo, Lepeng Zhao, Zhuotao Liu

机构 * Tsinghua University(清华大学) East China Normal University(华东师范大学)

AI总结 本研究推出AuthMem-Bench基准,发现智能体记忆整合存在权威崩溃问题,自动保留权威标签可大幅降低未授权动作率,证明记忆适配需同时保留权威信息。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00094 2026-08-05 cs.CV 版本更新

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23258 2026-08-05 cs.AI cs.LG 版本更新

CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics

CAPT:一种多任务连续自回归Transformer,实现钙群体动力学的跨数据集和跨物种转移

Xinhong Xu, Yimeng Zhang, Yuanlong Zhang

机构 * Tsinghua University(清华大学)

AI总结 研究针对钙群体动力学模型跨数据集和物种推广难的问题,提出CAPT这一连续自回归群体Transformer,通过连续补丁令牌化策略建模,经多数据集实验验证,其在预测任务中性能优且能形成共享功能空间,为通用神经基础模型开辟新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13040 2026-08-05 cs.RO 版本更新

RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation

RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试

Dayu Xia, Yue Shi, Yao Mu, Huiting Ji, Chaofan Ma, Yingjie Zhou, Hua Chen, Yang Liu, Jiezhang Cao, Guangtao Zhai

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) China University of Mining Technology(中国矿业大学)

AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11627 2026-08-05 cs.LG cs.AI 版本更新

When Context Returns: Toward Robust Internalization in On-Policy Distillation

当上下文回归:面向在线策略蒸馏中的鲁棒内化

Xun Wang, Ruishuo Chen, Zhuoran Li, Yu Chen, Longbo Huang

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院)

AI总结 针对在线策略蒸馏中上下文内化后重新引入上下文导致性能下降的问题,提出一种轻量级一致性正则化方法,通过锚定无上下文输出并惩罚偏离,有效缓解退化并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01168 2026-08-05 cs.LG cs.AI 版本更新

SphUnc: Hyperspherical Uncertainty Decomposition and Causal Identification via Information Geometry

SphUnc:通过信息几何的超球面不确定性分解与因果识别

Rong Fu, Chunlei Meng, Jinshuo Liu, Dianyu Zhao, Yongtai Liu, Yibo Meng, Xiaowen Ma, Wangyu Wu, Yangchen Zeng, Shuaishuai Cao, Simon Fong

机构 * University of Macau(澳门大学) Fudan University(复旦大学) Hangzhou Dianzi University(杭州电子科技大学) Renmin University of China(中国人民大学) Hanyang University(翰阳大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Liverpool(利物浦大学) Southeast University(东南大学) Central South University(中南大学)

AI总结 SphUnc结合超球面表示学习与结构因果建模,通过信息几何融合分解不确定性为epistemic和aleatoric成分,并通过样本模拟实现因果识别,提升多智能体系统中的预测准确性和不确定性校准能力。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏