arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-19 至 2026-03-19 共收录 14
2603.17771 2026-03-19 cs.LG cs.AI

Attention Sinks Induce Gradient Sinks

注意力沉底引发梯度沉底

Yihong Chen, Quanming Yao

机构 * Tsinghua University(清华大学) Peking University(北京大学)

AI总结 研究从反向传播角度探讨注意力沉底与梯度沉底的关系,发现因果掩码下注意力沉底会引发梯度集中,且在预归一化架构中,大规模激活是训练时对梯度压力的适应性响应。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17705 2026-03-19 cs.CV

Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation

参数高效模态平衡对称融合用于多模态遥感语义分割

Haocheng Li, Juepeng Zheng, Shuangxi Miao, Ruibo Lu, Guosheng Cai, Haohuan Fu, Jianxi Huang

机构 * College of Land Science and Technology, China Agricultural University(中国农业大学土地科学与技术学院) Key Laboratory of Remote Sensing for Agri-Hazards, Ministry of Agriculture and Rural Affairs(农业农村部农业灾害遥感重点实验室) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地质科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Henan Polytechnic University(河南理工大学) Key Laboratory of Spatio-Temporal Information and Ecological Restoration of Mines, Ministry of Natural Resources of the People’s Republic of China(矿产资源时空信息与生态修复重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) Ministry of Education Key Laboratory for Earth System Modeling and the Department of Earth System Science, Tsinghua University(地球系统模拟教育部重点实验室和清华大学地球系统科学系)

AI总结 本文提出MoBaNet,通过参数高效和模态平衡的对称融合框架,在减少可训练参数的同时提升多模态遥感语义分割的鲁棒性和平衡性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17704 2026-03-19 cs.GR cs.CV cs.HC

DancingBox: A Lightweight MoCap System for Character Animation from Physical Proxies

DancingBox:一种轻量级的基于物理代理的字符动画系统

Haocheng Yuan, Adrien Bousseau, Hao Pan, Lei Zhong, Changjian Li

机构 * University of Edinburgh 10 Crichton Street Edinburgh United Kingdom Inria, Universit\' e C\ o te d'Azur 2004 route des lucioles Valbonne France Tsinghua University No. 30 Shuangqing Road, Haidian District Beijing China University of Edinburgh Inria, Universit\' e C\ o te d'Azur Tsinghua University

AI总结 DancingBox通过将运动捕捉过程转化为数字提线木偶,利用日常物体的粗略运动生成逼真动画,降低了新手动画师的进入门槛。

Comments Accepted to CHI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17693 2026-03-19 cs.CV

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17613 2026-03-19 cs.CL cs.PL

VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation

VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成

Yaoxiang Wang, Qi Shi, ShangZhan Li, Qingguo Hu, Xinyu Yin, Bo Guo, Xu Han, Maosong Sun, Jinsong Su

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17441 2026-03-19 cs.CV cs.AI

AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement

AdaZoom-GUI: 基于自适应缩放的GUI定位与指令细化

Siqi Pei, Liang Tang, Tiaonan Duan, Long Chen, Shuxian Li, Kaer Huang, Yanzhe Jing, Yiqiang Yan, Bo Zhang, Chenghao Jiang, Borui Zhang, Jiwen Lu

机构 * Lenovo Research(联想研究院) Tsinghua University(清华大学)

AI总结 本文提出AdaZoom-GUI框架,通过指令细化模块和条件缩放策略提升GUI定位精度与指令理解,构建高质量数据集并采用GRPO训练模型,实现在高分辨率GUI理解中的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17416 2026-03-19 cs.RO cs.SY eess.SY

Physics-informed Deep Mixture-of-Koopmans Vehicle Dynamics Model with Dual-branch Encoder for Distributed Electric-drive Trucks

具有双分支编码器的物理信息深度混合Koopman车辆动力学模型用于分布式电动卡车

Jinyu Miao, Pu Zhang, Rujun Yan, Yifei He, Bowei Zhang, Zheng Fu, Ke Wang, Qi Song, Kun Jiang, Mengmeng Yang, Diange Yang

机构 * School of Vehicle and Mobility, and State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing, China(车辆与移动系统学院和智能绿色车辆与移动系统国家重点实验室,清华大学,北京,中国) KargoBot Inc., Beijing, China(KargoBot公司,北京,中国)

AI总结 本文提出了一种基于Koopman算子理论的全数据驱动方法,用于复杂分布式电动卡车的动力学建模,通过双分支编码器和物理信息监督机制提升建模精度和兼容性。

Comments 13 pages, 8 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17354 2026-03-19 cs.LG cs.CL

Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-Sensitivity

超越异常值:一种无需数据的分层混合精度量化方法,由数值和结构双敏感性驱动

Hengyuan Zhang, Xinrong Chen, Zunhai Su, Xiao Liang, Jing Xiong, Wendong Xu, He Xiao, Chaofan Tao, Wei Zhang, Ruobing Xie, Lei Jiang, Hayden Kwok-Hay So, Ngai Wong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Tencent(腾讯)

AI总结 本文提出NSDS方法,通过数值和结构双敏感性驱动分层混合精度量化,无需校准数据,在不同模型和任务中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16270 2026-03-19 cs.RO

MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations

MG-Grasp:基于稀疏RGB观测的度量尺度几何6自由度抓取框架

Kangxu Wang, Siang Chen, Chenxing Jiang, Shaojie Shen, Yixiang Dai, Guijin Wang

机构 * The Department of Electronic Engineering, Tsinghua University, Beijing 100084, China(清华大学电子工程系,北京100084,中国) The Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学电子与计算机工程系,香港,中国)

AI总结 本文提出MG-Grasp框架,利用双视角3D基础模型实现高精度6自由度抓取,通过稀疏RGB图像重建密集点云并生成稳定抓取方案,实验证明其在RGB基抓取方法中达到SOTA水平。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14331 2026-03-19 cs.CV

AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising

AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars

Liyuan Cui, Wentao Hu, Wenyuan Zhang, Zesong Yang, Fan Shi, Xiaoqiang Liu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学)

AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09513 2026-03-19 cs.RO

Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks

超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation

Honghui Wang, Zhi Jing, Jicong Ao, Shiji Song, Xuelong Li, Gao Huang, Chenjia Bai

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23728 2026-03-19 cs.CV cs.AI

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏