arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2601.19430 2026-01-28 cs.CV

Unveiling Perceptual Artifacts: A Fine-Grained Benchmark for Interpretable AI-Generated Image Detection

揭示感知伪影:一个可解释AI生成图像检测的细粒度基准

Yao Xiao, Weiyan Chen, Jiahao Chen, Zijie Cao, Weijian Deng, Binbin Yang, Ziyi Dong, Xiangyang Ji, Wei Ke, Pengxu Wei, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Xi’an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Tsinghua University(清华大学)

AI总结 本文提出X-AIGD基准,通过细粒度注释感知伪影,揭示现有AIGI检测器对伪影的依赖低,且需提升可解释性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19354 2026-01-28 cs.RO cs.SY eess.SY

Self-Supervised Path Planning in Unstructured Environments via Global-Guided Differentiable Hard Constraint Projection

通过全局引导可微硬约束投影实现无结构环境中的自监督路径规划

Ziqian Wang, Chenxi Fang, Zhen Zhang

机构 * State Key Laboratory of Tribology in Advanced Equipment, Tsinghua University(摩擦学国家重点实验室(先进装备)) Beijing Key Laboratory of Transformative High-end Manufacturing Equipment and Technology, Department of Mechanical Engineering, Tsinghua University(北京高端制造装备与技术关键实验室(机械工程系)) Automotive Electronics Business Unit at Hirain Inc.(惠而得(中国)汽车电子业务部)

AI总结 本文提出一种自监督路径规划框架,通过全局引导人工势场和可微硬约束投影层,提升无结构环境中自主导航的安全性和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08931 2026-01-28 cs.CV cs.AI cs.LG

Astra: General Interactive World Model with Autoregressive Denoising

Astra:通用交互世界模型与自回归去噪

Yixuan Zhu, Jiaqi Feng, Wenzhao Zheng, Yuan Gao, Xin Tao, Pengfei Wan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 Astra提出了一种通用交互世界模型,通过自回归去噪和动作感知适配器实现长周期视频预测与多样化交互。

Comments Accepted in ICLR 2026. Code is available at: https://github.com/EternalEvan/Astra

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17171 2026-01-28 cs.CV

Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling

生成然后重建:通过两阶段采样加速遮蔽自回归模型

Feihong Yan, Peiru Wang, Yao Zhu, Kaiyu Pang, Qingyan Wei, Huiqi Li, Linfeng Zhang

机构 * Beijing Institute of Technology(北京理工大学) EPIC Lab, SJTU(上海交通大学EPIC实验室) Tsinghua University(清华大学)

AI总结 GtR通过两阶段采样加速遮蔽自回归模型,实现3.72倍速度提升并保持高质量生成。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21044 2026-01-28 cs.LG cs.AI

Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs

强化学习微调增强大语言模型内部电路的激活强度和多样性

Honglin Zhang, Qianyue Hao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学)

AI总结 强化学习微调增强了LLMs内部电路的激活强度和多样性,相较于偏好优化方法,其在数学泛化上的优势源于信息流的冗余与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20674 2026-01-28 cs.RO cs.CV

Equi-RO: A 4D mmWave Radar Odometry via Equivariant Networks

等变RO:一种基于等变网络的4D毫米波雷达里程计

Zeyu Han, Shuocheng Yang, Minghan Zhu, Fang Zhang, Shaobing Xu, Maani Ghaffari, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学) Computational Autonomy and Robotic Laboratory, University of Michigan(计算自主与机器人实验室,密歇根大学) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动系统国家重点实验室,清华大学)

AI总结 本文提出Equi-RO,一种基于等变网络的4D毫米波雷达里程计方法,通过图结构增强稀疏雷达数据特征聚合,实现更准确的平移和旋转估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14140 2026-01-28 cs.AI

RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning

思维强化学习:通过推理时间强化学习导航大语言模型推理

Qianyue Hao, Sibo Li, Jian Yuan, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学)

AI总结 RL-of-Thoughts通过强化学习训练轻量级导航模型,提升大语言模型推理能力,实现多任务适应性和参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11234 2026-01-28 cs.LG cs.AI

Bayes Adaptive Monte Carlo Tree Search for Offline Model-based Reinforcement Learning

贝叶斯自适应蒙特卡洛树搜索用于离线模型驱动强化学习

Jiayu Chen, Le Xu, Wentse Chen, Jeff Schneider

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出贝叶斯自适应蒙特卡洛树搜索算法,用于提升离线模型驱动强化学习的性能,显著优于现有方法。

Comments This paper is accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13547 2026-01-28 cs.CL

ThinkNote: Enhancing Knowledge Integration and Utilization of Large Language Models via Constructivist Cognition Modeling

ThinkNote: 通过建构主义认知建模增强大型语言模型的知识整合与利用

Zhipeng Xu, Zhenghao Liu, Yukun Yan, Shuo Wang, Shi Yu, Zheni Zeng, Chaojun Xiao, Zhiyuan Liu, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 ThinkNote通过建构主义认知建模提升大型语言模型的知识整合与利用能力,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18829 2026-01-28 cs.LG cs.AI

CP Loss: Channel-wise Perceptual Loss for Time Series Forecasting

CP Loss:时间序列预测中的通道感知损失

Yaohua Zha, Chunlin Fan, Peiyuan Liu, Yong Jiang, Tao Dai, Hai Wu, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Perceptual Intelligence, Pengcheng Laboratory(感知智能研究院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 本文提出CP Loss,通过为每个通道学习独特的感知空间,提升时间序列预测中对通道特定动态的捕捉能力。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18771 2026-01-27 cs.CL cs.AI cs.IR

Dep-Search: Learning Dependency-Aware Reasoning Traces with Persistent Memory

Dep-Search: 基于持久记忆的学习依赖意识推理轨迹

Yanming Liu, Xinyue Peng, Zixuan Yan, Yanxin Shen, Wenjie Xu, Yuefeng Huang, Xinyi Wang, Jiannan Cao, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Intel Corporation(英特尔公司) Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 Dep-Search 通过 GRPO 集成结构化推理、检索和持久记忆,提升 LLM 处理复杂多跳推理任务的能力。

Comments Dep-Search 1st version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18393 2026-01-27 cs.SD cs.CL eess.AS

OCR-Enhanced Multimodal ASR Can Read While Listening

增强OCR的多模态ASR可边听边读

Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun, Chao Zhang

机构 * Department of Electrical Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

AI总结 Donut-Whisper通过结合双编码器和交叉注意力模块,利用视觉信息提升中英文语音识别性能,实现显著的WER和CER降低。

Comments 4 pages, 2 figures. Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18255 2026-01-27 cs.LG cs.AI

Beyond Retention: Orchestrating Structural Safety and Plasticity in Continual Learning for LLMs

超越保留:在连续学习中协调结构安全与可塑性

Fei Meng

机构 * Yangtze Delta Region Institute of Tsinghua University(清华大学 Yangtze Delta 区研究所)

AI总结 本文提出OSW方法,通过正交子空间唤醒协调连续学习中的结构安全与可塑性,有效保留脆弱任务能力并维持新任务学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18222 2026-01-27 cs.CV

HomoFM: Deep Homography Estimation with Flow Matching

HomoFM:基于流匹配的深度视角估计

Mengfan He, Liangzheng Sun, Chunyu Li, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) School of Aerospace Engineering, Beijing Institute of Technology(北京理工大学航空航天工程学院)

AI总结 HomoFM通过引入流匹配技术,首次将生成建模中的速度场学习应用于视角估计,提升估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10977 2026-01-27 cs.AI cs.CL

Revisiting Model Interpolation for Efficient Reasoning

重新审视模型插值以实现高效推理

Taiqiang Wu, Runming Yang, Tao Liu, Jiahao Wang, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 本文重新审视模型插值方法,发现其遵循三阶段进化范式,并通过实验验证了其在高效推理中的优越性。

Comments 14 pages, 6 figures, 7 tables. Working in progress (Llama results added)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10203 2026-01-27 cs.CV

A Style-Based Profiling Framework for Quantifying the Synthetic-to-Real Gap in Autonomous Driving Datasets

基于风格的 profiling 框架用于量化自动驾驶数据集的合成到现实差距

Dingyi Yao, Xinyao Han, Ruibo Ming, Zhihang Song, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 本文提出基于风格的 profiling 框架,通过 SEDD 度量标准量化合成与现实数据集的差距,提升自动驾驶数据集的质量控制。

Comments Accepted for publication at the 2026 IEEE Intelligent Vehicles Symposium (IEEE IV 2026)

Journal ref 2026 IEEE Intelligent Vehicles Symposium (IEEE IV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16522 2026-01-27 cs.CV

Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow

Adams-Bashforth-Moulton 解决方案用于 rectified 流中的反向和编辑

Yongjia Ma, Donglin Di, Xuan Liu, Xiaokai Chen, Lei Fan, Tonghua Su, Yue Gao

机构 * Li Auto(利亚 Auto) Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学) Tsinghua University(清华大学)

AI总结 本文提出ABM求解器,通过多步预测校正和自适应步长调整提升rectified流模型的求解精度和编辑质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17507 2026-01-27 cs.RO

MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions

MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合

Yutong Shen, Hangxu Liu, Kailin Pei, Ruizhe Xia, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。

Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17275 2026-01-27 cs.LG cs.AI

Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning

潜在空间对比强化学习用于稳定高效的LLM推理

Lianlei Shan, Han Chen, Yixuan Wang, Zhenjie Liu, Wei Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) EvolutionLeap(进化跃迁) Tsinghua University(清华大学)

AI总结 本研究提出深度潜在推理(DLR),通过潜在空间对比强化学习提升LLM在复杂推理任务中的稳定性与效率。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24330 2026-01-27 cs.CV

SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning

SenseNova-MARS: 通过强化学习赋能多模态代理推理与搜索

Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Dahua Lin, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

AI总结 SenseNova-MARS通过强化学习赋能多模态代理推理与搜索,提升视觉-语言模型在复杂视觉任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23077 2026-01-27 cs.RO

Embodied Learning of Reward for Musculoskeletal Control with Vision Language Models

具身学习奖励以实现肌肉骨骼控制与视觉语言模型

Saraswati Soedarmadji, Yunyue Wei, Chen Zhang, Yisong Yue, Yanan Sui

机构 * Tsinghua University(清华大学) California Institute of Technology(加州理工学院)

AI总结 本文提出MoVLR框架,利用视觉语言模型实现高维肌肉骨骼系统的具身学习,通过迭代交互发现和改进奖励函数。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17570 2026-01-27 cs.LG cs.AI cs.PF

GreedySnake: Accelerating SSD-Offloaded LLM Training with Efficient Scheduling and Optimizer Step Overlapping

GreedySnake: 通过高效调度和优化器步长重叠加速SSD卸载的LLM训练

Yishu Yin, Xuehai Qian

机构 * Tsinghua University(清华大学)

AI总结 GreedySnake通过高效调度和优化器步长重叠,显著提升了SSD卸载LLM训练的吞吐量,实验显示在不同规模的GPU上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13185 2026-01-27 physics.ao-ph cs.AI cs.LG

CondensNet: Enabling stable long-term climate simulations via hybrid deep learning models with adaptive physical constraints

CondensNet:通过混合深度学习模型与自适应物理约束实现稳定的长期气候模拟

Xin Wang, Jianda Chen, Juntao Yang, Jeff Adie, Simon See, Kalli Furtado, Chen Chen, Troy Arcomano, Romit Maulik, Wei Xue, Gianmarco Mengaldo

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) NVIDIA AI Technology Centre(NVIDIA人工智能技术中心) Centre for Climate Research Singapore(新加坡气候研究中心) Environmental Science Division, Argonne National Laboratory(阿贡国家实验室环境科学部) Information Sciences and Technology Department, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术系)

AI总结 CondensNet通过引入自适应物理约束,解决了混合模型中凝结过程的不稳定性问题,提升了长期气候模拟的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03167 2026-01-27 cs.CV cs.GR

CloSET: Modeling Clothed Humans on Continuous Surface with Explicit Template Decomposition

CloSET: 基于连续表面建模的着装人类建模

Hongwen Zhang, Siyou Lin, Ruizhi Shao, Yuxiang Zhang, Zerong Zheng, Han Huang, Yandong Guo, Yebin Liu

机构 * Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

AI总结 CloSET通过分解显式服装模板并学习姿态依赖的褶皱,提升服装变形建模的精度和泛化能力。

Comments CVPR 2023 Paper, Update project page: https://zhanghongwen.cn/closet

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06400 2026-01-27 cs.CV

PyMAF-X: Towards Well-aligned Full-body Model Regression from Monocular Images

PyMAF-X:迈向从单目图像中恢复对齐的完整身体模型

Hongwen Zhang, Yating Tian, Yuxiang Zhang, Mengcheng Li, Liang An, Zhenan Sun, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Computer Science and Technology, Nanjing University(计算机科学与技术系,南京大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

AI总结 PyMAF-X通过改进的回归方法实现从单目图像中准确恢复对齐的完整身体模型,提升了网格与图像的对齐性能。

Comments Article in IEEE TPAMI 2023, Update project page: https://zhanghongwen.cn/pymaf-x, An eXpressive extension of PyMAF [arXiv:2103.16507] for monocular human/hand/face/whole-body motion capture

详情

展开后加载摘要…

URL PDF HTML 收藏