arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-26 至 2026-03-26 共收录 18
2603.24581 2026-03-26 cs.CV cs.RO

Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving

潜在世界动作建模:端到端自动驾驶的潜在世界建模

Linbo Wang, Yupeng Zheng, Qiang Chen, Shiwei Li, Yichen Zhang, Zebin Xing, Qichao Zhang, Xiang Li, Deheng Qian, Pengxuan Yang, Yihang Dong, Ce Hao, Xiaoqing Ye, Junyu han, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of AI, Tsinghua University(清华大学人工智能学院) Zhongguancun Academy(中关村学院)

AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24382 2026-03-26 cs.LG cs.AI cs.CE

MolEvolve: LLM-Guided Evolutionary Search for Interpretable Molecular Optimization

MolEvolve: 基于大语言模型的可解释分子优化进化搜索

Xiangsen Chen, Ruilong Wu, Yanyan Lan, Ting Ma, Yang Liu

机构 * Hong Kong University of Science(香港科技大学) Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 MolEvolve通过大语言模型引导进化搜索,实现可解释的分子优化,优于传统方法在属性预测和分子优化任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24186 2026-03-26 cs.LG cs.AR

TsetlinWiSARD: On-Chip Training of Weightless Neural Networks using Tsetlin Automata on FPGAs

TsetlinWiSARD:基于FPGA的Tsetlin自动机实现重量神经网络的芯片级训练

Shengyu Duan, Marcos L. L. Sartori, Rishad Shafik, Alex Yakovlev

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克琴库特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

AI总结 本文提出TsetlinWiSARD,利用Tsetlin自动机实现重量神经网络的概率反馈学习,提升芯片级训练效率,实现1000倍加速和资源消耗降低。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11809 2026-03-26 cs.HC cs.RO

HiSync: Spatio-Temporally Aligning Hand Motion from Wearable IMU and On-Robot Camera for Command Source Identification in Long-Range HRI

HiSync: 从可穿戴IMU和机器人摄像头同步手部运动以在远距离HRI中进行命令源识别

Chengwen Zhang, Chun Yu, Borong Zhuang, Haopeng Jin, Qingyang Wan, Zhuojun Li, Zhe He, Zhoutong Ye, Yu Mei, Chang Liu, Weinan Shi, Yuanchun Shi

机构 * Department of Computer Science Technology, BNRist Tsinghua University Beijing China Technology, BNRist, College of AI Tsinghua University Beijing China Technology Tsinghua University Beijing China Beijing University of Posts Academy of Arts \& Design Tsinghua University Beijing China Qinghai University Xining China Tsinghua University Technology, BNRist, College of AI Technology Tsinghua University Academy of Arts \& Design Tsinghua University Qinghai University

AI总结 HiSync通过同步机器人摄像头光流与手环IMU信号,提取频域手部运动特征并融合多模态数据,实现远距离多用户HRI中的高准确率命令源识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01853 2026-03-26 cs.CL

Let the Agent Search: Autonomous Exploration Beats Rigid Workflows in Temporal Question Answering

让代理搜索:在时间问题回答中自主探索胜过固定工作流

Xufei Lv, Jiahui Yang, Haoyuan Sun, Xialin Su, Zhiliang Tian, Yifu Gao, Linbo Qiao, Houde Liu

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学)

AI总结 本文提出AT2QA代理,通过自主探索和动态自我纠正提升时间知识图谱问题回答性能,实验表明其在三个基准测试中超越现有最佳基线。

Comments Revised version with three added authors and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20732 2026-03-26 cs.LG cs.CV

Continual GUI Agents

连续GUI代理

Ziwei Liu, Borui Kang, Hangjie Yuan, Zixiang Zhao, Wei Li, Yifan Zhu, Tao Feng

机构 * Department of Computer Science and Technology, Tsinghua University, China(计算机科学与技术系,清华大学,中国) College of Computer Science, Zhejiang University, China(浙江大学计算机科学学院,中国) College of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机科学学院,中国)

AI总结 本文提出连续GUI代理任务,通过引入GUI-Anchoring in Flux框架,解决GUI分布变化时持续学习稳定性问题,实验显示其优于现有方法。

Comments Code is available at: https://github.com/xavierliu34/GUI-AiF

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24030 2026-03-26 cs.CV cs.MM

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23976 2026-03-26 cs.CV

SilLang: Improving Gait Recognition with Silhouette Language Encoding

SilLang: 通过轮廓语言编码提升步态识别

Ruiyi Zhan, Guozhen Peng, Canyu Chen, Jian Lei, Annan Li

机构 * Beihang University(北航大学) Tsinghua University(清华大学)

AI总结 本文提出SilLang模型,通过将二进制轮廓与自然语言结合,改进步态识别性能,利用LLM提取离散特征,提升时间模式建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23860 2026-03-26 cs.LG cs.AI

Why the Maximum Second Derivative of Activations Matters for Adversarial Robustness

为何激活函数的最大二阶导数对对抗鲁棒性至关重要

Yunrui Yu, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学)

AI总结 研究探讨了激活函数曲率对对抗鲁棒性的影响,发现曲率与模型表达能力和鲁棒泛化存在权衡,最优鲁棒性出现在最大二阶导数在4到10之间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23788 2026-03-26 cs.CV

Re-Prompting SAM 3 via Object Retrieval: 3rd of the 5th PVUW MOSE Track

通过目标检索重新提示SAM 3:5th PVUW MOSE Track的第三篇

Mingqi Gao, Sijie Li, Jungong Han

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文基于SAM 3开发自动重新提示框架,通过目标检索提升视频目标分割的鲁棒性,实现51.17%的J&F成绩,在MOSEv2 Track中排名第三。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23554 2026-03-26 cs.IR cs.AI

Mixture of Demonstrations for Textual Graph Understanding and Question Answering

演示混合用于文本图理解与问答

Yukun Wu, Lihui Liu

机构 * Independent Researcher, Wayne State University(韦恩州立大学独立研究者) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴court研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 本文提出MixDemo框架,通过MoE机制选择信息丰富的演示,结合查询特定图编码器减少噪声,提升文本图问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22343 2026-03-26 cs.LG cs.NI

Cloud-Edge Collaborative Large Models for Robust Photovoltaic Power Forecasting

云-边协同大模型用于鲁棒性光伏功率预测

Nan Qiao, Shuning Wang, Sijing Duan, Wenpeng Cui, Yuzhe Chen, Qingchen Yang, Xingyuan Hua, Ju Ren

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Computer Science and Technology, BNRist, Tsinghua University(清华大学计算机科学与技术系) Beijing Smartchip Microelectronics Technology Co., Ltd(北京智芯微电子技术有限公司)

AI总结 本文提出云-边协同框架CAPE,通过结合专用专家模型、轻量边缘模型和云端大模型,提升光伏功率预测的准确性与鲁棒性,同时满足严格的时延约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18996 2026-03-26 cs.CV

Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction

通过循环一致性掩码预测学习跨视角物体对应关系

Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) USTC(中国科学技术大学)

AI总结 本文提出基于条件二值分割的框架,通过循环一致性训练目标视角预测掩码并重建源视角掩码,实现无标注的自监督学习,提升跨视角物体对应性能。

Comments The paper has been accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11743 2026-03-26 cs.LG cs.AI

Uncertainty Makes It Stable: Curiosity-Driven Quantized Mixture-of-Experts

不确定性使其稳定:基于好奇心的量化专家混合框架

Sebastián Andrés Cajas Ordóñez, Luis Fernando Torres Torres, Mackenzie J. Meni, Carlos Andrés Duran Paredes, Eric Arazo, Cristian Bosch, Ricardo Simon Carbajo, Yuan Lai, Leo Anthony Celi

机构 * MIT Critical Data(MIT关键数据) Université de Rennes(里昂大学) Technetium Engineering(Technetium工程) Institución Universitaria Colegio Mayor del Cauca(科瓦卡大学学院) CeADAR - Ireland’s Centre for AI(爱尔兰人工智能中心) University College Dublin(都柏林大学) Tsinghua University(清华大学) Beth Israel Deaconess Medical Center(贝瑟尔以色列德acons医院) Harvard T.H. Chan School of Public Health(哈佛T.H.陈公共卫生学院)

AI总结 本文提出基于好奇心驱动的量化专家混合框架,通过贝叶斯知识不确定性路由提升模型在资源受限设备上的精度与推理延迟稳定性,实验证明其在音频分类任务中具有更高的准确率和更低的能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10223 2026-03-26 cs.CL cs.AI cs.LG

You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs

你只需要4个额外的标记:用于LLM的协同测试时间适应

Yijie Xu, Huizai Yao, Zhiyu Guo, Pengteng Li, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出SyTTA框架,通过输入侧困惑度和输出侧预测熵的协同作用,实现无需标注数据的LLM测试时间适应,显著提升农业问答任务的性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14181 2026-03-26 cs.LG cs.AI

Bridging Past and Future: Distribution-Aware Alignment for Time Series Forecasting

连接过去与未来:面向时间序列预测的分布感知对齐

Yifan Hu, Jie Yang, Tian Zhou, Peiyuan Liu, Yujin Tang, Rong Jin, Liang Sun

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里集团 DAMO 院) University of Illinois Chicago(伊利诺伊大学香槟分校) Dartmouth College(达特茅斯学院)

AI总结 本文提出TimeAlign框架,通过简单重建任务对齐辅助特征,提升时间序列预测性能,理论分析证明重建改善泛化能力,对齐增强表示与预测目标的互信息。

详情

展开后加载摘要…

URL PDF HTML 收藏