arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2503.12797 2026-04-03 cs.CV cs.AI cs.CL

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06499 2026-04-03 cs.CV cs.AI

ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis

ExGes:基于音频驱动的 gesture 合成中的 expressive 人类运动检索与调节

Xukun Zhou, Fengxin Li, Ming Chen, Yan Zhou, Pengfei Wan, Di Zhang, Yeying Jin, Zhaoxin Fan, Hongyan Liu, Jun He

机构 * Renmin University(中国人民大学) Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 本文提出ExGes框架,通过运动库构建、运动检索模块和精度控制模块,提升音频驱动手势合成的表达性和与音频语义的一致性,实验表明其在Fréchet Gesture Distance和运动多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01220 2026-04-02 cs.CL

Universal YOCO for Efficient Depth Scaling

通用YOCO用于高效深度扩展

Yutao Sun, Li Dong, Tianzhu Ye, Shaohan Huang, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

AI总结 本文提出通用YOCO(YOCO-U),结合递归计算与YOCO解码器解码器架构,实现更高效的推理效率与深度扩展能力,通过参数共享和浅层高效注意力层提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00955 2026-04-02 cs.CV

Enhancing Gradient Inversion Attacks in Federated Learning via Hierarchical Feature Optimization

通过分层特征优化增强联邦学习中的梯度反向攻击

Hao Fang, Wenbo Yu, Bin Chen, Xuan Wang, Shu-Tao Xia, Qing Liao, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出GIFD方法,通过分解GAN模型并搜索中间层的分层特征,提升梯度反向攻击的表达能力和泛化能力,同时引入正则化约束和OOD场景下的标签映射技术,实现像素级重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00754 2026-04-02 cs.CL cs.LG

Stochastic Attention: Connectome-Inspired Randomized Routing for Expressive Linear-Time Attention

随机注意力:受连接组启发的随机路由用于表达性线性时间注意力

Zehao Jin, Yanan Sui

机构 * Tsinghua University(清华大学)

AI总结 本文提出Stochastic Attention,通过随机排列token序列提升注意力机制的表达性,实现更高效的全局通信,在预训练和推理任务中均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00556 2026-04-02 cs.LG cs.AI cs.ET q-fin.CP q-fin.RM

HabitatAgent: An End-to-End Multi-Agent System for Housing Consultation

HabitatAgent:一种端到端的多智能体系统用于住房咨询

Hongyang Yang, Yanxin Zhang, Yang She, Yue Xiao, Hao Wu, Yiyang Zhang, Jiapeng Hou, Rongshan Zhang

机构 * Fangdongdong(方东东) Tsinghua University(清华大学) Columbia University(哥伦比亚大学)

AI总结 本文提出HabitatAgent,一种基于LLM的多智能体系统,通过四个专业角色提供可审计且可靠的住房咨询流程,实现高准确率的住房选择支持。

Comments Accepted at the DMO-FinTech Workshop (PAKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00375 2026-04-02 cs.CL

Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models

局部自信,全局停滞:扩散语言模型中的质量探索困境

Liancheng Fang, Aiwei Liu, Henry Peng Zou, Yankai Chen, Enze Ma, Leyi Pan, Chunyu Miao, Wei-Chieh Huang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学)

AI总结 本文探讨了扩散语言模型中质量与探索的矛盾,提出了一种平衡两者的方法,通过优化分布和采样策略提升生成质量与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25527 2026-04-02 cs.CV

Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training

超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境

Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 本文提出TQD方法,通过时间步选择性训练解决视频生成中运动与视觉质量的矛盾,证明在不平衡数据上训练可超越传统高质量数据训练效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09504 2026-04-02 cs.CL

MVSS: A Unified Framework for Multi-View Structured Survey Generation

MVSS:多视图结构化调查生成的统一框架

Yinqi Liu, Yueqi Zhu, Yongkang Zhang, Feiran Liu, Yutong Shen, Yufei Sun, Xin Wang, Renzhao Liang, Yidong Wang, Cunxiang Wang

机构 * Beijing University of Technology(北京工业大学) Peking University(北京大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本文提出MVSS框架,通过结构优先方法生成和对齐引用支撑的层级树、结构化比较表和调查文本,提升调查生成的结构组织和证据呈现质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00267 2026-04-02 cs.CV

ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Redirection

ActErase: 一种无需训练的概念擦除范式通过激活重定向

Yi Sun, Xinhao Zhong, Hongyan Li, Yimin Zhou, Junhao Li, Bin Chen, Xuan Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出无需训练的概念擦除方法ActErase,通过激活差异区域分析和动态替换输入激活,实现高效概念擦除,同时保持模型生成能力,且具有对抗攻击鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14275 2026-04-02 cs.CL

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计

Ante Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08522 2026-04-02 cs.CL

AlphaResearch: Accelerating New Algorithm Discovery with Language Models

AlphaResearch:利用语言模型加速新算法发现

Zhaojian Yu, Kaiyue Feng, Yilun Zhao, Shilin He, Xiao-Ping Zhang, Arman Cohan

机构 * Tsinghua University(清华大学) New York University(纽约大学) Yale University(耶鲁大学)

AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04921 2026-04-02 cs.CL

AgentExpt: Automating AI Experiment Design with LLM-based Resource Retrieval Agent

AgentExpt: 基于LLM的资源检索代理自动化AI实验设计

Yu Li, Lehui Li, Lin Chen, Qingmin Liao, Fengli Xu, Yong Li

机构 * Tsinghua University(清华大学) Shandong University(山东大学) Northeastern University(东北大学)

AI总结 本文提出基于LLM的资源检索代理框架,通过自动化数据收集和集体感知增强检索,提升实验设计的自动化和可解释性,实验结果显示在Recall@20和HitRate@5上分别提升5.85%和8.30%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09997 2026-04-02 cs.GR cs.CV

CLoD-GS: Continuous Level-of-Detail via 3D Gaussian Splatting

CLoD-GS:通过3D高斯散射实现连续细节层次

Zhigang Cheng, Mingchao Sun, Yu Liu, Zengye Ge, Luyang Tang, Mu Xu, Yangyan Li, Peng Pan

机构 * Tsinghua University(清华大学) AMAP(高德地图)

AI总结 本文提出CLoD-GS框架,利用3D高斯散射技术实现连续细节层次,通过动态调整高斯体透明度,实现单模型的平滑细节渐变,减少存储开销和视觉瑕疵。

Comments Accepted by ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14570 2026-04-02 cs.LG cs.AI

LPS-GNN : Deploying Graph Neural Networks on Graphs with 100-Billion Edges

LPS-GNN:在拥有1000亿条边的图上部署图神经网络

Xu Cheng, Liang Yao, Feng He, Yukuo Cen, Yufei He, Chenhui Zhang, Wenzheng Feng, Hongyun Cai, Jie Tang

机构 * Tsinghua University(清华大学) Sun Yat-sen University(中山大学) Tencent Inc(腾讯公司) National University of Singapore(新加坡国立大学)

AI总结 本文提出LPS-GNN框架,通过优化图分区和子图增强策略,在单块GPU10小时内处理1000亿图节点,提升用户获取场景性能13.8%。

Journal ref ACM Transactions on Knowledge Discovery from Data (TKDD) (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14222 2026-04-02 cs.SD cs.GR cs.MM eess.AS

MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation

MATHDance:具有统一标记化的Mamba-Transformer架构用于高质量3D舞蹈生成

Kaixing Yang, Xulong Tang, Ziqiao Peng, Yuxuan Hu, Xiangyue Zhang, Puwei Wang, Hongyan Liu, Jun He, Zhaoxin Fan

机构 * Renmin University of China(中国人民大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

AI总结 本文提出MATHDance框架,通过两阶段设计提升音乐到舞蹈生成的一致性,采用Kinematic-Dynamic量化阶段和混合架构生成高质量3D舞蹈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00057 2026-04-02 cs.MM cs.AI

Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning

面向知识增强视觉推理的自动足球解说生成

Zeyu Jin, Xiaoyu Qin, Songtao Zhou, Kaifeng Yun, Jia Jia

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

AI总结 本文提出GameSight模型,通过视觉推理与知识增强生成更准确的足球解说,提升解说质量与上下文相关性。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30038 2026-04-01 cs.CV

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

在3D几何计算机视觉中评估博士级别的编程能力

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao

机构 * AIR, Tsinghua University(清华大学智能产业研究院) Qiuzhen College, Tsinghua University(清华大学求真书院) BAAI(北京智源人工智能研究院) Peking University(北京大学) Nanjing University(南京大学) University of Toronto(多伦多大学)

AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。

Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29723 2026-04-01 cs.AI

Reinforced Reasoning for End-to-End Retrosynthetic Planning

强化推理用于端到端的逆合成规划

Chenyang Zuo, Siqi Fan, Yizhen Luo, Zaiqing Nie

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) PharMolix Inc(PharMolix公司)

AI总结 本文提出ReTriP框架,通过端到端生成方法将逆合成规划转化为连续推理任务,采用路径一致的分子表示和渐进训练课程,提升长周期规划的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28460 2026-04-01 cs.CV cs.LG

$R_\text{dm}$: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation

$R_\ ext{dm}$:重新概念化分布匹配作为扩散蒸馏的奖励

Linqian Fan, Peiqin Sun, Tiancheng Wen, Shun Lu, Chengru Song

机构 * KlingAI Research(KlingAI 研究院) Tsinghua University(清华大学)

AI总结 本文提出将分布匹配重新概念化为奖励以提升扩散蒸馏性能,通过引入GNDM提升优化稳定性,实现无缝奖励整合和改进采样效率,实验表明其在生成质量与保真度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29332 2026-04-01 cs.RO cs.AI

Scaling Whole-Body Human Musculoskeletal Behavior Emulation for Specificity and Diversity

为特定性和多样性扩展全身人体肌肉骨骼行为模拟

Yunyue Wei, Chenhui Zuo, Shanning Zhuang, Haixin Gong, Yaming Liu, Yanan Sui

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种大规模并行肌肉骨骼计算框架,用于基于生物力学的全身运动再现,通过整合GPU模拟与对抗性奖励聚合,实现了高维强化学习在肌肉骨骼控制中的优化,准确再现了700多块肌肉驱动的广泛运动 repertoire。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29318 2026-04-01 cs.AI

PSPA-Bench: A Personalized Benchmark for Smartphone GUI Agent

PSPA-Bench:面向智能手机GUI代理的个性化基准

Hongyi Nie, Xunyuan Liu, Yudong Bai, Yaqing Wang, Yang Liu, Quanming Yao, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Peking University(北京大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院)

AI总结 本文提出PSPA-Bench,用于评估智能手机GUI代理的个性化能力,通过12855条个性化指令和22款移动应用,揭示现有方法在个性化场景下的不足,并提出改进方向。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29217 2026-04-01 eess.AS cs.CL cs.SD

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

推进基于大语言模型的音素到字母转换以实现多语言语音识别

Lukuang Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

机构 * TasiTech Co., Ltd., China(塔斯科技股份有限公司,中国) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能(SPMI)实验室,中国) School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院,中国)

AI总结 本文研究了基于大语言模型的多语言音素到字母转换,通过鲁棒训练和低资源过采样将平均识别错误率从10.56%降至7.66%。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29182 2026-04-01 cs.LG cs.CR

Dummy-Aware Weighted Attack (DAWA): Breaking the Safe Sink in Dummy Class Defenses

伪类感知加权攻击(DAWA):打破伪类防御中的安全汇合

Yunrui Yu, Xuxiang Feng, Pengda Qin, Pengyang Wang, Kafeng Wang, Cheng-zhong Xu, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学) University of Macau(澳门大学) Tencent(腾讯)

AI总结 本文提出DAWA,一种新的评估方法,通过自适应加权同时攻击真实标签和伪标签,有效突破伪类防御机制,降低其鲁棒性评估值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29163 2026-04-01 cs.CV

SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving

SparseDriveV2:仅需评分即可实现端到端自动驾驶

Wenchao Sun, Xuewu Lin, Keyu Chen, Zixiang Pei, Xiang Li, Yining Shi, Sifa Zheng

机构 * Tsinghua University(清华大学) Horizon Continental Technology(地平线大陆科技) Horizon(地平线)

AI总结 本文提出SparseDriveV2,通过可扩展的词汇表示和评分策略提升端到端自动驾驶性能,实现在NAVSIM和Bench2Drive上的高评分和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13266 2026-04-01 cs.CL cs.AI

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

QuestA: 通过问题增强扩展大语言模型的推理能力

Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Amazon(亚马逊) Stanford University(斯坦福大学)

AI总结 QuestA通过问题增强策略在训练中引入部分解以降低问题难度,提升大语言模型在数学推理任务中的推理能力,取得新的SOTA结果。

Comments 25 pages, 18 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11539 2026-04-01 cs.CV cs.AI cs.LG

Streaming 4D Visual Geometry Transformer

流式4D视觉几何变换器

Dong Zhuo, Wenzhao Zheng, Jiahe Guo, Yuqi Wu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种流式视觉几何变换器,通过因果变换器架构实现低延迟的4D视觉几何重建,结合知识蒸馏和高效注意力机制,提升在线场景下的推理速度与重建质量。

Comments Code is available at: https://github.com/wzzheng/StreamVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏