arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2602.04340 2026-02-05 cs.CV cs.AI

Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning

显式不确定性建模用于主动CLIP适应与双提示微调

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室)

AI总结 本文提出基于双提示微调的显式不确定性建模框架,用于提升主动CLIP适应的分类可靠性与主动样本选择效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04337 2026-02-05 cs.CV cs.AI

Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner

无需人工标注的预训练视觉-语言模型微调

Qian-Wei Wang, Guanghao Meng, Ren Cai, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)

AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04196 2026-02-05 cs.CL cs.LG

The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment

缺失的一半:揭示训练时间隐含的安全风险

Zhexin Zhang, Yida Lu, Junfeng Fang, Junxiao Yang, Shiyao Cui, Hao Zhou, Fandong Meng, Jie Zhou, Hongning Wang, Minlie Huang, Tat-Seng Chua

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话研究院) National University of Singapore(新加坡国立大学) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院)

AI总结 本文首次系统研究训练期间隐式安全风险,揭示模型内部激励和上下文信息驱动的有害行为,并通过实验展示其广泛存在和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04167 2026-02-05 cs.CV

Point2Insert: Video Object Insertion via Sparse Point Guidance

Point2Insert: 通过稀疏点引导的视频物体插入

Yu Zhou, Xiaoyan Yang, Bojia Zi, Lihan Zhang, Ruijie Sun, Weishi Zheng, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Sun Yat-sen University(孙中山大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 Point2Insert通过稀疏点引导实现视频中物体的灵活插入,优于现有方法并具备更高的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03887 2026-02-05 eess.IV cs.CV

To What Extent Do Token-Level Representations from Pathology Foundation Models Improve Dense Prediction?

病理基础模型的标记级表示在密集预测中有多大的提升作用?

Weiming Chen, Xitong Ling, Xidong Wang, Zhenyang Cai, Yijia Guo, Mingxi Fu, Ziyi Zeng, Minxi Ouyang, Jiawen Li, Yizhi Wang, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) Peking University, Beijing, China(北京大学)

AI总结 本文提出PFM-DenseBench,通过评估17个病理基础模型在18个数据集上的表现,揭示不同模型和调优策略在异构数据集上的性能差异及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03849 2026-02-05 cs.HC cs.AI cs.CL cs.LG

HybridQuestion: Human-AI Collaboration for Identifying High-Impact Research Questions

HybridQuestion: 人机协作识别高影响力研究问题

Keyu Zhao, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学)

AI总结 HybridQuestion通过人机协作识别高影响力研究问题,利用AI处理数据与人类判断结合,验证了在科学突破和未来问题预测中的有效性。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10326 2026-02-05 cs.CV

StainNet: Scaling Self-Supervised Foundation Models on Immunohistochemistry and Special Stains for Computational Pathology

StainNet: 通过免疫组化和特殊染色在计算病理学中扩展自监督基础模型

Jiawen Li, Jiali Hu, Xitong Ling, Yongqiang Lv, Yuxuan Chen, Yizhi Wang, Tian Guan, Yifei Liu, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Biomedical Engineering Programme, City University of Hong Kong (Dongguan)(香港城市大学(东莞)生物医学工程项目) Department of Pathology, Affiliated Hospital of Nantong University(南通大学附属医院病理科) Nantong University(南通大学)

AI总结 StainNet通过自监督学习方法,针对IHC和特殊染色图像训练基础模型,提升计算病理学在非H&E图像中的应用能力。

Comments 26 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03822 2026-02-04 cs.CL

They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References

他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考

Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) The University of Western Australia(西澳大学) Stanford University(斯坦福大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。

Comments Accepted at the The Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00642 2026-02-04 cs.CL

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

LegalOne:一种用于可靠法律推理的基础模型家族

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Quancheng Laboratory(清华云城实验室) University of Waterloo, Canada(加拿大滑铁卢大学) China University of Political Science and Law(中国政法大学) MegaTech.AI Inc(MegaTech.AI公司)

AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。

Comments 25 pages, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03355 2026-02-04 cs.SD cs.LG

PACE: Pretrained Audio Continual Learning

PACE:预训练音频持续学习

Chang Li, Kanglei Zhou, Liyuan Wang

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(心理与认知科学系,清华大学)

AI总结 PACE通过改进的分析分类器和自适应子空间正交PEFT,提升预训练模型在音频持续学习中的鲁棒性和可扩展性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03310 2026-02-04 cs.RO cs.AI cs.CV cs.LG

RDT2: Exploring the Scaling Limit of UMI Data Towards Zero-Shot Cross-Embodiment Generalization

RDT2:探索UMI数据的缩放极限以实现零样本跨具身泛化

Songming Liu, Bangguo Li, Kai Ma, Lingxuan Wu, Hengkai Tan, Xiao Ouyang, Hang Su, Jun Zhu

机构 * Tsinghua University(清华大学)

AI总结 RDT2通过三阶段训练配方实现零样本跨具身泛化,提升机器人在开放词汇任务中的表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03242 2026-02-04 cs.CV

InstaDrive: Instance-Aware Driving World Models for Realistic and Consistent Video Generation

InstaDrive: 为真实和一致的视频生成实例感知的驾驶世界模型

Zhuoran Yang, Xi Guo, Chenjing Ding, Chiyu Wang, Wei Wu, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) SenseAuto(感etime) Tsinghua University(清华大学)

AI总结 InstaDrive通过实例感知机制提升驾驶视频生成质量,增强自动驾驶任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03237 2026-02-04 cs.LG cs.CL

Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations

超越合并:通过激活引导的旋转进行流式LLM更新

Yuxuan Yao, Haonan Sheng, Qingsong Lv, Han Wu, Shuqi Liu, Zehua Liu, Zengyan Liu, Jiahui Gao, Haochen Tan, Xiaojin Fu, Haoli Bai, Hing Cheung So, Zhijiang Guo, Linqi Song

机构 * City University of Hong Kong, Hong Kong SAR(香港城市大学) Tsinghua University(清华大学) Huawei Noah’s Ark Lab, Hong Kong SAR(华为诺亚实验室(香港)) University of Hong Kong(香港大学) Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 本文提出ARM策略,通过激活引导的旋转实现流式LLM更新,有效超越收敛模型,提供高效适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03230 2026-02-04 cs.CV

EventFlash: Towards Efficient MLLMs for Event-Based Vision

EventFlash: 向基于事件的视觉高效MLLMs迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Wen Jiang, Ming Li, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 EventFlash通过时空令牌稀疏化技术,实现高效事件视觉处理,提升吞吐量并支持更长的事件流处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03226 2026-02-04 cs.CL cs.AI

ATACompressor: Adaptive Task-Aware Compression for Efficient Long-Context Processing in LLMs

ATACompressor: 适应性任务感知压缩用于LLMs中高效长上下文处理

Xuancheng Li, Haitao Li, Yujia Zhou, Qingyao Ai, Yiqun Liu

机构 * DCST, Tsinghua University(清华大学数据科学研究院)

AI总结 ATACompressor通过自适应任务感知压缩提升LLMs长上下文处理效率,实现信息保留与压缩效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03176 2026-02-04 cs.CV

BinaryDemoire: Moiré-Aware Binarization for Image Demoiréing

BinaryDemoire: 用于图像去摩尔纹的摩尔纹感知二值化

Zheng Chen, Zhi Yang, Xiaoyang Liu, Weihang Zhang, Mengfan Wang, Yifan Fu, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 BinaryDemoire通过引入摩尔感知二值门和洗牌分组残差适配器,实现高效去摩尔纹,优于现有二值化方法。

Comments Code is available at: https://github.com/zhengchen1999/BinaryDemoire

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03134 2026-02-04 cs.CV cs.AI

SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass

SwiftVLM: 通过跨层令牌绕过实现高效的视觉-语言模型推理

Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma, Xin Miao

机构 * Tsinghua University, Beijing, China(清华大学)

AI总结 SwiftVLM通过跨层令牌绕过方法,在视觉-语言模型中实现高效的推理,优于现有修剪策略,提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03013 2026-02-04 cs.CV

Thinking inside the Convolution for Image Inpainting: Reconstructing Texture via Structure under Global and Local Side

在卷积中思考图像修复:通过结构下采样重建纹理

Haipeng Liu, Yang Wang, Biao Qian, Yong Rui, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Lenovo Research(联想研究院)

AI总结 本文提出通过结构和纹理特征图的统计归一化和去归一化策略,缓解卷积下采样中的信息损失,提升图像修复的高质量输出。

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02863 2026-02-04 cs.AI cs.LG

"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time

我可能没有表达清楚:在推理时间诊断LLM推理中的动态不稳定性

Jinkun Chen, Fengxiang Cheng, Sijia Han, Vlado Keselj

机构 * Dalhousie University(达尔豪斯大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学) Meta

AI总结 研究通过分析LLM推理过程中的动态不稳定性,发现早期不稳定性可能预示后续正确答案,而晚期不稳定性更易导致失败,提出基于分布偏移和熵的诊断方法。

Comments 21 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02597 2026-02-04 cs.LG cs.AI

ContextEvolve: Multi-Agent Context Compression for Systems Code Optimization

ContextEvolve: 多智能体上下文压缩用于系统代码优化

Hongyuan Su, Yu Zheng, Yong Li

机构 * Tsinghua University, Beijing, China(清华大学) Zhongguancun Academy, Beijing, China(中关村学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

AI总结 ContextEvolve通过多智能体框架实现系统代码优化,利用上下文压缩提升搜索效率,实验表明其在ADRS基准测试中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02591 2026-02-04 cs.SD cs.AI

VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis

VividVoice: 一个统一的框架,用于场景感知的视觉驱动语音合成

Chengyuan Ma, Jiawei Jin, Ruijie Xiong, Chunxiang Jin, Canxiang Yan, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Ant Group, China(蚂蚁集团)

AI总结 VividVoice通过构建大规模多模态数据集和设计核心对齐模块,提升了场景感知的视觉驱动语音合成的音频保真度和多模态一致性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02573 2026-02-04 cs.LG cs.AI

Product Interaction: An Algebraic Formalism for Deep Learning Architectures

产品交互:深度学习架构的一种代数形式化

Haonan Dong, Chun-Wun Cheng, Angelica I. Aviles-Rivero

机构 * Tsinghua University. Email(清华大学) University of Cambridge(剑桥大学) YMSC, Tsinghua University(清华大学数学科学中心)

AI总结 本文提出了一种代数形式化方法,通过产品交互构建深度学习架构,统一了线性、二次及更高阶的交互方式,适用于卷积、等变网络及注意力机制等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02536 2026-02-04 cs.LG cs.AI cs.CL cs.CV

From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation

从稀疏决策到密集推理:一种多属性轨迹范式用于多模态调制

Tianle Gu, Kexin Huang, Lingyu Li, Ruilin Luo, Shiyang Huang, Zongqi Wang, Yujiu Yang, Yan Teng, Yingchun Wang

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 UniMod提出一种多属性轨迹范式,通过多维边界学习提升多模态调制效果,以更少的数据实现高效安全内容识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01661 2026-02-04 cs.CV

From Frames to Sequences: Temporally Consistent Human-Centric Dense Prediction

从帧到序列:面向时间一致的人本密集预测

Xingyu Miao, Junting Dong, Qin Zhao, Yuhang Yang, Junhao Chen, Yang Long

机构 * Durham University(杜伦大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) USTC(中科大) Tsinghua University(清华大学)

AI总结 本文提出了一种可扩展的合成数据管道,结合静态预训练与动态序列监督,训练出统一的ViT密集预测器,以实现时间一致的人本密集预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01538 2026-02-04 cs.CV cs.AI cs.CL

Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars

让拟人化角色互动:面向文本驱动的人-物体交互的可控对话拟人化

Youliang Zhang, Zhengguang Zhou, Zhentao Yu, Ziyao Huang, Teng Hu, Sen Liang, Guozhen Zhang, Ziqiao Peng, Shunkai Li, Yi Chen, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Xiu Li

机构 * Tsinghua University(清华大学) Tencent HY(腾讯)

AI总结 本文提出InteractAvatar框架,通过双流结构实现文本驱动的人-物体交互生成,解决环境感知与控制质量矛盾,建立GroundedInter基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16540 2026-02-04 cs.SD cs.AI eess.AS

Do Models Hear Like Us? Probing the Representational Alignment of Audio LLMs and Naturalistic EEG

模型是像我们一样听吗?探查音频大语言模型与自然EEG的表征对齐

Haoyun Yang, Xin Xiao, Jiang Zhong, Yu Tian, Dong Xiaohua, Yu Mao, Hao Wu, Kaiwen Wei

机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) School of Economics and Business Administration, Chongqing University(重庆大学经济与商业管理学院) School of Artificial Intelligence, Southwest University(西南大学人工智能学院) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

AI总结 本研究通过比较音频大语言模型与EEG信号,揭示了模型在自然聆听中的表征对齐特性,发现排名依赖分裂、时空对齐模式及情感分离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22124 2026-02-04 cs.LG cs.AI

Efficient Utility-Preserving Machine Unlearning with Implicit Gradient Surgery

高效实用型机器去学习与隐式梯度手术

Shiji Zhou, Tianbai Yu, Zhi Zhang, Heng Chang, Xiao Zhou, Dong Wu, Han Zhao

机构 * Institute of Artificial Intelligence, Beihang University(北航人工智能研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学) YanTron Technology Co.Ltd(燕tron技术有限公司)

AI总结 本文提出了一种高效实用型机器去学习方法,通过隐式梯度手术实现去学习与实用性保持的平衡。

Comments Corresponding author: Shiji Zhou (zhoushiji25@buaa.edu.cn). Shiji Zhou and Tianbai Yu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11129 2026-02-04 cs.CV cs.AI

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏