arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4556
2411.07042 2026-01-30 cs.HC cs.AI cs.CL cs.CY

Minion: A Technology Probe to Explore How Users Negotiate Harmful Value Conflicts with AI Companions

Minion:一种技术探测器,用于探索用户如何与AI伙伴协商有害的价值冲突

Xianzhe Fan, Qing Xiao, Xuhui Zhou, Yuran Su, Zhicong Lu, Maarten Sap, Hong Shen

机构 * The University of Hong Kong(香港大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Tsinghua University(清华大学) Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

AI总结 Minion通过探测用户与AI伙伴协商有害价值冲突的过程,揭示了设计中需平衡用户责任与AI安全的挑战。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21633 2026-01-30 cs.CV

A Tilted Seesaw: Revisiting Autoencoder Trade-off for Controllable Diffusion

倾斜的锯齿:重新审视自动编码器在可控扩散中的权衡

Pu Cao, Yiyang Ma, Feng Zhou, Xuedan Yin, Qing Song, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 本文研究了自动编码器在可控扩散中的权衡问题,发现gFID指标在可控性评估中表现不佳,而重建导向的指标更能反映可控性,提出了更可靠的评估方法。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21572 2026-01-30 cs.LG cs.AI

Signal-Adaptive Trust Regions for Gradient-Free Optimization of Recurrent Spiking Neural Networks

信号自适应信任区域用于递归脉冲神经网络的梯度自由优化

Jinhao Li, Yuhao Sun, Zhiyuan Ma, Hao He, Xinche Zhang, Xing Chen, Jin Li, Sen Song

机构 * Tsinghua University(清华大学)

AI总结 本文提出信号自适应信任区域方法,用于提高递归脉冲神经网络在高维连续控制任务中的训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21312 2026-01-30 cs.LG

Few-Shot Learning for Dynamic Operations of Automated Electric Taxi Fleets under Evolving Charging Infrastructure: A Meta-Deep Reinforcement Learning Approach

少样本学习用于动态变化的自动电动出租车车队运营:一种元深度强化学习方法

Xiaozhuang Li, Xindi Tang, Fang He

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) School of Management Science and Engineering, Central University of Finance and Economics(中央财经大学管理科学与工程学院)

AI总结 本文提出GAT-PEARL框架,通过元强化学习方法解决动态变化的充电基础设施下自动驾驶电动出租车车队的少样本学习问题,实现快速适应和高效运营。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21281 2026-01-30 cs.LG

EGAM: Extended Graph Attention Model for Solving Routing Problems

EGAM:扩展图注意力模型用于解决路由问题

Licheng Wang, Yuzi Yan, Mingtao Huang, Yuan Shen

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)

AI总结 EGAM通过扩展图注意力机制,改进了传统GAM在路由问题中的性能,尤其在复杂图结构处理上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21067 2026-01-30 cs.LG

Out-of-Distribution Generalization in Graph Foundation Models

图基础模型中的分布外泛化

Haoyang Li, Haibo Chen, Xin Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学)

AI总结 本文综述了图基础模型中分布外泛化的最新进展,讨论了分布偏移带来的挑战,并总结了相关方法和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20234 2026-01-30 cs.IR cs.AI

MALLOC: Benchmarking the Memory-aware Long Sequence Compression for Large Sequential Recommendation

MALLOC:用于大规模序列推荐的内存感知长序列压缩基准测试

Qihang Yu, Kairui Fu, Zhaocheng Du, Yuxuan Si, Kaiyuan Li, Weihao Zhao, Zhicheng Zhang, Jieming Zhu, Quanyu Dai, Zhenhua Dong, Shengyu Zhang, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Noah's Ark Lab(华为诺亚实验室) Tsinghua University(清华大学)

AI总结 MALLOC提出了一种用于大规模序列推荐的内存感知长序列压缩基准测试,通过系统分类内存管理技术并整合到先进推荐系统中,以提升推荐系统的整体可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12142 2026-01-30 eess.AS cs.MM cs.RO

Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving

Listen, Look, Drive: 通过用户意识的VLA基于自主驾驶的音频指令耦合

Ziang Guo, Feng Yang, Xuefeng Zhang, Jiaqi Guo, Kun Zhao, Yixiao Zhou, Peng Lu, Sifa Zheng, Zufeng Zhang

机构 * SuZhou Automotive Research Institute of Tsinghua University(清华大学苏州汽车研究院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Hyundai Motor Advanced Tech. R&D Center School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

AI总结 EchoVLA通过结合音频指令与视觉信息,提升自动驾驶对用户意图和情绪的感知能力,显著降低误差和碰撞率。

Comments Accepted by IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13602 2026-01-30 cs.CL cs.AI cs.LG

NOSA: Native and Offloadable Sparse Attention

NOSA:原生且可卸载的稀疏注意力

Yuxiang Huang, Pengjie Wang, Jicheng Han, Weilin Zhao, Zhou Su, Ao Sun, Hongya Lyu, Hengyu Zhao, Yudong Wang, Chaojun Xiao, Xu Han, Zhiyuan Liu

机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(清华大学) OpenBMB, China(OpenBMB) BUPT, Beijing, China(北京邮电大学) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学)

AI总结 NOSA是一种专为KV缓存卸载设计的可训练稀疏注意力机制,通过限制CPU与GPU之间的KV传输量,实现了低通信开销和高解码吞吐量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10890 2026-01-30 cs.CL

LLM$\times$MapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System

LLM×MapReduce-V3:通过MCP驱动的分层模块化代理系统实现交互式深入调研生成

Yu Chao, Siyu Lin, xiaorong wang, Zhu Zhang, Zihan Zhou, Haoyu Wang, Shuo Wang, Jie Zhou, Zhiyuan Liu, Maosong Sun

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学) Peking University(北京大学) Modelbest Inc.(Modelbest公司) Nanyang Technological University(南洋理工大学)

AI总结 LLM×MapReduce-V3通过MCP驱动的分层模块化代理系统实现交互式深入调研生成,提升调研内容深度与长度。

Comments Accepted by EMNLP2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03229 2026-01-30 cs.CV cs.AI

Bridging Weakly-Supervised Learning and VLM Distillation: Noisy Partial Label Learning for Efficient Downstream Adaptation

弥合弱监督学习与VLM知识蒸馏:面向高效下游适应的噪声部分标签学习

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

AI总结 本文提出协同一致性正则化框架,通过协同伪标签机制和抗过拟合策略,提升预训练VLMs在噪声部分标签下的下游适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01042 2026-01-30 cs.CL cs.AI

Probing Neural Topology of Large Language Models

探测大型语言模型的神经拓扑

Yu Zheng, Yuan Yuan, Yue Zhuo, Yong Li, Gabriel Kreiman, Tomaso Poggio, Paolo Santi

机构 * Massachusetts Institute of Technology(麻省理工学院) New York University(纽约大学) Tsinghua University(清华大学) Harvard Medical School(哈佛医学院)

AI总结 本研究提出图探测方法,通过分析LLM神经拓扑揭示其语言生成性能,发现拓扑信息比激活信息更丰富,可提升模型效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13258 2026-01-30 cs.CL

Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning

迈向透明的RAG:通过强化学习促进LLM生成中的证据可追溯性

Jingyi Ren, Yekun Xu, Xiaolong Wang, Weitao Li, Ante Wang, Weizhi Ma, Yang Liu

机构 * DCST \& AIR, Tsinghua University Beijing, China DCST, Tsinghua University Beijing, China AIR, Tsinghua University Beijing, China DSCT \& AIR, Tsinghua University Beijing, China DCST \& AIR, Tsinghua University DCST, Tsinghua University AIR, Tsinghua University DSCT \& AIR, Tsinghua University

AI总结 TRACE通过强化学习提升LLM生成中的证据可追溯性,实现透明输出和准确性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14250 2026-01-30 cs.LG

Towards Anomaly-Aware Pre-Training and Fine-Tuning for Graph Anomaly Detection

面向图异常检测的异常感知预训练与微调

Yunhui Liu, Jiashun Cheng, Yiqing Lin, Qizhuo Xie, Jia Li, Fugee Tsung, Hongzhi Yin, Tao Zheng, Jianhua Zhao, Tieke He

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) The University of Queensland(昆士兰大学)

AI总结 本文提出APF框架,通过预训练和微调提升图异常检测的异常感知能力,结合谱多项式滤波器和门控融合机制,实现更有效的异常识别。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07720 2026-01-30 cs.CV

ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer

ACDiT:插值自回归条件建模与扩散变换器

Jinyi Hu, Shengding Hu, Yuxuan Song, Yufei Huang, Mingxuan Wang, Hao Zhou, Zhiyuan Liu, Wei-Ying Ma, Maosong Sun

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 ACDiT通过结合自回归和扩散范式,实现连续视觉信息的灵活插值生成,优于现有自回归基线,在视觉生成任务中表现最佳。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04969 2026-01-30 cs.CL

EVA-Score: Evaluating Abstractive Long-form Summarization on Informativeness through Extraction and Validation

EVA-Score:通过提取与验证评估抽象长形式摘要的信息性

Yuchen Fan, Yazhe Wan, Xin Zhong, Haonan Cheng, Ning Ding, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出EVA-Score,通过提取和验证评估抽象长形式摘要的信息性,发现其与人类评价的关联性最高,揭示了LLM在长形式摘要任务中的不足。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20499 2026-01-29 cs.CV

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20383 2026-01-29 cs.CV

HINT: Hierarchical Interaction Modeling for Autoregressive Multi-Human Motion Generation

HINT: 用于自回归多人体运动生成的分层交互建模

Mengge Liu, Yan Di, Gu Wang, Yun Qu, Dekai Zhu, Yanyan Li, Xiangyang Ji

机构 * Tsinghua University(清华大学)

AI总结 HINT通过分层交互建模提出了一种自回归框架,实现多人体运动生成,提升了交互建模的精度和长序列的连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20330 2026-01-29 cs.CL cs.LG

PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments

PsychePass:通过轨迹锚定竞赛校准LLM的治疗能力

Zhuang Chen, Dazhen Wan, Zhangkai Zheng, Guanqun Bi, Xiyao Xiao, Binghang Li, Minlie Huang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Lingxin AI(灵心AI) South China Normal University(华南师范大学) CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华人工智能研究院)

AI总结 PsychePass通过轨迹锚定竞赛校准LLM的治疗能力,利用动态比赛生成稳定评分并提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20162 2026-01-29 cs.CL

Me-Agent: A Personalized Mobile Agent with Two-Level User Habit Learning for Enhanced Interaction

Me-Agent:一种具有两级用户习惯学习的个性化移动代理以增强交互

Shuoxin Wang, Chang Liu, Gowen Loo, Lifan Zheng, Kaiwen Wei, Xinyi Zeng, Jingyuan Zhang, Yu Tian

机构 * Yunnan University(云南大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Southeast University(东南大学) Chongqing University(重庆大学) Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 Me-Agent通过两级用户习惯学习方法,提升移动代理在个性化交互中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05305 2026-01-29 eess.AS cs.CL eess.SP

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

WaveSP-Net: 基于小波域可学习稀疏提示微调的语音深度伪造检测

Xi Xuan, Xuechen Liu, Wenxin Zhang, Yi-Cheng Lin, Xiaojian Lin, Tomi Kinnunen

机构 * University of Eastern Finland(东芬兰大学) National Institute of Informatics(日本信息处理学会) University of Chinese Academy of Sciences(中国科学院大学) National Taiwan University(台湾大学) University of Toronto(多伦多大学) Tsinghua University(清华大学)

AI总结 WaveSP-Net通过结合小波域稀疏提示微调与Mamba架构,提升语音深度伪造检测的性能与效率。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21789 2026-01-29 cs.MA cs.CV

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

视觉多智能体系统:通过视觉流缓解幻觉雪球效应

Xinlei Yu, Chengming Xu, Guibin Zhang, Yongbo He, Zhangquan Chen, Zhucun Xue, Jiangning Zhang, Yue Liao, Xiaobin Hu, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 本文提出ViF方法,通过视觉流和注意力重新分配缓解多智能体系统中的视觉幻觉雪球效应,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16324 2026-01-29 cs.CV

From Prediction to Perfection: Introducing Refinement to Autoregressive Image Generation

从预测到完美:引入精修到自回归图像生成

Cheng Cheng, Lin Song, Di An, Yicheng Xiao, Xuchong Zhang, Hongbin Sun, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 TensorAR通过引入张量预测机制,改进自回归图像生成的质量和性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14174 2026-01-29 cs.LG cs.AI

Physics-Guided Multimodal Transformers are the Necessary Foundation for the Next Generation of Meteorological Science

物理引导的多模态Transformer是下一代气象科学的必要基础

Jing Han, Hanting Chen, Kai Han, Xiaomeng Huang, Wenjun Xu, Dacheng Tao, Ping Zhang

机构 * School of Artificial Intelligence, Beijing University of Posts Huawei Noah's Ark Lab Department of Earth System Science, Tsinghua University College of Computing \& Data Science, Nanyang Technological University State Key Laboratory of Networking Switching Technology, Beijing University of Posts

AI总结 本文提出通过物理引导的多模态Transformer构建下一代气象科学的统一范式,以提升模型的科学一致性和物理约束能力。

Comments Perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19834 2026-01-28 cs.AI

Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models

视觉生成通过多模态世界模型解锁类人推理

Jialong Wu, Xiaoying Zhang, Hongyi Yuan, Xiangcheng Zhang, Tianhao Huang, Changjing He, Chaoyi Deng, Renrui Zhang, Youbin Wu, Mingsheng Long

机构 * Tsinghua University(清华大学)

AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。

Comments Project page: https://thuml.github.io/Reasoning-Visual-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19707 2026-01-28 cs.LG cs.RO

Scalable Exploration for High-Dimensional Continuous Control via Value-Guided Flow

通过价值引导流实现高维连续控制的可扩展探索

Yunyue Wei, Chenhui Zuo, Yanan Sui

机构 * Tsinghua University(清华大学)

AI总结 Qflex通过价值引导流在高维动作空间中实现高效探索,优于现有方法并在复杂控制任务中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19606 2026-01-28 cs.CV cs.AI cs.LG cs.SD eess.AS

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining

GMS-CAVP:通过多尺度对比和生成预训练提升音频视频对应关系

Shentong Mo, Zehua Chen, Jun Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI Tsinghua University(清华大学)

AI总结 GMS-CAVP通过多尺度对比和生成预训练方法提升音频视频对应关系建模,实现更深入的跨模态理解和高保真生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19578 2026-01-28 cs.CL

Yunque DeepResearch Technical Report

Yunque DeepResearch 技术报告

Yuxuan Cai, Xinyi Lai, Peng Yuan, Weiting Liu, Huajian Li, Mingda Li, Xinghua Wang, Shengxie Zheng, Yanchao Hao, Yuyang Yin, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 Yunque DeepResearch提出了一种分层、模块化且稳健的框架,通过多代理协调、动态上下文管理和主动监督模块解决深度研究中的关键挑战,实现先进性能并开源支持社区发展。

详情

展开后加载摘要…

URL PDF HTML 收藏