arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Tsinghua University(清华大学)

2026-03-30 至 2026-03-30 共收录 17
2603.26664 2026-03-30 cs.SE cs.CL

Learning to Commit: Generating Organic Pull Requests via Online Repository Memory

学习承诺:通过在线仓库记忆生成有机的拉取请求

Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学)

AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26653 2026-03-30 cs.CV cs.AI cs.CL cs.LG

PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning

PerceptionComp:一个复杂感知导向推理的视频基准测试

Shaoxuan Li, Zhixuan Zhao, Hanze Deng, Zirun Ma, Shulin Tian, Zuyan Liu, Yushi Hu, Haoning Wu, Yuhao Dong, Benlin Liu, Ziwei Liu, Ranjay Krishna

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学)

AI总结 PerceptionComp是一个手动标注的复杂长时景视频推理基准测试,要求多时间片段的视觉证据和逻辑约束,涉及多个感知子任务,测试人类和模型在感知推理中的性能瓶颈。

Comments Project Page: https://perceptioncomp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26465 2026-03-30 cs.LG cs.AI

A Boltzmann-machine-enhanced Transformer For DNA Sequence Classification

一种增强型变换器用于DNA序列分类

Zhixuan Cao, Yishu Xu, Xuang WU

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出了一种结合玻尔兹曼机和变换器的模型,用于DNA序列分类,通过引入结构化的二进制门控变量和能量函数约束,提升对潜在相互作用和高阶依赖的建模能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26330 2026-03-30 cs.CV cs.AI

Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation

通过输入自适应深度聚合缓解视觉语言微调中的推理税

Yiming Ren, Yujiu Yang, Junjie Wang

机构 * Tsinghua University(清华大学)

AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26081 2026-03-30 eess.SY cs.CV cs.SY

Experimental study on surveillance video-based indoor occupancy measurement with occupant-centric control

基于监控视频的室内占用测量实验研究:以以 occupant-centric 控制为中心

Irfan Qaisar, Kailai Sun, Qingshan Jia, Qianchuan Zhao

机构 * Center for Intelligent and Networked Systems, Department of Automation, BNRist, Tsinghua University(清华大学自动化系智能与网络化系统中心,北京信息科学与技术国家研究中心) Urban Mobility Lab, Massachusetts Institute of Technology(麻省理工学院城市移动实验室) Singapore-MIT Alliance for Research and Technology Centre, Massachusetts Institute of Technology(麻省理工学院新加坡-麻省理工学院研究与技术联盟中心)

AI总结 本文研究了基于监控视频的室内占用测量方法,通过比较检测、跟踪和LLM优化流程,展示了LLM对提高测量精度和减少误报的影响,最终在HVAC控制中实现了17.94%的节能潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26055 2026-03-30 cs.CV

Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline

开创性视频流畅度评估:一种新任务及其基准数据集和基线

Qizhi Xie, Kun Yuan, Yunpeng Qu, Ming Sun, Chao Zhou, Jihong Zhu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 本文提出视频流畅度评估(VFA)作为独立任务,构建了面向流畅度的数据集FluVid,并开发了包含23种方法的基准,提出FluNet模型通过时间排列自注意力提升流畅度信息。

Comments 14 pages, 6 figures. Accepted by CVPR 2026 findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19562 2026-03-30 cs.LG cs.IT math.IT physics.comp-ph

Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination

神经不确定性原理:对抗脆弱性与大语言模型幻觉的统一视角

Dong-Xiao Zhang, Hu Lou, Jun-Jie Zhang, Jun Zhu, Deyu Meng

机构 * Northwest Institute of Nuclear Technology(西北核技术研究所) Tsinghua University(清华大学)

AI总结 本文揭示对抗脆弱性与大语言模型幻觉的共同几何起源,提出神经不确定性原理,通过输入与损失梯度的不确定性界限,提供统一的可靠性分析框架。

Comments 16 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15159 2026-03-30 cs.SE cs.AI cs.CL

To See is Not to Master: Teaching LLMs to Use Private Libraries for Code Generation

看清并非掌握:教LLM使用私有库进行代码生成

Yitong Zhang, Chengze Li, Ruize Chen, Guowei Yang, Xiaoran Jia, Yijie Ren, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Proxseer Inc.(Proxseer公司) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) Software Institute, Nanjing University(南京大学软件学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08323 2026-03-30 cs.AI

AtomMem : Learnable Dynamic Agentic Memory with Atomic Memory Operation

AtomMem:具有原子内存操作的可学习动态代理记忆

Yupeng Huo, Yaxi Lu, Zhong Zhang, Haotian Chen, Yankai Lin

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学)

AI总结 AtomMem通过将内存管理转化为动态决策问题,结合监督微调与强化学习,实现了任务对齐的自主内存策略,优于传统静态工作流方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18090 2026-03-30 cs.CV

Versatile Recompression-Aware Perceptual Image Super-Resolution

多功能的感知图像超分辨率:考虑再压缩

Mingwei He, Tongda Xu, Xingtong Ge, Ming Sun, Chao Zhou, Yan Wang

机构 * AIR, Tsinghua University(清华大学智能产业研究院) AGUS Tech HKUST(香港科技大学) Kuaishou Technology(快手科技)

AI总结 本文提出VRPSR,通过将压缩建模为条件文本到图像生成,利用预训练扩散模型构建通用编码器模拟器,并提出针对感知超分辨率的训练技术,实现SR与再压缩的联合优化,取得10%-40%的比特率节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21011 2026-03-30 cs.CV

Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring

Score2Instruct: 通过自动化维度评分扩展视频质量导向的指令

Qizhi Xie, Kun Yuan, Yunpeng Qu, Jiachao Gong, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 本文提出Score2Instruct管道,通过自动化生成视频质量指令数据,提升视频大模型的质量评分和解释能力,构建了S2I-Bench基准测试集并验证了方法的有效性。

Comments 16 pages, 5 figures. Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15702 2026-03-30 cs.IT cs.CV cs.NI math.IT

Editable-DeepSC: Reliable Cross-Modal Semantic Communications for Facial Editing

可编辑的深度语义通信:面向面部编辑的可靠跨模态语义通信

Bin Chen, Wenbo Yu, Qinshan Zhang, Tianqu Zhuang, Hao Wu, Yong Jiang, Shu-Tao Xia

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出Editable-DeepSC,一种用于面部编辑的跨模态语义通信方法,通过联合编辑-信道编码和SNR感知信道编码,提升传输效率与编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16541 2026-03-30 cs.CV cs.MM

QPT V2: Masked Image Modeling Advances Visual Scoring

QPT V2:掩码图像建模在视觉评分中的进展

Qizhi Xie, Kun Yuan, Yunpeng Qu, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

AI总结 本文提出QPT V2框架,通过掩码图像建模提升视觉质量和审美评分能力,通过数据筛选、降质引入和模型结构调整,在11个下游基准测试中表现优异。

Comments 8 pages, 6 figures. Accepted by ACM MM 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25872 2026-03-30 cs.LG

DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease

DRiffusion:通过草稿与精修过程轻松并行化扩散模型

Runsheng Bai, Chengyu Zhang, Yangdong Deng

机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) Tsinghua University(清华大学) IST, Nanjing University(南京大学智能科学与技术学院) School of Software, Tsinghua University(清华大学软件学院) FuturististAI Lab, Shanghai Tsinghua International Innovation Center(上海清华国际创新中心未来人工智能实验室)

AI总结 DRiffusion通过草稿与精修过程并行化扩散模型,提升采样速度同时保持生成质量,实验显示在多个模型上实现1.4至3.7倍加速,质量指标仅小幅下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25823 2026-03-30 cs.CV cs.AI

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

ViGoR-Bench:视觉生成模型距离零样本视觉推理还有多远?

Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出ViGoR-Bench基准,通过跨模态覆盖、双轨评估、证据驱动裁判和细粒度分析,揭示生成模型在因果推理和空间认知上的缺陷,验证了先进模型在零样本推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22265 2026-03-30 cs.LG

FedRE: A Representation Entanglement Framework for Model-Heterogeneous Federated Learning

FedRE:一种用于模型异质联邦学习的表示纠缠框架

Yuan Yao, Lixu Wang, Jiaqi Wu, Jin Song, Simin Chen, Zehua Wang, Zijian Tian, Wei Chen, Huixia Li, Xiaoxiao Li

机构 * Teleinfo, CAICT(中国信息通信研究院) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Nanjing University of Posts and Telecommunications(南京邮电大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of British Columbia(不列颠哥伦比亚大学) China University of Mining and Technology-Beijing(中国矿业大学(北京)) China University of Mining and Technology(中国矿业大学) Beijing Jiaotong University(北京交通大学)

AI总结 FedRE提出了一种表示纠缠框架,通过纠缠表示和纠缠标签编码提升模型异质联邦学习的性能,平衡模型效果、隐私保护和通信开销。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏