Learning to Commit: Generating Organic Pull Requests via Online Repository Memory
学习承诺:通过在线仓库记忆生成有机的拉取请求
机构 * Tsinghua University(清华大学)
AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。
Comments Preprint. Work in progress
高校专区
学习承诺:通过在线仓库记忆生成有机的拉取请求
机构 * Tsinghua University(清华大学)
AI总结 本文提出Learning to Commit框架,通过在线仓库记忆提升生成拉取请求的有机性,通过对比历史提交改进代码风格和架构约束。
Comments Preprint. Work in progress
PerceptionComp:一个复杂感知导向推理的视频基准测试
机构 * Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; Nanyang Technological University(南洋理工大学)
AI总结 PerceptionComp是一个手动标注的复杂长时景视频推理基准测试,要求多时间片段的视觉证据和逻辑约束,涉及多个感知子任务,测试人类和模型在感知推理中的性能瓶颈。
Comments Project Page: https://perceptioncomp.github.io
超越语言:基于手部指向的自我中心视觉指称表达定位
机构 * Tsinghua University(清华大学) ; Dalian University of Technology(大连理工大学) ; Northwestern Polytechnical University(西北工业大学) ; Apple(苹果公司)
AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。
一种增强型变换器用于DNA序列分类
机构 * Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出了一种结合玻尔兹曼机和变换器的模型,用于DNA序列分类,通过引入结构化的二进制门控变量和能量函数约束,提升对潜在相互作用和高阶依赖的建模能力。
Comments 19 pages
通过输入自适应深度聚合缓解视觉语言微调中的推理税
机构 * Tsinghua University(清华大学)
AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。
基于监控视频的室内占用测量实验研究:以以 occupant-centric 控制为中心
机构 * Center for Intelligent and Networked Systems, Department of Automation, BNRist, Tsinghua University(清华大学自动化系智能与网络化系统中心,北京信息科学与技术国家研究中心) ; Urban Mobility Lab, Massachusetts Institute of Technology(麻省理工学院城市移动实验室) ; Singapore-MIT Alliance for Research and Technology Centre, Massachusetts Institute of Technology(麻省理工学院新加坡-麻省理工学院研究与技术联盟中心)
AI总结 本文研究了基于监控视频的室内占用测量方法,通过比较检测、跟踪和LLM优化流程,展示了LLM对提高测量精度和减少误报的影响,最终在HVAC控制中实现了17.94%的节能潜力。
开创性视频流畅度评估:一种新任务及其基准数据集和基线
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出视频流畅度评估(VFA)作为独立任务,构建了面向流畅度的数据集FluVid,并开发了包含23种方法的基准,提出FluNet模型通过时间排列自注意力提升流畅度信息。
Comments 14 pages, 6 figures. Accepted by CVPR 2026 findings track
神经不确定性原理:对抗脆弱性与大语言模型幻觉的统一视角
机构 * Northwest Institute of Nuclear Technology(西北核技术研究所) ; Tsinghua University(清华大学)
AI总结 本文揭示对抗脆弱性与大语言模型幻觉的共同几何起源,提出神经不确定性原理,通过输入与损失梯度的不确定性界限,提供统一的可靠性分析框架。
Comments 16 pages,3 figures
看清并非掌握:教LLM使用私有库进行代码生成
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Proxseer Inc.(Proxseer公司) ; School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) ; Software Institute, Nanjing University(南京大学软件学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。
Comments 12 pages
AtomMem:具有原子内存操作的可学习动态代理记忆
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
AI总结 AtomMem通过将内存管理转化为动态决策问题,结合监督微调与强化学习,实现了任务对齐的自主内存策略,优于传统静态工作流方法。
多功能的感知图像超分辨率:考虑再压缩
机构 * AIR, Tsinghua University(清华大学智能产业研究院) ; AGUS Tech ; HKUST(香港科技大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出VRPSR,通过将压缩建模为条件文本到图像生成,利用预训练扩散模型构建通用编码器模拟器,并提出针对感知超分辨率的训练技术,实现SR与再压缩的联合优化,取得10%-40%的比特率节省。
Score2Instruct: 通过自动化维度评分扩展视频质量导向的指令
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出Score2Instruct管道,通过自动化生成视频质量指令数据,提升视频大模型的质量评分和解释能力,构建了S2I-Bench基准测试集并验证了方法的有效性。
Comments 16 pages, 5 figures. Accepted by CVPR 2026 main conference
可编辑的深度语义通信:面向面部编辑的可靠跨模态语义通信
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文提出Editable-DeepSC,一种用于面部编辑的跨模态语义通信方法,通过联合编辑-信道编码和SNR感知信道编码,提升传输效率与编辑质量。
QPT V2:掩码图像建模在视觉评分中的进展
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出QPT V2框架,通过掩码图像建模提升视觉质量和审美评分能力,通过数据筛选、降质引入和模型结构调整,在11个下游基准测试中表现优异。
Comments 8 pages, 6 figures. Accepted by ACM MM 24
DRiffusion:通过草稿与精修过程轻松并行化扩散模型
机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) ; Tsinghua University(清华大学) ; IST, Nanjing University(南京大学智能科学与技术学院) ; School of Software, Tsinghua University(清华大学软件学院) ; FuturististAI Lab, Shanghai Tsinghua International Innovation Center(上海清华国际创新中心未来人工智能实验室)
AI总结 DRiffusion通过草稿与精修过程并行化扩散模型,提升采样速度同时保持生成质量,实验显示在多个模型上实现1.4至3.7倍加速,质量指标仅小幅下降。
ViGoR-Bench:视觉生成模型距离零样本视觉推理还有多远?
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
AI总结 本文提出ViGoR-Bench基准,通过跨模态覆盖、双轨评估、证据驱动裁判和细粒度分析,揭示生成模型在因果推理和空间认知上的缺陷,验证了先进模型在零样本推理上的不足。
FedRE:一种用于模型异质联邦学习的表示纠缠框架
机构 * Teleinfo, CAICT(中国信息通信研究院) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of British Columbia(不列颠哥伦比亚大学) ; China University of Mining and Technology-Beijing(中国矿业大学(北京)) ; China University of Mining and Technology(中国矿业大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 FedRE提出了一种表示纠缠框架,通过纠缠表示和纠缠标签编码提升模型异质联邦学习的性能,平衡模型效果、隐私保护和通信开销。
Comments Accepted by CVPR 2026