Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
通过输入自适应深度聚合缓解视觉语言微调中的推理税
机构 * Tsinghua University(清华大学)
AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。
高校专区
通过输入自适应深度聚合缓解视觉语言微调中的推理税
机构 * Tsinghua University(清华大学)
AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。
基于监控视频的室内占用测量实验研究:以以 occupant-centric 控制为中心
机构 * Center for Intelligent and Networked Systems, Department of Automation, BNRist, Tsinghua University(清华大学自动化系智能与网络化系统中心,北京信息科学与技术国家研究中心) ; Urban Mobility Lab, Massachusetts Institute of Technology(麻省理工学院城市移动实验室) ; Singapore-MIT Alliance for Research and Technology Centre, Massachusetts Institute of Technology(麻省理工学院新加坡-麻省理工学院研究与技术联盟中心)
AI总结 本文研究了基于监控视频的室内占用测量方法,通过比较检测、跟踪和LLM优化流程,展示了LLM对提高测量精度和减少误报的影响,最终在HVAC控制中实现了17.94%的节能潜力。
开创性视频流畅度评估:一种新任务及其基准数据集和基线
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出视频流畅度评估(VFA)作为独立任务,构建了面向流畅度的数据集FluVid,并开发了包含23种方法的基准,提出FluNet模型通过时间排列自注意力提升流畅度信息。
Comments 14 pages, 6 figures. Accepted by CVPR 2026 findings track
神经不确定性原理:对抗脆弱性与大语言模型幻觉的统一视角
机构 * Northwest Institute of Nuclear Technology(西北核技术研究所) ; Tsinghua University(清华大学)
AI总结 本文揭示对抗脆弱性与大语言模型幻觉的共同几何起源,提出神经不确定性原理,通过输入与损失梯度的不确定性界限,提供统一的可靠性分析框架。
Comments 16 pages,3 figures
看清并非掌握:教LLM使用私有库进行代码生成
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Proxseer Inc.(Proxseer公司) ; School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) ; Software Institute, Nanjing University(南京大学软件学院) ; School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。
Comments 12 pages
AtomMem:具有原子内存操作的可学习动态代理记忆
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学)
AI总结 AtomMem通过将内存管理转化为动态决策问题,结合监督微调与强化学习,实现了任务对齐的自主内存策略,优于传统静态工作流方法。
多功能的感知图像超分辨率:考虑再压缩
机构 * AIR, Tsinghua University(清华大学智能产业研究院) ; AGUS Tech ; HKUST(香港科技大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出VRPSR,通过将压缩建模为条件文本到图像生成,利用预训练扩散模型构建通用编码器模拟器,并提出针对感知超分辨率的训练技术,实现SR与再压缩的联合优化,取得10%-40%的比特率节省。
Score2Instruct: 通过自动化维度评分扩展视频质量导向的指令
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出Score2Instruct管道,通过自动化生成视频质量指令数据,提升视频大模型的质量评分和解释能力,构建了S2I-Bench基准测试集并验证了方法的有效性。
Comments 16 pages, 5 figures. Accepted by CVPR 2026 main conference
可编辑的深度语义通信:面向面部编辑的可靠跨模态语义通信
机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文提出Editable-DeepSC,一种用于面部编辑的跨模态语义通信方法,通过联合编辑-信道编码和SNR感知信道编码,提升传输效率与编辑质量。
QPT V2:掩码图像建模在视觉评分中的进展
机构 * Tsinghua University(清华大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出QPT V2框架,通过掩码图像建模提升视觉质量和审美评分能力,通过数据筛选、降质引入和模型结构调整,在11个下游基准测试中表现优异。
Comments 8 pages, 6 figures. Accepted by ACM MM 24
DRiffusion:通过草稿与精修过程轻松并行化扩散模型
机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) ; Tsinghua University(清华大学) ; IST, Nanjing University(南京大学智能科学与技术学院) ; School of Software, Tsinghua University(清华大学软件学院) ; FuturististAI Lab, Shanghai Tsinghua International Innovation Center(上海清华国际创新中心未来人工智能实验室)
AI总结 DRiffusion通过草稿与精修过程并行化扩散模型,提升采样速度同时保持生成质量,实验显示在多个模型上实现1.4至3.7倍加速,质量指标仅小幅下降。
ViGoR-Bench:视觉生成模型距离零样本视觉推理还有多远?
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
AI总结 本文提出ViGoR-Bench基准,通过跨模态覆盖、双轨评估、证据驱动裁判和细粒度分析,揭示生成模型在因果推理和空间认知上的缺陷,验证了先进模型在零样本推理上的不足。
FedRE:一种用于模型异质联邦学习的表示纠缠框架
机构 * Teleinfo, CAICT(中国信息通信研究院) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of British Columbia(不列颠哥伦比亚大学) ; China University of Mining and Technology-Beijing(中国矿业大学(北京)) ; China University of Mining and Technology(中国矿业大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 FedRE提出了一种表示纠缠框架,通过纠缠表示和纠缠标签编码提升模型异质联邦学习的性能,平衡模型效果、隐私保护和通信开销。
Comments Accepted by CVPR 2026
通过证据蒸馏和写回丰富训练知识库
机构 * Peking University(北京大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Tsinghua University(清华大学)
AI总结 本文提出WriteBack-RAG框架,通过标注示例识别检索成功区域,提取相关文档并蒸馏为紧凑知识单元,提升RAG系统性能,平均提升2.14%。
Comments 15 pages
HiSpatial:在视觉-语言模型中驯服层次化3D空间理解
机构 * Tsinghua University(清华大学) ; Microsoft Research Asia(微软亚洲研究院) ; Xi’an Jiaotong University(西安交通大学) ; University of the Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。
Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial
基于Hessian的机器学习互作用势:连接理论与实验的桥梁
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Department of Chemistry, Tsinghua University(清华大学化学系) ; School of Physics, Peking University(北京大学物理学院) ; Interdisciplinary Institute of Light-Element Quantum Materials, Frontiers Science Center for Nano-Optoelectronics, State Key Laboratory of Artificial Microstructure and Mesoscopic Physics, Peking University(北京大学轻元素量子材料交叉研究所、纳米光电子前沿科学中心、人工微结构与介观物理国家重点实验室)
AI总结 本文提出一种基于Hessian的机器学习互作用势,通过高效训练协议HINT显著提升过渡态搜索并实现化学精度的吉布斯自由能预测,同时准确处理强非谐氢化物。
Comments 13 pages, 4 figures
AnyID: 从任意视觉参考生成超保真度的通用身份保持视频
机构 * School of Computer Science and Technology, MOEKLINNS, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院、MOEKLINNS) ; Alibaba Cloud Computing(阿里云计算有限公司) ; Tsinghua University(清华大学)
AI总结 AnyID通过引入可扩展的多参考架构和主参考生成范式,实现从多种异构身份输入生成高保真的视频,通过大规模数据集训练和强化学习微调提升身份保真度和属性可控性。
探测大型语言模型中稳定内部信念的缺乏
机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) ; Shanghai Qizhi Institute(上海期智研究院)
AI总结 本研究探讨了LLM在多轮交互中维持隐含一致性的能力,发现其隐含目标易随对话变化,需引入机制以锚定长期目标,以提升对话系统中的人格建模效果。
Comments Accepted by NeurIPS 2025 Workshop Mexico City PersonaNLP
Photon:通过高效多模态大语言模型加速体积理解
机构 * Tsinghua University(清华大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) ; Hupan Lab(湖畔实验室) ; Duke University(杜克大学)
AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。
Comments Accepted by ICLR 2026
RS-SSM:通过状态空间模型细化遗忘的特定信息以实现视频语义分割
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) ; Tsinghua University(清华大学) ; Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出RS-SSM模型,通过互补细化遗忘的时空细节,提升视频语义分割的像素级处理能力,在四个基准上取得最佳性能。
Comments Accepted by CVPR 2026
具有自约束先验的3D高斯点云用于高保真的表面重建
机构 * School of Software, Tsinghua University(清华大学软件学院) ; Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)
AI总结 本文提出自约束先验以约束3D高斯学习,提升深度渲染精度,通过融合当前3D高斯生成的深度图得到TSDF网格,生成带状约束以优化高斯分布,同时定期更新以提高准确性。
Comments Accepted by CVPR 2026. Project page: https://takeshie.github.io/GSPrior
Mario:基于大语言模型的多模态图推理
机构 * New York University Shanghai(上海纽约大学) ; New York University(纽约大学) ; Tsinghua University(清华大学) ; EPFL(瑞士联邦理工学院洛桑)
AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。
Comments CVPR 2026
MeanFuser: 一种基于MeanFlow的高效多模态轨迹生成与自适应重构方法用于端到端自动驾驶
机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Xiaomi EV(小米汽车) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院)
AI总结 本文提出MeanFuser,通过引入Gaussian Mixture Noise、MeanFlow Identity和轻量级ARM模块,实现了高效且鲁棒的多模态轨迹生成与自适应重构,提升了端到端自动驾驶的性能和效率。
Comments Accepted by CVPR 2026
DiffuGuard: 差分扩散语言模型中内在安全的丧失与恢复
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Squirrel Ai Learning(松鼠AI) ; Peking University(北京大学)
AI总结 本文分析了差分扩散语言模型在对抗攻击中的脆弱性,提出DiffuGuard框架通过随机退火重标记和块级审计修复提升模型安全性,有效降低攻击成功率。
Comments Accepted by ICLR2026
从何到为何:一个用于基于证据的化学反应条件推理的多智能体系统
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; University of Oxford(牛津大学)
AI总结 本文提出ChemMAS多智能体系统,通过机制 grounding、多通道回忆、约束感知辩论和理由聚合,提升化学反应条件推荐的可解释性,实验表明其在准确率和可解释性上优于现有方法。
Comments Accepted by ICLR 2026
通过LLM增强的跨城市学习预测极端事件中的人类移动
机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心)
AI总结 本文提出X-MLM框架,利用LLM建模移动意图,跨城市转移极端事件对移动意图的影响知识,提升极端事件中的人类移动预测性能。
自校准CLIP用于无训练开放词汇分割
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 本文提出自校准CLIP,通过消除异常token影响,提升CLIP在开放词汇分割中的表现,实现更精细的特征表示和语义一致性。
Comments Accepted by IEEE TIP
机会约束迭代线性二次随机博弈
机构 * Institute for Interdisciplinary Sciences, Tsinghua University(清华大学交叉信息研究院) ; Tier IV, Inc.(Tier IV公司) ; Shanghai Qizhi Institute(上海期智研究院)
AI总结 本文提出CCILQGames算法,通过增广拉格朗日方法解决机会约束随机博弈问题,在自动驾驶场景中验证了其生成安全交互策略的能力。
Comments Updated version of the published IEEE RA-L paper. Assumption 1 and strategy space definition revised to make the information structure explicit. Theorem 1 assumptions are more explict. No changes to algorithm or experimental results
MANDERA: 通过排序检测联邦学习中的恶意节点
机构 * University of Sydney(悉尼大学) ; School of Computing, Macquarie University(麦考瑞大学计算学院) ; School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) ; Department of Statistics and Data Science, Tsinghua University(清华大学统计与数据科学系)
AI总结 MANDERA通过将原始梯度空间转换为排序矩阵,有效检测联邦学习中的恶意梯度,适用于不同数据集和攻击类型。
Comments 21 pages, 11 figures, The Annals of Applied Statistics
COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统
机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) ; School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)
AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。