Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
通过对比嵌入链理解LVLMs的语言先验
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。
Comments ICLR 2026
高校专区
通过对比嵌入链理解LVLMs的语言先验
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。
Comments ICLR 2026
从像素到图像:深度学习在遥感图像语义分割中的结构调查
机构 * College of Science and Engineering and Centre for AI and Data Science Innovation, James Cook University(科学与工程学院和人工智能与数据科学创新中心,詹姆斯库克大学) ; Department of Forest and Wildlife Ecology, University of Wisconsin-Madison(森林与野生动物生态学系,威斯康星大学麦迪逊分校) ; School of Computing, Engineering and Mathematical Sciences, La Trobe University(计算、工程与数学科学学院,拉特罗布大学)
AI总结 本文系统回顾了深度学习在遥感图像语义分割中的结构演变,从像素到图像的层次化方法,涵盖多种技术并提供可复现的代码库。
Comments 34 pages, 9 figures, 5 tables
地理空间表示学习:从深度学习到大语言模型时代的一次综述
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; The University of New South Wales(新南威尔士大学) ; Southwest Jiaotong University(西南交通大学) ; Institute for Infocomm Research (I$^2$R), A*STAR(信息通信研究院(I$^2$R),A*STAR)
AI总结 本文综述了从深度学习到大语言模型时代的地理空间表示学习,探讨了其方法、应用及未来发展方向。
ARO:一种新的矩阵优化视角用于大模型
机构 * Microsoft Research(微软研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 ARO是一种基于梯度旋转的新矩阵优化方法,通过规范感知策略提升大模型训练效率,优于现有正交化和AdamW方法。
基于去噪扩散模型的多模态图像重建与合成统一框架
机构 * Department of Computer Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系) ; Mallinckrodt Institute of Radiology, Washington University in St. Louis(华盛顿大学圣路易斯分校马林克罗德特放射医学研究所) ; Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电气与系统工程系) ; Department of Neurology, Washington University in St. Louis(华盛顿大学圣路易斯分校神经病学系) ; Department of Biomedical Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校生物医学工程系) ; Division of Biology and Biomedical Sciences, Washington University in St. Louis(华盛顿大学圣路易斯分校生物学与生物医学科学 division) ; Department of Electrical and Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)
AI总结 Any2all通过统一框架实现多模态图像重建与合成,利用去噪扩散模型提升性能与质量。
基于多模态大语言模型的高效表格检索与理解
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; AWS(亚马逊网络服务)
AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。
Comments Published at EACL 2026 Findings
增强推理的表示用于多模态检索
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Kookmin University(韩国高丽大学)
AI总结 本研究提出一种增强推理的多模态检索方法,通过外部化推理和语义密集表示提升检索性能,尤其在知识密集型查询和组合修改请求中表现优异。
通过成对观测实现近似最优的主动聚类
机构 * National University of Singapore(国立新加坡大学) ; Indian Institute of Technology Hyderabad(印度海得拉巴理工学院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 通过成对观测实现近似最优的主动聚类,利用测度变化技术建立查询次数下界,并设计渐近最优算法。
Comments 31 pages, 1 figure
LH-Deception:模拟和理解长周期交互中大语言模型的欺骗行为
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Zhejiang University(浙江大学) ; Amazon AGI(亚马逊人工智能研究院)
AI总结 LH-Deception通过多智能体系统模拟长周期交互中的LLM欺骗行为,揭示欺骗的模型依赖性和对信任的侵蚀,为真实场景下的LLM评估提供基础。
Comments ICLR 2026
主动标签清洗用于透射电子显微镜图像中电子致密沉积物的可靠检测
机构 * School of Biomedical Engineering(生物医学工程学院) ; Southern Medical University(南方医科大学) ; College of Letters and Science(文理学院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; School of Basic Medical Sciences(基础医学学院) ; Department of Nephrology(肾内科) ; Nanfang Hospital, Southern Medical University(南方医科大学南芳医院)
AI总结 本文提出主动标签清洗方法,通过主动学习和专家重新标注,提升透射电子显微镜图像中电子致密沉积物检测的准确性和效率,降低标注成本。
Comments 10 pages, 6 figures
ARGaze:用于在线第一人称注视估计的自回归变换器
机构 * Department of Computer Science, University of Texas at Dallas, Richardson, TX, USA.(德克萨斯大学达拉斯分校计算机科学系) ; College of Computing, Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院计算机学院) ; Department of Computer Science, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系) ; Allen School of Computer Science, University of Washington, USA(华盛顿大学阿伦计算机科学学院)
AI总结 ARGaze通过自回归变换器模型,利用时间连续性提升在线第一人称注视估计的鲁棒性与准确性。
一个用于线性约束双层优化的单循环一阶算法
机构 * University of Virginia(弗吉尼亚大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Meta
AI总结 本文提出了一种单循环一阶算法,用于解决具有线性约束的双层优化问题,通过改写问题并分析收敛率,提升了算法效率。
Comments NeurIPS 2025
湍流磁鞘模拟中的电子神经闭合:能量通道
机构 * Centre for mathematical Plasma Astrophysics, Department of Mathematics, KU Leuven(数学等离子体天文学中心,数学系,KU莱顿大学) ; Department of Physics, University of Wisconsin-Madison(物理系,威斯康星大学麦迪逊分校)
AI总结 本文提出基于FCNN的非局部五时刻电子压力张量闭合模型,用于改进磁鞘湍流模拟,显著优于传统局部闭合方法。
Comments 19 pages, 10 figures, 4 tables
Journal ref Phys. Plasmas 33, 012901 (2026)
高秩矩阵补全的格拉斯曼代理融合
机构 * Department of Electrical Engineering, Mathematics, Biostatistics(电气工程、数学与生物统计学系) ; Wisconsin Institute of Discovery(威斯康星发现研究所) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出一种基于格拉斯曼代理融合的高秩矩阵补全方法,通过聚类和优化子空间距离,提升低采样率下的补全性能。
免费草稿与验证:迈向无损并行解码的扩散大语言模型
机构 * Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI(计算机科学系,威斯康星大学麦迪逊分校,麦迪逊,WI)
AI总结 FreeDave是一种专为DLLMs设计的快速解码算法,通过无损并行解码实现高效推理,无需模型修改或额外模块,提升了推理速度而不影响性能。
LUMINA:通过上下文-知识信号检测RAG系统中的幻觉
机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) ; Argonne National Laboratory(阿贡国家实验室)
AI总结 LUMINA通过上下文-知识信号检测RAG系统中的幻觉,利用分布距离和token演变测量,实现高准确率和实用性。
Comments ICLR 2026
C-kNN-LSH:一种用于序列反事实推断的最近邻算法
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Stevens Institute of Technology(史蒂文斯理工学院)
AI总结 C-kNN-LSH通过局部敏感哈希和双重鲁棒校正,有效处理高维、混淆的序列因果推断问题,提升长期新冠康复异质性识别与政策价值估计性能。
基于草案的近似推理用于大语言模型
机构 * FuriosaAI ; UW-Madison(威斯康星大学麦迪逊分校) ; Seoul National University(首尔国立大学) ; Ajou University(全州大学) ; KRAFTON
AI总结 本文提出基于草案的近似推理方法,通过结合lookahead技术和小模型预测,实现更精确的KV缓存丢弃和提示压缩,提升LLM在长上下文任务中的推理效率和准确性。
Comments Accepted to ICLR 2026
Journal ref ICLR 2026
自回归训练如何导致不忠推理?合成实验研究
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本研究通过合成实验探讨自回归训练如何导致不忠推理,发现训练噪声阈值影响推理的忠实性,模型在低噪声下能学习因果推理,高噪声下则出现跳步推理。
Comments 25 pages, 23 figures
HERMES: 一种集成端到端风险感知多模态具身系统,用于长尾自动驾驶
机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(土木与环境工程系,威斯康星大学麦迪逊分校)
AI总结 HERMES通过整合视觉-语言模型和多模态感知,提升自动驾驶在长尾混合交通场景中的风险感知和轨迹规划能力。
Stable Signer: 层级化手语生成模型
机构 * Rutgers University(罗格斯大学) ; Nanyang Technological University(南洋理工大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出Stable Signer模型,通过层级生成端到端任务提升手语视频生成质量,采用SLUL和SLP-MoE模块实现高效生成。
Comments 12 pages, 7 figures. More Demo at https://stablesigner.github.io
通过迭代映射视角对MLIPs进行微调
机构 * Department of Computer Science, Rice University, Houston, USA(计算机科学系,里士大学) ; Department of Materials Science(材料科学系) ; Nanoengineering, Rice University, Houston, USA(纳米工程,里士大学) ; Rice Advanced Materials Institute, Rice University, Houston, USA(里士先进材料研究所,里士大学) ; Faculty of Technical Sciences, University of Novi Sad, Novi Sad, Serbia(技术科学系,诺维萨德大学) ; Department of Computer Sciences, University of Wisconsin--Madison, Madison, USA(计算机科学系,威斯康星大学麦迪逊分校)
AI总结 本文提出通过迭代映射视角对MLIPs进行微调,通过端到端模拟循环提升结构弛豫精度,实现预测误差降低32%
Comments 9 main pages, total of 15 pages. 6 tables, 6 Figures
使用多模态语义扰动检测VLMs中的污染
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; Kookmin University(韩国庆北大学)
AI总结 本文提出了一种基于多模态语义扰动的检测方法,用于识别和验证受污染的视觉语言模型。
Comments Accepted at ICLR 2026
扩展的VIIRS类人工夜间光数据重建(1986-2024)
机构 * Department of Earth System Science, Ministry of Education, Ecological Field Station for East Asian Migratory Birds, Tsinghua University, Beijing 100084, China(地球系统科学系,教育部,东亚迁徙鸟类生态观测站,清华大学,北京100084,中国) ; Department of Computer Sciences, University of Wisconsin-Madison, Madison 53703, USA(计算机科学系,威斯康星大学麦迪逊分校,麦迪逊53703,美国) ; Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China(自动化研究所,中国科学院,北京100190,中国) ; China Association for International Exchange of Personnel, Beijing 100038, China(中国国际人员交流协会,北京100038,中国) ; National Disaster Reduction Center of China, Beijing 100124, China(中国减灾中心,北京100124,中国) ; Aerospace Information Research Institute, CAS, Beijing 100094, China(航天信息研究所,中国科学院,北京100094,中国)
AI总结 本文提出EVAL数据集,通过两阶段深度学习模型扩展VIIRS类人工夜间光数据,解决光强低估和结构细节缺失问题,提升时间序列研究的长期覆盖能力。
多模态大语言模型高效性中的标记压缩综述
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Xiamen University(厦门大学) ; National University of Singapore(新加坡国立大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of Central Florida(佛罗里达大学) ; Salesforce AI Research(Salesforce AI研究) ; Rice University(德克萨斯大学)
AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。
Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression
LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型
机构 * UCF(佛罗里达大学) ; UW-Madison(威斯康星大学麦迪逊分校) ; USC(南加州大学) ; UIC(伊利诺伊大学香槟分校)
AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。
Comments Accepted to ICCV 2025. First Version is released in 2024/03
机会性可提示分割:利用常规放射学注释指导3D CT病变分割
机构 * University of Wisconsin–Madison Department of Computer Sciences(威斯康星大学麦迪逊分校计算机科学系) ; University of Wisconsin–Madison Department of Radiology(威斯康星大学麦迪逊分校放射学系)
AI总结 SAM2CT通过利用放射科注释生成3D CT病变分割,实现机会性可提示分割,优于现有模型并展示零样本性能。
不完整数据上的子空间聚类与自监督对比学习
机构 * Department of Electrical Engineering, Biostatistics(电气工程与生物统计学系) ; Wisconsin Institute of Discovery(威斯康星发现研究所) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 本文提出对比子空间聚类(CSC)方法,通过自监督对比学习处理不完整数据,实现鲁棒的子空间聚类。
ReasoningBomb: 通过诱导病态长推理实现隐蔽的拒绝服务攻击
机构 * Johns Hopkins University(约翰霍普金斯大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Nanyang Technological University(南洋理工大学) ; NVIDIA(NVIDIA公司) ; University of California, Davis(加州大学戴维斯分校) ; Cornell University(康奈尔大学)
AI总结 ReasoningBomb通过生成短自然提示诱导大型推理模型进入病态长推理,实现隐蔽的拒绝服务攻击,具有高放大率、隐蔽性和可优化性。
Comments Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb
为何GRPO需要规范化:从局部曲率角度探讨自适应梯度
机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) ; Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) ; Department of Informatics, King's College London(伦敦国王学院信息学系) ; Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)
AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。