Gaze Heads: How VLMs Look at What They Describe
注视头:视觉语言模型如何观察它们所描述的内容
机构 * Northeastern University(东北大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
注视头:视觉语言模型如何观察它们所描述的内容
机构 * Northeastern University(东北大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。
课堂环境中的多模态说话人识别
机构 * University of Michigan(密歇根大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。
Comments 9 pages, 5 tables, 3 figures
MaskedFOP:缺失视觉模态下的多语言说话人识别通过级联图标签传播
机构 * College of Computing, University Mohammed VI Polytechnic(穆罕默德六世理工大学计算机学院)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM
AI总结 提出MaskedFOP系统,在测试时人脸完全缺失且语音为未见语言(乌尔都语)的挑战下,通过模态丢弃双头网络、互补嵌入平均和两级级联推理实现闭集多语言说话人识别,在POLY-SIM 2026挑战赛中取得第一。
FoleyGenEx: 统一视频到音频生成,具备多模态控制、时间对齐与语义精度
机构 * Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学前沿交叉学科研究院) ; Kling Team, Kuaishou Technology(快手科技Kling团队)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV
AI总结 提出FoleyGenEx统一框架,通过条件注入、多模态动态掩码和副词数据增强,实现视频到音频生成中多模态控制、帧级时间对齐与细粒度语义的同步合成。
Comments Accepted by INTERSPEECH 2026
Journal ref INTERSPEECH 2026
FEMOT: 使用帧和事件摄像机的多目标跟踪
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; Peng Cheng Laboratory(鹏城实验室) ; National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理全国重点实验室) ; School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出FEMOT大规模RGB-事件多目标跟踪数据集和FEMOTR多模态跟踪框架,通过频域融合解耦特征,有效利用互补信息实现鲁棒跟踪。
CoRe:一种持续奖励微调的LLM查询重写器,用于大规模视频搜索中的多阶段上下文感知相关性
机构 * TikTok
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 提出CoRe系统,通过半在线混合偏好优化和乘法奖励比,实现每周重新部署的LLM查询重写器,在多阶段视频搜索中显著降低变更查询率并提升相关性指标。
Comments 12 pages, 3 figures
通过持续学习中的灾难性遗忘视角重新思考后门对抗性去学习
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Key Laboratory of Media Security, Shenzhen University(深圳大学媒体安全深圳市重点实验室)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI
AI总结 本文将后门学习与去学习建模为持续学习视角下的三阶段过程,基于灾难性遗忘机制推导完全后门去学习的必要条件,并提出盲反演-后门对抗性去学习(BI-BAU)方法,通过期望最大化算法优化最大后验目标,有效消除后门效应。
Comments Accepted by ACM CCS 2026
FloVerse:基于楼层平面图的多模态导航
机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract)
AI总结 提出FloVerse任务统一PointNav、ObjectNav和ImageNav,构建FloVerse-1.6K数据集,并设计ThreeDiff两阶段模仿学习策略,利用楼层平面图先验提升导航性能。
Comments Accepted at CVPR 2026
扩散细化分割与视觉-语言解释用于儿童脑肿瘤MRI
机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) ; School of Medicine, Stanford University(斯坦福大学医学院)
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 提出两阶段框架,先用Swin-UNETR粗分割,再用条件扩散模型细化边界,最后结合多模态语言模型生成结构化报告,提升儿童脑肿瘤分割精度和可解释性。
InterleaveThinker: 强化智能体交错生成
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; Meituan(美团) ; CUHK IMIXR(香港中文大学IMIXR实验室)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。
Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker
VeriGeo: 可控几何问题生成与数值和分析验证
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。
Comments 32 pages, 4 figures, 9 tables
ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作
机构 * Shanghai Jiao Tong University(上海交通大学) ; Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。
从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练
机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) ; Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。
ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。
Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu
NEST3D:织布鸟树巢的高分辨率多模态数据集
机构 * Institute for Geoinformatics (ifgi), University of Münster(明斯特大学地理信息学研究所) ; École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) ; University of Konstanz(康斯坦茨大学) ; Kuzikus Research Station(库兹库斯研究站) ; Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 针对织布鸟巢缺乏精细3D结构数据的问题,提出包含104棵巢树、1.4TB多模态无人机数据集,并基准测试语义分割方法,PT-v3达86.35% mIoU。
Comments 14 pages, 4 figures. Dataset available at https://huggingface.co/NEST3D
HiST:用于跨模态空间转录组建模的分层稀疏Transformer
机构 * New Jersey Institute of Technology(新泽西理工学院) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Karolinska Institutet(卡罗林斯卡学院) ; Dartmouth College(达特茅斯学院)
专题命中 多模态评测 :cross-modal(title);分类 cs.CV
AI总结 提出HiST,一种分层稀疏Transformer,通过稀疏窗口注意力和分辨率变换算子实现高效的多尺度空间转录组推断,显著降低计算开销并提升预测性能。
Journal ref ICML 2026
GaSe分子束外延生长条件的多模态机器学习分析
专题命中 多模态评测 :multi-modal(title)
AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。
GarmentSketch:大规模草图到时尚基准
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。
Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch
ContactWorld: 视觉-触觉世界模型中什么对接触丰富操作至关重要
机构 * School of Industrial Engineering, Purdue University(普渡大学工业工程学院) ; Department of Mechanical Engineering, Texas A&M University(德克萨斯农工大学机械工程系)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)
AI总结 通过12项接触丰富操作任务,发现空间结构化和时间连续的表征(如点云)能显著提升规划成功率,且触觉传感的有效性依赖于跨模态表征兼容性。
Comments 32 pages, 12 figures, supplementary material included
CisTransCell:通过基因功能、调控控制和细胞上下文进行单细胞扰动预测
机构 * [q-bio.GN]
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 提出CisTransCell框架,结合调控序列和编码序列先验与细胞表达状态,建模扰动响应级联,实现零样本单细胞扰动预测。
生物医学拉曼光谱的机器学习:从光谱采集到临床转化
机构 * National Institute of Research and Development for Biological Sciences(罗马尼亚生物科学研究院) ; University of Bucharest(布加勒斯特大学) ; University of Turku(图尔库大学)
专题命中 多模态评测 :multimodal(abstract)
AI总结 综述机器学习在生物医学拉曼光谱全流程中的应用,包括预处理、诊断分类、可解释性分析及临床转化障碍,强调标准化与鲁棒验证的必要性。
Comments 52 pages, 2 figures
SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击
专题命中 多模态Agent :cross-modal(title,abstract)
AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。
用于自动化高中成绩单处理的多智能体AI系统:大规模协作文档分析
机构 * University of South Carolina(南卡罗来纳大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出一个多智能体AI系统,通过三个专业智能体协作,自动处理不同格式的高中成绩单,以GPA提取作为协调信号,实现96.7%的准确率和每份45秒的处理速度。
电子商务欺骗性界面下的Web Agent安全基准测试
机构 * AAII, University of Technology Sydney(悉尼科技大学AAII) ; University of Liverpool(利物浦大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL
AI总结 提出WebDecept框架,在电子商务环境中注入七种常见欺骗性界面模式,测试多模态Web Agent的安全性,发现当前Agent极易受骗且提示约束不足。
Comments Accepted to ACL 2026
RepFusion:利用多模态先验在表示空间中进行去噪
机构 * Meta AI ; New York University(纽约大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出RepFusion方法,利用多模态大语言模型作为噪声表示编码器,为扩散变压器提供条件信号,在相似推理预算下优于新初始化解码器基线。
Comments Project Page: https://xichenpan.com/repfusion
上下文感知的模态-拓扑协同对齐用于多模态属性图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出CoMAG框架,通过任务自适应可靠上下文学习和模态保持的跳令牌对齐,统一处理图任务和模态任务,在保持稀疏边线性复杂度的同时提升结构预测、跨模态匹配和图条件生成性能。
CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; Tianjin University(天津大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。
Comments Submitted to EMNLP 2026
自监督遥感视觉模型如何迁移到下游任务?
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究六种代表性自监督地理空间基础模型(GeoFMs)在下游任务中的迁移表现,发现模型排名随任务和适应设置变化,中间层特征比最终层更相关,且解码器设计等适应设置影响与模型选择相当。
三模态胶质瘤表示对齐通过体积对比学习
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。
一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择
机构 * Hikvision Research Institute(海康威视研究院) ; Peking University(北京大学) ; East China Normal University(华东师范大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。
Comments Accepted by CVPR 2026 (highlight)