PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
PRISM:基于结构化多模态数据合成的感知优先级的评分标准内化
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对多模态指令多要求重要性不等的问题,提出PRISM四阶段数据合成框架,结合PRISM-Eval评估,提升多模态大模型的多规则优先级感知指令遵循能力。
探测轻量视觉语言模型中视觉概念以用于自动驾驶
机构 * University of Limerick(利默里克大学) ; Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) ; Department of Electronic and Computer Engineering(电子与计算机工程系)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。
Journal ref Transactions on Machine Learning Research, 2026
RemoteZero:零样本地理空间推理
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
MoCA:隐式社会语境分析
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Wuhan University(武汉大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本文提出隐式社会语境分析(MoCA)新任务,构建含3108个实例的基准数据集,提出CoDAR框架提升模型性能,但模型与人类推理仍存差距,凸显隐式社会理解难度。
通过引导视觉令牌注意力实现直接视觉 grounding
机构 * Temple University(特拉华大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);vision language model(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对VLMs中视觉令牌注意力不足的问题,提出KL注意力损失,结合下一个令牌预测损失,在多个视觉任务上取得显著提升,还引入了用于评估VLMs线条追踪能力的新数据集。
基于大语言模型的符号图形编程
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。
Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/
释放视觉-语言模型在通用人工智能生成图像检测中的潜力
专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究针对AI生成图像检测,发现视觉-语言模型PE比DINOv3更具潜力,提出语义原型校准(SPC)方法得到PE-SPC,在多基准测试中达到新的最先进性能。
通过模态差距感知自蒸馏从符号状态学习视觉空间规划
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。
Comments 18 pages, preprint
Text2Villa:通过物理感知的合成分析进行3D室内环境的分层生成
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)
AI总结 研究旨在解决从自然语言生成3D室内场景的问题,提出Text2Villa框架。宏观构建数据集微调布局生成器,微观引入A-PSSG并结合碰撞检测与语义推理,有效解决相关问题,性能优于以往方法,为下游应用提供3D内容基础。
Comments 17 pages, 12 figures, Project page: https://xdlbw.github.io/Text2Villa/
通过上下文感知的合成增强缓解心理防御分类中的数据稀缺
机构 * College of Engineering and Computer Science, VinUniversity, Hanoi, Vietnam(越南 Vin大学工程与计算机科学学院,河内,越南) ; VinUni-Illinois Smart Health Center, VinUniversity, Hanoi, Vietnam(越南 Vin大学与伊利诺伊大学智能健康中心,河内,越南) ; Center for Innovations in Health Sciences, VinUniversity, Hanoi, Vietnam(越南 Vin大学健康科学创新中心,河内,越南)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出上下文感知合成增强框架与混合分类模型,解决心理防御机制分类中的数据稀缺问题,实验表明方法在低资源环境下取得显著提升。
通过封面判断书籍:调查多模态大语言模型用于多页手写文档转录
机构 * University of Oxford(牛津大学) ; QuantCo
专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文研究多模态大语言模型在多页手写文档转录中的应用,提出OCR+PAGE-1和OCR+PAGE-N策略,通过共享页面内容提升转录效果。
Comments 10 pages (36 including references and appendices), 11 figures, accepted at COLM 2026, earlier version accepted at AAAI 2025 Workshop on Document Understanding and Intelligence
DATAREEL:基于动画的自动化数据驱动视频故事生成
机构 * York University(约克大学) ; Bangladesh University of Business and Technology(孟加拉国商业与技术大学) ; RBC, Canada(加拿大RBC) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。
Comments Under Review
EchoVLA:用于VLA驱动移动操作的协同声明记忆
机构 * Shenzhen Campus of Sun Yat-sen University, Shenzhen, China(中山大学深圳校区) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Huawei Noah's Ark Lab, China(华为诺亚方舟实验室)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 EchoVLA通过协同声明记忆提升移动操作性能,结合场景与事件记忆,利用注意力融合指导基臂策略,实现高效导航与操作。
MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn)
AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。
Comments Project page: https://mobile-forge.github.io/
Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beihang University(北京航空航天大学) ; Huawei Foundation Model Department(华为基础模型部门)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。
VLA-Arena:一个用于基准测试视觉-语言-动作模型的开源框架
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 提出VLA-Arena基准,通过三正交轴(任务结构、语言命令、视觉观察)量化任务难度,系统评估视觉-语言-动作模型的能力边界与失败模式。
Comments Accepted by ICML 2026
Skill-RAG: 通过隐藏状态探测与技能路由实现故障状态感知的检索增强
机构 * University of Michigan(密歇根大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Rutgers University(罗格斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; New Jersey Institute of Technology(新泽西理工学院) ; TU Darmstadt(图腾斯大学) ; Wake Forest University(威克森林大学)
专题命中 幻觉与鲁棒性 :grounding(abstract)
AI总结 提出Skill-RAG框架,通过轻量级隐藏状态探测器和基于提示的技能路由器,在检索失败时诊断原因并选择四种技能(查询重写、问题分解、证据聚焦、退出)纠正查询-证据错位,显著提升多轮检索后困难案例的准确性。
VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。
Comments Accepted by ACM MM 2026
解耦相似性用于大视觉-语言模型中的任务感知token剪枝
机构 * Wuhan University(武汉大学) ; University of Exeter(埃克塞特大学) ; Chinese Academy of Sciences(中国科学院) ; Xi'an University of Electronic Science and Technology(西安电子科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。
Comments Accepted at ACM Multimedia 2026. Camera-ready version
IFCLoRA:用于参数高效微调的拓扑感知秩分配
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究针对LoRA方法中秩分配问题,提出IFCLoRA拓扑感知秩分配方法,利用小校准集和冻结模型构建交互图,结合全局拓扑先验与局部梯度敏感性计算得分来分配秩,在多场景下优于其他方法,还揭示了任务依赖的秩分布特点。
Comments 9 pages, 5 figures
MUGEN:用于高效运动理解与生成的统一框架
机构 * Florida State University(佛罗里达州立大学) ; Texas Christian University(得克萨斯基督教大学) ; University of Miami(迈阿密大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 MUGEN是一个无码本的统一运动-语言框架,通过自适应长度自编码器实现高效运动压缩,在HumanML3D和SnapMoGen数据集上的生成、检索与对齐指标均表现优异,兼顾效率与性能。
TIDE: 任务隔离扩散模型用于统一视频编辑与生成
机构 * Zhejiang University(浙江大学) ; Bilibili Inc.(哔哩哔哩股份有限公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。
Grad-ECLIP: 基于梯度的CLIP视觉与文本解释
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Division of Social Science and Department of Computer Science & Engineering, Hong Kong University of Science & Technology(香港科学与技术大学社会科学学院及计算机科学与工程系) ; SenseTime Group Ltd(时光集团有限公司)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出Grad-ECLIP方法,通过分解CLIP编码器架构并分析匹配相似度与中间空间特征的关系,生成有效热图以解释CLIP匹配结果。通过通道和空间权重提升视觉解释质量,并通过定性定量评估验证其有效性。
Journal ref Zhao C, Wang K, Hsiao J H, et al. Grad-eclip: Gradient-based visual and textual explanations for clip[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026
一致性存在可计算的盲区:视觉-语言图表阅读的无标签可靠性交换理论
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG
AI总结 该研究提出视觉-语言图表阅读的无标签可靠性交换理论,构建无标签、无需训练的检测器,发布REND-EQUIV数据集,揭示一致性盲区可计算,循环重标记可提升性能,解释排序反转现象。