MJ1: Multimodal Judgment via Grounded Verification
MJ1: 通过 grounded 验证实现多模态判断
机构 * Haize Labs(哈泽实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
MJ1: 通过 grounded 验证实现多模态判断
机构 * Haize Labs(哈泽实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。
指出你的意图:基于视觉的指令策略
机构 * Tongji University(同济大学) ; Shanghai Jiao Tong University(上海交通大学) ; Spirit AI ; Tsinghua University(清华大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。
MERIT: 用于可解释知识追踪的记忆增强检索
机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; WeChat AI, Tencent(微信AI,腾讯)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 MERIT提出一种无需训练的框架,结合冻结LLM推理与结构化教学记忆,通过语义去噪将学生分类为潜在认知模式,并构建模式库生成显式推理依据,提升教育诊断的可解释性和效率。
知识访问胜过模型规模:基于对话记忆的持久AI代理路由
机构 * vLLM Semantic Router Project(vLLM语义路由器项目) ; MBZUAI ; McGill University(麦吉尔大学) ; Mila ; AMD ; Red Hat(红帽)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出利用对话记忆提升AI代理效率,通过轻量模型结合检索信息,使小模型在用户特定查询中表现优于大模型,证明知识访问比模型规模更重要。
合成还是真实?从纵向证据构建心理健康患者模拟器
机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) ; X-LANCE Lab(X-LANCE实验室) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。
从分数到策略:面向可视化素养的凝视引导诊断评估
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出通过凝视数据补充传统测试,以更全面评估读者在可视化信息处理中的认知负荷和策略差异,推动评估从二元分类向精细化描述转变。
Comments 4 pages, Workshop on Data Literacy for the 21st Century at CHI 2026, April 26, Barcelona, Spain
时间与关系聚焦:对象导向事件数据的本体论基础
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出基于本体论的对象导向事件数据模型,通过三步方法解决现有模型在时间与动态关系方面的不足,增强表达能力与清晰度。
TRivia: 基于视觉-语言模型的自监督微调用于表格识别
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; Shanghai Jiaotong University(上海交通大学) ; Sensetime
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。
Comments Accepted by CVPR 2026
MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染
机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) ; Peking University(北京大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。
VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。
CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航
机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))
专题命中 GUI与屏幕智能体 :VLM(abstract);visual reasoning(abstract)
AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。
Comments 8 pages, 6 figures
Ego2Web:一种基于第一人称视频的网络代理基准测试
机构 * Google DeepMind(谷歌DeepMind) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。
Comments CVPR 2026. Project page: https://ego2web.github.io/
描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航
机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) ; Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。
ImmerseGen:基于代理的沉浸式世界生成与Alpha纹理代理
机构 * Bytedance(字节跳动) ; Zhejiang University(浙江大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV
AI总结 ImmerseGen通过轻量级几何代理和合成RGBA纹理实现高效沉浸式VR场景生成,结合地形条件纹理和上下文感知纹理生成多样且视觉一致的世界,提升真实感和渲染效率。
Comments Accepted by IEEE VR 2026 and TVCG Special Issue. Project webpage: https://immersegen.github.io
面向即兴任务的移动建筑机器人AI代理的定位任务感知
机构 * University of Michigan(密歇根大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 GUI与屏幕智能体 :visual reasoning(abstract)
AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。
SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作
机构 * UC San Diego(南加洲大学) ; Lambda, Inc(Lambda公司)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。
同意还是正确?医学视觉-语言模型中的 grounding 与谄媚权衡
机构 * Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI总结 研究评估了六种医学视觉问答模型,揭示了 grounding 与谄媚之间的权衡关系,并提出三种新指标以评估模型的可靠性与安全性。
基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。
Comments There is a update in result, which is needed to be addressed
TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。
Comments CVPR2026
gaze-VLM:通过注意力正则化连接 gaze 与 VLMs 以实现 egocentric 理解
机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆斯克特基金会数据科学研究所,香港大学) ; Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学)
专题命中 幻觉与鲁棒性 :VLM(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出 gaze-regularized 框架,通过注意力正则化提升 VLMs 在细粒度未来事件预测和当前活动理解任务中的性能,实验表明在预测精度和鲁棒性上有显著提升。
通过注意力校准缓解大视觉-语言模型中的物体幻觉
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。
HalDec-Bench:图像描述中幻觉检测的基准测试
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。
Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there
HalDec-Bench:图像描述中幻觉检测的基准测试
机构 * OMRON SINICX ; The University of Tokyo(东京大学) ; The University of Osaka(大阪大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。
Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident
基于卫星图像的检索引导光伏库存估计用于配电网规划
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 本文提出Solar-RAG框架,通过图像检索与多模态视觉语言推理结合,提升光伏部署估计的鲁棒性,减少配电网规划中的电压偏差和承载能力误差。
Comments 38 pages, 15 figures
一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型
机构 * Biological and Agricultural Engineering(生物与农业工程系) ; Department of Plant Sciences(植物科学系) ; Viticulture and Enology(葡萄栽培与酿酒系) ; Wageningen University & Research(瓦赫宁根大学与研究学院)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。
SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产
机构 * ByteDance Seed(字节跳动种子) ; NTU(国立台湾大学)
专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV
AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。
PopResume:基于人口代表性数据集的LLM/VLM简历筛选器因果公平性评估
机构 * ECE, Seoul National University(首尔国立大学电子与计算机工程系) ; IPAI, Seoul National University(首尔国立大学人工智能研究所) ; ASRI / INMC / AIIS, Seoul National University(首尔国立大学人工智能研究所)
专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI
AI总结 PopResume通过人口统计数据和自然属性关系,实现对LLM和VLM简历筛选系统的因果公平性评估,识别出五种传统指标无法捕捉的歧视模式。
Comments Under Review
ARGENT:自适应层次图像-文本表示
机构 * University of Maryland, College Park(马里兰大学 College Park分校) ; Samsung Research America, AI Center(三星美国研究院人工智能中心)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。
奠基效应塑造了开放大语言模型家族中多模态的进化动态
机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。
Comments 7 pages, 4 figures, 2 tables
基于目光调节的视觉语言模型用于以自身为中心的行为理解
机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆凯特基金会数据科学研究所,香港大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出一种基于目光调节的视觉语言模型框架,通过整合目光信息提升以自身为中心的行为理解能力,实验结果显示在语义得分上提升了近13%。