Selective "Selective Prediction": Reducing Unnecessary Abstention in Vision-Language Reasoning
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments Accepted to ACL Findings 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments Accepted to ACL Findings 2024
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Page: https://codi-2.github.io/
专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI;LLaVA(comments)
Comments Produced by MME+MMBench+LLaVA Teams. Project Page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Benchmarks
CT-ΔBench:基于视觉语言模型的纵向3D医学影像差异报告基准
机构 * University of Tennessee at Chattanooga(田纳西大学查塔努加分校)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
AI总结 本文针对现有医学基础模型缺乏纵向影像差异处理能力的问题,构建了专用基准CT-ΔBench,开发感知变化指标与医师验证流程,对比不同推理方式并提出基线模型DeltaMed,为时间感知医学基础模型奠定基础。
Comments Accepted by COLM 2026
提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏
专题命中 视觉推理 :vision-language model(title);分类 cs.LG
AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。
用于通用符号推理的递归视觉语言模型
专题命中 视觉推理 :vision language model(title);分类 cs.CV
AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。
蒸馏RGB可恢复的内容:面向仅RGB视觉-语言模型的特权3D证据
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
AI总结 本研究提出特权3D证据蒸馏框架,将训练时的3D证据转化为仅RGB视觉-语言模型的空间推理能力,使仅RGB学生模型在11项指标上均优于基线,验证了该方法的有效性。
EraseLoRA: 基于多模态大语言模型的前景排除与背景子类型聚合用于无数据集对象去除
机构 * OGQ ; Seoul National University(首尔大学)
专题命中 视觉推理 :MLLM(title);分类 cs.CV
AI总结 EraseLoRA通过多模态大语言模型实现前景排除与背景子类型聚合,提升无数据集对象去除的背景重建与前景抑制效果,显著提高重建真实性并减少冗余生成。
Comments Accepted to ECCV 2026
面向准确鲁棒的监控路边IVD:基于轨迹化的视听推理
机构 * Kahlert School of Computing, University of Utah(犹他大学卡勒特计算学院) ; Scientific Computing and Imaging Institute, University of Utah(犹他大学科学计算与成像研究所) ; Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 提出TAVR-IVD框架,通过多目标跟踪将车辆检测链接为轨迹,基于轨迹进行视听融合分类,提升信噪比、稳定时间决策、对齐车辆与麦克风空间先验,并在跨域场景下保持高效鲁棒。
基于时空场景图基础的计划与验证视频奖励推理
机构 * Korea University(高丽大学)
专题命中 视觉推理 :grounding(title);分类 cs.CV
AI总结 提出SG-PVR视频奖励模型,通过计划-验证推理和时空场景图,系统验证提示中的每个条件,实现细粒度语义对齐,提升文本到视频生成的组合对齐。
DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图
机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)
专题命中 视觉推理 :grounding(title);分类 cs.CV
AI总结 提出DGSG-Mind,一种混合实例感知的3D高斯动态场景图系统,通过概率体素网格与显式3D高斯结合实现鲁棒的跨模态实例融合和增量语义映射,并构建层次化场景图与3D高斯思维进行多模态推理,在零样本3D视觉定位、开放词汇语义分割和场景重建中取得领先性能。
Comments 9 pages, 6 figures
训练智能体而非专家:学习利用异构专家进行多轮视觉推理
机构 * Sun Yat-sen University(中山大学) ; HKUST(香港科技大学) ; Harbin Institute of Technology(哈尔滨理工大学)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 提出VisHarness,一种可训练的视觉智能体,通过解耦高层感知推理与低层任务执行,学习利用异构视觉专家模型,以轻量训练实现多轮交互下的通用视觉任务求解。
JointAVBench: 一个用于联合音频视觉推理评估的基准测试
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) ; Baichuan Inc(百川科技)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。
GeoR-Bench:评估地质学视觉推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing University of Technology(北京理工大学)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 GeoR-Bench通过推理引导的视觉编辑任务评估地质学视觉推理,包含440个样本涵盖6类地质学领域和24种任务类型,揭示地质学推理仍是关键瓶颈。
OmicsLM:一种多模态大语言模型用于多样本组学推理
专题命中 视觉推理 :multimodal large language model(title);分类 cs.AI
AI总结 OmicsLM通过整合定量组学数据与自然语言任务,实现多样本组学推理,其在多任务类型上表现优异,尤其在生物语言指导的推理任务中超越专用模型和通用LLM。
Comments 13 pages (main text), 14 pages (appendix), 1 figure, 10 tables
Omni-o3:深度嵌套多模态推理用于 deliberative 音视频推理
机构 * Nankai University(南开大学) ; Pengcheng Laboratory(鹏城实验室) ; Kuaishou Technology(快手科技) ; Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 Omni-o3通过深度嵌套推理策略,解决多模态交互中搜索空间大且冗余的问题,提升音视频推理效率与准确性。
多模态字体攻击在音频视觉推理中的系统研究
机构 * Boston University(波士顿大学)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。
心灵超越空间:多模态大语言模型能否进行心理导航?
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) ; School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) ; college of AI, Tsinghua University(清华大学人工智能学院) ; Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)
专题命中 视觉推理 :multimodal large language model(title);分类 cs.AI
AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。
CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法
机构 * National University of Singapore(新加坡国立大学) ; University of Mississippi(密西西比大学) ; ASUS Intelligent Cloud Services(ASUS智能云服务)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。
Comments Accepted by CVPR 2026
视觉到几何:用于连续具身MLLM推理和探索的3D空间记忆
机构 * ACTION Lab, Michigan State University(密歇根州立大学ACTION实验室) ; SAIR Lab, University at Buffalo(布法罗大学SAIR实验室)
专题命中 视觉推理 :MLLM(title);分类 cs.CV
AI总结 本文提出3DSPMR框架,利用视场覆盖作为几何先验,提升具身智能在连续任务中的记忆、推理与探索能力,并引入SEER-Bench基准测试连续具身探索与推理任务。
Comments Computer Vision
Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展
专题命中 视觉推理 :MLLM(title);分类 cs.CV
AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。
Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/
GTR-Bench:评估视觉-语言模型中的地理时间推理
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Peking University(北京大学) ; Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。
Comments ICLR 2026, 31 pages, 20 figures
CircuitSense: 一种层次化的MLLM基准,连接视觉理解和符号推理在工程设计过程
机构 * Northeastern University(东北大学) ; Brookhaven National Laboratory(布鲁克海文国家实验室)
专题命中 视觉推理 :MLLM(title);分类 cs.CV
AI总结 CircuitSense提出一个层次化基准,评估工程设计中视觉理解与符号推理的能力,揭示闭源模型在符号推导上的不足,强调数学理解对电路综合的重要性。
图表去渲染、推理与修复:基于视觉-语言模型
机构 * Universidad Torcuato Di Tella(托克托迪特拉大学) ; Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究理事会) ; Facultad de Ciencias Exactas y Naturales Universidad de Buenos Aires(布宜诺斯艾利斯大学科学与自然学院)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
AI总结 本文提出了一种结合图表去渲染、自动分析和迭代改进的框架,利用视觉-语言模型提供基于原则的可视化设计反馈,提升可视化质量和素养。
MindPower: 使基于视觉语言的具身智能体具备心智理论推理能力
机构 * Jilin University(吉林大学) ; National Taiwan University(台湾大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视觉推理 :VLM(title);分类 cs.AI
AI总结 MindPower通过整合感知、心理推理、决策和行动,使基于视觉语言的具身智能体具备心智理论推理能力,并在决策和行动生成上超越GPT-4o。
Comments Accepted by CVPR 2026
EAA: 用视觉语言模型代理自动化材料表征
机构 * Argonne National Laboratory(阿贡国家实验室) ; Advanced Photon Source(先进光子源) ; Data Science and Learning Division(数据科学与学习 division) ; Department of Radiation Oncology(放射肿瘤学系) ; Northwestern University(西北大学)
专题命中 视觉推理 :vision language model(title);分类 cs.AI
AI总结 EAA利用视觉语言模型代理自动化材料表征,通过多模态推理和工具增强操作提升显微镜实验效率,减少操作负担并降低用户专业门槛。
M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。
VLN-Pilot: 大型视觉-语言模型作为自主室内无人机操作员
机构 * University Institute for Compute Research(计算研究大学研究所) ; University of Alicante(阿利坎特大学)
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
AI总结 VLN-Pilot利用大型视觉-语言模型实现自主室内无人机导航,通过自然语言指令和视觉感知结合,提高飞行任务的自主性和安全性。