Visual cognition in multimodal large language models
专题命中 视觉推理 :multimodal large language model(title);分类 cs.LG
Comments Updated manuscript
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :multimodal large language model(title);分类 cs.LG
Comments Updated manuscript
专题命中 视觉推理 :vision-language model(title);分类 cs.CV
Comments On-going work
专题命中 视觉推理 :visual reasoning(title);分类 cs.LG
Comments 12 pages
Journal ref International Conference on Pattern Recognition and Artificial Intelligence (ICPRAI) 2024
专题命中 视觉推理 :visual reasoning(title);分类 cs.AI
专题命中 视觉推理 :vision language model(title);分类 cs.CV
Comments 10 pages, 7 figures
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
Comments PhD thesis
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title);分类 cs.LG
专题命中 视觉推理 :visual reasoning(title);分类 cs.CV
Comments Accepted at ECCV 2018 - long version (16 pages + ref)
Journal ref ECCV 2018
基于区域级组织推理与非平衡最优传输的淋巴细胞模拟修正
机构 * Duke University(杜克大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 针对细胞模拟导致的病理细胞分类歧义问题,提出Loki-OT方法,结合区域级组织推理与非平衡最优传输,在TCGA-BRCA队列上取得更优性能。
Comments 13 pages, 3 figures. Accepted to the MICCAI 2026 COMPAYL Workshop
VISOR: 通过迭代搜索和超视距推理实现基于视觉检索的增强生成
机构 * Soochow University(苏州大学) ; Baidu Inc.(百度公司)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 VISOR通过结构化证据空间和动态轨迹机制解决多步推理中的视觉证据稀疏和搜索漂移问题,实现高效长视距视觉推理。
Comments Accepted by ACM Multimedia 2026 (MM '26). 8 pages, 3 figures. Code: https://github.com/syc1336/VISOR
MetaReason:通过编辑元信息实现精确的交错多模态推理以解决几何问题
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出MetaReason框架,构建TutorGeo与ExamGeo数据集,结合监督微调与强化学习,实现几何问题的精确交错多模态推理,性能优于现有开源模型。
在潜空间思考,以语言解释:自解释潜推理
专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究提出自解释潜推理框架SELR,通过多任务训练使单个模型兼具高效潜推理与自解释能力,在LLMs和VLMs上实现更优效率、准确性与自包含可解释性。
提示驱动的探索
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Improbable AI Lab(英普罗巴布尔人工智能实验室)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。
复杂城市场景中基于证据的可信多模态推理与评估基准
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; Tencent CDG(腾讯云与智慧产业事业群) ; Institute of Information Engineering, CAS(中国科学院信息工程研究所)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。
Comments Accepted by IJCV
MIRA:面向智能体诊断的医学图像反射
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出医学视觉诊断框架MIRA,通过两阶段训练优化工具使用与证据验证,在9个医学视觉推理基准上较Qwen3-VL-8B backbone提升7.44分,改善工具使用判断并减少有害判断。
对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告
机构 * University of Pittsburgh(匹兹堡大学) ; University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) ; The University of Manchester(曼彻斯特大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。
何时与何地查看:用于高效长视频理解的自适应视觉证据调度
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
NarrativeTrack: 评估实体中心推理在叙事理解中的表现
机构 * Apple(苹果公司) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。
Comments Project Page: https://github.com/apple/ml-NarrativeTrack
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
See2Think:多模态模型是否真正利用中间视觉状态?
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。
Comments 10 pages, 5 figures, and 8 tables
Ouroboros-Spatial:闭环数据-模型循环的空间推理
机构 * Peking University(北京大学) ; Ant International(蚂蚁国际) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出Ouroboros-Spatial自演化框架,通过提议器与求解器闭环交互,动态生成与模型能力匹配的训练样本,在六个空间推理基准上以十分之一数据量显著提升Qwen3-VL性能。
VistaHop: 视觉深度搜索的多跳视觉推理基准
机构 * East China Normal University(东华大学) ; Meituan(美团) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。
GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) ; University of Science and Technology Beijing(北京科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。
Comments Accepted by ACM MM 2026
EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解
机构 * Guangdong University of Technology(广东工业大学) ; Southern University of Science and Technology(南方科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。
LanteRn:潜在视觉结构推理
机构 * Instituto de Telecomunicações(电信研究所) ; Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出LanteRn框架,通过将语言与紧凑的潜在视觉表示结合,使大多模态模型能在潜在空间中进行视觉推理,提升视觉理解和细粒度推理能力。
AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构
专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。
Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat
SiPhy:单图像物理属性推理
机构 * Michigan State University(密歇根州立大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究从单图像推断物理属性,核心方法是引入SiPhy框架,将视觉线索与材料知识对齐,通过采样、提取特征等操作及对比聚合器、重量感知细化来实现。在多个数据集上取得领先性能,还验证了其在真实交互数据集上作为数据标注引擎的潜力。
Comments Accepted to ECCV 2026 (main track)
MIRROR:从其他视角学习以进行多模态推理
机构 * University of Southern California(南加州大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。