ViLLA: Fine-Grained Vision-Language Representation Learning from Real-World Data
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ICCV 2023
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ICCV 2023
专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted to NeurIPS 2019. Project page: https://deanplayerljx.github.io/tabvcr
Cambrian-P: 基于姿态的视频理解
机构 * New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; Meta FAIR
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。
Comments Project Page: https://cambrian-mllm.github.io/
MindClaw: 用于精确干预的闭环具身心理状态推理
机构 * Jilin University(吉林大学) ; Microsoft Asia(微软亚洲) ; National Taiwan University(国立台湾大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出MindClaw框架,通过闭环具身心理状态推理实现精确干预,结合多源输入、信念记忆、认知触发技能和动作生成,在动态环境中优化干预时机。
Comments Extended version of the CVPR 2026 paper *MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents*. This work is in progress
视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型
机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) ; University of Texas Health(德克萨斯大学健康科学中心) ; Virginia Hospital Center(弗吉尼亚医院中心) ; Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) ; Stanford University(斯坦福大学) ; Cedars-Sinai Medical Center(西达赛奈医疗中心) ; Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) ; University of California–Los Angeles(加州大学洛杉矶分校) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Columbia University(哥伦比亚大学)
专题命中 视觉推理 :VLM(abstract,comments);vision language model(abstract);分类 cs.AI
AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。
Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results
Journal ref npj Digital Medicine 8, 797 (2025)
NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理
专题命中 视觉推理 :multimodal large language model(title)
AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。
在变压器推理中为潜在算法路由建立基础
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉推理 :grounding(title)
AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。
Comments Accepted by COLM 2026
在思考之前,先学会决策:面向高效视觉推理的主动路由
机构 * Xi’an Jiaotong University(西安交通大学) ; ARC Lab, Tencent IEG(腾讯IEG ARC实验室) ; City University of Hong Kong(香港城市大学) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Harvard University(哈佛大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :visual reasoning(title)
AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。
Comments 36 pages, 20 figures
结构化可视化设计知识:用于基础生成推理和情境反馈
专题命中 视觉推理 :grounding(title)
AI总结 提出一种结构化方案,将可视化设计知识编码为带语义元数据的自然语言指南,支持专家编写、机器查询,并嵌入向量空间以分析冲突和跨领域原则,弥补符号系统与生成模型之间的鸿沟。
评估和引导多模态大语言模型中的模态偏好
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)
专题命中 视觉推理 :multimodal large language model(title)
AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。
Comments Modality Preference
FinCoT:在专家金融推理中 grounding 思维链
机构 * SCB 10X, SCBX Group(SCB 10X集团)
专题命中 视觉推理 :grounding(title)
AI总结 FinCoT通过整合专家金融推理蓝图,提升金融领域模型性能并减少推理成本,实现更可解释的推理过程。
Comments Accepted at FinNLP-2025, EMNLP (Oral Presentation)
通过上下文归一化增强长上下文推理用于检索增强生成
机构 * City University of Hong Kong(香港城市大学) ; Baidu Inc.(百度公司)
专题命中 视觉推理 :grounding(title)
AI总结 通过上下文归一化策略提升RAG在长上下文推理中的鲁棒性和稳定性
在可观察之前看见:通过视觉语言模型在自动驾驶中的潜在风险推理
机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)
专题命中 视觉推理 :vision language model(title)
AI总结 本文提出PotentialRiskQA数据集和PR-Reasoner框架,通过视觉语言模型提升自动驾驶中潜在风险的前瞻性推理能力。
机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) ; University of Freiburg(弗赖堡大学)
专题命中 视觉推理 :multimodal large language model(title)
机构 * Northeastern University(东北大学)
专题命中 视觉推理 :multimodal large language model(title)
Comments 13 pages, 6 figures, 2 tables
专题命中 视觉推理 :MLLM(title)
机构 * School of Software, Henan University(河南大学软件学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉推理 :multimodal large language model(title)
专题命中 视觉推理 :grounding(title)
Comments Preprint
专题命中 视觉推理 :vision-language model(title)
Comments ICRA 2025
专题命中 视觉推理 :multimodal large language model(title)
Comments 20 pages, 12 figures
专题命中 视觉推理 :grounding(title)
Comments AAAI 2023 RL Ready for Production Workshop
专题命中 视觉推理 :visual reasoning(title)
Comments Accepted for publication at IEEE VIS 2020
REChart:基于大型推理模型的推理高效图表编辑方法
机构 * HKUST(GZ)(香港科技大学(广州))
专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 REChart是两阶段训练框架,通过过程级监督提升图表编辑的保真度与推理效率,在两个基准上实现同规模开源模型最优性能,推理token用量降低79.0%。
抖音多模态嵌入模型技术报告
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理
机构 * National University of Singapore(新加坡国立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。
具备多模态增强能力的可泛化手术室专家
专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。
Comments Accepted by ACM Multimedia 2026
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
顺序很重要:LVLMs作为图像序列时间推理的评判者
机构 * University of Bologna(博洛尼亚大学) ; NOVA School of Science and Technology(NOVA科技学院) ; NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。
Comments 34 pages, camera-ready
听、看与跟踪:面向全模态大模型的时空视听声音事件推理
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI
AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。