UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Journal ref PMLR 235:49733-49787, 2024
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project page: https://github.com/LaVi-Lab/Visual-Table
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 27 pages, 23 figures
专题命中 视觉推理 :visual reasoning(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published in Proceedings of the 37th International Conference on Machine Learning (ICML), Online, PMLR 119, 2020
AVERY:基于具身自感知的意图驱动自适应VLM分发计算以实现高效的灾害响应系统
机构 * University of California, Irvine(加州大学尔湾分校) ; Kookmin University(国民大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 AVERY通过意图驱动的自适应分发计算框架,在资源受限平台高效部署VLM,利用双流分发策略提升灾害响应系统实时查询能力,实现更高的准确性和更低的能耗。
Comments Paper is currently under review. Authors' version posted for personal use and not for redistribution. Previous version of the preprint was titled: 'AVERY: Adaptive VLM Split Computing through Embodied Self-Awareness for Efficient Disaster Response Systems'
专题命中 视觉推理 :VLM(title,comments);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Peinl, René; Tischler, Vincent (2025): VLM@school - Evaluation of AI image understanding on German middle school knowledge. Future Technologies Conference (FTC) 2025, Munich, Germany 2025 (accepted)
面向病理图像解读的语言空间空间消息传递
机构 * National Taiwan University(台湾大学) ; University of Oxford(牛津大学) ; ZYTCA Limited(ZYTCA有限公司)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出SLMP框架,在语言空间对病理图像执行空间推理,无需微调MLLM,提升肿瘤描述准确率,缩小通用与病理专用MLLM的性能差距。
Comments Accepted at MICCAI 2026 Workshop (Oral)
GeoBridge:用于生成式图像地理定位的解耦语义条件机制
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; School of Advanced Interdisciplinary Sciences(先进交叉科学学院) ; School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。
人工智能与人类专家推理:基于街景图像评估建筑类型预测中的一致性
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 研究探讨视觉语言模型从街景图像推断建筑类型的潜力,将其预测与人类专家比较,评估多种VLM,发现思维链提示性能更稳定,通过分析关键词概率研究推理过程,表明VLM能逼近专家能力,为城市分析提供支持。
ME-IQA: 通过重新排序增强的记忆图像质量评估
机构 * City University of Hong Kong(香港城市大学) ; ByteDance Inc.(字节跳动公司)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。
Comments Published as a conference paper at ECCV 2026
ThinkBLOX:基于渐进推理的3D室内场景生成
机构 * City University of Hong Kong(香港城市大学) ; University of Hong Kong(香港大学) ; Beijing Information Science and Technology University(北京信息科技大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。
Comments 20 pages
WeaveEarth:用于免训练超高分辨率遥感理解的结构化证据构建与推理
机构 * School of Frontier Sciences, Nanjing University(南京大学前沿科学学院) ; Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对UHR遥感图像理解,提出免训练框架WeaveEarth,通过全局感知证据构建选最小支持证据集,经结构化证据推理增强VLM全局-局部联合推理能力,在多基准测试中表现优于现有方法。
用于空间推理的视觉语言记忆
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。
Comments Accepted to European Conference on Computer Vision (ECCV), 2026
模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级
机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。
DGSeg:用于推理分割的语义-空间引导预测的动态门控
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。
Comments Accepted to ECCV2026
重新思考视觉隐私:一种用于严重性评估的组合隐私风险框架与VLM
机构 * University of Southern California(南加州大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; Amazon AGI(亚马逊AGI)
专题命中 视觉推理 :VLM(title_cn,summary_cn);分类 cs.CV
AI总结 提出组合隐私风险分类法(CPRT),将视觉属性按独立可识别性和组合危害潜力分级,并构建6.7K图像数据集,评估VLM在组合隐私风险评估中的表现。
SER: 用语义证据奖励学习视频推理定位
机构 * Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV
AI总结 提出语义证据奖励(SER),通过将时空证据定位重构为约束验证任务,利用裁判VLM评估证据的相关性和定位质量,在V-STAR基准上提升3.0点mLGM。
统一多模态模型规划
机构 * Mila - Québec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出Uni-Plan框架,利用统一多模态模型同时作为策略、动态模型和价值函数,通过自判别过滤避免动态预测幻觉,在具身决策任务中优于VLM方法,无需专家演示且数据可扩展。
Comments 29 pages, 11 figures
认知:从评估到对抗多模态大语言模型CAPTCHA求解器
机构 * Missouri University of Science and Technology(密苏里科技大学) ; University of South Florida(佛罗里达州立大学) ; Visa Inc.(Visa公司) ; George Mason University(乔治·马歇尔大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 本文研究多模态大语言模型如何削弱视觉CAPTCHA的安全性,评估7种主流MLLM在18种CAPTCHA任务中的表现,揭示其解决能力及防御策略。
Comments Accepted by USENIX Sec'26
PRISM: 感知与推理交错用于序列决策
机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 提出PRISM框架,通过动态问答流水线紧密耦合视觉语言模型(VLM)和语言模型(LLM),实现任务驱动的感知,在ALFWorld和R2R基准上显著超越现有图像模型。
Foresight: 关于导航关键线索的迭代推理
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; FieldAI
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。
Comments 22 pages, 10 figures, 3 tables
看见而不暴露:面向开放世界、上下文饥渴型MLLM的自适应隐私控制
机构 * City University of Hong Kong(香港城市大学) ; Hon Hai Research Institute(鸿海研究学院) ; Lingnan University(岭南大学)
专题命中 视觉推理 :MLLM(title_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大语言模型在开放世界中面临不可预测敏感信息泄露的隐私挑战,提出无训练方法APD,将隐私元素漂移至语义等价替代物并锚定上下文线索,结合新基准AdaptShield实现隐私保护与上下文保留的平衡提升。
物理推理的因果支架:面向视觉语言模型中因果启发的物理世界理解基准
机构 * CFAR(因果推理研究所) ; IHPC(信息技术研究所) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 提出CausalPhys基准(含3000+视频/图像问题及因果图),并设计因果图度量评估VLM推理,进一步提出因果理性微调(CRFT)提升推理准确性与可解释性。
Comments Accepted by KDD 2026 Dataset and Benchmark Track
视觉-语言因果推理中的抽象差距
机构 * Department of Electrical and Computer Engineering, University of Nebraska--Lincoln, Lincoln, Nebraska, USA(电气与计算机工程系,内布拉斯加大学林肯分校,内布拉斯加,林肯,美国)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉-语言模型(VLM)生成因果解释时语言流畅性与忠实因果推理的混淆问题,提出双探针方法和抽象差距(AG)指标,通过CAGE基准评估发现多数模型存在显著AG,但通过预训练和架构选择可缩小差距。
MACReD:一种用于反应图解解析的多智能体协作推理框架
机构 * University of Science ; Technology of China \& iFLYTEK Co., Ltd. Hefei China ; Technology of China \& iFLYTEK Co., Ltd.
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 提出MACReD分层多智能体框架,通过协调分子感知、箭头理解、文本提取和反应重建等专用智能体,在统一VLM引导架构下实现化学图解解析,在RxnScribe基准上达到最优性能。
Comments Preprint. Code is available at https://github.com/TC9905/MACReD
AD-H:基于分层智能体的语言引导自动驾驶
机构 * Dalian University of Technology(大连理工大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出AD-H分层多智能体框架,上层MLLM规划器生成中层驾驶指令,下层轻量控制器执行连续动作,通过规则重建1.15M中层指令对,以3B+350M参数超越7B模型,实现长时域泛化与指令遵循。
基于生成式人工智能的RISC-V供应链探索方法
机构 * Chair of Robotics, Artificial Intelligence and Real-Time Systems(机器人、人工智能与实时系统教授会) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI
AI总结 本文提出利用LLM和VLM的供应链分析流程,结合MDE技术提升对异构数据的分析能力,通过知识图谱揭示供应链组件间的依赖关系,支持供应链韧性评估。