arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 253 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 253 篇

2607.20833 2026-07-30 cs.CL 版本更新 50%

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

REFACT:用于紧凑且忠实的思维链推理的自适应事实重述

Zhensheng Jin, Xin Dai, Zhenghao Liu, Chaojun Xiao, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 研究复杂任务中语言模型推理轨迹易偏离上下文的问题,提出REFACT自适应事实重述框架,经两阶段优化,实验证明其能提升长上下文问答等能力,减少令牌消耗,保留更多证据使推理轨迹更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15050 2026-07-29 cs.CL 版本更新 50%

Beyond Factual Accuracy: Evaluating Global Reasoning Integrity in RAG Systems with LogicScore

超越事实准确性:使用逻辑得分评估RAG系统中的全球推理完整性

Zhichao Yan, Yunxiao Zhao, Jiapu Wang, Jiaoyan Chen, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * Shanxi University(山西大学) Nanjing University of Science and Technology(南京理工大学) University of Manchester(曼彻斯特大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出LogicScore,通过全局推理审查弥补RAG系统在长文本生成中逻辑完整性不足的问题,揭示模型在事实准确性高但全局推理质量差的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29007 2026-07-21 cs.CL 版本更新 50%

Taxonomy-Targeted Error Generation for Quantitative Reasoning

错误作为透镜:通过合成误解生成探究LLM推理

Xinming Yang, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约市立大学皇后学院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出一个框架,通过生成针对Bloom分类学五类错误的合成误解,以诊断LLM推理能力,并发现目标错误生成比自由形式错误生成更难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新 50%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新 50%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 50%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07036 2026-06-18 physics.ed-ph 版本更新 50%

Using Large Language Models to Analyze Engagement in Computational Thinking via Computational Physics Essays

使用大型语言模型通过计算物理论文分析计算思维中的参与度

Sean Savage, Amir Bralin, Paul Hur, N. Sanjay Rebello

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本研究利用多模态大型语言模型自动评估100篇学生计算物理论文中的计算思维参与度,在明确子任务上达到84%的准确率,但主观整体质量评估准确率仅71%。

Comments 13 pages, 3 figures, 3 tables. Submitted to Physical Review Physics Education Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03727 2026-06-16 cs.IR 版本更新 50%

When Does Latent Reasoning Help? MeRa: Metric-Space Bias for Spatial Prediction

潜在推理何时有帮助?MeRa:空间预测的度量空间偏差

Zhenyu Yu, Shuigeng Zhou

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出MeRa模块,通过在序列编码器和预测头之间引入度量空间偏差,证明潜在推理在空间预测中有效,否则会降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03503 2026-06-16 cs.CL 版本更新 50%

Understanding LLM Reasoning for Abstractive Summarization

理解大语言模型在抽象摘要中的推理能力

Haohan Yuan, Haopeng Zhang

机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)

专题命中 视觉推理 :grounding(abstract)

AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。

Comments 27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16975 2026-06-16 cs.SD eess.AS 版本更新 50%

Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估

Yuhang Jia, Xu Zhang, Yang Chen, Hui Wang, Enzhi Wang, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24102 2026-06-15 cs.CL 版本更新 50%

From Training to Generalization: Improving Moral Reasoning Through Pragmatic Inference

道德推理习得的语用推理:通过元语用链接实现泛化

Guangliang Liu, Xi Chen, Bocheng Chen, Han Zi, Xitong Zhang, Kristen Johnson

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Nanyang Technological University(南洋理工大学) University of Mississippi(密苏里大学) Northeastern University(东北大学) Qualcomm(高通公司) Michigan State University(密歇根州立大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 针对大语言模型在道德推理中泛化能力不足的问题,提出基于元语用链接和道德基础理论的语用推理方法,使模型获取道德推理目标与社会变量间的元语用链接,在三个任务上验证了其适应性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25371 2026-06-10 cs.RO 版本更新 50%

FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand

FOUND-IT: 基于基础模型优先、按需粒度的任务驱动3D场景图

Dominic Maggio, Nicolas Gorlo, Kris Hauser, Luca Carlone

机构 * Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Samsung Research America(三星美国研究院)

专题命中 视觉推理 :grounding(abstract)

AI总结 提出首个基于未标定单目相机实时构建任意室内外环境分层任务驱动3D场景图的方法,通过几何基础模型和可调整粒度支持动态任务,并在ASHiTA SG3D基准上提升79%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10832 2026-06-08 cs.CL 版本更新 50%

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents

面向视觉原生多模态深度搜索智能体的在策略数据演化

Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 提出在策略数据演化(ODE)框架,通过图像库引用协议和闭环数据生成器,解决多模态深度搜索中视觉证据不可复用和训练数据静态问题,在8个基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏