arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-06 至 2026-04-06 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 8 篇

2604.03179 2026-04-06 cs.LG cs.AI cs.CV 80%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02945 2026-04-06 cs.DC 67%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01297 2026-04-06 cs.MA 67%

SimCity: Multi-Agent Urban Development Simulation with Rich Interactions

SimCity: 基于丰富交互的多智能体城市开发模拟

Yeqi Feng, Yucheng Lu, Hongyu Su, Yixin Tao, Tianxing He

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 SimCity利用大语言模型构建可解释的宏观经济系统,通过自然语言推理实现灵活适应行为,模拟摩擦性劳动力市场、异质商品市场和金融市场,并通过视觉语言模型生成虚拟城市地图,复现宏观经济规律和城市扩张动态。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 57%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02434 2026-04-06 cs.AI 57%

Compositional Neuro-Symbolic Reasoning

组合式神经符号推理

Anugyan Das, Omkar Ghugarkar, Vishvesh Bhat, Asad Aali

机构 * CoreThink AI Stanford University(斯坦福大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出一种结合神经和符号方法的推理框架,通过提取网格对象结构、利用神经先验提出变换候选方案并过滤假设,提升ARC-AGI-2任务表现,无需任务特定微调或强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00683 2026-04-06 cs.CV 57%

Video Understanding: Through A Temporal Lens

视频理解:通过时间视角

Thong Thanh Nguyen

机构 * Institute of Data Science(数据科学研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过时间视角探讨如何利用视频元素间的时间关系提升视频理解,提出自动标注框架、参数高效微调策略、状态空间层整合、新型对比学习框架及对大视觉-语言模型的全面研究,揭示了视觉-语言接口对时间推理的瓶颈。

Comments PhD Thesis, NUS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15279 2026-04-06 cs.RO cs.CV 57%

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception

看、聚焦、理解:用于具身感知的机器人眼球

Jiashu Yang, Yifan Han, Yucheng Xie, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03088 2026-04-06 cs.IR 50%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏