arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-16 至 2026-03-16 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2603.12746 2026-03-16 cs.CV 85%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 75%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00150 2026-03-16 cs.CV cs.AI cs.CE cs.MM 62%

FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications

FCMBench: 首个大规模金融信用多模态基准用于实际应用

Yehui Yang, Dalu Yang, Fangxin Shang, Wenshuo Zhou, Jie Ren, Yifan Liu, Haojun Fei, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(奇富科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FCMBench是首个大规模且隐私合规的多模态基准,涵盖金融信用应用中的任务和鲁棒性挑战,包含26种证书类型、5198张隐私合规图像和13806对VQA样本,评估模型在现实干扰下的感知与推理任务,揭示现代视觉语言模型的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18507 2026-03-16 cs.CV cs.AI 62%

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

多场景视角下的多模态持续学习与MLLMs

Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNIFIER框架,通过视觉表征扩展和视觉一致性约束解决多场景下的持续学习问题,提升跨场景视觉问答和F1分数。

Comments 22 pages, 17 figures. This is a preprint version of a paper submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏