ReForm-Eval: Evaluating Large Vision Language Models via Unified Re-Formulation of Task-Oriented Benchmarks
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV
Comments 38 pages, 11 figures, 24 tables
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV
Comments 38 pages, 11 figures, 24 tables
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments ICCV 2023; Project Page:https://chengshiest.github.io/logo
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV
Comments Published in CVPR 2023 as Highlight. Data and code are released at https://github.com/Lizw14/Super-CLEVR
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments ACL 2023
专题命中 视觉推理 :visual reasoning(title);grounding(abstract);分类 cs.AI
Comments Accepted to 2023 Conference on Computer-Human Interaction (CHI) Human-Centered Explainable AI Workshop, 8 pages
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
专题命中 视觉推理 :grounding(title,abstract);分类 cs.CV
Comments 11 pages, 7 figures. EMNLP 2022-findings
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments 16 pages, 9 figures, project website at https://semantic-abstraction.cs.columbia.edu/
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments AKBC 2022
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments To appear at Findings of NAACL 2022
专题命中 视觉推理 :visual reasoning(title);visual question answering(abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments Under review
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments CVPR2019
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments 17 pages, 5 figures
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments CVPR 2018
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments workshop paper at ICLR 2018
基于证据链的多模态推理用于少样本时序动作定位
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。
Comments Accepted by TIP2026
NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准
机构 * The University of Tokyo(东京大学) ; Kyushu University(九州大学) ; Macau University of Science and Technology(澳门科技大学) ; Infinimind Japan Inc.(Infinimind日本公司) ; University of Alberta(阿尔伯塔大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。
Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release
超越试错:面向图像到视频一致性的智能体优化
机构 * Google Cloud(谷歌云) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。
Sci-VBench:面向科学领域知识与推理密集型视频生成的评估
机构 * Zhejiang University(浙江大学) ; UCAS(中国科学院大学) ; Tongji University(同济大学) ; Yale University(耶鲁大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。
Comments COLM 2026
PrismVAU: 用于多模态视频异常理解的提示优化推理系统
机构 * Universitat de Barcelona(巴塞罗那大学) ; Computer Vision Center(计算机视觉中心) ; Aalborg University(奥胡斯大学) ; Milestone Systems(Milestone系统)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 PrismVAU通过轻量级系统和自动提示工程实现高效的多模态视频异常理解,无需复杂标注和外部模块。
Comments This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
机构 * Beijing Jiaotong University(北京交通大学) ; HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) ; MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 视觉推理 :grounding(abstract,abstract_cn);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。
Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables
PhysMind:从视频到可执行世界的无训练物理推理框架
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 PhysMind是无训练的智能体框架,为每个视频构建可执行世界,在CLEVRER、Physion++数据集及反事实问题上的物理推理准确率显著优于现有视觉语言模型。
Comments 27 pages, 18 figures. Project page: https://physmind.github.io/
CURV:通过课程可视化接地推理增强图表理解
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。