arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-09 至 2026-03-09 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2603.06084 2026-03-09 cs.RO 85%

Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划

Cristiano Battistini, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)

AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05591 2026-03-09 cs.CV 70%

Thinking with Spatial Code for Physical-World Video Reasoning

基于空间代码的物理世界视频推理

Jieneng Chen, Wenxin Ma, Ruisheng Yuan, Yunzhi Zhang, Jiajun Wu, Alan Yuille

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。

Comments Code at https://github.com/Beckschen/spatialcode

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01646 2026-03-09 cs.CL cs.AI cs.LG 62%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11245 2026-03-09 cs.CV 57%

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

NarrLV: 向长视频生成的综合性叙事导向评估迈进

X. Feng, H. Yu, M. Wu, S. Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang

机构 * UCAS CASIA(中国科学院自动化研究所) AMAP, Alibaba Group(阿里云实验室) NTU(国立科技大学) PKU(北京大学)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。

Comments Project Page: https://amap-ml.github.io/NarrLV-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20047 2026-03-09 cs.IR cs.AI cs.DB 57%

HCT-QA: A Benchmark for Question Answering on Human-Centric Tables

HCT-QA:一种用于人类中心表格问答的基准测试

Mohammad S. Ahmad, Zan A. Naeem, Michaël Aupetit, Ahmed Elmagarmid, Mohamed Eltabakh, Xiaosong Ma, Mourad Ouzzani, Chaoyi Ruan, Hani Al-Sayeh

机构 * Meta

专题命中 视觉问答 :vision language model(abstract);分类 cs.AI

AI总结 HCT-QA提出了一种用于人类中心表格问答的基准测试,包含大量真实和合成表格数据及对应的问答对,旨在评估和比较基于LLM和VLM的查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL 50%

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 视觉问答 :visual language model(abstract)

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏