arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-24 至 2026-04-24 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2604.21523 2026-04-24 cs.CV cs.CL 89%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07940 2026-04-24 cs.CV 57%

Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos

超越帧限:从视角视频生成360度全景视频

Rundong Luo, Matthew Wallingford, Ali Farhadi, Noah Snavely, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出从视角视频生成完整全景视频的方法,通过设计几何与运动感知操作提升生成质量,实现空间与时间一致性,应用于视频稳定、视角控制和交互式视觉问答。

Comments Project page: https://red-fairy.github.io/argus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10003 2026-04-24 cs.CL 50%

SocraticKG: Knowledge Graph Construction via QA-Driven Fact Extraction

SocraticKG:通过问答驱动的事实提取构建知识图谱

Sanghyeok Choi, Woosang Jeon, Kyuseok Yang, Taehyeong Kim

机构 * Department of Biosystems Engineering, Seoul National University(首尔国立大学生物系统工程系) Artificial Intelligence Institute, Seoul National University(首尔国立大学人工智能研究所) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Interdisciplinary Program in Cognitive Science, Seoul National University(首尔国立大学认知科学跨学科项目)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出SocraticKG方法,通过引入问答对作为中间表示,系统展开文档语义,提升知识图谱的事实保留与结构连贯性,支持复杂多跳推理。

详情

展开后加载摘要…

URL PDF HTML 收藏