arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-03 至 2026-04-03 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2604.01966 2026-04-03 cs.CV cs.AI cs.RO 84%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01259 2026-04-03 cs.RO 82%

Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models

Bench2Drive-VL: 用于基于视觉语言模型的闭环自动驾驶的基准测试

Xiaosong Jia, Yuqian Shao, Zhenjie Yang, Qifeng Li, Zhiyuan Zhang, Junchi Yan

机构 * Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身智能重点实验室)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出Bench2Drive-VL,通过闭环评估方法提升视觉语言模型在自动驾驶中的性能,包含DriveCommenter生成多样化问题对、统一协议接口、灵活推理框架及完整开发生态,开源代码和标注数据。

Comments All codes and annotated datasets are available at \url{https://github.com/Thinklab-SJTU/Bench2Drive-VL} and \url{https://huggingface.co/datasets/Telkwevr/Bench2Drive-VL-base}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01310 2026-04-03 cs.CV 77%

Sparse Spectral LoRA: Routed Experts for Medical VLMs

稀疏光谱LoRA:用于医学VLMs的路由专家

Omid Nejati Manzari, Hojat Asgariandehkordi, Taha Koleilat, Yiming Xiao, Hassan Rivaz

机构 * Concordia University(康考迪亚大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出MedQwen,一种参数高效的医学VLM,结合了光谱路由的专家混合(MoE)与理论支持的缩放规则,通过非重叠SVD段初始化专家,减少序列遗忘并提升医疗图像任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12957 2026-04-03 cs.CV 70%

Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation

通过语义引导的奖励崩溃缓解实现自适应的开放性医疗推理

Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(菲斯克智能科技有限公司(菲斯克AI)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出ARMed框架,通过监督微调和强化优化提升开放性医疗VQA的推理一致性和事实准确性,实验表明其在六个医疗VQA基准上显著提升准确性和泛化能力。

Comments Accept to 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01869 2026-04-03 cs.CV 57%

GeoAI Agency Primitives

地理人工智能代理原语

Akram Zaytar, Rohan Sawahn, Caleb Robinson, Gilles Q. Hacheme, Girmaw A. Tadesse, Inbal Becker-Reshef, Rahul Dodhia, Juan Lavista Ferres

机构 * Microsoft AI for Good Lab(微软人工智能公益实验室) NASA Harvest

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出9个原语用于地理人工智能代理层,解决GIS实践中迭代协作的缺失问题,通过基准测试提升人类生产力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 11 篇

2604.01764 2026-04-03 cs.CV 85%

Hidden Meanings in Plain Sight: RebusBench for Evaluating Cognitive Visual Reasoning

显而易见的隐含意义:RebusBench用于评估认知视觉推理

Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);LLaVA(abstract);InternVL(abstract)

AI总结 本文提出RebusBench基准,用于评估模型在需要多步推理的隐含意义理解能力,发现现有模型在认知连接方面存在缺陷。

Comments Accepted at ICLR 2026 Workshop: From Human Cognition to AI Reasoning (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02991 2026-04-03 cs.CV cs.AI 73%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01681 2026-04-03 cs.RO cs.AI 70%

Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning

通过代理快慢规划弥合大模型推理与实时控制

Jiayi Chen, Shuai Wang, Guangxu Zhu, Chengzhong Xu

机构 * Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong (Shenzhen)(深圳市大数据研究院,香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出一种分层框架,通过感知-决策-轨迹-控制的分离,提升自动驾驶系统在扰动下的鲁棒性,减少侧向偏移和完成时间。

Comments 8 pages, 12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 62%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16082 2026-04-03 q-bio.QM cs.AI cs.LG 62%

BIOGEN: Evidence-Grounded Multi-Agent Reasoning Framework for Transcriptomic Interpretation in Antimicrobial Resistance

BIOGEN:基于证据的多智能体推理框架用于抗菌药物耐药性中的转录组解释

Elias Hossain, Mehrdad Shoeibi, Ivan Garibay, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 BIOGEN通过结合生物信息检索、结构化推理和多批评验证,生成可追溯的转录组模块解释,其在抗菌药物耐药性研究中表现出强生物学基础和零幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01754 2026-04-03 cs.CL cs.AI cs.LG 62%

LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketches

LiveMathematicianBench: 一个用于数学家级推理的实时基准

Linyang He, Qiyao Yu, Hanze Dong, Baohao Liao, Xinxing Xu, Micah Goldblum, Jiang Bian, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LiveMathematicianBench,一个基于近期arXiv论文的动态多选基准,用于评估大语言模型的数学推理能力,通过证明草图指导的干扰项生成机制,提升对真实理解的检测。

Comments Project page: https://livemathematicianbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02318 2026-04-03 cs.RO cs.CV 57%

Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning

停止游荡:通过元认知推理实现高效的视觉-语言导航

Xueying Li, Feng Lyu, Hao Wu, Mingliu Liu, Jia-Nan Liu, Guozi Liu

机构 * Central South University(中南大学) Nanjing University(南京大学) State Grid Hubei Electric Power Research Institute(国网湖北省电力有限公司电力科学研究院) Dongguan University of Technology(东莞理工学院)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出MetaNav,通过整合空间记忆、历史感知规划和反思修正,提升视觉-语言导航的效率与鲁棒性,实验显示其在多个基准上表现优异,减少了20.7%的VLM查询。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01882 2026-04-03 cs.CV 57%

A3R: Agentic Affordance Reasoning via Cross-Dimensional Evidence in 3D Gaussian Scenes

A3R: 通过跨维度证据进行3D高斯场景中的代理 affordance 推理

Di Li, Jie Feng, Guanbin Li, Ronghua Shang, Yuhui Zheng, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学) Qinghai Normal University(青海师范大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出A3R框架,通过跨维度证据获取提升复杂3D高斯场景中细粒度affordance推理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01634 2026-04-03 cs.LG cs.CL 57%

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

CRIT: 基于图的自动数据合成以增强跨模态多跳推理

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(高丽大学计算机科学与工程系) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG

AI总结 CRIT通过图基自动管道生成复杂跨模态推理任务,提升多跳推理能力,实验表明先进模型在该任务上表现欠佳,训练于CRIT的模型在SPIQA等基准上显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01610 2026-04-03 cs.AI 57%

GraphWalk: Enabling Reasoning in Large Language Models through Tool-Based Graph Navigation

GraphWalk: 通过基于工具的图导航在大语言模型中实现推理

Taraneh Ghandi, Hamidreza Mahyar, Shachar Klaiman

机构 * McMaster University(麦克马斯特大学) BASF Digital Solutions(巴斯夫数字解决方案)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 GraphWalk通过基于工具的图导航框架,使大语言模型能够高效进行多跳推理,提升在不同任务中的性能,尤其在大规模知识图谱中表现更优。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 50%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 18 篇

2604.00528 2026-04-03 cs.CV cs.AI 90%

Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding

思考、行动、构建:一种基于视觉语言模型的代理框架用于零样本3D视觉定位

Haibo Wang, Zihao Lin, Zhiyang Xu, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(title);vision-language model(abstract);VLM(abstract)

AI总结 本文提出TAB框架,通过2D到3D重建范式直接处理原始RGB-D流,利用2D VLMs解析复杂空间语义并结合多视图几何构建3D结构,克服传统方法依赖预处理点云的局限,实验证明其在ScanRefer和Nr3D上优于零样本方法和全监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10611 2026-04-03 cs.CV cs.AI 87%

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI

AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。

Comments Updated first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV 86%

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title);分类 cs.CV

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06763 2026-04-03 cs.CV cs.AI 84%

SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding

SafePLUG: 通过像素级洞察和时间锚定赋能多模态大语言模型以理解交通事故

Zihao Sheng, Zilin Huang, Yansong Qu, Jiancong Chen, Yuhao Luo, Yen-Jung Chen, Yue Leng, Sikai Chen

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Google(谷歌)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SafePLUG框架,通过像素级理解和时间锚定提升多模态大语言模型在交通事故分析中的能力,引入新数据集并实现区域问答、像素分割、时间事件定位等任务的高性能表现。

Comments The code, dataset, and model checkpoints will be made publicly available at: https://zihaosheng.github.io/SafePLUG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12797 2026-04-03 cs.CV cs.AI cs.CL 84%

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

KARL:面向知识密集型视觉定位的知识感知推理与强化学习

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun

机构 * University of Macau(澳门大学) Shandong University(山东大学) Northwestern Polytechnical University(西北工业大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出KARL框架,通过知识引导的推理数据和强化学习方法,提升模型在知识密集型视觉定位任务中的表现,实现跨领域泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01915 2026-04-03 cs.CV 83%

Enhancing Medical Visual Grounding via Knowledge-guided Spatial Prompts

通过知识引导的空间提示增强医学视觉 grounding

Yifan Gao, Tao Zhou, Yi Zhou, Ke Zou, Yizhe Zhang, Huazhu Fu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Yong Yoo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出KnowMVG框架,通过知识增强提示和全局局部注意力机制提升医学视觉 grounding的精度,实验显示在四个基准上优于现有方法。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02323 2026-04-03 cs.CV 79%

Beyond Referring Expressions: Scenario Comprehension Visual Grounding

超越指称表达:场景理解视觉 grounding

Ruozhen He, Nisarg A. Shah, Qihua Dong, Zilin Xiao, Jaywon Koo, Vicente Ordonez

机构 * Rice University(莱斯大学) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出RSC基准,探索基于场景的视觉 grounding,通过角色、意图和关系上下文推断目标,而非显式命名。ScenGround方法结合监督预热与难度感知强化学习,提升模型在复杂场景下的表现。

Comments 20 pages, 18 figures, Project Page: https://catherine-r-he.github.io/RSC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16880 2026-04-03 eess.SP cs.CL cs.LG q-bio.NC 79%

NeuroNarrator: A Generalist EEG-to-Text Foundation Model for Clinical Interpretation via Spectro-Spatial Grounding and Temporal State-Space Reasoning

NeuroNarrator:一种通过频谱-空间定位和时间状态空间推理的通用EEG到文本基础模型,用于临床解释

Guoan Wang, Shihao Yang, Jun-en Ding, Hao Zhu, Feng Liu

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 NeuroNarrator通过频谱-空间定位和时间状态空间推理,将EEG信号转化为临床文本,解决传统EEG分析方法在临床解释中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01893 2026-04-03 cs.CV 79%

ProVG: Progressive Visual Grounding via Language Decoupling for Remote Sensing Imagery

ProVG:通过语言解耦实现遥感图像的渐进式视觉定位

Ke Li, Ting Wang, Di Wang, Yongshan Zhu, Yiming Zhang, Tao Lei, Quan Wang

机构 * Xidian University(西安电子科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 ProVG通过解耦语言表达为全局上下文、空间关系和对象属性,提出一种改进遥感图像定位精度的新框架,采用渐进式跨模态调节器和跨尺度融合模块,实现更精确的视觉语言对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02071 2026-04-03 cs.CV cs.AI cs.LG 75%

Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

挖掘实例导向的视觉-语言上下文以实现人-物交互检测

Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi

机构 * Seoul National University(首尔国立大学) Hanyang University(汉阳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。

Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01630 2026-04-03 cs.CL 71%

Grounding AI-in-Education Development in Teachers' Voices: Findings from a National Survey in Indonesia

将教育中的AI发展扎根于教师的声音:来自印度尼西亚全国调查的结果

Nurul Aisyah, Muhammad Dehan Al Kautsar, Arif Hidayat, Fajri Koto

机构 * Quantic School of Business and Technology(昆蒂克商业与技术学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Indonesia University of Education(印度尼西亚教育大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 研究通过全国性调查揭示印尼教师对AI在教育中的应用现状,发现AI在教学、内容开发和教学媒体中日益普及,但应用不均,教师更倾向于利用AI减轻教学准备负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM 70%

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01987 2026-04-03 cs.CV cs.LG 62%

Curia-2: Scaling Self-Supervised Learning for Radiology Foundation Models

Curia-2:用于放射学基础模型的自监督学习扩展

Antoine Saporta, Baptiste Callard, Corentin Dancette, Julien Khlaut, Charles Corbière, Leo Butsanets, Amaury Prat, Pierre Manceron

机构 * Raidium Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02252 2026-04-03 cs.CV 57%

SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation

SPAR:单次通过任意分辨率ViT用于开放词汇分割

Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏