arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-09 至 2026-03-09 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2603.06167 2026-03-09 cs.CV 57%

A Semi-Supervised Framework for Breast Ultrasound Segmentation with Training-Free Pseudo-Label Generation and Label Refinement

一种用于乳腺超声分割的半监督框架,具有无训练伪标签生成和标签细化

Ruili Li, Jiayi Ding, Ruiyu Li, Yilun Jin, Shiwen Ge, Yuwen Zeng, Xiaoyong Zhang, Eichi Takaya, Jan Vrba, Noriyasu Homma

机构 * Tohoku University Graduate School of Medicine(东北大学医学研究科) Advanced Institute of Convergence Knowledge Informatics(融合知识信息先进研究所) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) National Institute of Technology, Sendai College(名古屋国立技术大学送崎学院) State Key Laboratory of Oncology in South China, Sun Yat-sen University Cancer Center(南方肿瘤学国家重点实验室,中山大学肿瘤中心) Department of Mathematics, Informatics, and Cybernetics, University of Chemistry and Technology(化学与技术大学数学、信息学与自动控制系) School of Software Technology, Zhejiang University(浙江大学软件技术学院) Southeast University, School of Cyber Science and Engineering(东南大学网络科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无训练伪标签生成和标签细化的半监督框架,通过跨域结构迁移提升乳腺超声分割性能,实现低标注下的高效分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06081 2026-03-09 cs.CV 57%

Lyapunov Probes for Hallucination Detection in Large Foundation Models

Lyapunov探针用于大型基础模型中的幻觉检测

Bozhi Luan, Gen Li, Yalan Qin, Jifeng Guo, Yun Zhou, Faguo Wu, Hongwei Zheng, Wenjun Wu, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) School of Electronic and Information Engineering, State Key Laboratory of CNS/ATM, Beihang University(电子与信息工程学院, CNS/ATM 国家重点实验室,北航) National Key Laboratory of Information Systems Engineering, National University of Defense Technology(信息系统工程国家重点实验室,国防科技大学) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Shanghai University(上海大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 通过Lyapunov探针检测大型基础模型中的幻觉,利用动力系统稳定性理论分析知识过渡区域的边界特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06022 2026-03-09 cs.CV 57%

MOSIV: Multi-Object System Identification from Videos

MOSIV:从视频中多物体系统识别

Chunjiang Liu, Xiaoyuan Wang, Qingran Lin, Albert Xiao, Haoyu Chen, Shizheng Wen, Hao Zhang, Lu Qi, Ming-Hsuan Yang, Laszlo A. Jeni, Min Xu, Yizhou Zhao

机构 * CMU(卡内基梅隆大学) Georgia Tech(佐治亚理工学院) Harvard(哈佛大学) ETH Zurich(苏黎世联邦理工学院) UIUC(伊利诺伊大学香槟分校) Insta360 UC Merced(加州大学默塞德分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MOSIV通过从视频中导出的几何目标直接优化连续材料参数,提升多物体系统识别的接地准确性和模拟保真度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21835 2026-03-09 cs.CV 57%

UniVBench: Towards Unified Evaluation for Video Foundation Models

UniVBench:迈向统一评估视频基础模型

Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) Zhejiang Lab(浙江实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15849 2026-03-09 cs.CL cs.AI 57%

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

IntelliAsk: 通过RLVR学习生成高质量的研究问题

Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 IntelliAsk通过RLVR技术提升生成问题的质量,生成更深入、基于证据的问题,优于现有基线模型。

Comments 24 Pages, v2, Abstract Modified

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05909 2026-03-09 cs.CL 50%

InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning

InfoGatherer: 通过证据检索和策略性提问进行原理化的信息获取

Maksym Taranukhin, Shuyue Stella Li, Evangelos Milios, Geoff Pleiss, Yulia Tsvetkov, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Washington(华盛顿大学) Dalhousie University(达尔豪斯大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 InfoGatherer通过证据检索和策略性提问,结合结构化证据网络和Dempster-Shafer理论,实现原理化的信息获取,提升医疗和法律任务中的可靠性与可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2508.13238 2026-03-09 cs.CV 79%

DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model

DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力

Qian Chen, Xianyin Zhang, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2603.06181 2026-03-09 cs.CV 57%

Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots

迈向运动图灵测试:评估人形机器人的人性化

Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学) National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学) OPPO Research Institute(OPPO研究院) ShanghaiTech University(上海科技大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出运动图灵测试框架,通过HHMotion数据集评估人形机器人动作的人性化程度,并展示基线模型在预测人性化的有效性。

Comments 13 pages, 10 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21273 2026-03-09 cs.CV 57%

StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives

StoryTailor: 一种零样本 pipelines 用于动作丰富的多主体视觉叙事

Jinghao Hu, Yuhe Zhang, GuoHua Geng, Kang Li, Han Zhang

机构 * College of Computer Science, Northwest University(计算机科学学院,西北大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 StoryTailor通过零样本方法生成动作丰富的多主体视觉叙事,结合GCA、AB-SVR和SFC模块提升动作忠实性和跨帧连续性,实验显示其在多个指标上优于基线方法。

Comments 24 pages,19 figures,accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 50%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 7 篇

2603.06148 2026-03-09 cs.CV cs.AI 90%

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

VLM-RobustBench: 一种全面的视觉语言模型鲁棒性基准

Rohit Saxena, Alessandro Suglia, Pasquale Minervini

机构 * University of Edinburgh, UK(爱丁堡大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(title,abstract);InternVL(abstract);分类 cs.CV、cs.AI

AI总结 VLM-RobustBench评估了视觉语言模型在不同图像失真下的鲁棒性,发现低严重性空间扰动对性能影响更大,提示需改进鲁棒性评估和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06270 2026-03-09 cs.CV cs.AI 88%

HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models

HiPP-Prune: 基于层次化偏好条件的结构化剪枝用于视觉-语言模型

Lincen Bai, Hedi Tabia, Raul Santos-Rodriguez

机构 * Université Paris-Saclay(巴黎萨克雷大学) University of Bristol(布里斯托大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);grounding(abstract)

AI总结 HiPP-Prune通过层次化偏好条件的结构化剪枝框架,在视觉-语言模型中实现高效部署,通过多目标优化提供可控的鲁棒性与效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15048 2026-03-09 cs.CV cs.AI cs.LG cs.MM 85%

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

使VLM在卡通角色图像上通过姿态信息识别视觉幻觉

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo

机构 * Chung-Ang University(Chung-Ang 大学) Coupang(韩国Coupang)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。

Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06141 2026-03-09 cs.CV 83%

Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models

空间色彩混合错觉作为视觉-语言模型的感知压力测试

Nicoleta-Nina Basoc, Adrian Cosma, Emilian Radoi

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰布加勒斯特技术大学) IDSIA, The Dalle Molle Institute for Artificial Intelligence(达摩信息技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究通过空间色彩混合错觉测试视觉-语言模型的感知鲁棒性,发现模型在结构化色彩扭曲下表现下降,而人类表现更优,预处理步骤可提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11689 2026-03-09 cs.RO cs.AI 83%

Phys2Real: Fusing VLM Priors with Interactive Online Adaptation for Uncertainty-Aware Sim-to-Real Manipulation

Phys2Real: 融合视觉语言模型先验与交互在线适应以实现不确定性感知的仿真到现实操控

Maggie Wang, Stephen Tian, Aiden Swann, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 Phys2Real通过融合视觉语言模型先验与交互适应,提升仿真到现实操控的不确定性感知与任务成功率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06256 2026-03-09 cs.CV cs.AI 62%

GazeMoE: Perception of Gaze Target with Mixture-of-Experts

GazeMoE:基于专家混合的注视目标感知

Zhuangzhuang Dai, Zhongxi Lu, Vincent G. Zakka, Luis J. Manso, Jose M Alcaraz Calero, Chen Li

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。

Comments 8 pages, 3 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05936 2026-03-09 cs.CV 57%

OD-RASE: Ontology-Driven Risk Assessment and Safety Enhancement for Autonomous Driving

基于本体的风险评估与安全增强:面向自动驾驶

Kota Shimomura, Masaki Nambata, Atsuya Ishikawa, Ryota Mimura, Takayuki Kawabuchi, Takayoshi Yamashita, Koki Inoue

机构 * Chubu University(楚鸟大学) Elith Inc.(Elith公司) Honda R&D Co., Ltd.(本田研发公司)

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV

AI总结 OD-RASE通过本体驱动的数据过滤和视觉语言模型生成,提升自动驾驶系统对事故诱因道路结构的预测和改进能力,增强交通环境的安全性。

Comments Accepted ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 8 篇

2508.03351 2026-03-09 cs.CV cs.AI cs.CL 84%

VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models

VLMQ:基于令牌显著性的后训练量化用于视觉-语言模型

Yufei Xue, Yushi Huang, Jiawei Shao, Lunjie Zhu, Chi Zhang, Xuelong Li, Jun Zhang

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 VLMQ通过显著性驱动的后训练量化方法,针对视觉-语言模型的激活特性优化量化过程,实现低比特下的高性能压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01653 2026-03-09 cs.CV cs.AI 81%

MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing

MAP: 通过地图级注意力处理缓解大视觉-语言模型中的幻觉

Chenxi Li, Yichen Guo, Benfang Qian, Jinhao You, Kai Tang, Yaosong Du, Zonghao Zhang, Xiande Huang

机构 * DAIL Tech(DAIL科技)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 MAP通过地图级注意力处理提升大视觉-语言模型的事实一致性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19535 2026-03-09 cs.CV cs.AI 73%

CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion

CASA: 交叉注意力优于自注意力用于高效的视觉-语言融合

Moritz Böhle, Amélie Royer, Juliette Marrie, Edouard Grave, Patrick Pérez

机构 * Kyutai

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 CASA通过交叉注意力机制提升视觉-语言模型的效率,实现实时视频字幕处理中的低延迟和恒定内存成本。

Comments updated with improved CA results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06459 2026-03-09 cs.CV cs.AI 62%

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

基础模型知道几何吗?通过冻结特征进行连续物理测量

Yakov Pyotr Shkolnikov

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究发现视觉-语言模型通过冻结特征可实现连续几何测量,LoRA微调和架构分析揭示了路径训练缺陷及中层注意力头对几何信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06403 2026-03-09 cs.LG 57%

Adapter-Augmented Bandits for Online Multi-Constrained Multi-Modal Inference Scheduling

适配器增强的带状机用于在线多约束多模态推断调度

Xianzhi Zhang, Yue Xu, Yinlin Zhu, Di Wu, Yipeng Zhou, Miao Hu, Guocong Quan

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, 510006, China.(中山大学计算机科学与工程学院) School of Computing, Macquarie University, NSW 2109, Australia(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG

AI总结 M-CMAB通过多适配器增强框架,实现多模态任务调度中的多约束优化,提升推断效率和预算利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06038 2026-03-09 cs.CV cs.GR 57%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17938 2026-03-09 cs.CL cs.LG 57%

SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization

SPINE:基于熵带正则化的令牌选择性测试时间强化学习

Jianghao Wu, Yasmeen George, Jin Ye, Yicheng Wu, Daniel F. Schmidt, Jianfei Cai

机构 * Monash University(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG

AI总结 SPINE通过令牌选择性和熵带正则化提升测试时间推理稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06986 2026-03-09 cs.CV cs.CL 57%

Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs

重新思考多模态大语言模型中视觉编码器混合范式以提升视觉理解

Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 LEO通过轻量级融合设计提升多模态大语言模型的视觉理解能力,并在自动驾驶领域展现良好泛化性能。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 2 篇

2603.06340 2026-03-09 cs.CV cs.AI 62%

K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging

K-MaT: 基于知识的流形传输用于医学影像中的跨模态提示学习

Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 K-MaT通过基于知识的流形传输实现跨模态提示学习,提升医学影像模型在不同模态间的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05629 2026-03-09 cs.CV 57%

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

重新思考概念瓶颈模型:从误区到解决方案

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 CBM-Suite通过引入熵度量、非线性层和蒸馏损失,系统解决概念瓶颈模型的准确性、可解释性和系统性研究问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏