arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-07 至 2026-07-07 共收录 176 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 57 篇

2607.03884 2026-07-07 cs.SE 新提交 50%

LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas

LogNLQ:基于解析器诱导和语义基础模式的自然语言日志查询

Juepeng Wang, Jinyang Liu, Zhuangbin Chen, Zibin Zheng

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自然语言日志查询难题,提出LogNLQ框架,通过解析日志成表、双粒度语义标注及语义搜索获取候选模式,结合大语言模型生成可执行SQL,还引入LogNLQ-Bench,实验证明其性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06121 2026-07-07 cs.RO 版本更新 50%

Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

Glance-Say:通过粘性注视实现多模态人机协作与意图识别

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Benjamin Kiefer, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16897 2026-07-07 physics.comp-ph cond-mat.mtrl-sci 版本更新 50%

Machine Learning Hamiltonians are Accurate Energy-Force Predictors

机器学习哈密顿量是精确的能量-力预测器

Seongsu Kim, Chanhui Lee, Yoonho Kim, Seongjun Yun, Honghui Kim, Nayoung Kim, Changyoung Park, Sehui Han, Sungbin Lim, Sungsoo Ahn

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究现有哈密顿量模型作为能量-力预测器表现不明的问题,通过直接从预测哈密顿量计算能量和力的基准测试填补空白,提出QHFlow2模型并展示其优势及与模型容量和数据的关系

Comments 2026 ICML poster accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新 50%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24380 2026-07-07 cs.SE 版本更新 50%

Agentic Services Computing

智能服务计算

Shuiguang Deng, Hailiang Zhao, Ziqi Wang, Wenzhuo Qian, Xiang Ao, Guanjie Cheng, Jianwei Yin, Albert Y. Zomaya, Schahram Dustdar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 探讨服务计算范式转变带来的新问题,基于现有研究基础,引入智能服务计算,扩展服务计算范畴,为未来服务生态系统奠定以服务为中心的基础,实现对自治代理的系统管理。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 7 篇

2607.02961 2026-07-07 cs.CV cs.CR 新提交 79%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02853 2026-07-07 cs.CV cs.SE 新提交 79%

Prior Bias in Vision Language Models on UML Diagram Interpretation

视觉语言模型在UML图解释中的先验偏差

Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio Mastropaolo

机构 * Dept. of Computer Science(计算机科学系) William & Mary, USA(威廉玛丽学院)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型在UML图解释时是依据先验知识还是真正理解图表。通过引入对比基准测试,评估多个模型,发现反转关系箭头会降低开源模型关系方向准确率,不同模型表现有差异,揭示先验驱动的理解故障。

Comments 16 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03836 2026-07-07 cs.CV cs.AI cs.CL 新提交 79%

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

何时越简单越好:评估中世纪拉丁文手稿的翻译管道

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud

机构 * Eötvös Loránd University(厄特沃什·罗兰大学) King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 针对历史手稿翻译难题,提出评估中世纪拉丁文手稿图像到翻译流程的框架。通过CATMuS数据集对比发现领域特定OCR模型优势,引入新数据集IPC,实验揭示简单管道表现更佳,为低资源历史场景翻译系统部署提供基准与指导。

Comments 17 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03650 2026-07-07 cs.CV cs.AI 新提交 73%

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

Enshuo Hsu, Jin Zhou, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 57%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04612 2026-07-07 cs.GR cs.CV 新提交 57%

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation

StructuredEdit:通过可微参数传播实现约束感知的平面设计编辑

Veeramanohar Avudaiappan, Ritwik Murali

机构 * Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham India(电子与电子工程系,阿米特拉工程学院,科伊巴托尔,阿米特拉世界学院,印度) Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham India(计算机科学与工程系,阿米特拉计算学院,科伊巴托尔,阿米特拉世界学院,印度)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对平面设计编辑在严格约束下操作难的问题,提出StructuredEdit将设计编辑转为参数操作,核心方法是可微参数传播,贡献是提升了约束满意度等指标,还减少了用户编辑时间和校正迭代次数。

Comments 3 page poster short paper.2 Figures, 2 Tables. Planned to submit to SIGGRAPH Asia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02956 2026-07-07 cs.CV cs.CL 新提交 57%

MORE: A Multilingual Document Parsing Benchmark and Evaluation

MORE:一个多语言文档解析基准和评估

Long Xu, Binghong Wu, Tinghao Yu, Hao Feng, Zhenyu Huang, Haoqing Jiang, Yunhao Wang, Shuo Huang, Feng Zhang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对多语言文档解析,现有基准侧重高资源语言。为此引入MORE基准,其具规模大、结构复杂、数据真实的特点,用它评估模型,为长尾语言建性能基线并验证基准有效性。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 11 figures. Code and dataset available at https://github.com/zimoqingfeng/MORE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 11 篇

2607.04988 2026-07-07 cs.RO 新提交 80%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract)

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29563 2026-07-07 cs.AI cs.CV cs.RO 版本更新 79%

Planning with the Views

通过场景自我探索进行视图规划

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Manling Li

机构 * Northwestern University(西北大学) University of Washington(华盛顿大学) Microsoft(微软) University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ViewSuite基准测试揭示VLM在多步视图规划中的不足,并设计迭代框架通过自我探索和视图图蒸馏将Qwen2.5-VL-7B的交互式视图规划准确率从2.5%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 70%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04637 2026-07-07 cs.CV 新提交 70%

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04816 2026-07-07 cs.RO 新提交 67%

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 62%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16533 2026-07-07 cs.AI cs.CV 新提交 62%

Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI

Kairos: 面向物理AI的原生世界模型栈

Kairos Team, Fei Wang, Shan You, Qiming Zhang, Tao Huang, Zuoyi Fu, Zhisheng Zheng, Yunlong Xi, Feng Lv, Xiaoming Wu, Zeyu Liu, Cong Wan, Pu Li, Ruiqing Yang, Xiaoou Li, Wei Wang, Kangkang Zhu, Yuwei Zhang, Shi Fu, Zheng Zhang, Xiaoning Wu, Xuzeng Fan, Dacheng Tao, Xiaogang Wang

机构 * Kairos Team(Kairos团队)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Kairos原生世界模型栈,通过跨具身数据课程、混合线性时间注意力架构和部署感知系统协同设计,实现世界知识获取、长时程状态保持与高效执行,在具身世界模型等基准上达到顶级性能。

Comments Kairos Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10522 2026-07-07 cs.CV 新提交 57%

GUI-AC: Enhancing Continual Learning in GUI Agents

GUI-AC:增强GUI代理的持续学习能力

Can Lin, Tao Feng, Hangjie Yuan, Dan Zhang, Yifan Zhu, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 针对GUI代理在持续学习中的分布漂移和强化微调不稳定性问题,提出GUI-AC方法,通过自适应优势和动态裁剪机制提升性能,超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26946 2026-07-07 cs.CV cs.RO 版本更新 57%

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器

Wanrong Zheng, Yunhao Ge, Laurent Itti

机构 * University of Southern California(南加州大学) NVIDIA Research(NVIDIA研究)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。

Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01858 2026-07-07 cs.CL cs.AI 版本更新 57%

Web-CogReasoner: Towards Multimodal Knowledge-Induced Cognitive Reasoning for Web Agents

Web-CogReasoner:迈向用于网络智能体的多模态知识诱导认知推理

Yuhan Guo, Cong Guo, Aiwen Sun, Hongliang He, Xinyu Yang, Yue Lu, Yingji Zhang, Xuntao Guo, Dong Zhang, Jianzhuang Liu, Jiang Duan, Yijia Xiao, Liangjian Wen, Hai-Ming Xu, Yong Dai

机构 * Southwestern University of Finance and Economics(西南财经大学) Shanghai Jiao Tong University(上海交通大学) Central South University(中南大学) Hithink Research(Hithink研究) Westlake University(西湖大学) Harbin Institute of Technology(哈尔滨工业大学) University of Manchester(曼彻斯特大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Adelaide(阿德莱德大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chengdu Everimaging Science and Technology Co., Ltd(成都亿联科技有限公司)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 研究将网络智能体能力分解为知识内容学习和认知过程两阶段,提出框架分类知识,构建数据集,基于此用新推理框架开发训练智能体,实验显示其优势,还引入评估套件。

Comments Accepted to ICLR 2026. Our code and data is released at https://github.com/Gnonymous/Web-CogReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22867 2026-07-07 cs.CV cs.RO 版本更新 57%

MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集

Zhuonan Liu, Xinyu Zhang, Zishuo Wang, Runji Cai, Tomohito Kawabata, Qianyi Li, Xuance Peng, Tianze Yu, Zhen Xiong, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 13 篇

2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 92%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 83%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03365 2026-07-07 cs.CV cs.AI 新提交 81%

Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources

品牌即记忆:视觉语言模型为新闻来源编码因果性、可机制定位的可信度先验

Chih-Ting Liao, Xin Cao

机构 * University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中基于媒体身份的来源可信度先验,通过交叉模型基准测试和机制分析,揭示其特性及影响,如模型和规模依赖性、因果形成机制等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 81%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31876 2026-07-07 cs.AI cs.CV cs.LG 新提交 80%

Harnessing Textual Refusal Directions for Multimodal Safety

利用文本拒绝方向实现多模态安全

Moreno D'Incà, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 79%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03177 2026-07-07 cs.CV 版本更新 79%

SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision

SAVER:通过风格感知视觉早期修正减轻大型视觉语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Yi Yu, Qiangqiang Wu, Xinghao Jiang, Ngai-Man Cheung, Bihan Wen, Alex Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,跨学科研究生项目,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,电子与电气工程学院,新加坡) City University of Hong Kong, Hong Kong SAR(香港城市大学,香港特别行政区) Shanghai Jiao Tong University, China(上海交通大学,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) VinUniversity, Hanoi, Vietnam(越南文大学,河内,越南)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型幻觉问题,构建含照片及风格化图像数据集并对比,提出SAVER机制,利用早期层反馈基于视觉注意力模式动态调整输出,减轻风格化图像引起的幻觉,实验证明其性能先进。

Comments Accepted at AAAI 2026. 24 pages, 10 figures. Code: https://github.com/llizhaoxu/SAVER

详情

展开后加载摘要…

URL PDF HTML 收藏