arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 233 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 233 篇

2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 92%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 92%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(title,abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 91%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08126 2026-06-09 cs.CV 新提交 91%

One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

一石三鸟:面向多VLM选择、自适应与集成的自适应最优传输

Qiyu Xu, Zhanxuan Hu, Yu Duan, Yonghang Tai, Huafeng Li, Quanxue Gao, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Yunnan Normal University(云南师范大学) Xidian University(西安电子科技大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出无训练框架OSTB,通过自适应最优传输估计共识样本-类别结构,同时解决多VLM的模型选择、目标域自适应和预测集成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 90%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11024 2026-08-12 cs.CV 新提交 90%

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models

当视觉信号产生误导:视觉语言模型中属性幻觉的机制研究

Yufei Zhang, Chenlu Zhan, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);InternVL(abstract,abstract_cn);VLM(abstract)

AI总结 针对视觉语言模型的属性幻觉问题,提出VISOR框架,通过VSNR诊断区分失败模式并路由适配操作,在三类模型上减少属性假阳性且不依赖先验主导假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20419 2026-06-19 cs.CV 新提交 90%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20364 2026-06-19 cs.LG 新提交 90%

Judging to Improve: A De-biased VLM-as-3D-Judge Protocol for Single-Image 3D Generation

评判以改进:一种去偏的 VLM-as-3D-Judge 协议用于单图像 3D 生成

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.LG

AI总结 本文提出一种去偏的跨模型 VLM-as-3D-Judge 协议,将评判者从排序扩展到优化,通过训练与评估评判者分离、位置偏差校正及修复三种失效模式,实现轻量级适应下与强基线的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18451 2026-06-18 cs.LG 新提交 90%

A Cross-Model VLM-Judge Protocol for Single-Image 3D Mesh Quality (and Why Cheap Proxies Fall Short)

跨模型VLM评判协议用于单图像3D网格质量(以及为什么廉价代理方法不足)

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.LG

AI总结 提出可重复的VLM评判协议评估单图3D网格质量,发现几何有效性和渲染CLIP等廉价代理方法无法替代VLM评判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20244 2026-06-23 cs.CV cs.AI 新提交 90%

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑工业大学) Sagenic Tech Zhejiang University(浙江大学) vivo Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :VLM(title_cn,summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01973 2026-07-03 cs.CV cs.AI cs.LG 新提交 89%

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer

机构 * University of Tuebingen(图宾根大学) Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)

专题命中 幻觉与鲁棒性 :VLM(title,abstract_cn);InternVL(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)

AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交 89%

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06485 2026-07-08 cs.CV cs.AI 新提交 89%

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

AirflowAttack:针对红外遥感视觉语言模型的热气流对抗扰动

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对红外遥感视觉语言模型的对抗攻击,提出AirflowAttack方法,用热气流湍流作扰动先验,由轻量级生成器合成扰动。该方法在多个CLIP主干上攻击成功率高,能降低模型场景分类准确率,还揭示了红外VLM生态系统的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27180 2026-06-26 cs.LG cs.AI cs.RO 新提交 89%

Automating Potential-based Reward Shaping with Vision Language Model Guidance

基于视觉语言模型引导的势能奖励塑形自动化

Henrik Müller, Daniel Kudenko

机构 * L3S Research Center Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出VLM-PBRS框架,利用轻量级视觉语言模型的偏好学习势能函数,实现自动化奖励塑形,保证最优策略不变,提升样本效率并避免奖励黑客。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 89%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20852 2026-06-23 cs.CV cs.AI 新提交 89%

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

将推理时控制转化为放射学视觉语言模型:针对胸部X光片肺炎分类的激活引导

Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka, Paulo Eduardo de Aguiar Kuriki, Felipe Campos Kitamura

机构 * Universidade Federal de São Paulo (UNIFESP)(圣保罗联邦大学) Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) Stanford University School of Medicine(斯坦福大学医学院) DASA University of Texas Southwestern Medical Center (UTSW)(德克萨斯大学西南医学中心) Eden

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究评估对比激活添加(CAA)能否在不微调模型权重的情况下改善胸部X光片视觉语言模型(VLM)的肺炎分类性能,在三个冻结模型上测试,发现对其中一个模型有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14786 2026-06-16 cs.MM cs.AI cs.CV 新提交 89%

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

机构 * Tiktok(字节跳动) National University of Singapore School of Computing(新加坡国立大学计算机学院)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09202 2026-08-11 cs.AI 新提交 89%

CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving

CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合

Junyao Wang, Yulin Xu, Yu Li, Pramod Khargonekar, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02790 2026-08-05 cs.CV 新提交 89%

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计

Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey Plis

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) TReNDS Center(TReNDS中心)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11266 2026-06-11 cs.LG 新提交 89%

Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models

碰撞前的预见:利用冻结视觉-语言模型的预期性安全强化学习

Samuel Tetteh, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.LG

AI总结 提出VLM-Safe-RL框架,通过冻结视觉-语言模型生成预期性成本项,改进CMDP拉格朗日更新,在高速碰撞场景下实现安全与回报的平衡。

Comments 44pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07706 2026-06-09 cs.CR cs.AI 新提交 89%

MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models

MLingualFC: 评估多语言视觉语言模型中的越狱漏洞

Rishabh Makwana, Mamta, Deeksha Varshney, Oana Cocarascu

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院) King’s College London(伦敦国王学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 提出多语言多模态基准MLingualFC,使用流程图编码有害指令评估多语言VLM的越狱漏洞,发现拉丁语系攻击成功率显著高于非拉丁语系,揭示安全机制跨语言泛化不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 88%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25212 2026-06-26 cs.RO 新提交 88%

RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation

RigPI: 通过VLM种子可微仿真进行刚体动力学参数辨识

Xincheng He, Rongrong Zhang, Wei Jiang, Wenqiang Xu

机构 * Way-Robotics(Way-机器人)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract)

AI总结 提出RigPI框架,结合视觉语言模型初始化和可微物理仿真梯度优化,两步策略实现刚体与多连杆刚体动力学参数精确辨识,实验验证了其鲁棒性和预测有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09428 2026-06-09 cs.CL 新提交 88%

Guide Me Out: A Framework to Benchmark VLM Operators Communication in Crisis Scenarios

引导我出去:危机场景下评估VLM操作员通信的框架

Giacomo Gonella, Stefano Menini, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract)

AI总结 提出一个基准框架,评估视觉语言模型在模拟疏散中引导平民的策略(窄播 vs. 广播)、环境表示(视觉 vs. 图)和威胁行为(静态 vs. 移动),发现窄播降低失败率,视觉表示主导性能,移动威胁增加失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09362 2026-06-09 cs.CV cs.LG 新提交 88%

Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

零样本语义重识别用于自动驾驶:一项VLM基线研究

Eduardo Borges, Manuel Abreu, Luís Garrote, Urbano J. Nunes

机构 * Autonomous Mobile Robot(自主移动机器人) University of Minho(明德大学)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出使用视觉-语言模型生成语义描述进行零样本重识别,在自动驾驶场景中实现与监督CNN基线相当的检索性能,并增强可解释性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08948 2026-06-09 cs.CV cs.AI 新提交 88%

NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis

NutriMLLM:用于膳食微量营养素分析的多模态大语言模型

Runze Yan, Minxiao Wang, Jiaying Lu, Darren Liu, Xiao Hu, Hanqi Luo

机构 * Emory University(埃默里大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有MLLM在膳食微量营养素估计中不可靠的问题,利用十年人口规模膳食回顾生成约110万图像-营养素三元组,微调Qwen3-VL和GLM-4.6V-Flash得到NutriMLLM,在真实图像上实现65种营养素全覆盖,准确率匹配或超越专有模型。

Comments 35 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08777 2026-06-09 cs.LG cs.AI 新提交 88%

How Many Counterfactuals Does It Take? Probing VLM Hallucinations Through Circuits and Causal Effects

需要多少反事实?通过电路和因果效应探究VLM幻觉

Abhivansh Gupta, Simardeep Singh, Advika Sinha, Shreyansh Modi, Akshat Tomar

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);visual language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过定义基于对数概率差异的因果影响度量,并利用电路发现技术,研究视觉语言模型幻觉输出的反事实鲁棒性,推导出检测不稳定所需的最小反事实样本数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24957 2026-07-29 cs.CV 新提交 87%

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

感知基准:评估多模态大语言模型中的原子视觉感知

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

机构 * Moonshot AI(登月人工智能)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 87%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 幻觉与鲁棒性 :VLM(title,summary_cn);分类 cs.CV

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 87%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 幻觉与鲁棒性 :MLLM(title_cn,summary_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏