arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-31 至 2026-07-31 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 11 篇

2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 81%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12055 2026-07-31 cs.CV cs.LG 版本更新 81%

Continual Learning with Vision-Language Models via Semantic-Geometry Preservation

通过语义-几何保持实现视觉-语言模型的持续学习

Chiyuan He, Zihuan Qiu, Fanman Meng, Runtong Zhang, Linfeng Xu, Qingbo Wu, Hongliang Li

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。

Comments Accepted by IEEE TCSVT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28211 2026-07-31 cs.CV 新提交 79%

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

扩大视觉-语言模型规模不足以缓解偏见

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27897 2026-07-31 cs.CV 新提交 79%

Unifying Adversarially Robust Model Experts in Vision-Language Models

统一视觉-语言模型中的对抗鲁棒模型专家

Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28285 2026-07-31 cs.CV 新提交 70%

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26518 2026-07-31 cs.CV 版本更新 70%

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

EgoSafe:用于视觉安全理解的第一人称移动采集基准

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Beihang University(北京航空航天大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract_cn);分类 cs.CV

AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28573 2026-07-31 cs.AI 新提交 57%

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡

Woongkyu Lee, Jungwook Choi

机构 * Hanyang University(汉阳大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文针对本地计算机使用智能体的推理时扩展开展系统实证研究,评估多款模型在OSWorld基准上的表现,揭示其边际收益递减、失败模式转变等规律,提出高效本地智能体的设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28532 2026-07-31 cs.CV 新提交 57%

MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

MarkushGlyph与OCSRGlyph:改进的化学结构识别

Alex Andonian, Samuel G Rodriques, Andrew D White, Siddharth M Narayanan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本研究将化学结构识别视为图像到文本转换任务,提出OCSRGlyph与MarkushGlyph模型,前者优化OCSR性能,后者针对Markush结构采用整体视觉语言建模,还提出新指标解决Markush结构翻译的准确性判定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28226 2026-07-31 cs.CR cs.AI 新提交 57%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19412 2026-07-31 cs.CV cs.CL 57%

VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

VCE:通过视觉对比编辑实现LVLMs的零成本幻觉抑制方法

Yanbin Huang, Yisen Li, Guiyao Tie, Xiaoye Qu, Pan Zhou, Hongfei Wang, Zhaofan Zou, Hao Sun, Xuelong Li

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院) China Telecom(中国电信)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VCE方法,通过分析模型对对比视觉扰动的响应,利用SVD分解激活模式以抑制幻觉倾向,有效减少多基准测试中的物体幻觉,同时保持计算效率。

Comments ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 16657-16661

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08582 2026-07-31 cs.NE math.OC 50%

Physics-Structured Surrogate Modeling and Conformal Robust Multipoint Optimization for Glider Wing Design

一种基于神经代理的多方法框架用于鲁棒机翼设计优化

Arash Fath Lipaei, AmirHossein Ghaemi, Melika Sabzikari

专题命中 幻觉与鲁棒性 :VLM(abstract_cn)

AI总结 本文提出一种基于神经代理的多方法框架,用于提高机翼设计的鲁棒性和效率,通过多种优化算法提升空气动力学性能。

详情

展开后加载摘要…

URL PDF HTML 收藏