arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-01 至 2026-07-01 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 9 篇

2606.31577 2026-07-01 cs.CV cs.LG 新提交 86%

Localized Conformal Prediction for Image Classification with Vision-Language Models

基于视觉语言模型的图像分类局部化共形预测

Clément Fuchs, Tim Bary, Benoît Macq

机构 * CÉCI F.R.S.-FNRS(比利时国家科学研究基金会) Walloon Region(瓦隆大区)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对图像分类中局部化共形预测未充分探索的问题,提出一种简单的余弦相似度非线性变换,在保持边际覆盖保证的同时显著降低平均集大小。

Comments 7 pages, 2 figures, 3 tables, code availables, accepted to EUVIP 2025

Journal ref 2025 13th European Workshop on Visual Information Processing (EUVIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31976 2026-07-01 cs.AI cs.MA 新提交 85%

TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models

TreeAgent: 一种基于编译专家规则和视觉语言模型的通用多智能体框架,用于林业自动化偏差标注

Shiyi Chen, Nicholas Saban, Collin Hargreaves, Huiqi Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TreeAgent多智能体框架,结合专家决策树与视觉语言模型,通过解耦声明式决策实现零修改泛化,在树木偏差分类中超越监督学习基线并降低标注成本。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32012 2026-07-01 cs.LG cs.CV 新提交 82%

CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation

CoMet:多模态不确定性估计的上下文与多样性分解

Sanghyuk Chun, William Yang, Amaya Dharmasiri, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出CoMet方法,将多模态大模型的不确定性分解为上下文项和多样性项,通过轻量级后验模块高效估计,无需自回归生成或重复采样,在多个基准上优于现有方法。

Comments 33 pages, 13.3MB

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交 75%

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交 73%

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 70%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30875 2026-07-01 cs.CV cs.AI cs.LG 新提交 67%

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning

标签模仿游戏:用于零样本伪标签剪枝的图灵测试网络

Brent A. Griffin, Jason J. Corso

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出图灵测试网络(TTN)作为任务无关的“裁判”,通过对抗性交互在数据集上下文中评估伪标签,无需监督或重训练即可提升标签准确性,并实现零样本任务迁移。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31478 2026-07-01 cs.AI cs.CV 新提交 62%

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

一次反思不够:通过多假设失败归因进行自我修正的自主研究

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Hello Inc.(Hello公司) Xiaohongshu Inc.(小红书公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SAGE框架,通过多假设失败归因(MHFA)机制将实验失败恢复转化为结构化因果诊断,显著提升自主研究代理的可靠性和产出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31002 2026-07-01 cs.AI cs.CL cs.LO 新提交 57%

Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization

超越编译:评估从自然语言到Lean的忠实语句形式化

Ke Zhang, Patricio Gallardo Candela, Sudhir Murthy, Yi Xie, Zhi Wang, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of Arizona(亚利桑那大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出忠实语句形式化评估方法,结合Lean编译、跨模型语义判断和人类专家校准,发现编译通过但语义不忠实的29.0%差距,并分解形式化流程中的关键干预因素。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏