arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-13 至 2026-03-13 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2603.10577 2026-03-13 cs.AI cs.HC 79%

CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents

CUAAudit: 视觉语言模型作为自主计算机使用代理的元评估

Marta Sumyk, Oleksandr Kosovan

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型作为自主计算机使用代理审计员的元评估,发现尽管先进模型在准确性方面表现良好,但在复杂环境中性能下降,突显了现实部署中需考虑评估者可靠性与不确定性的重要性。

Comments This work has been accepted to appear at the HEAL @ CHI 2026 Worshop on Human-centered Evaluation and Auditing of Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 78%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11542 2026-03-13 cs.CV cs.AI 62%

ReHARK: Refined Hybrid Adaptive RBF Kernels for Robust One-Shot Vision-Language Adaptation

ReHARK:基于重构混合自适应RBF核的鲁棒单样本视觉-语言适应

Md Jahidul Islam

机构 * Buet.ac.bd(巴特西大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ReHARK通过重构混合自适应RBF核框架,利用全局近端正则化提升单样本视觉-语言适应的稳定性与准确性,实现65.83%的平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12089 2026-03-13 cs.CR 50%

EmbTracker: Traceable Black-box Watermarking for Federated Language Models

EmbTracker: 用于联邦语言模型的可追溯黑盒水印

Haodong Zhao, Jinming Hu, Yijie Bai, Tian Dong, Wei Du, Zhuosheng Zhang, Yanjiao Chen, Haojin Zhu, Gongshen Liu

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 EmbTracker是一种用于联邦语言模型的可追溯黑盒水印框架,通过嵌入后门水印实现模型泄露的可追溯性,同时具备高鲁棒性和低性能影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏