arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-12 至 2026-08-12 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2608.11191 2026-08-12 cs.CV cs.AI cs.CL 新提交 89%

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位

Shiyu Xuan, Zechao Li

专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08941 2026-08-12 cs.LG 版本更新 85%

Predictive Entropy as a Joint Screen for Error and Paraphrase Instability in Medical Vision-Language Models

预测熵连接校准与改写敏感性在医疗视觉-语言模型中

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究医疗视觉语言模型在部署中的校准和改写敏感性问题,通过预测熵方法发现决策边界接近性是共同原因,并展示单一熵阈值能有效识别不可靠和改写敏感的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09816 2026-08-12 cs.RO 版本更新 83%

Hierarchical Fast-Slow ReAct Agent for Zero-Shot Object-Goal Navigation

用于零样本物体目标导航的分层快慢ReAct智能体

Zhaochen Lan, Zhi Yang, Yuxiang Fu, Mengxiang Lin

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究针对零样本物体目标导航,提出分层快慢ReAct智能体,结合价值图控制器与坐标锚定记忆及VLM,在HM3D、MP3D验证集上取得零样本方法最高成功率,远前沿审议可提升性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26148 2026-08-12 cs.HC cs.CL 版本更新 75%

Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations

超越截图:评估VLMs对UI动画的理解

Chen Liang, Xirui Jiang, Naihao Deng, Eytan Adar, Anhong Guo

机构 * University of Michigan(密歇根大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 本文提出AniMINT数据集,评估VLMs对动态UI动画的理解能力,发现其在基础运动检测上可靠,但高阶解释仍不一致,揭示了模型性能的关键瓶颈。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10484 2026-08-12 cs.RO cs.AI cs.CL 新提交 70%

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 57%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏