arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-07 至 2026-04-07 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2604.04664 2026-04-07 cs.RO cs.AI cs.MA 70%

ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration

ROSClaw:一种用于异构多智能体协作的分层语义-物理框架

Rongfeng Zhao, Xuanhao Zhang, Zhaochen Guo, Xiang Shao, Zhongpan Zhu, Bin He, Jie Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) National Key Laboratory of Autonomous Intelligent Unmanned Systems (Tongji University)(自主智能无人系统全国重点实验室(同济大学)) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Tongji University(同济大学) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 ROSClaw通过统一视觉语言模型控制器整合策略学习与任务执行,构建仿真到现实的拓扑映射,实现多智能体协作中的语义连续性和动态任务分配,提升多策略执行的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03631 2026-04-07 cs.AI 70%

Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors

单 agent 与多 agent 在自动视频分析上的协作学习行为研究

Likai Peng, Shihui Feng

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Institute of Data Science, The University of Hong Kong(香港大学数据科学研究所)

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文比较了单 agent 和多 agent 框架在自动编码协作学习场景视频中的性能,提出两种多 agent 方法,分别在场景检测和动作检测任务中表现优异。

Comments 15 pages, 4 figures. To be published in the 27th International Conference on Artificial Intelligence in Education (AIED2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01676 2026-04-07 cs.CV cs.AI cs.SE 62%

GPA: Learning GUI Process Automation from Demonstrations

GPA:从演示中学习图形用户界面过程自动化

Zirui Zhao, Jun Hao Liew, Yan Yang, Wenzhuo Yang, Ziyang Luo, Doyen Sahoo, Silvio Savarese, Junnan Li

机构 * Salesforce AI Research(Salesforce AI 研究院)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 GPA是一种轻量但通用的基于视觉的机器人流程自动化方法,通过单次演示实现快速稳定的过程回放,解决了传统RPA的脆弱性和当前基于视觉语言模型的GUI代理的非确定性风险,具备鲁棒性、确定性和隐私保护等核心优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04419 2026-04-07 cs.CV 57%

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu

机构 * Tsinghua University(清华大学) Beijing Sport University(北京体育大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV 57%

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12510 2026-04-07 cs.RO cs.AI cs.CL 57%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏