arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-30 至 2026-03-30 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2603.26211 2026-03-30 cs.CV cs.AI 84%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26033 2026-03-30 cs.CV 77%

Knowledge is Power: Advancing Few-shot Action Recognition with Multimodal Semantics from MLLMs

知识即力量:利用大语言模型的多模态语义提升少样本动作识别

Jiazheng Xing, Chao Xu, Hangjie Yuan, Mengmeng Wang, Jun Dan, Hangwei Qian, Yong Liu

专题命中 GUI与屏幕智能体 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FSAR-LLaVA,首次利用大语言模型作为多模态知识库直接增强少样本动作识别。通过多模态解码器提取时空丰富表示,结合多模态特征增强模块生成视觉和文本特征,并利用MLLM的灵活性设计复合任务导向原型构造,提升跨数据集性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV 57%

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21723 2026-03-30 cs.RO cs.MA 50%

Can a Robot Walk the Robotic Dog: Triple-Zero Collaborative Navigation for Heterogeneous Multi-Agent Systems

机器人能否行走:异构多智能体系统的三零协同导航

Yaxuan Wang, Yifan Xiang, Ke Li, Xun Zhang, BoWen Ye, Zhuochen Fan, Fei Wei, Tong Yang

机构 * Yuanpei College, Peking University(北京大学元培学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Pengcheng Laboratory(鹏城实验室) Beijing Jinruyi Large Model Technology Co., Ltd.(北京金如意大模型科技有限公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 本文提出三零路径规划框架,通过协调者-探索者架构实现无需训练、无需先验知识和无需模拟的异构多机器人系统协作导航,实验显示其在复杂环境中具有鲁棒性和适应性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22498 2026-03-30 cs.RO 50%

HELIOS: Hierarchical Exploration for Language-Grounded Interaction in Open Scenes

HELIOS:面向开放场景的语言引导交互的分层探索

Katrina Ashton, Chahyon Ku, Shrey Shah, Saumit Vedula, Tingrui Zhang, Wen Jiang, Kostas Daniilidis, Bernadette Bucher

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 HELIOS通过分层场景表示和搜索目标,解决开放环境中语言指令与部分观测场景的语义关联及动态更新问题,实现高仿真实验和现实场景中的语言引导抓取放置任务。

详情

展开后加载摘要…

URL PDF HTML 收藏