arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-01 至 2026-04-01 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2512.05955 2026-04-01 cs.RO cs.CV 83%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29161 2026-04-01 cs.AI 83%

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

Webscraper:利用多模态大语言模型进行索引-内容网页抓取

Guan-Lun Huang, Yuh-Jzer Joung

机构 * Dept. of Information Management, National Taiwan University, Taipei, Taiwan(国立台湾大学资讯管理学系,台北,台湾)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出Webscraper框架,利用多模态大语言模型自动导航交互界面并提取结构化数据,通过五阶段提示和定制工具提升动态网站抓取准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 70%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV 57%

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22846 2026-04-01 cs.AI 57%

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

CoMaTrack: 基于竞争的多智能体博弈跟踪与视觉-语言-动作模型

Youzhi Liu, Li Gao, Liu Liu, Mingyang Lv, Yang Cai

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI

AI总结 本文提出CoMaTrack,一种基于竞争的多智能体强化学习框架,通过动态对抗环境训练,提升跟踪任务的适应性和鲁棒性,并引入首个开源的CoMaTrack-Bench基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29627 2026-04-01 cs.RO 50%

Semantic Zone-Based Map Management for Stable AI-Integrated Mobile Robots

基于语义区域的映射管理:用于稳定集成AI的移动机器人

Huichang Yun, Seungho Yoo

机构 * Dept. of computer Engineering, Pukyong National University(釜庆大学计算机工程系)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出一种基于语义区域的映射管理方法,以在内存限制下稳定使用密集地图。通过将关键帧与语义室内区域关联,该方法减少了关键帧加载和卸载频率,提高了内存使用效率,并在实验中验证了其在内存压力下的稳定性和性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28901 2026-04-01 cs.RO 50%

See Something, Say Something: Context-Criticality-Aware Mobile Robot Communication for Hazard Mitigations

看见即应言:面向灾害缓解的上下文感知移动机器人通信

Bhavya Oza, Devam Shah, Ghanashyama Prabhu, Devika Kodi, Aliasghar Arab

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) ASAS LABS, Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系ASAS实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出一种上下文感知的移动机器人通信框架,通过感知驱动自适应消息生成,提升灾害响应速度和有效性,在60多次实验中验证了结构化关键性评估对响应速度和缓解效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏