arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-17 至 2026-03-17 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 9 篇

2506.06251 2026-03-17 cs.SE cs.AI 83%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 79%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 70%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14724 2026-03-17 cs.AI 70%

GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representation

GameUIAgent:一种基于大语言模型的自动化游戏UI设计框架,采用结构化中间表示

Wei Zeng, Fengwei An, Zhen Liu, Jian Zhao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出GameUIAgent框架,通过结构化中间表示将自然语言描述转化为Figma设计,结合神经符号管道实现迭代自校正,发现质量天花板效应和渲染评估保真原则。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 62%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 62%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21071 2026-03-17 cs.HC cs.AI 57%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏