arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-03 至 2026-04-03 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2604.01371 2026-04-03 cs.CV cs.AI cs.RO eess.IV 73%

AffordTissue: Dense Affordance Prediction for Tool-Action Specific Tissue Interaction

AffordTissue: 密集的工具-动作特定组织交互 affordance 预测

Aiza Maksutova, Lalithkumar Seenivasan, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Yiqing Shen, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AffordTissue框架,通过多模态方法预测手术中工具-动作特定的组织affordance区域,改进了视觉语言模型在密集手术affordance预测中的表现,为安全手术自动化提供空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02329 2026-04-03 cs.CV 57%

Generative World Renderer

生成世界渲染器

Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan, Ruihan Yu, Yidan Zhang, Bo Zheng, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大人工智能研究院东京) National Taiwan University(国立台湾大学) The University of Tokyo(东京大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 本文提出一个大规模动态数据集,用于解决生成逆向和正向渲染在现实场景中的限制,通过双屏拼接方法提取400万帧数据,提升渲染真实性和时间一致性,并提出新的评估协议。

Comments Project page: https://alaya-studio.github.io/renderer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02190 2026-04-03 cs.CV cs.RO 57%

UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving

UniDriveVLA: 联合理解、感知与行动规划以实现自动驾驶

Yongkang Li, Lijun Zhou, Sixu Yan, Bencheng Liao, Tianyi Yan, Kaixin Xiong, Long Chen, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) SKL-IOTSC, University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 UniDriveVLA通过专家解耦和三阶段训练策略,解决自动驾驶中感知与推理的冲突,实现空间感知与语义推理的统一,取得nuScenes和Bench2Drive的优异性能。

Comments code has been released at https://github.com/xiaomi-research/unidrivevla

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01723 2026-04-03 cs.RO cs.AI 57%

Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving

基于运行时安全监督的因果场景叙述用于视觉-语言-动作驾驶

Yun Li, Yidu Zhang, Simon Thompson, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) TIER IV, Inc.(TIER IV 公司)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文提出CSN方法,通过意图约束对齐、定量 grounding 和结构分离重构VLA文本输入,提升驾驶评分并增强安全性。

Comments 18 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01535 2026-04-03 cs.CL 50%

Read More, Think More: Revisiting Observation Reduction for Web Agents

多读多想:重新审视网络代理中的观察缩减

Masafumi Enomoto, Ryoma Obara, Haochen Zhang, Masafumi Oyamada

机构 * NEC Corporation(日本电气股份有限公司)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文研究网络代理中观察缩减的优化问题,发现模型能力和思考token预算影响观察表示选择,高能力模型适合详细HTML观察,低能力模型适合紧凑的访问树观察,同时引入diff-based表示提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏