Driver Activity Classification Using Generalizable Representations from Vision-Language Models
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(abstract)
Comments 9 pages, 4 figures
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :grounding(summary_cn,abstract_cn);MLLM(abstract_cn);分类 cs.CV
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
VoLN:仅视觉的长距离导航——范式、基准和方法
机构 * Beihang University(北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);分类 cs.AI
AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。
Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/
Fly0: 解耦语义定位与几何规划以实现零样本空中导航
机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) ; National University of Defense Technology(国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; Information Support Force Engineering University(信息支援力量工程大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。
DeMaVLA:面向可泛化可变形物体操作的视觉-语言-动作基础模型
机构 * Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 提出DeMaVLA模型,采用VLM骨干与动作专家结合流匹配生成连续动作,通过剪枝Transformer层提升效率,并利用大规模真实世界数据和人类反馈数据聚合训练,实现可变形物体折叠操作的多类别泛化。
Comments 14 pages, 2 figures
基于多模态大语言模型的移动用户体验推理:任务、基准与方法
机构 * Ant Group(蚂蚁集团)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。
Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings
SleepWalk:一种三层压力测试基准,用于指导的视觉-语言导航
机构 * Indian AI Research Organization (IAIRO)(印度人工智能研究组织) ; ĸragya Lab, BITS Pilani Goa(BITS Pilani Goa 的 ĸragya 实验室) ; University of Dhaka(达卡大学) ; Delhi Technological University(德里技术大学) ; Apple(苹果公司) ; Meta
专题命中 GUI与屏幕智能体 :VLM(summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出SleepWalk基准,用于评估基于指令的轨迹预测,针对局部化、交互导向的具身推理,揭示当前VLM在空间推理中的系统性失败。
AffordanceVLA:一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
机构 * Peking University(北京大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学) ; Knowin AI
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出AffordanceVLA框架,通过引入结构化可供性预测作为任务导向的中间表示,解决VLA模型中语义空间与具身控制策略的结构不匹配问题,实现精确的感知-动作映射。
Comments Preprint. Code and project page are available. Code: https://github.com/Skywalker-yqz/AffordanceVLA Project page: https://skywalker-yqz.github.io/AffordanceVLA/
在值得时询问:面向实例目标导航的成本感知开放式交互
机构 * Adelaide University(阿德莱德大学) ; Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心,澳大利亚机器学习研究所) ; Institute for Infocomm Research (I2R), A*STAR(信息与通信研究院(I2R),A*STAR) ; iMotion ; CSIRO Data61 Project Website(CSIRO Data61项目网站)
专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 针对实例目标导航中语言歧义问题,提出一种成本敏感的不确定性减少方法,通过信息增益分析确定有效问题类型,并构建基准测试和加权成功率指标,实现零样本MLLM导航器仅在预期收益大于成本时查询。
通过逆动力学学习缓解视觉-语言-动作模型中的状态混叠
机构 * KAIST(韩国科学技术院) ; Korea University(韩国大学)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 提出将逆动力学学习作为辅助目标,直接监督VLA视觉编码器,通过预测当前与未来观测之间的动作来捕捉细粒度视觉差异,从而缓解状态混叠问题。
AgentHijack:基准测试计算机使用智能体对常见环境干扰的鲁棒性
机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Sydney AI Centre, The University of Sydney(悉尼大学 AI 中心) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 提出AgentHijack基准,通过9种可配置的常见环境干扰评估多模态大语言模型驱动的计算机使用智能体的鲁棒性,并设计AgentHijack-Agent框架提升其抗干扰能力。
Comments accepted by ICML 2026
EvoScene-VLA: 在动作解码器中进化场景信念用于分块机器人控制
机构 * Australian National University(澳大利亚国立大学) ; The University of Queensland(昆士兰大学) ; Beijing Normal University(北京师范大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出EvoScene-VLA,通过在动作解码器中维护更新的场景状态,改进分块机器人控制中的多步控制预测,提升了场景信念的持续性和准确性。
AutoGUI-v2:一个全面的多模态GUI功能理解基准
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; New Laboratory of Pattern Recognition(模式识别新实验室) ; State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) ; Hong Kong Institute of Science & Innovation(香港科学创新研究院) ; PolyU ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。
Comments Technical Report
LookasideVLN: 基于方向的空中视觉与语言导航
机构 * Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) ; Cardiff University(卡迪夫大学) ; Beihang University(北航) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)
专题命中 GUI与屏幕智能体 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。
Comments Accepted by CVPR 2026
GUI-Perturbed:领域随机化揭示GUI接地模型的系统性脆弱性
机构 * Fig 2 Manifold Research(图2曼尼福德研究)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI、cs.LG
AI总结 GUI接地模型在标准基准上准确率超过85%,但在需要空间推理而非直接元素命名时下降27-56个百分点。GUI-Perturbed框架通过独立变化视觉场景和指令来评估接地鲁棒性,发现关系指令导致所有模型准确性崩溃,70%浏览器缩放显著降级,且增强数据训练反而降低性能。
Comments 26 Pages, 17 Figures, 9 Tables
WinDOM:面向小型模型GUI定位的自家族蒸馏
机构 * \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Lausanne, Switzerland
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI、cs.LG
AI总结 提出WinDOM数据集和自家族蒸馏方法,通过DOM直接获取边界框数据,结合强化学习提升小模型GUI定位性能,在Qwen3.5-2B上取得显著提升。
基于人类演示的计算机使用智能体基础构建
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; ServiceNow Research(ServiceNow研究) ; University of Waterloo(滑铁卢大学) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; École de Technologie Supérieure(高级技术学院) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.AI、cs.LG
AI总结 为解决桌面环境高质量基础数据稀缺问题,构建了包含87个应用、56K截图和3.56M人工标注的GroundCUA数据集,并基于此训练GroundNext模型,在5个基准上以少于先前十分之一的数据取得最优结果。
Comments Accepted at ICLR 2026
VideoGameBench: 能否让视觉-语言模型完成流行视频游戏?
机构 * Princeton University(普林斯顿大学)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 VideoGameBench通过10款经典游戏测试视觉-语言模型在无辅助信息下的实时游戏完成能力,发现前沿模型受推理延迟限制,仅能完成极少量游戏内容。
Comments 10 pages, 38 pages including supplementary
从自身学习点击位置:面向GUI定位的在线自蒸馏
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出GUI-SD框架,通过视觉增强上下文和熵引导蒸馏提升GUI定位性能,实验显示其在准确性和训练效率上优于现有方法。
Comments under review
BAMI:无需训练的GUI定位偏差缓解
机构 * Tsinghua University, China(清华大学,中国) ; Lenovo Research, China(联想研究院,中国)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。
Comments Accepted by CVPR 2026
UI-Zoomer: 基于不确定性的自适应缩放以实现GUI定位
机构 * Zhejiang University(浙江大学)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出UI-Zoomer框架,通过将缩放触发和尺度作为不确定性量化问题,改进GUI定位中的小图标和密集布局识别。实验表明,该方法在多个模型架构上均优于现有基线,提升幅度达13.4%至4.2%。
Comments Project Page: https://zju-real.github.io/UI-Zoomer Code: https://github.com/ZJU-REAL/UI-Zoomer
GameVerse: 视觉-语言模型能否通过视频反思学习?
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 GameVerse通过反思-重试范式评估视觉-语言模型在视频反思中的学习能力,结合失败轨迹和专家教程提升模型性能。
Comments https://gameverse-bench.github.io/
开源多模态Moxin模型:Moxin-VLM和Moxin-VLA
机构 * Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Futurewei(未来通信) ; AIBAO LLC
专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出开源多模态Moxin模型,通过Moxin-VLM、Moxin-VLA和Moxin-Chinese三种变体,提升视觉-语言、视觉-语言-动作及中文任务的性能。
零样本大视觉语言模型提示法用于古放射学x光档案中骨骼自动识别
专题命中 GUI与屏幕智能体 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 利用大视觉语言模型实现古放射学x光图像中骨骼自动识别,提升内容导航效率。
AndesVL 技术报告:一种高效的移动端多模态大语言模型
机构 * AndesVL Team(AndesVL团队) ; OPPO AI Center(OPPO人工智能中心)
专题命中 GUI与屏幕智能体 :multimodal large language model(title);InternVL(abstract);分类 cs.CV、cs.AI
AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。
Comments Tech report of OPPO AndesVL Team
LISN: 基于VLM控制器的指令引导社交导航
机构 * RoboScience Co.(RoboScience公司) ; ShanghaiTech University(上海科技大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);分类 cs.CV、cs.AI
AI总结 LISN通过VLM控制器实现指令引导的社交导航,提出首个标准化基准并提升动态避障能力。
Comments 8 pages
机构 * Department of Computing, University of Turku(图尔库大学计算机系) ; Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所) ; Centre for Artificial Ingelligence, Zurich University of Applied Sciences(应用科学大学人工智能中心) ; Agentic Systems Lab, Department of Management, Technology and Economics, ETH Zürich(苏黎世联邦理工学院管理、科技与经济系代理系统实验室) ; Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG
机构 * Renmin University of China(中国人民大学) ; Tongyi Lab, Alibaba Group(阿里云实验室)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV、cs.AI
机构 * Michigan State University(密歇根州立大学) ; Amazon(亚马逊) ; Northeastern University(东北大学) ; Northwestern University(西北大学) ; University of Central Florida(佛罗里达中央大学)
专题命中 GUI与屏幕智能体 :VLM(title);grounding(abstract);分类 cs.AI、cs.LG