Knowledge Prompting for Few-shot Action Recognition
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
Comments Paper accepted to the BNAIC/BeNeLearn 2022 conference
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments EMNLP 2022
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments CVPR 2022 Camera-ready
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments Findings of EMNLP 2020
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.LG
Comments Annual Conference of the Association for Computational Linguistics (ACL 2020)
专题命中 GUI与屏幕智能体 :visual reasoning(abstract);分类 cs.CV
Comments Accepted to ICIP 2020
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
Comments To appear at 2019 Conference on Robot Learning (CoRL)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments Accepted at SpLU-RoboNLP 2019 (workshop at NAACL)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
面向健康与福祉的移动及可穿戴传感器融合对话智能体设计
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。
Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)
Journal ref In 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26), August 31-September 03, 2026, Swansea, United Kingdom
融合UI结构与语义的面向特征的应用屏幕检索与聚类
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。
Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy
CrossTracer:基于VLA模型推理与轨迹残差自适应的跨 embodiments 导航
机构 * Peng Cheng Laboratory(鹏城实验室) ; Southern University of Science and Technology(南方科技大学) ; Innovation Investment Research Institute(创新投资研究院) ; Soochow University(苏州大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本研究提出跨 embodiment 导航框架 CrossTracer,通过 VL-Tracer 和 CE-Adapter 优化轨迹,在 NaviTrace 基准得分 45.68,优于 Gemini-2.5-Pro,实际部署于轮式、腿式机器人效果良好。
超越扁平策略:面向机器人操作具身智能体的分层后训练
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 针对现有VLA模型扁平策略难以处理长时程操作的问题,提出HiRoC分层后训练框架,通过解耦规划与执行并对齐分布,在机器人操作基准上取得优于强基线的性能。
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)
AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。
通过强化学习学习检测用户界面原则违规
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。
面向视觉-语言-动作模型的鲁棒指令泛化的基础语义重绑定
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 针对视觉-语言-动作模型因指令释义导致性能骤降的架构问题,提出GSR方法,在LIBERO-Para基准提升成功率44.6%,推出ParaVLA模型,规避低效数据扩展,实现鲁棒指令泛化。
Comments 23 pages, 8 figures
EndoWAM:用于通用内窥镜导航的基于接地的世界-动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 EndoWAM是首个用于通用机器人内窥镜导航的世界-动作模型,通过未来接地机制结合轻量型扩散Transformer与离散动作专家,在EndoMotion数据集上优于基线,具强零样本泛化能力。
SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。
超越单一评判者:用于生成式UI评估的社会角色面板模拟
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。
世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究
机构 * Huawei Technologies(华为技术有限公司) ; University of Toronto(多伦多大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。
Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。
Comments 17 pages, 15 figures
DSCD-Nav: 双视角协作辩论用于物体导航
机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。
VL-LN基准:通过主动对话实现长视界目标导向导航
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。
ZONDA:多楼层环境中具有动态避障功能的零样本目标导航
机构 * Southern University of Science and Technology(南方科技大学) ; Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) ; South China University of Technology(华南理工大学) ; Great Bay University(大湾区大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。
GeoWorldAD:用于自动驾驶的几何世界行动模型
机构 * Nanyang Technological University(南洋理工大学) ; Xiaomi EV(小米汽车) ; Zhejiang University(浙江大学) ; Harvard University(哈佛大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。