arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-14 至 2026-07-14 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 9 篇

2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 91%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新 75%

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11388 2026-07-14 cs.AI cs.CL cs.LG cs.MA 新提交 73%

StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

StructAgent:利用统一因果结构驾驭长时程数字智能体

Wenyi Wu, Sibo Zhu, Kun Zhou, Aayush Salvi, Zixuan Song, Biwei Huang

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) Aether AI Lab(以太人工智能实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对长时程任务中智能体任务进展难解释、验证和恢复的问题,提出StructAgent框架,通过统一因果结构维护任务进展并规范工作流程,实验证明其能提升多种模型性能且具有通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新 67%

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 62%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 57%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11427 2026-07-14 cs.RO 新提交 50%

EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation

EDAR:学习用于机器人操作的环境相关动作表示

Yuecheng Xu, Tong Yang, Jingkai Jia, Chi Zhang, Xuelong Li, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) TeleAI, China Telecom(中国电信天翼人工智能公司)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 研究针对机器人操作中动作表示难的问题,提出EDAR方法,将动作令牌与可执行控制结构和预期视觉后果关联,通过实验证明该方法能改善下游策略学习,突出环境相关动作表示的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09962 2026-07-14 cs.RO 新提交 50%

Task Planning for Mobile Manipulation in Retail Stores using Foundation Models with Iterative Re-planning

使用具有迭代重新规划的基础模型进行零售商店中的移动操作任务规划

Vismay Vakharia, Sanjana Garai, Rolif Lima, Nijil George, Vighnesh Vatsal, Kaushik Das

机构 * TCS Research, Tata Consultancy Services Ltd.(塔塔咨询服务公司TCS研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 研究零售场景补货问题,利用大语言模型和视觉语言模型,结合定制移动操作平台、用户驱动提示及反馈迭代重新规划方法纠错,在模拟环境验证端到端系统,为零售自动化提供了新的任务规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 50%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏