arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-18 至 2026-03-18 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 2 篇

2601.15541 2026-03-18 cs.RO 82%

CompliantVLA-adaptor: VLM-Guided Variable Impedance Action for Safe Contact-Rich Manipulation

CompliantVLA-adaptor:基于视觉-语言模型的变量阻抗控制用于安全的高接触密度操作

Heng Zhang, Wei-Hsing Huang, Qiyi Tong, Gokhan Solak, Puze Liu, Kaidi Zhang, Sheng Liu, Jan Peters, Yu She, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚,意大利) Ph.D. program of national interest in Robotics and Intelligent Machines (DRIM) and Università di Genova, Genoa, Italy(机器人与智能机器国家利益博士项目和热那亚大学,热那亚,意大利) Edwardson School of Industrial Engineering, Purdue University, West Lafayette, IN 47907, USA(工业工程埃德华森学校,普渡大学,西拉法克萨,印第安纳州47907,美国) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,亚特兰大,美国) German Research Center for AI, Germany(德国人工智能研究中心,德国) TU Darmstadt, Darmstadt, Germany(图宾根大学,图宾根,德国) Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院,卡尔斯鲁厄,德国)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出CompliantVLA-adaptor,通过引入基于视觉语言模型的上下文感知变量阻抗控制,提升接触密集任务的安全性和有效性。方法通过图像和自然语言解读任务上下文,调节阻抗控制器的刚度和阻尼参数,并利用实时力/扭矩反馈确保安全。实验表明在模拟和现实任务中均优于基线方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15624 2026-03-18 cs.CV cs.AI cs.RO 73%

Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision

探索视觉语言模型在帮助视障和低视力人士导航中的应用

Yu Li, Yuchen Zheng, Giles Hamilton-Fletcher, Marco Mezzavilla, Yao Wang, Sundeep Rangan, Maurizio Porfiri, Zhou Yu, John-Ross Rizzo

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学) Politecnico di Milano(米兰理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了多种VLMs在基础视觉技能和导航任务中的表现,发现GPT-4o在空间推理和场景理解上表现最佳,而开源模型在复杂环境中存在不足,需进一步改进以提升实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏