arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-14 至 2026-07-14 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2607.11633 2026-07-14 cs.RO 新提交 50%

Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues

突破15%的障碍:一个由用户非语言线索触发的、用于主动社交机器人的真实世界数据驱动系统

Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira

机构 * Kyushu Institute of Technology(九州工业大学) CyberAgent(CyberAgent公司) The University of Osaka(大阪大学)

专题命中 其他VLM :vision-language model(abstract)

AI总结 研究零售商店中服务机器人交互,发现非语言行为触发机器人话语占比15.3%。通过分析客户行为定义非语言线索,开发识别器和对话框架,能基于非语言线索实现主动机器人响应,还进行了离线评估和展示在线原型。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06186 2026-07-14 cs.RO 版本更新 50%

Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation

用于双足四足运动操纵的小腿集成手臂

Yan Pan, Yuanchuan Ren, Chipui Chan, Jingcheng Sun, Chengxu Zhou

机构 * University College London(伦敦大学学院)

专题命中 其他VLM :vision-language model(abstract)

AI总结 研究双足四足运动操纵设计权衡问题,核心方法是将特定操纵器集成到前小腿,实现双手地面操纵且四足着地、基座可行走,借助视觉语言模型排序技能,模拟中完成三项双手任务。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏