arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-09 至 2026-03-09 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 3 篇

2603.06181 2026-03-09 cs.CV 57%

Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots

迈向运动图灵测试:评估人形机器人的人性化

Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学) National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学) OPPO Research Institute(OPPO研究院) ShanghaiTech University(上海科技大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出运动图灵测试框架,通过HHMotion数据集评估人形机器人动作的人性化程度,并展示基线模型在预测人性化的有效性。

Comments 13 pages, 10 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21273 2026-03-09 cs.CV 57%

StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives

StoryTailor: 一种零样本 pipelines 用于动作丰富的多主体视觉叙事

Jinghao Hu, Yuhe Zhang, GuoHua Geng, Kang Li, Han Zhang

机构 * College of Computer Science, Northwest University(计算机科学学院,西北大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 StoryTailor通过零样本方法生成动作丰富的多主体视觉叙事,结合GCA、AB-SVR和SFC模块提升动作忠实性和跨帧连续性,实验显示其在多个指标上优于基线方法。

Comments 24 pages,19 figures,accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 50%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏