arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-21 至 2026-08-21 共收录 6
2608.20312 2026-08-21 cs.CV 新提交

Inter-X++: A Comprehensive Benchmark for Multimodal Human-Human Interaction Analysis

Inter-X++:用于多模态人与人交互分析的综合基准

Liang Xu, Chengqun Yang, Zili Lin, Xintao Lv, Yichao Yan, Xin Jin, Zhibo Chen, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(宁波工程学院) University of Science and Technology of China(中国科学技术大学)

AI总结 该研究提出多模态人与人交互基准Inter-X++,构建含精细标注的大规模数据集,开发统一HHI框架OpenHHI,其在生成与感知任务上达最优性能,验证了统一表示的有效性。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-08-21 cs.CV 新提交

DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: this https URL (https://ggxxii.github.io/dreamhand/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20284 2026-08-21 cs.CV cs.RO 新提交

Towards Surgical World-Action Modeling: A Preliminary Joint Visual-Trajectory Forecasting for Surgical Motion Planning

面向外科世界动作建模:外科手术运动规划的初步联合视觉-轨迹预测

Weiliang Huang, Huanrong Liu, Bob Zhang, Qi Dou, Zhen Chen, Yun Gu, Guy Rosman, Qingbiao Li

机构 * University of Macau(澳门大学) University of Macau Advanced Research Institute in Hengqin(澳门大学横琴研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Tongren Hospital(同仁医院) Duke University(杜克大学)

AI总结 本文提出初步联合视觉-轨迹世界动作模型,从历史手术观测中同时预测未来视觉状态与器械轨迹,采用分块自回归展开法,提升了预测性能,证明了联合预测的可行性,但仍存在长范围预测的退化与误差挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20251 2026-08-21 cs.RO 新提交

Video2DoorTraversal: Push Door Traversal via Simulated Door Twins

Video2DoorTraversal:通过模拟门孪生体实现推门穿越

Xincheng Tang, Yiji Chen, Youhan Xie, Wanyu Li, Zhengjie Shu, Lai Jiang, Wenkang Hu, Yitong Li, Jinchuang Zhang, Xibin Song, Ruigang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) NeoWa Robotics(NeoWa机器人公司) Shandong University(山东大学)

AI总结 本文提出Video2DoorTraversal框架,通过DoorTwin重构门孪生体,训练ArticuACT策略,实现轮腿式移动机械手开门穿越,在真实门与未见门上分别达到96.57%和80.95%的成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20087 2026-08-21 cs.RO cs.AI 新提交

Towards Professional Tennis Styles for Humanoid Robots with Adaptive Motion Planning and Tracking

面向人形机器人的专业网球风格:自适应运动规划与跟踪

Tao Huang, Ruofei Liu, Xuchen Tang, Xinyin Zhang, Junli Ren, Huayi Wang, Feiyu Jia, Yukai Qi, Kangning Yin, Weishuai Zeng, Lipeng Chen, Xi Li, Ting Wu, Kailin Li, Ruoli Dai, Jingbo Wang, Lei Han, Jiangmiao Pang

机构 * Noitom Robotics(诺亦腾机器人) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Dobot Robotics(越疆机器人)

AI总结 本研究提出AdaPT框架,从广播视频学习专业网球风格,通过自适应机制弥合仿真到现实的差距,在Unitree G1和Dobot Atom人形机器人上验证了有效性,为相关系统提供了见解。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19662 2026-08-21 cs.CL 新提交

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩

Yichu Fang, Sitong Wei, Haozhe Hu, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Xi’an Jiaotong University(西安交通大学)

AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏