UMI-3D: Extending Universal Manipulation Interface from Vision-Limited to 3D Spatial Perception
UMI-3D:从视觉受限到3D空间感知的通用操作接口扩展
机构 * HKU(香港大学) ; USTC(中国科学技术大学)
AI总结 UMI-3D通过集成轻量级低成本LiDAR传感器,提升数据采集的鲁棒性和可扩展性,实现3D空间感知,增强操作任务的性能与可行性。
高校专区
UMI-3D:从视觉受限到3D空间感知的通用操作接口扩展
机构 * HKU(香港大学) ; USTC(中国科学技术大学)
AI总结 UMI-3D通过集成轻量级低成本LiDAR传感器,提升数据采集的鲁棒性和可扩展性,实现3D空间感知,增强操作任务的性能与可行性。
通过小规模偏好优化修剪大推理模型的长推理链
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence(人工智能研究院) ; Hefei Comprehensive National Science Center(合肥综合性国家科学中心) ; Central China Normal University(中部师范大学) ; Meituan(美团) ; NeoShell
AI总结 本文提出LCPO方法,通过统一的Bradley-Terry损失框架,有效减少大推理模型的输出长度,同时保持推理性能,实验显示在多个基准上平均输出长度减少超过50%。
Comments 26 pages, 8 figures, ICLR'26
迈向细粒度时间感知:通过音频侧时间提示进行后训练的大音频-语言模型
机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China, Hefei, China(语音与语言信息处理国家级工程研究中心,中国科学技术大学,合肥,中国) ; ICT Cluster, Singapore Institute of Technology, Singapore(新加坡理工学院ICT集群,新加坡)
AI总结 本文提出Audio-Side Time Prompt方法,结合强化学习改进大音频-语言模型的时间感知能力,在音频定位、事件检测等任务中取得显著提升。
Comments Submitted to Interspeech 2026
权重修补:向LLMs中源级机理定位迈进
机构 * Key Laboratory of Ministry of Education for Brain Inspired Intelligent Perception and Cognition, University of Science and Technology of China(教育部脑科学与智能感知认知重点实验室,中国科学技术大学)
AI总结 本文提出权重修补方法,通过参数空间干预分析配对同架构模型,揭示指令跟随任务中从浅层候选源侧载体到聚合路由模块再到下游执行电路的层次结构,提升模型融合效果。
Comments 36 pages. Submitted to IEEE for possible publication
SocialMirror: 从单目视频中利用语义和几何引导重建3D人体交互行为
机构 * ShanghaiTech University(上海科技大学) ; Nanyang Technological University(南洋理工大学) ; Guangzhou Institute of Energy Conversion, CAS(广州能源研究所,中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Inceptio Technology(Inceptio科技) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出SocialMirror框架,通过语义和几何引导解决单目视频中人体重建的挑战,实现高精度交互行为重建,展现强大的泛化能力。