arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2790
2605.22631 2026-05-22 cs.CV

AtomicMotion: Learning Human Motion From Different Human Parts

AtomicMotion: 从不同人体部分学习人体动作

Runzhen Liu, Chuhua Xian, Fa-Ting Hong

机构 * School of Computer Science and Engineering(计算机科学与工程学院) South China University of Technology(华南理工大学) Department of Computer Science and Engineering(计算机科学与工程系) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 该研究提出AtomicMotion框架,通过解耦和重新整合身体动态,解决从稀疏头部和手部轨迹准确重建完整身体姿态的挑战,核心方法是逻辑身体分区、全身体预条件化策略和运动学注意力机制,实验表明其在AMASS数据集上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22200 2026-05-22 cs.CV cs.AI cs.LG

OSS: Open Suturing Skills Vision-Based Assessment Challenge 2024-2025

OSS: 2024-2025 开放缝合技能基于视觉的评估挑战

Hanna Hoffmann, Setareh Bady, Claas de Boer, Max Kirchner, Jan Egger, Rainer Röhrig, Frank Hölzle, Lennart Johannes Gruber, Kunpeng Xie, Marlon Neuhaus, Victor Alves, Guilherme Barbosa, Leonardo Barroso, João Carvalho, Hao Chen, Gabriella d'Albenzio, André Ferreira, Nuno Gomes, Yuichiro Hayashi, Kousuke Hirasawa, Rebecca Hisey, Seungjae Hong, Seoi Jeong, Tiago Jesus, Daehong Kang, Satoshi Kasai, Shunsuke Kikuchi, Takayuki Kitasaka, Satoshi Kondo, Hyoun-Joong Kong, Youngbin Kong, Atsushi Kouno, Shlomi Laufer, Kyu Eun Lee, Bining Long, Nooshin Maghsoodi, Hiroki Matsuzaki, Evangelos Mazomenos, Ori Meiraz, Kensaku Mori, Marina Music, Masahiro Oda, Roi Papo, Jieun Park, Rafael Piexoto, Saeid Rezaei, Mariana Ribeiro, Soyeon Shin, Yang Shu, Idan Smoller, Danail Stoyanov, Yihui Wang, Xinkai Zhao, Sebastian Bodenstedt, Isabel Funke, Stefanie Speidel, Behrus Hinrichs-Puladi

机构 * Department of Translational Surgical Oncology, National Center for Tumor Diseases (NCT/UCC) Dresden(转化外科肿瘤学部,肿瘤疾病国家中心(NCT/UCC)德累斯顿) The Centre for Tactile Internet with Human-in-the-Loop (CeTI), TUD Dresden University of Technology(具有人环路触觉互联网中心(CeTI),德累斯顿技术大学) Department of Oral and Maxillofacial Surgery, University Hospital RWTH Aachen(口腔和颌面外科部,亚琛大学医院) Center for Tooth-, Mouth- and Jaw Medicine, University Göttingen(牙科、口科和颌科医学中心,哥廷根大学) Institute of Medical Informatics, University Hospital RWTH Aachen(医学信息学研究所,亚琛大学医院) Faculty of Medicine and University Hospital Carl Gustav Carus, TUD Dresden University of Technology(医学系和卡尔·戈斯塔·卡鲁斯大学医院,德累斯顿技术大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) Muroran Institute of Technology(牟然技术学院) Niigata University of Health and Welfare(北九州市保健福利大学) Konica Minolta, Inc.(柯尼卡美能达公司) Jmees, Inc.(Jmees公司) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程部,香港科学与技术大学) Center Algoritmi/LASI, University of Minho(算法中心/ALASI,米尼奥大学) Life and Health Sciences Research Institute (ICVS), School of Medicine, University of Minho(生命与健康科学研究院(ICVS),医学院,米尼奥大学) ICVS/3B's - PT Government Associate Laboratory(ICVS/3B's - PT政府附属实验室) Institute for AI in Medicine (IKIM), University Medicine Essen(医学人工智能研究所(IKIM),埃森大学医学部) The Faculty of Data and Decisions Science, Technion - Israel Institute of Technology(数据与决策科学系,技术学院-以色列理工学院) UCL Hawkes Institute, University College London(UCL Hawkes研究所,伦敦大学学院) School of Computing, Queen's University(计算学院,皇后大学) Department of Transdisciplinary Medicine, Seoul National University Hospital(跨学科医学部,首尔国立大学医院) Interdisciplinary Program in Medical Informatics, Seoul National University(医学信息学跨学科项目,首尔国立大学) Department of Clinical Medical Sciences, Seoul National University(临床医学科学部,首尔国立大学) Institute of Convergence Medicine with Innovative Technology, Seoul National University Hospital(融合医学与创新技术研究所,首尔国立大学医院) Department of Surgery, Seoul National University College of Medicine and Seoul National University Hospital(外科部,首尔国立大学医学院和首尔国立大学医院)

AI总结 本文提出OSS挑战,旨在通过基于视觉的评估方法提升开放手术技能训练,通过挑战数据集和多任务评估,评估不同方法在开放手术技能评估中的表现,揭示视频评估的潜力与限制。

Comments Stefanie Speidel and Behrus Hinrichs-Puladi jointly supervised this work. Submitted to MEDIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22089 2026-05-22 cs.CV cs.AI

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型

Xiaodong Mei, Diankun Zhang, Hongwei Xie, Guang Chen, Hangjun Ye, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaomi EV(小米电动车)

AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20342 2026-05-22 cs.CV

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用

Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKU(香港大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。

Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12058 2026-05-22 cs.LG cs.AI

Holder Policy Optimisation

Hölder Policy Optimisation

Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin, Weinan Zhang, Jun Wang

机构 * University College London(伦敦大学学院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 本文提出HölderPO框架,通过Hölder均值统一token级概率聚合,解决固定聚合机制导致的训练崩溃与性能不足问题,理论证明不同p值对梯度集中度和方差的平衡作用,并通过动态退火算法实现训练周期内的p值调度,实验表明其在多个数学基准测试中取得更优的稳定性和收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11739 2026-05-22 cs.CL

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation

学习预见:揭示在线蒸馏的解锁效率

Yuchen Cai, Ding Cao, Liang Lin, Chunxi Luo, Xin Xu, Kai Yang, Weijie Liu, Saiyong Yang, Tianxiang Zhao, Guangzhong Sun, Guiquan Liu, Junfeng Fang

机构 * USTC(中国科学技术大学) Tencent(腾讯) NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) UCAS-IIE(中国科学技术大学国际交流学院) SHU(上海大学)

AI总结 本文研究了在线蒸馏(OPD)的效率来源,提出EffOPD方法通过适应性选择 extrapolation 步长和沿当前更新方向移动来加速OPD,实现了3倍的训练加速同时保持最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07243 2026-05-22 cs.CL

SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

SpecBlock:带有动态树草案的块迭代推测解码

Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) MetaX Zhejiang Normal University(浙江师范大学) Soochow University(苏州大学)

AI总结 该研究提出了一种结合路径依赖性和低成本草案的块迭代草案方法SpecBlock,通过动态树草案和路径依赖机制提高LLM推理效率,同时在部署时利用验证器反馈进行成本感知适应,从而在速度和成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00515 2026-05-22 cs.DC cs.AI cs.NI

SpaceMoE: Realizing Distributed Mixture-of-Experts Inference over Space Networks

SpaceMoE:在空间网络上实现分布式混合专家推理

Zhanwei Wang, Huiling Yang, Min Sheng, Khaled B. Letaief, Kaibin Huang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong (HKU)(香港大学电子与计算机工程系) State Key Laboratory of Integrated Service Networks, Institute of Information Science, Xidian University(西安电子科技大学信息科学学院集成服务网络国家重点实验室) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology (HKUST)(香港科学与技术大学电子与计算机工程系)

AI总结 本文提出SpaceMoE框架,旨在解决在卫星网络中高效部署大规模LLM的挑战,通过分层专家放置策略减少延迟,实现混合专家模型在空间环境中的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06676 2026-05-22 cs.CV

Can We Build a Monolithic Model for Fake Image Detection? SICA: Semantic-Induced Constrained Adaptation for Unified-Yet-Discriminative Artifact Feature Space Reconstruction

我们能否为伪造图像检测构建一个单一模型?SICA:语义诱导约束适应用于统一且具有判别性的伪影特征空间重建

Bo Du, Xiaochen Ma, Xuekang Zhu, Zhe Yang, Chaogun Niu, Chenfan Qu, Mingqi Fang, Zhenming Wang, Jingjing Liu, Jian Liu, Ji-Zhe Zhou

机构 * Sichuan University(四川大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学) South China University of Technology(华南理工大学)

AI总结 本文提出了一种新的单体伪造图像检测模型SICA,通过语义诱导约束适应方法,解决伪影特征空间重建的统一与判别性矛盾,实验表明其优于15种现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07603 2026-05-22 cs.CV

UIKA: Fast Universal Head Avatar from Pose-Free Images

UIKA:从无姿态图像快速生成通用头身模型

Zijian Wu, Boyao Zhou, Liangxiao Hu, Hongyu Liu, Yuan Sun, Xuan Wang, Xun Cao, Yujun Shen, Hao Zhu

机构 * Nanjing University(南京大学) Ant Group(蚂蚁集团) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出UIKA,一种从任意数量的无姿态输入(包括单张图像、多视角捕捉和手机拍摄视频)生成可动画的高斯头身模型。与传统头身模型不同,UIKA通过模型表示、网络设计和数据准备重新思考任务,引入了UV引导的头身建模策略,设计了可学习的UV标记,并通过聚合所有输入视角的UV信息解码为标准高斯属性。

Comments CVPR 2026 Highlight. Code: https://github.com/ant-research/UIKA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20785 2026-05-22 cs.CV

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT: 通过原生工具调用激励'通过长视频思考'

Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

AI总结 本文提出LongVT,一种端到端的代理框架,通过交错的多模态工具链式思考实现'通过长视频思考',通过利用LMM的固有时间定位能力作为原生视频裁剪工具,以解决长视频推理中的幻觉问题,并通过VideoSIAH数据集提升训练和评估效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22051 2026-05-22 cs.CV

EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation

EasyVFX: 用于资源高效视觉效果生成的频率驱动解耦

Yue Ma, Xu Ye, Qinghe Wang, Yucheng Wang, Hongyu Liu, Yinhan Zhang, Xinyu Wang, Yuanpeng Che, Shanhui Mo, Paul Liang, Fangneng Zhan, Qifeng Chen

机构 * HKUST(香港科技大学) DUT(东华大学) THU(清华大学) MIT(麻省理工学院)

AI总结 本文提出EasyVFX框架,通过频率域分解解耦高频和低频成分,降低视觉效果生成的计算和数据依赖性,实现高效且高质量的视觉效果合成。

Comments Accepted by SIGGRAPH 2026. Project page: https://easy-vfx.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22036 2026-05-22 cs.CV cs.AI

GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation

GA-VLN: 用于高效视觉-语言导航的几何感知鸟瞰图表示

Jiahao Yang, Zihan Wang, Xiangyang Li, Xing Zhu, Yujun Shen, Yinghao Xu, Shuqiang Jiang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Robbyant School of Computing, National University of Singapore(新加坡国立大学计算机学院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出GA-VLN框架,通过引入几何感知的鸟瞰图表示(GA-BEV),整合显式和隐式几何信息,提升视觉-语言导航的效率和性能,实验表明其在仅使用导航数据的情况下取得了最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22012 2026-05-22 cs.CL cs.CV

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解

Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, Junbo Niu, Tianyu Guo, Yang Shi, Yue Ding, Yiyan Ji, Bingyin Mei, Yushuo Guan, Yuanxing Zhang, Pengfei Wan, Fangcheng Fu, Wentao Zhang

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) HKUST(香港科技大学) CASIA(中国科学院自动化研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21988 2026-05-22 cs.CV cs.AI

Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

通过反事实强化学习学习视频大语言模型中的时空敏感性

Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

AI总结 本文提出CRPO方法,通过反事实强化学习提升视频大语言模型对时空动态的敏感性,通过构建反事实视频并引入反事实关系奖励,有效抑制了依赖静态线索的简略策略,从而在DyBench基准测试中提升了模型的时空敏感性。

Comments Project website: https://ddz16.github.io/crpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21954 2026-05-22 cs.CV cs.AI

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。

Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19192 2026-05-22 cs.AI cs.CR

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

幻觉作为利用:证据承载多模态智能体

Guijia Zhang, Hao Zheng, Harry Yang

机构 * Shenzhen University(深圳大学) HKUST(香港科技大学)

AI总结 本文研究了多模态智能体中幻觉导致授权失败的问题,提出证据承载多模态智能体(ECA)方法,通过分解工具调用、获取类型证书并使用确定性门控来授权,从而将模型的模糊信念转换为可审计的残余,提高了系统的安全性。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10348 2026-05-22 cs.CL cs.AI cs.LG

Training-Trajectory-Aware Token Selection

基于训练轨迹的token选择

Zhanming Shen, Jiaqi Hu, Zeyu Qin, Hao Chen, Wentao Ye, Zenan Huang, Yihong Zhuang, Guoshan Lu, Junlin Zhou, Junbo Zhao

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出T3S方法,通过在token层面重构训练目标,清除未学习token的优化路径,从而在连续蒸馏中提升性能,实验表明在AR和dLLM设置中均取得显著效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21372 2026-05-21 cs.CV cs.AI cs.LG cs.RO

Closed Loop Dynamic Driving Data Mixture for Real-Synthetic Co-Training

闭环动态驾驶数据混合用于真实-合成协同训练

Hongzhi Ruan, Pei Liu, Weiliang Ma, Zhengning Li, Xueyang Zhang, Jun Ma, Dan Xu, Kun Zhan

机构 * Li Auto(力汽车) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

AI总结 本文提出了一种闭环动态数据混合方法,通过动态优化过程调整训练数据混合比例,以提升模型性能,解决了在有限预算下优化数据混合的关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21258 2026-05-21 cs.RO cs.AI

Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation

为机器人操作中的高效视觉表征学习结构潜在点

Yicheng Jiang, Jiaxu Wang, Junhao He, Zesen Gan, Junhao Li, Qiang Zhang, Jingkai Sun, Jiahang Cao, Mingyuan Sun, Xiangyu Yue, Qiming Shao

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) X-Humanoid Robots(X-Humanoid机器人) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 本文提出了一种新的预训练框架,通过学习混合表示-结构潜在点,结合隐式表示的表达能力和显式表示的结构先验,以提高机器人操作中的视觉表征效率和鲁棒性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21195 2026-05-21 cs.CV

RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

RankE: 用于离散文本到图像生成的端到端后训练方法 with Decoder Co-Evolution

Siyong Jian, Siyuan Li, Luyuan Zhang, Zedong Wang, Xin Jin, Ying Li, Cheng Tan, Huan Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出RankE,一种端到端的后训练框架,通过解码器与策略的协同进化,解决离散自回归文本到图像生成中策略优化导致的潜在协变量偏移问题,同时提升图像质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21131 2026-05-21 cs.CV

UniT: Unified Geometry Learning with Group Autoregressive Transformer

UniT: 基于群自回归变换器的统一几何学习

Haotian Wang, Yusong Huang, Zhaonian Kuang, Hongliang Lu, Xinhu Zheng, Meng Yang, Gang Hua

机构 * Intelligent Transportation Thrust of the Systems Hub, The Hong Kong University of Science and Technology (GZ), Guangzhou, P.R.China(香港理工大学(广州)系统中心智能交通研究组,中国广东省广州市) The National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University, Xi’an, P.R.China(人机混合增强智能国家级重点实验室,西安交通大学,中国陕西省西安市) Applied Science, Amazon.com, Inc., USA(亚马逊公司应用科学部,美国)

AI总结 本文提出UniT模型,通过群自回归变换器统一了几何感知中的多种能力,包括在线感知、离线重建、多模态融合、长视界扩展和度量尺度估计,并引入了适应性几何损失以提升跨场景的度量尺度泛化能力。

Comments Submitted to IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21121 2026-05-21 cs.CV cs.GR

ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation

ROAR-3D: 为高保真3D生成实现任意视角路由

Hanxiao Sun, Mingxin Yang, Shuhui Yang, Zebin He, Xintong Han, Hongbo Fu, Chunchao Guo, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent Hunyuan(腾讯文生)

AI总结 本文提出ROAR-3D方法,通过改进预训练单视角模型以支持任意数量的未置位图像,利用视图路由和双流注意力设计实现高效的多视角3D生成,显著提升生成质量并支持测试时视角扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20780 2026-05-21 cs.LG cs.CV

Learning to Think in Physics: Breaking Shortcut Learning in Scientific Diffusion via Representation Alignment

学习物理中的推理:通过表征对齐打破科学扩散中的捷径学习

Haozhe Jia, Pengyu Yin, Wenshuo Chen, Shaofeng Liang, Lei Wang, Bowen Tian, Xiucheng Wang, Nanqian Jia, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Shandong University(山东大学) LimX Dynamics Technology Co., Ltd.(LimX动态技术有限公司) Xidian University(西安电子科技大学) Peking University(北京大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(感知技术研究院,江苏工业技术研究院(JITRI)) Griffith University(格里菲斯大学)

AI总结 该研究提出了一种无需教师的框架REPA-P,通过使用原理残差对中间特征与物理状态进行对齐,以解决物理信息扩散模型中中间表示在边界条件变化时容易产生捷径学习的问题,从而在四个PDE任务中提高了收敛速度、减少了物理残差并增强了分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15876 2026-05-21 cs.CV

Unlocking Dense Metric Depth Estimation in VLMs

解锁VLMs中的密集度量深度估计

Hanxun Yu, Xuan Qu, Yuxin Wang, Jianke Zhu, Lei Ke

机构 * Zhejiang University(浙江大学) Tencent Hunyuan LLM(腾讯混元大模型) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出DepthVLM,一种将单个VLM转换为原生密集几何预测器的简单有效框架,同时保持其多模态能力。通过在LLM主干上附加轻量级深度头,并在统一的视觉-文本监督范式下进行训练,DepthVLM能够在单次前向传递中生成高分辨率深度图和语言输出。此外,还引入了一个统一的室内-室外度量深度基准,实验表明DepthVLM在推理效率、复杂3D空间推理等方面均优于现有VLMs和纯视觉模型。

Comments Project Page: https://depthvlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14417 2026-05-21 cs.RO cs.CV

Before the Body Moves: Learning Anticipatory Joint Intent for Language-Conditioned Humanoid Control

在身体移动之前:为语言条件的人形控制学习预见性关节意图

Haozhe Jia, Honglei Jin, Yuan Zhang, Youcheng Fan, Shaofeng Liang, Lei Wang, Shuxu Jin, Kuimou Yu, Zinuo Zhang, Jianfei Song, Wenshuo Chen, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动态技术有限公司) Shandong University(山东大学) Data61/CSIRO Griffith University(格里菲斯大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(深度感知技术研究院,江苏省工业技术研究院(JITRI))

AI总结 该研究提出DAJI框架,通过学习语言生成与闭环控制之间的预见性关节意图接口,解决语言条件人形机器人中预见未来物理转换的需求,实现了在HumanML3D风格生成和BABEL任务中的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22727 2026-05-21 cs.LG eess.SP

Spiking Personalized Federated Learning for Brain-Computer Interface-Enabled Immersive Communication

基于脑机接口的沉浸式通信的脉冲个性化联邦学习

Chen Shang, Dinh Thai Hoang, Diep N. Nguyen, Jiadong Yu

机构 * School of Electrical and Data Engineering, University of Technology Sydney(悉尼技术大学电气与数据工程学院) Thrust of Internet of Things, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)物联网研究所)

AI总结 本文提出了一种利用脑机接口获取脑信号以推断用户中心状态(如意图和感知相关不适)的沉浸式通信框架,通过个性化联邦学习模型处理脑信号,以适应神经多样性数据并防止敏感脑信号信息泄露,同时通过嵌入脉冲神经网络降低能耗,实验表明在真实脑信号数据集上识别准确率最高且能耗降低6.46倍。

Comments 6 pages, 3 figures

Journal ref INFOCOM Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06206 2026-05-21 cs.RO cs.CV

Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model

Affordance-R1: 为多模态大语言模型中的通用化 affordance 推理设计的强化学习

Hanqing Wang, Shaoyang Wang, Yiming Zhong, Zemin Yang, Jiamin Wang, Zhiqing Cui, Jiahao Yuan, Yifan Han, Mingyu Liu, Yuexin Ma

机构 * The Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) ShanghaiTech University(上海科技大学) East China Normal University(华东师范大学) Nanjing University of Information Science & Technology(南京信息工程大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出 Affordance-R1,一种结合认知 CoT 引导的 Group Relative Policy Optimization (GRPO) 的统一 affordance 地标框架,通过强化学习实现零样本泛化和测试时推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01386 2026-05-21 cs.LG stat.ML

On the Suboptimality of GP-UCB under Polynomial Effective Optimism

关于多项式有效乐观性下GP-UCB的次优性质

Wenjia Wang, Xiaowei Zhang

机构 * Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科学与技术大学工业工程与决策分析系)

AI总结 本文研究了GP-UCB在多项式有效乐观性下的次优性质,通过定义有效乐观性水平(核岭回归中的探索系数与正则化参数的乘积),在统一置信假设下证明了GP-UCB在Matérn核下的新后悔下界,表明有效乐观性水平的多项式增长排除了最小最大最优后悔率,揭示了标准GP-UCB证明最小最大最优性的障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏