arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2605.22597 2026-05-22 cs.LG cs.AI cs.GR cs.RO

MoSA: Motion-constrained Stress Adaptation for Mitigating Real-to-Sim Gap in Continuum Dynamics via Learning Residual Anisotropy

MoSA: 通过学习残余各向异性来缓解连续动力学中现实到模拟差距的运动约束应力适应

Jiaxu Wang, Junhao He, Jingkai Sun, Yi Gu, Yunyang Mo, Jiahang Cao, Qiang Zhang, Renjing Xu

机构 * Hong Kong University of Science(香港科学大学) MMLab, Chinese University of Hong Kong, Hong Kong SAR(香港中文大学MMLab, 香港特别行政区) The University of Hong Kong, Hong Kong SAR(香港大学, 香港特别行政区)

AI总结 本文提出MoSA框架,通过运动约束应力适应来缓解连续动力学中现实到模拟差距,利用各向同性模型作为物理先验,并学习残余应力算子以捕捉轻微各向异性和非均匀性,最终在机器人操作中验证了其有效性。

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22123 2026-05-22 cs.RO

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations

超越像素:从少量示范中学习不变的奖励以实现实世界机器人学

Tengye Xu, Yangting Sun, Ziju Shen, Guanqi Chen, Zhen Fu, Chen yizhou, Hua Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong(计算科学与数据科学学院,香港大学) LimX Dynamics Technology Co., Ltd(LimX动力技术有限公司) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种从少量示范中学习不变奖励的方法,以实现实世界机器人学中的泛化能力,通过发现行为不变量来改进奖励函数的设计,从而在多个任务中提升策略学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20342 2026-05-22 cs.CV

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

ParaVT: 平衡工具先验悖论以实现代理视频强化学习中的并行工具使用

Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKU(香港大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

AI总结 本文提出ParaVT,一种用于并行视频工具调用的端到端强化学习框架,通过引入PARA-GRPO机制解决工具先验悖论,提升了长视频理解的性能。

Comments Project Page: https://evolvinglmms-lab.github.io/ParaVT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00515 2026-05-22 cs.DC cs.AI cs.NI

SpaceMoE: Realizing Distributed Mixture-of-Experts Inference over Space Networks

SpaceMoE:在空间网络上实现分布式混合专家推理

Zhanwei Wang, Huiling Yang, Min Sheng, Khaled B. Letaief, Kaibin Huang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong (HKU)(香港大学电子与计算机工程系) State Key Laboratory of Integrated Service Networks, Institute of Information Science, Xidian University(西安电子科技大学信息科学学院集成服务网络国家重点实验室) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology (HKUST)(香港科学与技术大学电子与计算机工程系)

AI总结 本文提出SpaceMoE框架,旨在解决在卫星网络中高效部署大规模LLM的挑战,通过分层专家放置策略减少延迟,实现混合专家模型在空间环境中的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22270 2026-05-22 cs.LG q-bio.PE

Prior Knowledge-enhanced Spatio-temporal Epidemic Forecasting

先验知识增强的时空疫情预测

Sijie Ruan, Jinyu Li, Jia Wei, Zenghao Xu, Jie Bao, Junshi Xu, Junyang Qiu, Shuliang Wang, Xiaoxiao Wang, Hanning Yuan

机构 * Beijing Institute of Technology(北京理工大学) Zhejiang Provincial Center for Disease Control and Prevention(浙江省疾病预防控制中心) JD Technology(京东科技) The University of Hong Kong(香港大学) China Mobile Internet(中国移动互联网)

AI总结 本文提出了一种结合隐式时空先验和显式专家先验的新型混合框架STOEP,通过动态调整区域依赖关系、放大弱信号和机制性预测来提升时空疫情预测的准确性。

Comments 12 pages, 10 figures, accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22769 2026-05-22 cs.CV

PartCo: Part-Level Correspondence Priors Enhance Category Discovery

PartCo: 基于部分级对应先验的类别发现增强

Fernando Julio Cendra, Kai Han

机构 * Visual AI Lab, School of Computing and Data Science, The University of Hong Kong, Hong Kong(视觉人工智能实验室,计算与数据科学学院,香港大学,香港) Visual AI Lab, School of Computing(视觉人工智能实验室,计算学院) Data Science, The University of Hong Kong, Hong Kong(数据科学,香港大学,香港)

AI总结 PartCo通过引入部分级对应先验,提升了类别发现的性能,通过捕捉更细粒度的语义结构,改进了现有方法在区分密切相关类别方面的表现。

Comments ICML 2026, Project page: https://visual-ai.github.io/partco

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22060 2026-05-22 cs.CR cs.AI

Safeguarding Text-to-Image Generative Models Against Unauthorized Knowledge Distillation

防范未经授权的知识蒸馏的文本到图像生成模型

Yilan Gao, Sida Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学电子学院(iOPEN)、西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信) The University of Hong Kong(香港大学)

AI总结 本文提出WaveGuard,一种单次生成器基保护框架,通过在用户指定的扰动预算下保护发布的合成图像,以防止未经授权的知识蒸馏和能力复制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03205 2026-05-22 cs.RO

HUSKY: Humanoid Skateboarding System via Physics-Aware Whole-Body Control

HUSKY:通过物理感知的全身控制实现人形滑雪板系统

Jinrui Han, Dewei Wang, Chenyun Zhang, Xinzhe Liu, Ping Luo, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出HUSKY框架,通过整合人形滑雪板系统建模和物理感知的全身控制,解决高动态和复杂交互任务中的稳定动态操控问题,实现在实际场景中稳定灵活的滑雪板操作。

Comments Accepted to RSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16739 2026-05-22 cs.AI

AI-Driven Prediction of Cancer Pain Episodes: A Hybrid Decision Support Approach

基于AI的癌症疼痛发作预测:一种混合决策支持方法

Yipeng Zhuang, Yifeng Guo, Yuewen Li, Yuheng Wu, Philip Leung-Ho Yu, Tingting Song, Zhiyong Wang, Kunzhong Zhou, Weifang Wang, Li Zhuang

机构 * The University of Hong Kong(香港大学) Peking University Cancer Hospital Yunnan Hospital, The Third Affiliated Hospital of Kunming Medical University(北京大学肿瘤医院云南医院,昆明医科大学第三附属医院)

AI总结 本研究提出了一种混合机器学习和大语言模型的方法,利用结构化和非结构化电子健康记录数据预测癌症患者在住院48和72小时内疼痛发作,通过整合时间序列药物趋势和模糊剂量记录,提高了敏感性和可解释性,实现了87.6%和91.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07962 2026-05-22 cs.CL cs.AI

LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?

LightReasoner: 小型语言模型能否教会大型语言模型推理?

Jingyuan Wang, Yankai Chen, Zhonghang Li, Chao Huang

机构 * University of Hong Kong(香港大学) University of Chicago(芝加哥大学)

AI总结 本文提出LightReasoner框架,通过利用强专家模型与弱业余模型之间的行为差异,发现高价值推理时刻,从而提升大型语言模型的推理能力,同时减少资源消耗。

Comments Updated to ACL 2026 camera-ready version with improved method presentation, expanded related work discussion, additional analyses, and presentation refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21388 2026-05-21 cs.LG cs.AI cs.NA math.NA stat.ML

On the Regularity and Generalization of One-Step Wasserstein-guided Generative Models for PDE-Induced Measures

关于PDE诱导度量的一步Wasserstein引导生成模型的正则性和泛化性

Likun Lin, Zhongjian Wang, Jack Xin, Zhiwen Zhang

机构 * Department of Mathematics, The University of Hong Kong(香港大学数学系) Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学数学科学系) Department of Mathematics, University of California at Irvine(加州大学 Irvine 分校数学系)

AI总结 本文研究了一步Wasserstein引导生成模型在处理PDE诱导概率度量时的正则性和泛化性,通过理论框架证明了运输映射的正则性和生成模型的泛化性质,并通过实验验证了理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21258 2026-05-21 cs.RO cs.AI

Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation

为机器人操作中的高效视觉表征学习结构潜在点

Yicheng Jiang, Jiaxu Wang, Junhao He, Zesen Gan, Junhao Li, Qiang Zhang, Jingkai Sun, Jiahang Cao, Mingyuan Sun, Xiangyu Yue, Qiming Shao

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) X-Humanoid Robots(X-Humanoid机器人) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 本文提出了一种新的预训练框架,通过学习混合表示-结构潜在点,结合隐式表示的表达能力和显式表示的结构先验,以提高机器人操作中的视觉表征效率和鲁棒性。

Journal ref International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21217 2026-05-21 stat.ML cs.LG

Federated LoRA Fine-Tuning for LLMs via Collaborative Alignment

通过协作对齐的联邦LoRA微调大型语言模型

Shuaida He, Liwen Chen, Long Feng

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

AI总结 本文研究了在联邦学习环境下使用LoRA进行参数高效微调的问题,提出了一种名为CLAIR的框架,通过结构低秩加块稀疏分解来恢复共享LoRA子空间并检测污染客户端,从而在噪声情况下实现精确恢复,并在不同条件下实现稳定和一致的协作集恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21130 2026-05-21 cs.CV

VersusQ: Pairwise Margin Reasoning for Generalizable Video Quality Assessment

VersusQ:用于通用视频质量评估的成对边距推理

Shibei Meng, Binxin Yang, Yuan Liu, Jiexuan Zhang, Zhengyao Lv, Hubery Yin, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) WeChat Vision, Tencent Inc.(腾讯公司视觉部门) Beijing Normal University(北京师范大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出VersusQ,一种基于成对边距推理的框架,通过直接比较视频来缓解绝对尺度校准偏差,实现跨域的视频质量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20856 2026-05-21 cs.RO cs.AI cs.LG

DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

DISC: 通过策略生成解耦指令与状态条件控制

Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) TranscEngram

AI总结 DISC通过策略生成解耦指令与状态条件控制,解决了任务状态耦合导致的观察泄漏问题,并在多个基准测试中表现出色,证明了语言生成的策略参数驱动行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17776 2026-05-21 cs.RO

CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪

Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

AI总结 本文提出CosFly-Track数据集,用于无人机视觉跟踪任务,通过多约束轨迹优化生成大规模多模态数据,提升了动态目标跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15305 2026-05-21 cs.GR cs.LG

WorldParticle: Unified World Simulation of Lagrangian Particle Dynamics via Transformer

WorldParticle:通过Transformer实现拉格朗日粒子动力学的统一世界模拟

Caoliwen Wang, Minghao Guo, Siyuan Chen, Heng Zhang, Mengdi Wang, Xingyu Ni, Hanson Sun, Kunyi Wang, Zherong Pan, Kui Wu, Lingjie Liu, Yin Yang, Chenfanfu Jiang, Taku Komura, Wojciech Matusik, Peter Yichen Chen

机构 * University of British Columbia(不列颠哥伦比亚大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Georgia Institute of Technology(佐治亚理工学院) Inria(法国国家信息与自动化技术研究院) Meta Independent Researcher(独立研究者) University of Pennsylvania(宾夕法尼亚大学) University of Utah(犹他大学) University of California Los Angeles(加州大学洛杉矶分校) University of Hong Kong(香港大学)

AI总结 本文提出基于Transformer架构的粒子模拟器,能够统一模拟布料、弹性固体、牛顿流体、非牛顿流体、颗粒材料和分子动力学等不同物理现象,通过预测-校正设计和粒子表示,实现高效的模拟与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27505 2026-05-21 cs.CV

Leveraging Verifier-Based Reinforcement Learning in Image Editing

利用基于验证器的强化学习进行图像编辑

Hanzhong Guo, Jie Wu, Jie Liu, Yu Gao, Zilyu Ye, Linxiao Yuan, Xionghui Wang, Yizhou Yu, Weilin Huang

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Center for Embodied AI and Computer Vision, Shenzhen Loop Area Institute(具身人工智能与计算机视觉中心,深圳Loop Area研究院)

AI总结 本文提出Edit-R1框架,通过构建基于推理的验证器奖励模型(RRM)来解决图像编辑中缺乏稳健奖励模型的问题,该模型通过分解指令为不同原则并逐项评估图像,实现细粒度奖励,实验表明其在图像编辑任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06862 2026-05-21 cs.CV

Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing

参数作为专家:通过动态参数路由适应视觉模型

Meng Lou, Stanley Yu, Yizhou Yu

机构 * The University of Hong Kong(香港大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出ParaX方法,通过动态参数路由机制实现视觉模型的高效微调,以生成更定制化和强大的特征表示,从而在多种视觉识别任务中取得优越性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23538 2026-05-21 cs.AI cs.CL cs.CV cs.SE

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

JanusCoder: 向代码智能的视觉-程序化界面迈进

Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。

Comments ICLR 2026 Camera Ready Version, with code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20276 2026-05-21 cs.LG

OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization

OmniISR: 一个通过中间监督和正则化实现集中学习和联邦学习统一框架

Wei-Bin Kou, Guangxu Zhu, Ming Tang, Chen Zhang, Lisheng Wu, Lei Zhou, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Shenzhen Research Institute of Big Data, Shenzhen, China(深圳大数据研究院,深圳,中国) Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong, China(香港大学电子与电气工程系,香港,中国) Yinwang Intelligent Technology Co. Ltd., Shenzhen, China(云网智能科技有限公司,深圳,中国)

AI总结 本文提出OmniISR框架,通过中间监督和正则化信号融合纯集中学习、纯联邦学习和混合集中-联邦学习训练模式,解决了集中学习和联邦学习之间的不兼容优化问题,并在理论上推导了收敛界、联邦漂移界、梯度对齐保证和逃逸时间界。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19919 2026-05-20 cs.RO

Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

超越动作残差:通过瓶颈潜在强化学习实现现实世界机器人策略引导

Dongjie Yu, Kun Lei, Zhennan Jiang, Jia Pan, Huazhe Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shanghai Qizhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 本文提出了一种名为Z-Perturbation Reinforcement Learning(ZPRL)的方法,通过紧凑的瓶颈潜在空间来引导预训练策略,从而提高样本效率和最终性能,同时在现实世界任务中显著提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19660 2026-05-20 cs.LG cs.CL

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

OScaR:LLMs及更广泛场景中的极压缩KV缓存量化之奥卡姆之刀

Zunhai Su, Rui Yang, Chao Zhang, Yaxiu Liu, Yifan Zhang, Wei Wu, Jing Xiong, Dayou Du, Xialie Zhuang, Yulei Qian, Yuchen Xie, Yik-Chung Wu, Hongxia Yang, Ngai Wong

机构 * Tsinghua University(清华大学) Meituan LongCat Team(美团LongCat团队) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学) UCAS(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对LLMs中KV缓存极压缩时的量化保真问题,提出OScaR框架,通过Canalized Rotation和Omni-Token Scaling有效缓解Token Norm Imbalance,实现近无损的INT2量化性能,同时提升解码速度和吞吐量。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19594 2026-05-20 cs.RO

MCNav: Memory-Aware Dynamic Cognitive Map for Zero-shot Goal-oriented Navigation

MCNav: 用于零样本目标导向导航的记忆感知动态认知图

Jingyu Li, Zhe Liu, Wenxiao Wu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出MCNav,一种记忆感知的动态认知图导航框架,通过高效查询已探索区域的相关物体信息,解决零样本目标导向导航中目标丢失或误识别的问题,通过目标再验证和遗漏目标再探索策略,结合黑名单和双检机制,实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19592 2026-05-20 cs.RO cs.AI

Implicit Action Chunking for Smooth Continuous Control

隐式动作分块用于平滑连续控制

Bosun Liang, Shuo Pei, Zirui Chen, Chuanzhi Fan, Chen Sun, Yuankai Wu, Huachun Tan, Yong Wang

机构 * Department of Data and Systems Engineering, The University of Hong Kong, Hong Kong SAR, China(香港大学数据与系统工程系) Beijing Institute of Technology, Zhuhai, China(北京理工大学珠海学院) College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院)

AI总结 本文提出了一种隐式动作分块框架Dual-Window Smoothing (DWS),用于实现平滑的连续控制。该方法通过双窗口设计,在不扩展动作空间的情况下,确保物理平滑性和时间差分目标的一致性,从而解决传统显式动作分块方法的优化困难和与标准逐步交互不兼容的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19533 2026-05-20 cs.CV

Replacement Learning: Training Neural Networks with Fewer Parameters

替代学习:用更少的参数训练神经网络

Yuming Zhang, Peizhe Wang, Tianyang Han, Hengyu Shi, Junhao Su, Dongzhi Guan, Jiabin Liu, Jiaji Wang

机构 * The University of Hong Kong(香港大学) Southeast University(东南大学)

AI总结 本文提出替代学习(RepL)方法,通过替换而非删除神经网络中的部分模块来减少全深度反向传播的冗余,从而在保持性能的同时降低参数量、内存使用和训练时间。

Comments 16pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19523 2026-05-20 cs.CL cs.AI cs.CV

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

探究跨模态技能注入:场景、方法与超参数

Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) WeChat AI, Tencent Inc., China(腾讯公司,中国) The University of Hong Kong(香港大学)

AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19506 2026-05-20 cs.CV

EventPrune: Cascaded Event-Assisted Token Pruning for Efficient First-Person Dynamic Spatial Reasoning

EventPrune: 用于高效第一人称动态空间推理的级联事件辅助标记修剪

Pengtao Ma, Ziliang Zhou, Ciyu Ruan, Haoyang Wang, Kaiyuan Li, Zihang Gong, Wenhua Ding, Chen Gao, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 本文提出Event Cascade Pruning (ECP),一种无需训练的框架,利用事件相机的高频运动线索作为连续事件引导的运动先验,指导标记选择,从而在第一人称动态空间推理中实现高效的标记修剪,提升推理速度和减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19374 2026-05-20 cs.CV cs.AI cs.LG

Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings

基于概念的噪声负样本抑制用于零样本分类和胸片发现的 grounding

Chenyu Lian, Hong-Yu Zhou, Chun-Ka Wong, Jing Qin

机构 * The Center for Smart Health, School of Nursing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能健康中心,护理学院,中国香港) Research Institute for Smart Ageing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能老龄化研究 institute,中国香港) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University, Beijing, China(清华大学生物医学工程学院,清华大学,北京,中国) Queen Mary Hospital, LKS Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉诚医学院Queen Mary医院,中国香港)

AI总结 本文提出了一种基于概念的噪声负样本抑制框架CoNNS,通过构建层次化概念本体,解决不同患者间相似发现导致的噪声负样本问题,提升零样本理解任务的性能。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏