arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2509.26281 2026-02-03 cs.CV cs.AI

Point2RBox-v3: Self-Bootstrapping from Point Annotations via Integrated Pseudo-Label Refinement and Utilization

Point2RBox-v3: 通过集成伪标签细化和利用实现点标注的自举学习

Teng Zhang, Ziqian Fan, Mingxin Liu, Xin Zhang, Xudong Lu, Wentong Li, Yue Zhou, Yi Yu, Xiang Li, Junchi Yan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) East China Normal University(华东师范大学) Ohio State University(俄亥俄州立大学)

AI总结 Point2RBox-v3通过集成伪标签细化和利用,实现了点标注的自举学习,有效提升稀疏和密集场景下的检测性能。

Comments 19pages, 5figures, 6tables

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21033 2026-02-03 cs.SD cs.AI

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

SupCLAP:通过支持向量正则化控制音频-文本对比学习中的优化轨迹漂移

Jiehui Luo, Yuguo Yin, Yuxin Xie, Jinghan Ru, Xianwei Zhuang, Minghua He, Aofan Liu, Zihan Xiong, Dongchao Yang

机构 * Peking University(北京大学) Central Conservatory of Music(中央音乐学院) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 SupCLAP通过支持向量正则化有效控制音频-文本对比学习中的优化轨迹漂移,提升多模态学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16324 2026-02-03 cs.LG cs.GT

Auto-bidding under Return-on-Spend Constraints with Uncertainty Quantification

在考虑不确定性量化下的回报率约束下的自动出价

Jiale Han, Chun Gan, Chengcheng Zhang, Jie He, Zhangang Lin, Ching Law, Xiaowu Dai

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出了一种基于符合预测的自动出价方法,在考虑不确定性量化的情况下,通过机器学习提升回报率约束下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16559 2026-02-03 cs.CV

Comparative validation of surgical phase recognition, instrument keypoint estimation, and instrument instance segmentation in endoscopy: Results of the PhaKIR 2024 challenge

内镜手术阶段识别、器械关键点估计和器械实例分割的比较验证:PhaKIR 2024挑战赛结果

Tobias Rueckert, David Rauber, Raphaela Maerkl, Leonard Klausmann, Suemeyye R. Yildiran, Max Gutbrod, Danilo Weber Nunes, Alvaro Fernandez Moreno, Imanol Luengo, Danail Stoyanov, Nicolas Toussaint, Enki Cho, Hyeon Bae Kim, Oh Sung Choo, Ka Young Kim, Seong Tae Kim, Gonçalo Arantes, Kehan Song, Jianjun Zhu, Junchen Xiong, Tingyi Lin, Shunsuke Kikuchi, Hiroki Matsuzaki, Atsushi Kouno, João Renato Ribeiro Manesco, João Paulo Papa, Tae-Min Choi, Tae Kyeong Jeong, Juyoun Park, Oluwatosin Alabi, Meng Wei, Tom Vercauteren, Runzhi Wu, Mengya Xu, An Wang, Long Bai, Hongliang Ren, Amine Yamlahi, Jakob Hennighausen, Lena Maier-Hein, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Shu Yang, Yihui Wang, Hao Chen, Santiago Rodríguez, Nicolás Aparicio, Leonardo Manrique, Juan Camilo Lyons, Olivia Hosie, Nicolás Ayobi, Pablo Arbeláez, Yiping Li, Yasmina Al Khalil, Sahar Nasirihaghighi, Stefanie Speidel, Daniel Rueckert, Hubertus Feussner, Dirk Wilhelm, Christoph Palm

机构 * Regensburg Medical Image Computing (ReMIC), OTH Regensburg(雷根萨大学医学影像计算中心) Research Group MITI, TUM University Hospital, School of Medicine and Health(技术大学慕尼黑大学医院MITI研究组) Regensburg Center of Biomedical Engineering (RCBE), OTH Regensburg(雷根萨生物医学工程研究中心) Regensburg University(雷根萨大学) Regensburg Center of Health Sciences and Technology (RCHST), OTH Regensburg(雷根萨健康科学与技术研究中心) AI Centre of Excellence, Medtronic Ltd.(医学影像人工智能卓越中心) Engineering Sciences, University College London(伦敦大学学院工程科学系) Augmented Intelligence Lab, Kyung Hee University(庆熙大学增强智能实验室) University of Minho, Braga(明霍大学) Jmees Inc.(Jmees公司) School of Sciences, São Paulo State University (UNESP), Bauru(圣保罗州立大学科学学院) KIST HARILAB, Center for Humanoid Research, Artificial Intelligence and Robot Institute, Korea Institute of Science and Technology (KIST)(韩国科学技术院HARILAB中心) King's College London(伦敦国王学院) The Chinese University of Hong Kong(香港中文大学) Division of Intelligent Medical Systems, German Cancer Research Center (DKFZ)(德国癌症研究中心智能医疗系统部门) Muroran Institute of Technology, Hokkaido(北海道Muroran技术学院) Niigata University of Health and Welfare(Niigata医疗福利大学) Konica Minolta, Inc.(东宝株式会社) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, Shenzhen(香港科技大学深圳-香港协同创新研究院) Center for Research and Formation in Artificial Intelligence (CinfonIA), Los Andes University, Bogota(安第斯大学人工智能研究与培养中心) Department of Biomedical Engineering, Medical Image Analysis Group, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) Institute of Information Technology (ITEC), Klagenfurt University(克雷格夫大学信息技术研究所) Center for Tactile Internet with Human-in-the-loop (CeTI), TU Dresden(德累斯顿技术大学触觉互联网中心)

AI总结 PhaKIR 2024挑战赛通过多中心数据集验证内镜手术阶段识别、关键点估计和实例分割的性能,推动RAMIS领域的时间感知和情境驱动方法发展。

Comments A challenge report pre-print accepted by the journal Medical Image Analysis (MedIA), containing 37 pages, 15 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08870 2026-02-03 cs.CV

SAM2-UNet: Segment Anything 2 Makes Strong Encoder for Natural and Medical Image Segmentation

SAM2-UNet:Segment Anything 2 为自然和医学图像分割构建强大编码器

Xinyu Xiong, Zihuang Wu, Shuangyi Tan, Wenxue Li, Feilong Tang, Ying Chen, Siying Li, Jie Ma, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer and Information Engineering, Jiangxi Normal University(江西师范大学计算机与信息工程学院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Tianjin University(天津大学) Monash University(墨尔本大学) Pazhou Lab(琶洲实验室) Smart Hospital Research Institute, Peking University Shenzhen Hospital(北京大学深圳医院智能医院研究所)

AI总结 SAM2-UNet通过结合SAM2的Hiera主干和U型解码器,为自然和医学图像分割提供强大编码器,实现了高效且无需复杂调整的多任务分割性能。

Comments Technical Report

Journal ref Visual Intelligence, Volume 4, article number 2, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17381 2026-02-03 cs.LG cs.CV

Retrospective Feature Estimation for Continual Learning

回顾性特征估计用于持续学习

Nghia D. Nguyen, Hieu Trung Nguyen, Ang Li, Hoang Pham, Viet Anh Nguyen, Khoa D. Doan

机构 * VinUni-Illinois Smart Health Center(VinUni-伊利诺伊州立健康中心) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong(香港中文大学) Simular Research(Simular研究公司) University of Warwick(沃里克大学)

AI总结 本文提出回顾性特征估计方法,通过逆转特征变化来缓解持续学习中的灾难性遗忘问题。

Comments Published in Transactions on Machine Learning Research with Featured Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00413 2026-02-03 stat.ML cs.LG

Alignment of Diffusion Model and Flow Matching for Text-to-Image Generation

扩散模型与流匹配的对齐方法用于文本到图像生成

Yidong Ouyang, Liyan Xie, Hongyuan Zha, Guang Cheng

机构 * Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计学系) Department of Industrial and Systems Engineering, University of Minneasota(明尼苏达大学工业与系统工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

AI总结 本文提出了一种无需微调的对齐框架,通过分数指导和速度指导分别优化扩散模型和流匹配模型,显著降低计算成本并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26313 2026-02-03 cs.CL

One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient

单个标记回滚:通过策略梯度引导大语言模型的监督微调

Rui Ming, Haoyuan Wu, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) ChatEDA Tech(ChatEDA技术公司)

AI总结 通过策略梯度引导监督微调,单个标记回滚(OTR)在多个基准测试中优于标准SFT,展示了on-policy数据对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23128 2026-02-02 cs.LG

Distribution-informed Efficient Conformal Prediction for Full Ranking

基于分布的高效全排名符合预测

Wenbo Liao, Huipeng Huang, Chen Jia, Huajun Xi, Hao Zeng, Hongxin Wei

机构 * Department of Mathematics, Chinese University of Hong Kong(中国香港大学数学系) Department of Statistics and Data Science, Southern University of Science and Technology(南方科技大学统计与数据科学系) School of Computation, Information, and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院)

AI总结 本文提出DCR方法,通过推导非符合分数的精确分布,提高全排名场景中预测集的效率,同时保持有效性覆盖。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22873 2026-02-02 eess.AS cs.AI cs.CL cs.SD

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

EmoShift: 轻量级激活引导用于增强情感感知语音合成

Li Zhou, Hao Jiang, Junjie Li, Tianrui Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学)

AI总结 EmoShift通过轻量级激活引导框架提升情感感知语音合成的情感表达与自然性。

Comments Activation Steering; Emotion-Aware TTS; Speech Synthesis; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22790 2026-02-02 cs.AI math.ST stat.TH

Conditional Performance Guarantee for Large Reasoning Models

基于条件的大型推理模型性能保证

Jianguo Huang, Hao Zeng, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 本文提出G-PAC和C-PAC推理框架,通过分组策略实现组条件风险控制,提升异质环境下推理效率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22746 2026-02-02 cs.ET cs.AI

UrbanMoE: A Sparse Multi-Modal Mixture-of-Experts Framework for Multi-Task Urban Region Profiling

UrbanMoE: 一种用于多任务城市区域刻画的稀疏多模态专家混合框架

Pingping Liu, Jiamiao Liu, Zijian Zhang, Hao Miao, Qi Jiang, Qingliang Li, Qiuzhan Zhou, Irwin King

机构 * Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学) Changchun Normal University(长春师范大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 UrbanMoE提出了一种稀疏多模态专家混合框架,用于解决多任务城市区域刻画问题,通过多模态特征动态路由实现高效预测,提升了城市分析的性能和可重复性。

Comments 12 pages, 6 figures, 5tables, Proceedings of the ACM Web Conference 2026 (WWW '26), April 13--17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21280 2026-02-02 cs.CV

Token Entropy Regularization for Multi-modal Antenna Affiliation Identification

基于令牌熵正则化的多模态天线归属识别

Dong Chen, Ruoyu Li, Xinyan Zhang, Jialei Xu, Ruosen Zhao, Zhikang Zhang, Lingyun Li, Zizhuang Wei

机构 * Huawei(华为) The University of Hong Kong(香港大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出基于令牌熵正则化的多模态天线归属识别方法,通过融合视频、几何特征和PCI信号,提升通信网络优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09133 2026-02-02 cs.AI cs.LG math.ST stat.TH

On the Provable Performance Guarantee of Efficient Reasoning Models

关于高效推理模型的可证明性能保证

Hao Zeng, Jianguo Huang, Bingyi Jing, Hongxin Wei, Bo An

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Southern University of Science(南方科技大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 本文提出PAC推理方法,通过动态切换思考与非思考模式,在用户指定容忍度下控制性能损失,实现高效推理与性能保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12683 2026-02-02 cs.LG cs.CV math.ST stat.TH

TorchCP: A Python Library for Conformal Prediction

TorchCP: 一个用于置信预测的 Python 库

Jianguo Huang, Jianqing Song, Xuanning Zhou, Bingyi Jing, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 TorchCP 是一个基于 PyTorch 的库,旨在将先进的置信预测算法集成到深度学习技术中,提升大规模数据中的不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22708 2026-02-02 cs.LG cs.CL

A Unified Study of LoRA Variants: Taxonomy, Review, Codebase, and Empirical Evaluation

LoRA变体的统一研究:分类、综述、代码库和实证评估

Haonan He, Jingqi Ye, Minglei Li, Zhengbo Wang, Tao Chen, Lei Bai, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文系统研究了LoRA变体,通过分类、理论综述、代码库和实证评估,揭示了LoRA及其变体对学习率的敏感性,并展示了其在多种任务中的性能优势。

Comments Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22575 2026-02-02 cs.CV cs.CL

PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios

PhoStream:面向移动场景的多模态助手实时流基准测试

Xudong Lu, Huankang Guan, Yang Bo, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Peiwen Sun, Xueying Li, Wei Zhang, Xue Yang, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(CUHK 多模态实验室) Huawei Research(华为研究) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03370 2026-02-02 q-bio.QM cs.AI cs.CE

InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions

InstructPLM-mu:在1小时内微调ESM2在蛋白质突变预测中优于ESM3

Junde Xu, Yapin Shi, Lijun Lang, Taoyong Cui, Zhiming Zhang, Guangyong Chen, Jiezhong Qiu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Hangzhou Institute of Medicine, CAS(杭州医学研究所,中国科学院) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究 institute,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学) Tianjin University(天津大学)

AI总结 InstructPLM-mu通过1小时微调ESM2在蛋白质突变预测中超越ESM3,揭示了结构输入对模型性能的关键影响。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05179 2026-02-02 cs.CV

FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation

FlashVideo: 为高效高分辨率视频生成实现流畅的细节保真度

Shilong Zhang, Wenbo Li, Shoufa Chen, Chongjian GE, Peize Sun, Yifu Zhang, Yi Jiang, Zehuan Yuan, Bingyue Peng, Ping Luo

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

AI总结 FlashVideo通过两阶段框架在高效高分辨率视频生成中实现流畅细节保真度,优化计算效率并提升商业应用潜力。

Comments Model and Weight: https://github.com/FoundationVision/FlashVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22010 2026-01-30 cs.LG

Exploring Diverse Generation Paths via Inference-time Stiefel Activation Steering

通过推理时间的Stiefel激活引导探索多样生成路径

Dongxuan Zhu, Ly Tran Ho Khanh, Andy Yat-Ming Cheung, Man-Chung Yue, Viet Anh Nguyen

机构 * The Chinese University of Hong Kong(香港中文大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 STARS通过在推理时间利用Stiefel流形优化,提升语言模型生成路径的多样性,无需训练并在多个基准中表现更优。

Comments 34 pages, 2 figures. Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21750 2026-01-30 cs.LG

FISMO: Fisher-Structured Momentum-Orthogonalized Optimizer

FISMO:基于Fisher信息几何的结构化动量正交化优化器

Chenrui Xu, Wenjing Yan, Ying-Jun Angela Zhang

机构 * Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong(信息工程系,香港中文大学)

AI总结 FISMO优化器通过结合Fisher信息几何和正交化动量更新,在非凸优化中实现结构化预处理,提升训练效率和最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11004 2026-01-30 cs.CV cs.RO

EROAM: Event-based Camera Rotational Odometry and Mapping in Real-time

EROAM:基于事件相机的实时旋转里程计与建图

Wanli Xing, Shijie Lin, Linhan Yang, Zeqing Zhang, Yanjun Du, Maolin Lei, Yipeng Pan, Chen Wang, Jia Pan

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Centre for Transformative Garment Production(转型服装生产中心) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Humanoids and Human Centered Mechatronics Research Line, Istituto Italiano Di Tecnologia (IIT)(人形与以人为核心机电系统研究组,意大利IIT)

AI总结 EROAM通过球形事件表示和ES-ICP框架,实现基于事件相机的实时高精度旋转里程计与建图,提升空间分辨率和计算效率,适用于高速和长序列场景。

Comments Accepted by IEEE Transactions on Robotics (T-RO), 2026. Project page: https://wlxing1901.github.io/eroam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21713 2026-01-30 cs.RO cs.AI

Disentangling perception and reasoning for improving data efficiency in learning cloth manipulation without demonstrations

解构感知与推理以提高无演示学习布料操控的数据效率

Donatien Delehelle, Fei Chen, Darwin Caldwell

机构 * Advanced Robotics, Istituto Italiano di Tecnologia (IIT)(先进机器人技术研究所(IIT)) epartment of Mechanical and Automation Engineering, T-Stone Robotics Institute, The Chinese University of Hong Kong(机械与自动化工程系,腾讯机器人研究院,香港中文大学) University of Genova(热那亚大学)

AI总结 本文提出了一种高效且模块化的强化学习方法,通过减少模型大小和训练时间来提高布料操控学习的数据效率,并在现实世界中实现有效迁移。

Comments 6 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21362 2026-01-30 cs.NI cs.CV cs.MM

ViTMAlis: Towards Latency-Critical Mobile Video Analytics with Vision Transformers

ViTMAlis:面向延迟敏感移动视频分析的视觉变换器

Miao Zhang, Guanzhen Wu, Hao Fang, Yifei Zhu, Fangxin Wang, Ruixiao Zhang, Jiangchuan Liu

机构 * School of Computing Science, Simon Fraser University(计算科学系,西蒙·弗雷泽大学) Global College, Shanghai Jiao Tong University(全球学院,上海交通大学) School of Science and Engineering (SSE) and The Future Network of Intelligence Institute (FNii), The Chinese University of Hong Kong, Shenzhen(科学与工程学院(SSE)和未来智能网络研究所(FNii),香港中文大学(深圳)) Computer Science Department, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

AI总结 ViTMAlis通过动态混合分辨率推理策略和设备到边缘卸载框架,降低移动视频分析的延迟并提升渲染精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21316 2026-01-30 cs.LG cs.AI

Heterogeneous Vertiport Selection Optimization for On-Demand Air Taxi Services: A Deep Reinforcement Learning Approach

异构垂直起降点选择优化用于按需空中出租车服务:一种深度强化学习方法

Aoyu Pang, Maonan Wang, Zifan Sha, Wenwei Yue, Changle Li, Chung Shue Chen, Man-On Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室) State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学集成服务网络国家重点实验室) Nokia Bell Labs(诺基亚贝尔实验室)

AI总结 本文提出一种基于深度强化学习的框架,用于优化空中出租车服务中的垂直起降点选择,提升城市多模式交通系统的效率和整合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20575 2026-01-29 eess.IV cs.CV

SegRap2025: A Benchmark of Gross Tumor Volume and Lymph Node Clinical Target Volume Segmentation for Radiotherapy Planning of Nasopharyngeal Carcinoma

SegRap2025:鼻咽癌放疗计划中GTV和淋巴结临床靶区体积分割的基准测试

Jia Fu, Litingyu Wang, He Li, Zihao Luo, Huamin Wang, Chenyuan Bian, Zijun Gao, Chunbin Gu, Xin Weng, Jianghao Wu, Yicheng Wu, Jin Ye, Linhao Li, Yiwen Ye, Yong Xia, Elias Tappeiner, Fei He, Abdul qayyum, Moona Mazher, Steven A Niederer, Junqiang Chen, Chuanyi Huang, Lisheng Wang, Zhaohu Xing, Hongqiu Wang, Lei Zhu, Shichuan Zhang, Shaoting Zhang, Wenjun Liao, Guotai Wang

机构 * School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(电子科技大学机械与电子工程学院) Department of Radiation Oncology, Sichuan Cancer Center, Radiation Oncology Key Laboratory of Sichuan Province, Sichuan Clinical Research Center for Cancer, Sichuan Cancer Hospital and Institute, University of Electronic Science and Technology of China(四川省肿瘤医院放射肿瘤科) Shanghai AI Lab, Shanghai, China(上海人工智能实验室) The Affiliated Hospital of Qingdao University, Qingdao, China(青岛大学附属医院) Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学计算机科学与工程系) Faculty of Information Technology, Monash University, Melbourne, Australia(墨尔本大学信息科技学院) Department of Computing and Department of Brain Sciences, Imperial College London, United Kingdom(伦敦帝国理工学院计算机系和脑科学系) School of Computer Science and Engineering, Northwestern Polytechnical University, Xi'an, China(西北工业大学计算机科学与工程学院) UMIT Tirol - Private University for Health Sciences and Health Technology, Austria(蒂罗尔大学(私人健康科学与健康技术大学)) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) National Heart and Lung Institute, Imperial College London, London, United Kingdom(伦敦帝国理工学院国家心脏和肺研究所) Hawkes Institute, Department of Computer Science, University College London, London, United Kingdom(伦敦大学学院霍克斯研究所) Shanghai MediWorks Precision Instruments Co., Ltd., China(上海 MediWorks 精密仪器有限公司) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院) Department of Systems Hub, Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科技大学(广州)系统中心)

AI总结 SegRap2025旨在通过多中心、多模态的基准测试提升鼻咽癌放疗计划中GTV和LN CTV分割的通用性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20326 2026-01-29 cs.CL cs.AI cs.LG

Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning

超越加速 -- 利用KV缓存进行采样与推理

Zeyu Xing, Xing Li, Hui-Ling Zhen, Mingxuan Yuan, Sinno Jialin Pan

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出将KV缓存作为轻量级表示用于采样与推理,展示了其在链式嵌入和快速/缓慢思考切换任务中的有效性,显著提升了推理效率。

Comments Accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20300 2026-01-29 cs.CL eess.AS

MiLorE-SSL: Scaling Multilingual Capabilities in Self-Supervised Models without Forgetting

MiLorE-SSL: 在不遗忘的前提下扩展多语言能力的自监督模型

Jing Xu, Minglin Wu, Xueyuan Chen, Xixin Wu, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 MiLorE-SSL通过结合LoRA和软MoE机制,实现高效多语言自监督学习,有效缓解遗忘问题,仅用2.14%参数在新语言上取得优异表现。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏