arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2603.28068 2026-04-01 cs.CV

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28575 2026-03-31 cs.LG cs.AI

ChemCLIP: Bridging Organic and Inorganic Anticancer Compounds Through Contrastive Learning

ChemCLIP:通过对比学习弥合有机和无机抗癌化合物的鸿沟

Mohamad Koohi-Moghadam, Hongzhe Sun, Hongyan Li, Kyongtae Tyler Bae

机构 * Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院) Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Chemistry, The University of Hong Kong(香港大学化学系)

AI总结 本文提出ChemCLIP框架,通过对比学习统一有机和无机抗癌化合物的表示,利用共享抗癌活性而非结构相似性,提升跨领域化学知识迁移能力。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28152 2026-03-31 cs.CV

ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGS Models

ObjectMorpher: 通过可变形3DGS模型实现3D感知的图像编辑

Yuhuan Xie, Aoxuan Pan, Yi-Hua Huang, Chirui Chang, Peng Dai, Xin Yu, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学)

AI总结 ObjectMorpher通过可变形3DGS模型实现3D感知图像编辑,提供精确的物体级控制,支持快速且保持身份的编辑,优于2D拖拽和3D感知基线。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28126 2026-03-31 cs.CV

SVGS: Single-View to 3D Object Editing via Gaussian Splatting

SVGS: 通过高斯散射实现单视图到3D物体编辑

Pengcheng Xue, Yan Tian, Qiutao Song, Ziyi Wang, Linyang He, Weiping Ding, Mahmoud Hassaballah, Karen Egiazarian, Wei-Fa Yang, Leszek Rutkowski

机构 * School of Computer Science and Technology, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(浙江省大数据与未来电子商务技术重点实验室) Jianpei Technology Co., Ltd.(建培科技有限公司) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) Department of Computer Science, College of Computer Engineering and Sciences, Prince Sattam Bin Abdulaziz University(沙特本·阿卜杜勒阿齐兹王子大学计算机工程与科学学院计算机科学系) Department of Computer Science, Faculty of Computers and Information, Qena University(基纳大学计算机与信息学院计算机科学系) Department of Computing Sciences, Faculty of Information Technology and Communication Sciences, Tampere University(坦佩雷大学信息技术与通信科学学院计算科学系) Division of Oral and Maxillofacial Surgery, Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院口腔颌面外科) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(AGH科技大学) SAN University(SAN大学)

AI总结 本文提出SVGS方法,通过单视图文本驱动编辑和稀疏3D高斯散射提升3D编辑效率与一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27813 2026-03-31 cs.CV

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

MuSEAgent:一种具有状态化经验的多模态推理代理

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, Zongyuan Ge

机构 * Southeast University(东南大学) Monash University(莫纳什大学) Xiaohongshu Inc.(小红书) Shanghai Jiao Tong University(上海交通大学) University of Hong Kong(香港大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学)

AI总结 MuSEAgent通过引入状态化经验学习范式,提升多模态推理代理的决策能力,其通过 hindsight reasoning 抽象交互数据为原子决策经验,并在推理时进行质量过滤的经验检索,实验表明其在细粒度视觉感知和复杂多模态推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27558 2026-03-31 cs.CV

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27460 2026-03-31 cs.CV cs.AI

Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development

Project Imaging-X:1000多个开放访问医学影像数据集的调查

Zhongying Deng, Cheng Tang, Ziyan Huang, Jiashi Lin, Ying Chen, Junzhi Ning, Chenglong Ma, Jiyao Liu, Wei Li, Yinghao Zhu, Shujian Gao, Yanyan Huang, Sibo Ju, Yanzhou Su, Pengcheng Chen, Wenhao Tang, Tianbin Li, Haoyu Wang, Yuanfeng Ji, Hui Sun, Shaobo Min, Liang Peng, Feilong Tang, Haochen Xue, Rulin Zhou, Chaoyang Zhang, Wenjie Li, Shaohao Rui, Weijie Ma, Xingyue Zhao, Yibin Wang, Kun Yuan, Zhaohui Lu, Shujun Wang, Jinjie Wei, Lihao Liu, Dingkang Yang, Lin Wang, Yulong Li, Haolin Yang, Yiqing Shen, Lequan Yu, Xiaowei Hu, Yun Gu, Yicheng Wu, Benyou Wang, Minghui Zhang, Angelica I. Aviles-Rivero, Qi Gao, Hongming Shan, Xiaoyu Ren, Fang Yan, Hongyu Zhou, Haodong Duan, Maosong Cao, Shanshan Wang, Bin Fu, Xiaomeng Li, Zhi Hou, Chunfeng Song, Lei Bai, Yuan Cheng, Yuandong Pu, Xiang Li, Wenhai Wang, Hao Chen, Jiaxin Zhuang, Songyang Zhang, Huiguang He, Mengzhang Li, Bohan Zhuang, Zhian Bai, Rongshan Yu, Liansheng Wang, Yukun Zhou, Xiaosong Wang, Xin Guo, Guanbin Li, Xiangru Lin, Dakai Jin, Mianxin Liu, Wenlong Zhang, Qi Qin, Conghui He, Yuqiang Li, Ye Luo, Nanqing Dong, Jie Xu, Wenqi Shao, Bo Zhang, Qiujuan Yan, Yihao Liu, Jun Ma, Zhi Lu, Yuewen Cao, Zongwei Zhou, Jianming Liang, Shixiang Tang, Qi Duan, Dongzhan Zhou, Chen Jiang, Yuyin Zhou, Yanwu Xu, Jiancheng Yang, Shaoting Zhang, Xiaohong Liu, Siqi Luo, Yi Xin, Chaoyu Liu, Haochen Wen, Xin Chen, Alejandro Lozano, Min Woo Sun, Yuhui Zhang, Yue Yao, Xiaoxiao Sun, Serena Yeung-Levy, Xia Li, Jing Ke, Chunhui Zhang, Zongyuan Ge, Ming Hu, Jin Ye, Zhifeng Li, Yirong Chen, Yu Qiao, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Institute of Optics and Fine Mechanics(上海光学精密机械研究所) Fudan University(复旦大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Fuzhou University(福州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Incept Labs Monash University(莫纳什大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Alibaba DAMO Academy(阿里巴巴达摩院) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与产业研究院) Shanghai Academy of Artificial Intelligence for Science(上海科学智能研究院) Nankai University(南开大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) School of Informatics, Xiamen University(厦门大学信息学院) University College London(伦敦大学学院) Sun Yat-sen University(中山大学) Alibaba Group, DAMO Academy, New York, NY, USA(阿里巴巴集团达摩院(纽约)) Tongji University(同济大学) University of Toronto(多伦多大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) Academy for Clinical Innovation and Translation of Shanghai(上海临床创新转化研究院) University of California, Santa Cruz(加州大学圣克鲁兹分校) ELLIS Institute Finland(芬兰ELLIS研究所) Aalto University(阿尔托大学) Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文调查了1000多个开放访问医学影像数据集,揭示了其规模小、任务碎片化和分布不均的问题,并提出元数据驱动融合方法和交互发现门户,为医学影像数据集的整合和基础模型发展提供路线图。

Comments 157 pages, 19 figures, 26 tables. Project repo: \url{https://github.com/uni-medical/Project-Imaging-X}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14903 2026-03-31 cs.CL

ExPosST: Explicit Positioning with Adaptive Masking for LLM-Based Simultaneous Machine Translation

ExPosST:基于自适应掩码的LLM同时机器翻译显式定位

Yuzhe Shang, Pengzhi Gao, Yazheng Yang, Jiayao Ma, Wei Liu, Jian Luan, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队) The University of Hong Kong(香港大学)

AI总结 ExPosST通过显式位置分配解决LLM在同时机器翻译中的位置不匹配问题,实现高效解码与位置一致性,支持多种策略下的同时翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14498 2026-03-31 cs.RO cs.CV

R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation

R3DP:实时3D感知策略用于具身操作

Yuhao Zhang, Wanxi Dong, Yue Shi, Yi Liang, Jingnan Gao, Qiaochu Yang, Yaxing Lyu, Zhixuan Liang, Yibin Liu, Congsheng Xu, Xianda Guo, Wei Sui, Yaohui Jin, Xiaokang Yang, Yanyan Xu, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) D-Robotics(地平线机器人) Southern University of Science and Technology(南方科技大学) Xspark AI(星火科技) The University of Hong Kong(香港大学) Wuhan University(武汉大学) Xiamen University Malaysia(厦门大学马来西亚分校) Northeastern University(东北大学)

AI总结 R3DP通过异步快慢协作模块整合大尺度3D先验知识,提升实时操作性能,实验显示在成功率和推理时间上均优于现有方法。

Comments Project Page: https://dazazh.github.io/r3dp-project-page/ Github Repo: https://github.com/dazazh/R3DP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07738 2026-03-31 cs.LG cs.CV

From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练

Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学)

AI总结 本文提出一种两阶段熵优化方法,通过探索阶段提升输出多样性,利用阶段提高预测准确性,增强噪声容忍能力,实验证明在不同模型和任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08096 2026-03-31 cs.RO cs.AI cs.ET cs.LG

Hybrid Action Based Reinforcement Learning for Multi-Objective Compatible Autonomous Driving

基于混合动作的多目标兼容自动驾驶强化学习

Guizhe Jin, Zhuoren Li, Bo Leng, Wei Han, Lu Xiong, Chen Sun

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) Department of Data and Systems Engineering, University of Hong Kong(香港大学数据与系统工程系)

AI总结 本文提出一种多目标集成-批评强化学习方法,通过混合参数化动作空间结构和不确定性探索机制,提升自动驾驶在多目标兼容性、效率和安全性方面的性能。

Comments 14 pages, accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (T-NNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21086 2026-03-31 cs.CV cs.AI

Efficient Mixture-of-Expert for Video-based Driver State and Physiological Multi-task Estimation in Conditional Autonomous Driving

高效多专家模型用于基于视频的驾驶员状态和生理多任务估计在条件自动驾驶中

Jiyao Wang, Xiao Yang, Zhenyu Wang, Ximeng Wei, Ange Wang, Dengbo He, Kaishun Wu

机构 * the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Hong Kong(香港大学)

AI总结 本文提出VDMoE模型,通过RGB视频和远程PPG数据监测驾驶员状态,优化多专家框架以提升多模态输入下的检测效率与准确性,通过新数据集验证其在条件自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25823 2026-03-30 cs.CV cs.AI

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

ViGoR-Bench:视觉生成模型距离零样本视觉推理还有多远?

Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出ViGoR-Bench基准,通过跨模态覆盖、双轨评估、证据驱动裁判和细粒度分析,揭示生成模型在因果推理和空间认知上的缺陷,验证了先进模型在零样本推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25745 2026-03-27 cs.CV

Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting

更少高斯,纹理更多:4K前馈纹理散射

Yixing Lao, Xuyang Bai, Xiaoyang Wu, Nuoyuan Yan, Zixin Luo, Tian Fang, Jean-Daniel Nahmias, Yanghai Tsin, Shiwei Li, Hengshuang Zhao

机构 * HKU(香港大学) Apple(苹果公司)

AI总结 本文提出LGTM方法,通过预测紧凑高斯体与每体纹理,实现高分辨率4K视图合成,无需场景优化,显著减少高斯体数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25607 2026-03-27 cs.CV cs.AI

DeepFAN, a transformer-based deep learning model for human-artificial intelligence collaborative assessment of incidental pulmonary nodules in CT scans: a multi-reader, multi-case trial

DeepFAN,一种基于transformer的深度学习模型,用于人类-人工智能协作评估CT扫描中的偶发性肺结节:多读者、多病例试验

Zhenchen Zhu, Ge Hu, Weixiong Tan, Kai Gao, Chao Sun, Zhen Zhou, Kepei Xu, Wei Han, Meixia Shang, Xiaoming Qiu, Yiqing Tan, Jinhua Wang, Zhoumeng Ying, Li Peng, Wei Song, Lan Song, Zhengyu Jin, Nan Hong, Yizhou Yu

机构 * Department of Radiology, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院北京协和医学院北京协和医院放射科,疑难重症及罕见病国家重点实验室) Theranostics and Translational Research Center, National Infrastructures for Translational Medicine, Institute of Clinical Medicine, State Key Laboratory of Complex Severe and Rare Diseases, Peking Union Medical College Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院北京协和医学院北京协和医院临床医学研究所,国家转化医学基础设施,诊疗与转化研究中心,疑难重症及罕见病国家重点实验室) Artificial Intelligence Lab, Deepwise Healthcare(深睿医疗人工智能实验室) Department of Epidemiology and Health Statistics, Institute of Basic Medicine Sciences, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院基础医学研究所流行病学与卫生统计学系) Department of Biostatistics, Peking University First Hospital(北京大学第一医院生物统计室) Department of Radiology, Huangshi Central Hospital, Affiliated Hospital of Hubei Polytechnic University(湖北理工学院附属医院黄石市中心医院放射科) Department of Radiology, Wuhan Third Hospital, Tongren Hospital of Wuhan University(武汉大学同仁医院武汉市第三医院放射科) +4 Medical Doctor Program, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院4+4医学博士项目) Department of Medicine Imaging, School of Clinical Medicine, Southwest Medical University(西南医科大学临床医学院医学影像系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 本文提出DeepFAN模型,通过多读者多病例试验验证其在辅助初级放射科医生评估肺结节方面的有效性,提升了诊断准确率和一致性。

Comments 28 pages for main text and 37 pages for supplementary information, 7 figures in main text and 9 figures in supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25580 2026-03-27 cs.CV

UNIC: Neural Garment Deformation Field for Real-time Clothed Character Animation

UNIC:基于神经变形场的神经服装变形用于实时穿衣角色动画

Chengfeng Zhao, Junbo Qi, Yulou Liu, Zhiyang Dou, Minchen Li, Taku Komura, Ziwei Liu, Wenping Wang, Yuan Liu

机构 * HKUST(香港科技大学) Waseda(早稻田大学) MIT(麻省理工学院) CMU(卡内基梅隆大学) HKU(香港大学) NTU(南洋理工大学) TAMU(德克萨斯农工大学)

AI总结 本文提出UNIC方法,通过实例特定的神经变形场实时动画角色服装,无需泛化到新服装,提升变形质量和训练效率。

Comments Project page: https://igl-hkust.github.io/UNIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25319 2026-03-27 cs.CV

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

MACRO:通过结构化长上下文数据推进多参考图像生成

Zhekai Chen, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

AI总结 本文提出MACRO数据集和基准,解决多参考图像生成中参考数量增加导致性能下降的问题,通过结构化长上下文数据提升生成质量。

Comments Project Page: https://macro400k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00216 2026-03-27 cs.CL

From Evidence-Based Medicine to Knowledge Graph: Retrieval-Augmented Generation for Sports Rehabilitation and a Domain Benchmark

从循证医学到知识图谱:面向体育康复的检索增强生成及领域基准

Jinning Zhang, Jie Song, Wenhui Tu, Zecheng Li, Jingxuan Li, Jin Li, Xuan Liu, Taole Sha, Zichen Wei, Yan Li

机构 * Beijing Key Laboratory of Sports Performance and Skill Assessment, Beijing Sport University(北京体育大学北京市运动表现与技能评估重点实验室) Department of Exercise Physiology, School of Sport Science, Beijing Sport University(北京体育大学运动科学学院运动生理学教研室) School of Sport Medicine and Physical Therapy, Beijing Sport University(北京体育大学运动医学与康复学院) Rehabilitation Center, Beijing Rehabilitation Hospital(北京康复医院康复中心) Optum Care Washington School of Management, Beijing Sport University(北京体育大学管理学院) Department of Statistics and Actuarial Science, The University of Hong Kong(香港大学统计与精算学系)

AI总结 本文提出SR-RAG框架,结合PICO框架构建知识图谱并改进检索,引入贝叶斯证据层级重排序方法,通过体育康复验证,释放包含357844个节点和371226条边的知识图谱及1637个问答对基准,显著优于基线模型。

Comments 18 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21764 2026-03-27 cs.LG cs.AI

Adaptive Online Mirror Descent for Tchebycheff Scalarization in Multi-Objective Learning

自适应在线镜像下降法用于多目标学习中的切比雪夫标量化

Meitong Liu, Xiaoyuan Zhang, Chulin Xie, Kate Donahue, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

AI总结 本文提出自适应在线镜像下降算法(AdaOMD-TCH),用于多目标学习中的切比雪夫标量化,通过自适应在线到批量转换提升解的最优性,实现$\mathcal O(\sqrt{\log m/T})$收敛速度。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23864 2026-03-26 cs.CV

See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning

看见、记忆、探索:面向流式空间推理的基准与基线

Yuxi Wei, Wei Huang, Qirui Chen, Lu Hou, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出S3-Bench基准,通过流式空间问答与主动探索解决传统方法在长时序推理和主动感知方面的不足,并提出AMF-VLM模型在压缩内存与主动探索方面实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23729 2026-03-26 cs.CV

Bi-CRCL: Bidirectional Conservative-Radical Complementary Learning with Pre-trained Foundation Models for Class-incremental Medical Image Analysis

Bi-CRCL:基于预训练基础模型的双向保守-激进互补学习用于类别增量医疗图像分析

Xinyao Wu, Zhe Xu, Cheng Chen, Jiawei Ma, Yefeng Zheng, Raymond Kai-yu Tong

机构 * Department of Biomedical Engineering, The Chinese University of Hong Kong(生物医学工程系,香港中文大学) Department of Radiation Oncology, Columbia University Irving Medical Center and Data Science Institute, Columbia University(放射肿瘤学系,哥伦比亚大学伊万杰琳医学中心及数据科学研究院,哥伦比亚大学) Department of Electrical and Electronic Engineering and School of Biomedical Engineering, The University of Hong Kong(电气电子工程系和生物医学工程学院,香港大学) Department of Computer Science, City University of Hong Kong(计算机科学系,城市大学) Department of Artificial Intelligence, Westlake University(人工智能系,西湖大学)

AI总结 本文提出Bi-CRCL框架,通过保守和激进学习者结合双向交互机制,解决医疗图像类别增量学习中的异构数据与隐私约束问题,提升模型持续学习能力。

Comments preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09195 2026-03-26 cs.CL cs.AI

ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection

ProFit:通过概率引导的标记选择利用SFT中的高价值信号

Tao Liu, Taiqiang Wu, Runming Yang, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 ProFit通过概率引导的标记选择策略,有效缓解SFT中单参考答案导致的过拟合问题,提升模型在通用推理和数学任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14997 2026-03-26 q-fin.RM cs.AI cs.LG

A Comprehensive Survey on Enterprise Financial Risk Analysis from Big Data and LLMs Perspective

面向大数据和大语言模型的企业财务风险分析综述

Huaming Du, Cancan Feng, Yuqian Lei, Chenyang Zhang, Guisong Liu, Gang Kou, Carl Yang, Yu Zhao

机构 * Southwestern University of Finance and Economics(西南财经大学) Chengdu University(成都大学) Universität Hamburg(汉堡大学) The University of Hong Kong(香港大学) Hunan University of Technology and Business(湖南工业大学) Xiangjiang Laboratory(湘江实验室) Emory University(埃默里大学)

AI总结 本文从大数据和大语言模型视角综述企业财务风险分析,系统梳理现有方法,总结研究方法与关键发现,指出当前局限并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏