arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2603.11647 2026-03-16 cs.MM cs.CV cs.SD

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing:释放实时联合音频视觉生成

Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索学院) Fudan University(复旦大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23790 2026-03-16 cs.CV

Fourier Angle Alignment for Oriented Object Detection in Remote Sensing

基于傅里叶角对齐的遥感定向目标检测

Changyu Gu, Linwei Chen, Lin Gu, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) University of Hong Kong(香港大学) Tohoku University(东北大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心)

AI总结 本文提出傅里叶角对齐方法,通过频谱分析角度信息并对其对齐,提升遥感中旋转目标检测的性能,实验显示在DOTA数据集上取得新的SOTA结果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03222 2026-03-16 cs.CV

Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

Mocap-2-to-3:多视角提升用于单目运动恢复的2D预训练

Zhumei Wang, Zechen Hu, Ruoxi Guo, Huaijin Pi, Ziyong Feng, Liang Zhang, Mingtao Pei, Siyuan Huang

机构 * Beijing Institute of Technology(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) Deep Glint Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shandong Agricultural University(山东农业大学)

AI总结 本文提出Mocap-2-to-3框架,通过多视角合成过程和分阶段训练提升单目运动恢复的精度与泛化能力,实现更精确的物理空间定位。

Comments Project page: https://wangzhumei.github.io/mocap-2-to-3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12257 2026-03-13 cs.CV

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12026 2026-03-13 cs.LG

Efficient Generative Modeling with Unitary Matrix Product States Using Riemannian Optimization

利用Riemannian优化的单位矩阵积态高效生成建模

Haotong Duan, Zhongming Chen, Ngai Wong

机构 * Department of Mathematics, School of Sciences, Hangzhou Dianzi University(数学系,信息工程学院,杭州电子科技大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学)

AI总结 本文提出利用Riemannian优化方法,通过单位ary MPS提升生成建模的效率和性能,实验表明其在数据适应性和稳定性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20058 2026-03-13 math.NA cs.LG cs.NA

Deep Eigenspace Network for Parametric Non-self-adjoint Eigenvalue Problems

深度特征空间网络用于参数非自 adjoint 特征值问题

H. Li, J. Sun, Z. Zhang

机构 * Department of Mathematics, The University of Hong Kong(香港大学数学系) Department of Mathematical Sciences, Michigan Technological University(密歇根理工大学数学科学系) Materials Innovation Institute for Life Sciences and Energy (MILES), HKU-SIRI(生命科学与能源材料创新研究院(MILES),HKU-SIRI)

AI总结 本文提出深度特征空间网络DEN,用于高效求解参数非自 adjoint 特征值问题,通过整合傅里叶神经运算符、几何自适应POD基底和显式带状交叉模式混合机制,证明了特征空间的Lipschitz连续性并推导了特征值误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26796 2026-03-13 cs.CV cs.GR

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10220 2026-03-12 cs.CV cs.AI cs.RO

Robotic Ultrasound Makes CBCT Alive

机器人超声使CBCT活起来

Feng Li, Ziyuan Li, Zhongliang Jiang, Nassir Navab, Yuan Bi

机构 * Chair for Computer-Aided Medical Procedures and Augmented Reality, Technical University of Munich(计算机辅助医学程序与增强现实 chair,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) The University of Hong Kong(香港大学)

AI总结 利用机器人超声实现动态CBCT更新,通过实时估计组织变形提升手术导航精度

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10125 2026-03-12 cs.CV

4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video

4DEquine:从单目视频中解耦运动与外观进行4D马类重建

Jin Lyu, Liang An, Pujin Cheng, Yebin Liu, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 4DEquine通过解耦运动与外观重建,提出新框架实现高效4D马类重建,展示在真实数据集上的优越性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10028 2026-03-12 cs.CY cs.AI

How to Count AIs: Individuation and Liability for AI Agents

如何计算AI:AI代理的个体化与责任归属

Yonathan Arbel, Peter Salib, Simon Goldstein

机构 * University of Alabama(阿拉巴马大学) University of Hong Kong(香港大学) University of Houston(休斯顿大学) HKU AI & Humanity Lab(香港大学AI与人类实验室) Center for Law & AI Risk(法律与人工智能风险中心) Institute for Law & AI(法律与人工智能研究所)

AI总结 本文提出通过‘算法公司’解决AI代理的个体识别与责任归属问题,通过法律虚构实体实现对AI行为的追踪与责任划分。

Comments 36 pages. Presented at the Law Following AI conference, Cambridge University. Interdisciplinary: AI safety, AI governance, legal theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19498 2026-03-12 cs.LG cs.AI cs.CR

Hierarchical Dual-Strategy Unlearning for Biomedical and Healthcare Intelligence Using Imperfect and Privacy-Sensitive Medical Data

层次化双策略去学习用于生物医学与医疗智能的不完美和隐私敏感医疗数据

Yi Zhang, Chao Zhang, Zijian Li, Tianxiang Xu, Kunyu Zhang, Zhan Gao, Meinuo Li, Xiaohan Zhang, Qichao Qi, Bing Chen

机构 * Department of Neurosurgery, Qilu Hospital of Shandong University and Institute of Brain and Brain-Inspired Science(齐鲁医院山东大学神经外科和脑科学与脑启发科学研究院) Department of Neurosurgery, The Affiliated Hospital of Qingdao University(青岛大学附属医院神经外科) Department of Neurosurgery, Peking Union Medical College Hospital(北京地坛医院神经外科) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) College of Artificial Intelligence, Dalian Maritime University(大连海事大学人工智能学院) University of Colorado Boulder(科罗拉多大学波尔德分校) Zhengzhou University(郑州大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出层次化双策略去学习框架,用于在医疗数据中精确移除专业性知识并保留基本医疗能力,同时保障隐私并满足合规要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01068 2026-03-11 cs.RO cs.LG

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

制定你的策略!通过测试时的分布级组合改进扩散型或流型机器人策略

Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo

机构 * The University of Hong Kong(香港大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究提出无需训练的通用策略组合方法,通过测试时分布级组合提升机器人策略性能。

Comments Accepted to ICLR 2026. Project Page: https://sagecao1125.github.io/GPC-Site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01941 2026-03-10 cs.RO

FreeTacMan: Robot-free Visuo-Tactile Data Collection System for Contact-rich Manipulation

FreeTacMan: 无需机器人的人工智能视觉-触觉数据采集系统用于接触密集的 manipulation

Longyan Wu, Checheng Yu, Jieji Ren, Li Chen, Yufei Jiang, Ran Huang, Guoying Gu, Hongyang Li

机构 * Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai University(上海大学)

AI总结 FreeTacMan 提出了一种无需机器人的视觉-触觉数据采集系统,通过可穿戴抓取器和高精度光学跟踪系统,实现了高效的数据收集和多模态数据集的构建,推动了机器人 manipulation 的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08055 2026-03-10 cs.CV cs.AI

Speed3R: Sparse Feed-forward 3D Reconstruction Models

Speed3R: 稀疏前馈3D重建模型

Weining Ren, Xiao Tan, Kai Han

机构 * The University of Hong Kong(香港大学) Baidu AMU(百度AMU)

AI总结 Speed3R通过稀疏关键点匹配机制实现高效3D重建,以12.4倍速度提升推理效率,同时保持几何精度。

Comments CVPR 2026 Findings, project page: https://visual-ai.github.io/speed3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07787 2026-03-10 cs.LG

Vision Transformers that Never Stop Learning

永不停止学习的视觉变换器

Caihao Sun, Mingqi Yuan, Shiyuan Wang, Jiayu Chen

机构 * University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学) Technische Universität Dresden(德累斯顿理工大学) INFIFORCE

AI总结 本文提出ARROW优化器,通过自适应调整梯度方向,有效提升视觉变换器的持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07663 2026-03-10 cs.RO

DAISS: Phase-Aware Imitation Learning for Dual-Arm Robotic Ultrasound-Guided Interventions

DAISS:面向双臂机器人超声引导干预的相位感知模仿学习

Feng Li, Pei Liu, Shiting Wang, Ning Wang, Zhongliang Jiang, Nassir Navab, Yuan Bi

机构 * Chair for Computer Aided Medical Procedures(CAMP), Technical University of Munich(TUM)(计算机辅助医疗程序主席职位(CAMP),慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) The University of Hong Kong(HKU)(香港大学)

AI总结 DAISS通过相位感知模仿学习实现双臂机器人在超声引导干预中的精准操作,减少认知负担。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07552 2026-03-10 cs.CV cs.RO

ReconDrive: Fast Feed-Forward 4D Gaussian Splatting for Autonomous Driving Scene Reconstruction

ReconDrive: 用于自动驾驶场景重建的快速前馈4D高斯点扩散

Haibao Yu, Kuntao Xiao, Jiahang Wang, Ruiyang Hao, Yuxin Huang, Guoran Hu, Haifang Qin, Bowen Jing, Yuntian Bo, Ping Luo

机构 * Tuojing Intelligence The University of Hong Kong(香港大学) King's College London(伦敦国王学院) The University of Sydney(悉尼大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 ReconDrive通过改进的4D高斯点扩散方法,在自动驾驶场景重建中实现高效高保真生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07393 2026-03-10 cs.RO cs.SY eess.SY

Underwater Embodied Intelligence for Autonomous Robots: A Constraint-Coupled Perspective on Planning, Control, and Deployment

水下具身智能:一种约束耦合视角下的规划、控制与部署

Jingzehua Xu, Guanwen Xie, Jiwei Tang, Shuai Zhang, Xiaofan Li

机构 * Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

AI总结 本文提出一种约束耦合视角下的水下具身智能方法,探讨了规划、控制与部署中的紧密耦合约束,旨在实现更可靠和可扩展的自主性。

Comments This article is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13810 2026-03-10 cs.LG cs.AI

Mean Flow Policy with Instantaneous Velocity Constraint for One-step Action Generation

具有瞬时速度约束的一步动作生成均流策略

Guojian Zhan, Letian Tao, Pengcheng Wang, Yixiao Wang, Yiheng Li, Yuxin Chen, Hongyang Li, Masayoshi Tomizuka, Shengbo Eben Li

机构 * School of Vehicle and Mobility & College of AI, Tsinghua University(车辆与移动学院及人工智能学院,清华大学) Berkeley AI Research (BAIR), UC Berkeley(伯克利人工智能研究(BAIR),加州大学伯克利分校) The University of Hong Kong(香港大学)

AI总结 本文提出均速度策略(MVP),通过引入瞬时速度约束来提升动作生成效率,实现高效的一步动作生成并在机器人操作任务中取得最佳性能。

Comments ICLR Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23932 2026-03-10 cs.CL

SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving

SwingArena: 用于长上下文GitHub问题解决的竞争性编程竞技场

Wendong Xu, Jing Xiong, Chenyang Zhao, Qiujiang Chen, Haoran Wang, Hui Shen, Zhongwei Wan, Jianbo Dai, Taiqiang Wu, He Xiao, Chaofan Tao, Z. Morley Mao, Ying Sheng, Zhijiang Guo, Hongxia Yang, Bei Yu, Lingpeng Kong, Quanquan Gu, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of California Los Angeles(加州大学洛杉矶分校) Tsinghua University(清华大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) The Ohio State University(俄亥俄州立大学) University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LMSYS Org(LMSYS组织)

AI总结 SwingArena是一个用于评估LLM在真实CI驱动软件开发环境中性能的竞争性编程竞技场,通过模拟软件迭代过程,结合检索增强型代码生成模块,实现对长上下文问题的高效处理。

Comments The paper has been accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19747 2026-03-10 cs.CL cs.AR

HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture

HaLoRA: 基于混合计算-内存架构的硬件感知低秩适应法用于大型语言模型

Taiqiang Wu, Chenchen Ding, Wenyong Zhou, Yuxin Cheng, Xincheng Feng, Shuqi Wang, Wendong Xu, Chufan Shi, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 HaLoRA通过在混合计算-内存架构中部署低秩适应,利用RRAM和SRAM实现高效能和高精度的LLM微调。

Comments 22 pages, Accepted by TODAES (ACM Transactions on Design Automation of Electronic Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15163 2026-03-10 cs.LG stat.ML

The Exploration of Error Bounds in Classification with Noisy Labels

在噪声标签下分类中误差界限的探索

Haixia Liu, Boxiao Li, Can Yang, Yang Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) School of Mathematics and Statistics(数学与统计学学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学)

AI总结 本文研究了噪声标签下深度学习分类中的误差界限,通过分解统计误差和近似误差,提出理论分析方法以提高分类性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00643 2026-03-10 cs.CV

Position: Evaluation of Visual Processing Should Be Human-Centered, Not Metric-Centered

位置:视觉处理的评估应以人类为中心,而非以指标为中心

Jinfan Hu, Fanghua Yu, Zhiyuan You, Xiang Yin, Hongyu An, Xinqi Lin, Chao Dong, Jinjin Gu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) The University of Hong Kong(香港大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱孟·奥赫里迪斯』) Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong(香港中文大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文主张视觉处理评估应转向以人类为中心的方法,强调情境感知和细致评估,以更准确反映人类感知和用户需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11165 2026-03-10 cs.CV

Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning

Traffic-MLLM: 基于好奇心正则化的交通场景案例推理监督学习

Waikit Xiu, Qiang Lu, Bingchen Liu, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学) University of Bristol(布里斯托大学)

AI总结 Traffic-MLLM通过好奇心驱动的结构化案例学习,提升多模态交通场景推理的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05578 2026-03-09 cs.SE cs.AI

Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent

Tool-Genesis: 一种以任务为导向的工具创建基准,用于自进化语言代理

Bowei Xia, Mengkang Hu, Shijian Wang, Jiarui Jin, Wenxiang Jiao, Yuan Lu, Kexin Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司)

AI总结 Tool-Genesis提出一种任务驱动的工具创建基准,用于评估自进化语言代理在无预定义规范下构建任务相关工具的能力及下游性能。

Comments 25 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00543 2026-03-09 cs.CV

Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark

跨尺度 pansharpening 通过 ScaleFormer 和 PanScale 数据集

Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 本文提出 ScaleFormer 架构和 PanScale 数据集,通过跨尺度 pansharpening 方法提升多尺度场景下的图像融合质量与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04461 2026-03-09 cs.CV

UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing

UniTS:面向遥感的统一时空生成模型

Yuxiang Zhang, Shunlin Liang, Wenyuan Li, Han Ma, Jianglei Xu, Yichuan Ma, Jiangwei Xie, Wei Li, Mengmeng Zhang, Ran Tao, Xiang-Gen Xia

机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) Department of Geography, the University of Hong Kong(香港大学地理系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)

AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05369 2026-03-06 cs.CL

Progressive Residual Warmup for Language Model Pretraining

逐步残差预热用于语言模型预训练

Tianhao Chen, Xin Xu, Lu Yin, Hao Chen, Yang Wang, Shizhe Diao, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) NVIDIA, Santa Clara, US(NVIDIA公司) The University of Hong Kong, Hong Kong, China(香港大学) University of Surrey, Guildford, UK(萨里大学)

AI总结 ProRes通过逐步残差预热方法提升语言模型预训练的稳定性与收敛速度,实现更快的收敛和更好的性能

详情

展开后加载摘要…

URL PDF HTML 收藏