arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1508
2603.16130 2026-07-03 cs.CV 版本更新

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法

Zhiwei Wang, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam

机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)

AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03178 2026-07-03 cs.LG cs.RO

RADE: Learning Risk-Adjustable Driving Environment via Multi-Agent Conditional Diffusion

RADE:通过多智能体条件扩散学习风险可调整的驾驶环境

Jiawei Wang, Xintao Yan, Yao Mu, Haowei Sun, Zhong Cao, Henry X. Liu

机构 * Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Department of Computer Science, University of Hong Kong(香港大学计算机科学系) University of Michigan Transportation Research Institute(密歇根大学交通研究研究院)

AI总结 RADE通过多智能体条件扩散模型生成真实且可控风险的驾驶场景,直接从数据学习风险条件行为,提升自动驾驶安全评估的现实性和可扩展性。

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00712 2026-07-02 cs.CV cs.MM 新提交

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

面向内存高效的自回归视频生成:基于实例特定参数吸收

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) The University of Hong Kong(香港大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00620 2026-07-02 cs.CV cs.AI 新提交

Identifying Latent Concepts and Structures for Generalized Category Discovery

识别潜在概念与结构以实现广义类别发现

Boyang Dai, Chaoqi Chen, Yizhou Yu

机构 * The University of Hong Kong(香港大学) Shenzhen University(深圳大学)

AI总结 提出组合基元场(CPF-GCD)框架,通过低秩组合组织重塑特征空间,使潜在结构可识别,从而提升广义类别发现性能。

Comments This paper has been accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00090 2026-07-02 cs.CV cs.AI 新提交

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

迷失在尾部:解决城市视觉地点识别中的地理不平衡问题

Zhiyao Shu, Jiacheng Yang, Yang Lu, Waishan Qiu, Chuan Li, Da Chen

机构 * George Mason University(乔治梅森大学) Xiamen University(厦门大学) University of Hong Kong(香港大学) Lambda University of Bath(巴斯大学)

AI总结 针对城市级视觉地点识别中数据长尾分布导致模型偏向频繁拍摄区域的问题,提出分布感知地点识别(DAPR)框架,通过重平衡梯度贡献和多尺度距离搜索机制,在SF-XL等基准上显著提升性能。

Comments Accepted to ECCV 2026, 28 pages including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00029 2026-07-02 cs.RO cs.AI cs.MA cs.NI 新提交

Memory-Native Non-Terrestrial Networks for Embodied Intelligence

面向具身智能的记忆原生非地面网络

Chengyang Li, Yikun Wang, Jiahui He, Yujie Wan, Shuai Wang, Yuan Wu, Yik-Chung Wu, Chengzhong Xu, Huseyin Arslan

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Macau(澳门大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

AI总结 针对非地面网络与具身智能协同中的动态资源受限问题,提出记忆原生NTN范式,通过双记忆架构(物理记忆与数字记忆)实现跨层记忆增强决策,在卫星具身问答任务中显著优于传统方法。

Comments 8 pages, 4 figures, 2 tables, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00397 2026-07-02 q-bio.NC cs.AI cs.CL 交叉投稿

NeuroCogMap Reveals Cognitive Organization of Large Language Models

NeuroCogMap揭示大语言模型的认知组织

Zhongxiang Sun, Haolang Lu, Qiang Ma, Qi Li, Qipeng Wang, Liang Pang, Chenyu Liu, Qiankun Li, Hao Sun, Kun Wang, Yi Zeng, Jun Xu, Guoqi Li, Ji-Rong Wen

机构 * The University of Hong Kong(香港大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) IGS, Imperial College London(伦敦帝国理工学院IGS)

AI总结 提出神经认知地图框架,将LLM内部特征组织为功能分区,揭示其与认知能力、行为失败及人类大脑皮层的对应关系。

Comments 79 pages, 6 main figures, 5 extended figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16813 2026-07-02 cs.GR cs.CV 版本更新

QuadLink: Autoregressive Quad-Dominant Mesh Generation via Point-Relation Learning

QuadLink: 通过点关系学习的自回归四边形主导网格生成

Yiheng Zhang, Zhe Zhu, Tingrui Shen, Zhuojiang Cai, Tianxiao Li, Zixing Zhao, Qiujie Dong, Zhiyang Dou, Jiepeng Wang, Le Wan, Yuwang Wang, Wenping Wang, Yuan Liu, Cheng Lin

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent VISVISE(腾讯VISVISE) Peking University(北京大学) Technical University of Munich(慕尼黑技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院) Texas A&M University(德克萨斯大学) Macau University of Science and Technology(澳门科技大学)

AI总结 提出QuadLink框架,通过将点云链接成结构化面片,以自回归方式生成各向异性的四边形主导网格,实现高几何保真度和拓扑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01001 2026-07-02 cs.CV cs.AI 版本更新

EgoSim: Egocentric World Simulator for Embodied Interaction Generation

EgoSim:用于具身交互生成的视角世界模拟器

Jinkun Hao, Mingda Jia, Ruiyan Wang, Hongrui Zhu, Jiafei Cao, Xihui Liu, Ran Yi, Lizhuang Ma, Jiangmiao Pang, Xudong Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

AI总结 EgoSim通过建模可更新的世界状态,解决现有视角模拟器在3D grounding和动态更新上的不足,生成空间一致的交互视频并支持跨具身迁移。

Comments Project Page: egosimulator.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08127 2026-07-02 cs.CV cs.AI 版本更新

Controllable Diffusion-Based Lesion Inpainting for Scalable Histopathology Data Augmentation

基于可控扩散的病灶修复用于可扩展的组织病理学数据增强

Mohamad Koohi-Moghadam, Mohammad-Ali Nikouei Mahani, Rex K. H. Au-Yeung, Raymond Yu O, Monalyn Marabi, Piyapharom Intarawichian, Fabian Z. X. Lean, Andrew Ferguson, Kyongtae Tyler Bae

机构 * Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Pathology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院病理学系) Department of Anatomical and Cellular Pathology, Prince of Wales Hospital, The Chinese University of Hong Kong(香港中文大学威尔斯亲王医院解剖及细胞病理学系) Department of Infectious Diseases and Public Health, Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong(香港城市大学赛马会动物医学及生命科学院传染病及公共卫生学系) CityU Veterinary Diagnostic Laboratory Co., Ltd., City University of Hong Kong(香港城市大学城市大学兽医诊断实验室有限公司)

AI总结 提出PathoGen扩散模型,将病灶可控地修复到良性组织图像中,生成高保真形态,在四个数据集上优于基线,病理专家区分真假仅略高于随机(57.75%),数据增强使分割Dice提升最高0.18。

Comments 19 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31844 2026-07-01 cs.RO cs.AI 新提交

Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling

闭环交通建模中局部观测与全局仿真的桥接

Ziyan Wang, Tan Xiang, Peng Chen, Xintao Yan

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学)

AI总结 提出CRAFT框架,通过自监督失败发现和偏好引导的测试时对齐,缓解自回归交通模拟器在闭环部署中的局部-全局上下文不匹配问题,减少碰撞31.2%和交通违规33.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31777 2026-07-01 cs.CV 新提交

Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

Mesh BDF: 用于原生3D网格生成的重心支配场

Gaochao Song, Haohan Weng, Luo Zhang, Zibo Zhao, Shenghua Gao

机构 * HKU(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯混元3D) NTU(南洋理工大学)

AI总结 提出重心支配场(BDF),一种在三角网格表面上定义的连续表示,将顶点拓扑连接编码为连续信号,弥合离散网格拓扑与连续扩散生成模型之间的差距,使扩散模型能生成高质量、可扩展且鲁棒的原生网格。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31524 2026-07-01 cs.LG cs.AI stat.ML 新提交

On the Convergence of Self-Improving Online LLM Alignment

关于自改进在线大语言模型对齐的收敛性

Xudong Wu, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

AI总结 针对SAIL算法收敛性分析缺失的问题,提出SAIL-RevKL正则化目标,证明其满足PL条件并实现近线性样本复杂度,在MuJoCo和LLM对齐任务上优于原始SAIL。

Comments Accepted at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31352 2026-07-01 cs.LG eess.SP 新提交

Dualformer: Efficient Feature Extractor for Complex-valued Blind Communication Signal Analysis

Dualformer: 用于复值盲通信信号分析的高效特征提取器

Yurui Zhao, Xiang Wang, Jingreng Lei, Wanlong Zhang, Yik-Chung Wu, Zhitao Huang

机构 * College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电气与电子工程系)

AI总结 提出双通道神经网络DualNN,通过IQ通道参数共享高效处理复值信号,并基于Transformer实现Dualformer,在自动调制识别等任务上性能优于现有方法。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30673 2026-07-01 cs.GR cs.CV 新提交

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

机构 * ZJU(浙江大学) Tencent(腾讯) THU(清华大学) CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学)

AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30687 2026-07-01 physics.chem-ph cond-mat.stat-mech cs.AI 新提交

Unsupervised Thermodynamics of Molecular Diffusion Models: Action-Operator Semantics and Auditable Free-Energy Readout

分子扩散模型的无监督热力学:作用-算子语义与可审计自由能读出

Wenjie Xi

机构 * Department of Physics and HK Institute of Quantum Science & Technology, The University of Hong Kong(香港大学物理系及香港量子科技研究院)

AI总结 提出一种与扩散模型兼容的作用-算子框架,通过噪声算子桥从端点系综读出自由能差,在丙氨酸二肽和配体-口袋扰动中验证了精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30406 2026-06-30 cs.CL cs.LG

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

MOPD: 面向LLM后训练中能力集成的多教师同策略蒸馏

Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, Jinhao Dong, Zhifang Sui, Fuli Luo

机构 * Peking University(北京大学) LLM Core Xiaomi(小米大模型核心团队) University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

AI总结 提出多教师同策略蒸馏(MOPD)范式,通过先训练领域专家再在学生自生成数据上蒸馏,消除暴露偏差并提供密集优化信号,在Qwen3-30B-A3B上优于多种基线,并已部署于工业级模型MiMo-V2-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30168 2026-06-30 cs.CV

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

潜在噪声掩码:减少多模态大语言模型中的视觉冗余

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) Fudan University(复旦大学) The University of Hong Kong(香港大学)

AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。

Comments 21 pages, 7 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29776 2026-06-30 cs.LG cs.AI

Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent

面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法

Zheng Fang, Chen Yang, Yusen Tan, Yunpeng Zhao, Fanjie Xu, Hongxin Xiang, Hanyu Sun, Hanyu Gao, Xiaojian Wang, Wenjie Du, Yuqiang Li, Jun Xia

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) The University of Hong Kong(香港大学) Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) The Hong Kong University of Science and Technology(香港科技大学) Hunan University(湖南大学) AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)

AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29301 2026-06-30 cs.CV

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision

Pointer-CAD v2: 先规划后构建的尺寸感知参数化CAD生成

Dacheng Qi, Chenyu Wang, Jingwei Xu, Yi Ma, Shenghua Gao

机构 * The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) TranscEngram Monash University(墨尔本大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Pointer-CAD v2,采用先规划后构建范式,通过指针机制直接预测连续参数值,消除量化误差,并在顶点、边和面层级引入层次化几何精度指标,显著提升CAD生成的几何精度。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Snitro/Pointer-CAD-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29038 2026-06-30 cs.MA cs.AI

Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy

度量聚合分歧:基于智能体的策略优化中隐藏的有效性威胁及其契约式补救

Ruiyu Zhang, Lin Nie, Xin Zhao

机构 * Department of Politics and Public Administration(政治与公共行政系) The University of Hong Kong(香港大学) Department of Applied Social Sciences(应用社会科学系) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文揭示基于智能体模型与多目标进化算法(ABM+MOEA)中因各阶段独立重实现度量聚合导致的“度量聚合分歧”(MAD)问题,通过流行病策略工具复现和实验证明其严重性,并提出“度量契约”作为统一接口的工程补救方案。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29028 2026-06-30 cs.RO

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

关键姿态探索:高效的自动轨迹标注与跨实体策略迁移

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)

AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。

Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28835 2026-06-30 cs.LG cs.AI

Fisher-Routed Mixture of Experts for Federated Class-Incremental Learning

Fisher路由专家混合模型用于联邦类增量学习

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Zewei Liu, Edith Cheuk Han Ngai

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院)

AI总结 提出FedFMX框架,通过Fisher路由专家混合模型解决联邦类增量学习中的容量冲突、灾难性遗忘、数据异构和类别错位问题,实现自适应专家专业化。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16325 2026-06-30 cs.LG cs.AI

UniMamba: A Unified Spatial-Temporal Modeling Framework with State-Space and Attention Integration

UniMamba:一种集成状态空间与注意力机制的时空建模框架

Xingsheng Chen, Xianpei Mu, Deyu Yi, Yilin Yuan, Xingwei He, Bo Gao, Regina Zhang, Pietro Lio, Siu-Ming Yiu

机构 * School of Computing and Data Science, The University of Hong Kong, Hong Kong, China(计算与数据科学学院,香港大学,香港,中国) School of Information Engineering, Beijing Institute of Graphic Communication, Beijing, China(信息工程学院,北京印刷学院,北京,中国) Innovation Engineering College, Macau University of Science(创新工程学院,澳门科学技术大学) Department of Computer Science and Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国)

AI总结 UniMamba整合了高效的状态空间动态与注意力依赖学习,通过Mamba变体通道编码层和时空注意力层,提升多变量时间序列预测的准确性和效率。

Comments The authors wish to withdraw this preprint due to a lack of consensus regarding the final authorship list and the order of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23292 2026-06-30 cs.AI cs.CL

Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning

学习如何使用工具,而非仅仅何时:基于模式的工具集成推理

Ningning Xu, Yuxuan Jiang, Shubhashis Roy Dipta, Hengyuan Zhang

机构 * University of Georgia(佐治亚大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) The University of Hong Kong(香港大学)

AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。

Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12784 2026-06-30 cs.CV cs.CL

SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models

SRUM:细粒度自奖励用于统一多模态模型

Weiyang Jin, Yuwei Niu, Jiaqi Liao, Chengqi Duan, Aoxue Li, Shenghua Gao, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) The University of Hong Kong(香港大学) Peking University(北京大学) Noah’s Ark Lab, Huawei(华为诺亚方舟实验室) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 SRUM通过内部评估模块对生成模块进行自奖励,提升统一多模态模型的视觉生成能力,实验证明在T2I-CompBench和T2I-ReasonBench上性能显著提升。

Comments Accepted to ECCV 2026. 20 pages, 8 figures, webpage can be seen in https://waynejin0918.github.io/srum_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18060 2026-06-30 cs.CV

Semantic Correspondence: Unified Benchmarking and a Strong Baseline

语义对应:统一的基准测试与强大的基线

Kaiyan Zhang, Xinghui Li, Jingyi Lu, Kai Han

机构 * The University of Hong Kong(香港大学)

AI总结 本文首次全面调研语义对应方法,提出分类体系并汇总多基准结果,提出高性能基线,为未来研究奠定基础。

Comments accepted by TPAMI 2025

Journal ref IEEE Trans. Pattern Anal. Mach. Intell. 48, no. 3 (2026) 3911-3930

详情

展开后加载摘要…

URL PDF HTML 收藏