VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
VideoSSM:基于混合状态-空间记忆的自回归长视频生成
机构 * HKU(香港大学) ; PICO, ByteDance(字节跳动PICO) ; SUSTech(南方科技大学)
AI总结 VideoSSM通过结合自回归扩散与混合状态空间记忆,实现了具有全局一致性和运动稳定性的长视频生成,支持提示自适应交互并提升内容多样性。
高校专区
VideoSSM:基于混合状态-空间记忆的自回归长视频生成
机构 * HKU(香港大学) ; PICO, ByteDance(字节跳动PICO) ; SUSTech(南方科技大学)
AI总结 VideoSSM通过结合自回归扩散与混合状态空间记忆,实现了具有全局一致性和运动稳定性的长视频生成,支持提示自适应交互并提升内容多样性。
机器现象学:一个简单方程分类快速射电暴
机构 * School of Computer Science, University of South China(南华大学计算机科学学院) ; Department of Physics E. Pancini, University Federico II(费米研究所物理系) ; Key Laboratory of Particle Astrophysics, Institute of High Energy Physics, Chinese Academy of Sciences(中国科学院高能物理研究所粒子天体物理重点实验室) ; School of Mathematics and Physics, University of South China(南华大学数学物理学院) ; The Hong kong Institute for Astronomy and Astrophysics, University of Hong Kong(香港大学天文与天体物理研究所) ; Department of Physics, University of Hong Kong(香港大学物理系) ; Nevada Center for Astrophysics, University of Nevada(内华达大学天文中心) ; School of Physical Science and Technology, Southwest Jiaotong University(西南交通大学物理科学与技术学院)
AI总结 本文提出一个简单方程通过符号回归分类快速射电暴,结合人类物理推理与机器学习发现经验定律。
Comments 19 pages, 9 figures, 3 tables. Submitted to SCIENCE CHINA Physics, Mechanics & Astronomy
SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理
机构 * Huawei(华为) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学)
AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。
测试时校正:通过视觉提示的在线3D检测系统
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; GAC R&D Center(GAC研发中心) ; The University of Hong Kong(香港大学) ; Google(谷歌) ; Koç University(科克大学)
AI总结 本文提出一种通过视觉提示实现在线3D检测的测试时校正系统,旨在提升自动驾驶系统在部署后的实时纠错能力。
PipeFusion: 基于扩散变换器推理的片级流水线并行
机构 * ByteDance(字节跳动) ; HUST(华中科技大学) ; Tencent(腾讯) ; The University of Hong Kong(香港大学)
AI总结 PipeFusion通过片级流水线并行方法,提高扩散变换器推理的效率和性能,适用于大模型如Flux.1。
DGGT:利用未定位图像实现动态驾驶场景的前馈4D重建
机构 * AIR, Tsinghua University(清华人工智能研究院) ; Xiaomi EV(小米电动车) ; The University of Hong Kong(香港大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 DGGT通过前馈方法实现无姿态动态驾驶场景的4D重建,结合3D高斯地图和轻量级动态头,提升重建速度与性能。
TEXTRIX:用于原生纹理生成及更广泛领域的潜在属性网格
机构 * Nanjing University(南京大学) ; DreamTech ; HKU(香港大学) ; OriginArk
AI总结 TEXTRIX通过构建潜在3D属性网格和稀疏注意力扩散变换器,实现高保真纹理合成及精确3D分割。
Comments Project Page: https://www.neural4d.com/research-page/textrix
DiverseAR: 提升位级自回归图像生成中的多样性
机构 * PRLab, Nanjing University(南京大学PRLab) ; The University of Hong Kong(香港大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Lovart AI ; WeChat, Tencent Inc.(腾讯公司)
AI总结 DiverseAR通过自适应logits分布缩放和能量基生成路径搜索算法,提升位级自回归图像生成的样本多样性,同时保持视觉质量。
Comments 23 pages
RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎
机构 * Tsinghua University(清华大学) ; Synapath ; CUHK(香港中文大学) ; HKU(香港大学) ; PolyU
AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。
Comments 27 Pages, 21 figures
超越置信度:用于扩散语言模型的自适应与一致解码
机构 * City University of Hong Kong(香港城市大学) ; Huawei Research(华为研究) ; The University of Hong Kong(香港大学)
AI总结 本文提出Coherent Contextual Decoding方法,通过自适应解码策略提升扩散语言模型的生成质量和采样效率。
Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位
机构 * University College London(伦敦大学学院) ; Chico Future AI Lab(芝加哥未来人工智能实验室) ; The University of Hong Kong(香港大学) ; Princeton University(普林斯顿大学)
AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。
CaliTex: 用于视图一致3D纹理生成的几何校准注意力
机构 * PKU(北京大学) ; HKUST(香港科技大学) ; CUHK(SZ)(香港中文大学(深圳)) ; HKU(香港大学) ; LIGHTSPEED
AI总结 CaliTex通过几何校准注意力机制,解决3D纹理生成中的跨视图不一致问题,提升纹理的视图一致性与生成质量。
The Station:一个面向AI驱动发现的开放世界环境
机构 * DualverseAI ; University of Cambridge(剑桥大学) ; University of Hong Kong(香港大学)
AI总结 STATION是一个开放世界多智能体环境,通过自主科学发现的涌现行为实现AI驱动的科学突破。
Comments 55 pages
人类决策易受AI驱动的操控
机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) ; State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) ; The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) ; Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ; ANT Group(ANT集团)
AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。
Comments Work in progress
在统一多模态模型中,理解是否会影响生成?从分析到未来路径
机构 * Peking University(北京大学) ; Chongqing University(重庆大学) ; HKU MMLab(香港大学多模态实验室) ; PengCheng Laboratory(鹏城实验室)
AI总结 研究通过UniSandbox分析统一多模态模型中理解与生成之间的差距,发现显式链式思维和自训练方法能有效弥合这一差距,并揭示查询架构的潜在CoT特性。
Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能
机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) ; Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)
AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。
PointNSP: 通过下一尺度细节预测实现自回归3D点云生成
机构 * National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; University of Hong Kong(香港大学) ; University of Cambridge(剑桥大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 PointNSP通过下一尺度细节预测实现自回归3D点云生成,首次在自回归范式中达到最先进的生成质量,并在参数、训练和推理效率上超越扩散基线。
Comments 24 pages; Previously this version appeared as arXiv:2510.05613 which was submitted as a new work by accident
通过动态MRI生成语音音频的增强知识条件变分自编码器
机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) ; School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) ; Wake Forest University School of Medicine(威克森林大学医学学院) ; Department of Radiology, Harvard Medical School(哈佛医学院放射科)
AI总结 本文提出KE-CVAE方法,通过动态MRI生成语音音频,解决MRI数据损坏和噪声问题,提升语音合成质量。
Hyper-GoalNet: 基于超网络的目标条件化操纵策略学习
机构 * InfoBodied AI Lab, The University of Hong Kong(信息身体AI实验室,香港大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 Hyper-GoalNet通过超网络生成任务特定策略参数,提升机器人操纵在多样化目标和环境下的鲁棒性与性能。
OccluGaussian:面向大场景重建与渲染的遮挡感知高斯点云技术
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) ; The University of Hong Kong(香港大学) ; Huawei Embodied Intelligence Lab(华为具身智能实验室)
AI总结 OccluGaussian通过遮挡感知的场景划分和区域渲染技术,提升大规模场景重建与渲染的质量和效率。
Comments Accepted to ICCV 2025. Project website: https://occlugaussian.github.io
代理调优:为以主题驱动的图像生成定制多模态自回归模型
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学) ; Nanjing University of Information Science and Technology(南京信息工程大学)
AI总结 本文提出代理调优方法,通过扩散模型增强AR模型在主题驱动图像生成中的能力,揭示了弱到强泛化现象,提升了多主题组合和上下文理解的表现。
通过强化学习教学语言模型进行批评
机构 * The University of Hong Kong(香港大学)
AI总结 本文提出CTRL框架,通过强化学习训练批评模型以提升代码生成的准确性和性能,实现迭代改进和误差缓解。
向理解变换器在学习随机游走中的能力
机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
AI总结 本文研究了变换器在学习随机游走中的能力和可解释性,证明单层变换器在预测随机游走时能达到最优准确性,并揭示了其可解释性机制。
Comments 45 pages, 13 figures
从幻觉到意图:用于视觉-语言推理的视觉理由学习
机构 * Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; Meituan(美团)
AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。
Comments 19 pages, 15 figures
MICCAI STS 2024挑战:在全景X光和CBCT图像中实现半监督实例级牙齿分割
机构 * Innovation Center for Electronic Design Automation Technology(电子设计自动化技术创新中心) ; School of Cyberspace(网络空间学院) ; Hangzhou Dianzi University(杭州电子科技大学) ; Hangzhou Geriatric Stomatology Hospital(杭州老年牙科医院) ; Shenzhen University(深圳大学) ; Queen Mary University of London(伦敦大学Queen Mary分校) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; The University of Hong Kong(香港大学) ; Chinese Academy of Sciences(中国科学院) ; Yunnan Provincial Stomatology Hospital(云南省牙科医院) ; Shanghai MediWorks Precision Instruments Co., Ltd(上海 MediWorks 精密仪器有限公司) ; University of Leicester(莱斯特大学)
AI总结 MICCAI STS 2024挑战通过半监督学习方法在全景X光和CBCT图像中实现实例级牙齿分割,展示了SSL在数据稀缺情况下的显著性能提升。
VaMP:用于视觉-语言模型的变分多模态提示学习
机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)
AI总结 VaMP提出了一种变分多模态提示学习框架,通过实例条件提示和不确定性建模提升视觉-语言模型在少样本和领域泛化任务中的性能。
Comments Accepted to NeurIPS 2025
MG-Nav:基于稀疏空间记忆的双尺度视觉导航
机构 * The University of Hong Kong(香港大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。
Comments 10pages, 5 figures
Fin3R:通过单目知识蒸馏细调馈送式3D重建模型
机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) ; Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)
AI总结 Fin3R通过单目知识蒸馏细调馈送式3D重建模型,提升几何精度和鲁棒性,仅增加微小权重。
Comments NeurIPS 2025
OralGPT-Omni: 一种多功能的牙科多模态大语言模型
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) ; College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) ; School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) ; Singapore University of Technology and Design(新加坡科技与设计大学) ; University of Auckland(奥克兰大学) ; University of Science and Technology of China(中国科学技术大学) ; School of Computer Science, Peking University(北京大学计算机学院) ; College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。
Comments 47 pages, 42 figures, 13 tables
可解释的多模态癌症原型生成:结合整张滑片图像与不完全配对的基因组学
机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) ; Department of Electrical & Electronic Engineering, The University of Manchester, UK(曼彻斯特大学电气与电子工程系) ; Department of Pathology, State Key Laboratory of Oncology in South China, Guangdong Provincial Clinical Research Center for Cancer, Sun Yat-sen University Cancer Center, China(南方医科大学肿瘤学国家重点实验室、广东省癌症临床研究中心、中山大学肿瘤中心病理学部) ; Department of Statistics and Actuarial Science, The University of Hong Kong, Hong Kong SAR, China(香港大学统计与精算科学系) ; Department of Clinical Neurosciences and Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学临床神经科学系和应用数学与理论物理系;邓迪大学科学与工程学院和医学学院) ; School of Science and Engineering and School of Medicine, University of Dundee, UK
AI总结 本文提出了一种可解释的多模态原型生成框架,通过整合整张滑片图像和不完整的基因组学数据,提升精准肿瘤学中的多模态整合效果。