Beyond Retrieval: Analytic Memory for Multimodal Agents
超越检索:多模态智能体的分析记忆
机构 * HKUST(香港科技大学) ; ByteDance(字节跳动)
AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。
高校专区
超越检索:多模态智能体的分析记忆
机构 * HKUST(香港科技大学) ; ByteDance(字节跳动)
AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。
TriGlue:一种用于生成分子胶水诱导三元复合物的生物启发式生成模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Jilin University(吉林大学) ; University of Sydney(悉尼大学)
AI总结 研究针对分子胶水计算设计未充分探索的问题,提出生物启发式生成框架TriGlue,将三元复合物生成分解为界面估计和条件复合物生成两阶段,经实验验证其能生成有效分子和合理复合物,加速分子胶水发现。
Stream3D: 基于证据记忆的序列多视角3D生成
机构 * World Mind Lab, HKUST(世界心智实验室,香港科技大学) ; Media Lab and EECS, MIT(媒体实验室和电子工程与计算机科学系,麻省理工学院) ; Kempner Institute, Harvard University(凯普纳研究所,哈佛大学)
AI总结 提出Stream3D,一种无需训练的流式机制,通过维护紧凑的证据记忆缓存关键历史帧,将冻结的视角条件3D生成器转换为流式生成器,解决单目视频流中3D生成的时间不一致问题。
Comments Multi-view 3D Generation, Streaming 3D Generation
GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习
机构 * THU(清华大学) ; Motphys ; Dexmal ; DISCOVER Robotics ; HKUST(GZ)(香港科技大学(广州)) ; BIT(北京理工大学) ; NUS(新加坡国立大学) ; HITSZ(哈尔滨工业大学) ; XJTU(西安交通大学) ; NJU(南京大学) ; SJTU(上海交通大学) ; D-Robotics
AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。
Comments Robotics: Science and Systems 2026
Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者)
AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。
Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学)
AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。
Comments We need to make a huge revision
一种适用于部署的高效计算病理学基础框架
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) ; Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University(病理学系,南芳医院,南方医科大学) ; Guangdong Province Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) ; Jinfeng Laboratory, Chongqing, China(锦峰实验室,重庆,中国) ; Department of General Surgery (Colorectal Surgery), The Sixth Affiliated Hospital, Sun Yat-sen University(普外科(结直肠外科),中山大学第六附属医院)
AI总结 LitePath是一种高效计算病理学基础框架,通过压缩模型和自适应碎片选择器,显著降低计算成本,实现快速、节能的病理图像分析。
通过固定基空间中的系数映射学习算子
机构 * Department of Mathematics(数学系) ; University of Michigan(密歇根大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Algorithms of Machine Learning and Autonomous Driving Research Lab(机器学习与自动驾驶算法研究实验室) ; HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究机构)
AI总结 FB-C2CNet通过固定基空间中的系数映射学习算子,有效降低计算复杂度并提升训练效率。
ReCamDriving:无需LiDAR的相机控制新型轨迹视频生成
机构 * Sun Yat-sen University(中山大学) ; ZYT ; Shenzhen Polytechnic University(深圳职业技术大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 ReCamDriving通过基于3DGS的密集渲染和两阶段训练策略,实现了无需LiDAR的相机可控新型轨迹视频生成,构建了ParaDrive数据集并展示了卓越的生成效果。
Comments Project page: https://recamdriving.github.io/
FGGS-LiDAR:从通用3DGS模型到LiDAR的超快速GPU加速仿真
机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; DISCOVER Robotics ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))
AI总结 提出FGGS-LiDAR框架,通过体积离散化和TSDF提取将预训练3DGS资产转换为水密网格,结合GPU加速光线投射实现超500 FPS的LiDAR仿真,在并行设置中比Isaac Sim低一个数量级延迟。
RSC-GestureNet:面向中国交通警察手势的可靠性感知选择性因果识别模型
机构 * Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科技大学跨学科研究学院) ; Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院)
AI总结 本研究提出RSC-GestureNet,通过对不可靠姿态关节降权、因果聚合时序证据等方式提升中国交通警察手势识别的早期性、稳定性与鲁棒性,在CTPGesture数据集上取得最优性能。
Comments 2026 PRCV Oral; Project Page: https://github.com/chengli24/rsc-gesturenet-prcv2026
超越全局隐变量:面向可扩展3D建模的基于块的稀疏网格变分自编码器
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Tencent Hunyuan(腾讯混元) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 该研究针对稀疏体素网格内存随分辨率快速增长的问题,提出基于块的ChunkVAE,通过局部算子和互补数据算子实现可扩展3D建模,在多基准测试中性能优于或相当基线,且内存与推理效率更优。
Comments 14 pages, 9 figures
DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUDT(中国人民解放军国防科技大学) ; OUC(中国海洋大学) ; HITSZ(哈尔滨工业大学(深圳)) ; Huawei Cloud BU(华为云业务部)
AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。
LiveLight:具备交互式控制的实时流视频重光照
机构 * HKUST(香港科技大学) ; University of Macau(澳门大学) ; THU(清华大学) ; UoT(多伦多大学) ; University of Tuebingen(蒂宾根大学)
AI总结 本研究提出首个基于扩散模型的实时流视频重光照框架LiveLight,通过三项关键设计解决三大挑战,在实时速度下达到最优重光照质量,将公开发布相关资源以推动该领域研究。
Comments Accepted by TOG 2026. Project page: https://living-lighting.github.io
面向高效自我中心 grounding 的动态分辨率路由
机构 * National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Nanyang Technological University(南洋理工大学)
AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。
DocNavRAG:面向复杂文档问答的、具有状态化证据构建能力的文档结构化图RAG
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文提出DocNavRAG,将文档结构组织为可导航图并维护证据状态,在四个文档QA基准上,相比最强基线平均提升答案质量7.8%、上下文充分性17.7%。
Comments 19 pages, 5 figures, 16 tables
利用对抗蒸馏定制去偏差的、针对乳腺癌的疾病专用病理学基础模型
机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) ; Leicester Cancer Research Centre, University of Leicester(莱斯特大学莱斯特癌症研究中心) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Nuffield Department of Medicine, University of Oxford(牛津大学纳菲尔德医学院) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程学系) ; ZoyMed(佐医医疗(ZoyMed))
AI总结 本研究提出SmartStu框架,通过多教师集成蒸馏与对抗蒸馏等技术,定制出比通用PFMs小30倍以上且性能相当的乳腺癌专用病理学基础模型。
Comments 11 pages, 2 figures, 2 tables. Accepted to MICCAI 2026 (early accept)
CORTIVA:用于EEG和MEG到图像检索的互补视觉教师的候选分数融合
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 CORTIVA是一种候选分数融合框架,通过保留互补视觉教师的异构证据,在EEG/MEG到图像检索任务中大幅提升了Top-1和Top-5准确率,为神经图像检索提供了更优方案。
Comments 31 pages, 19 figures; includes supplementary information. Code: https://github.com/Fuyunhan/CORTIVA
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
LooperMuscle:基于结构化混合专家的人形机器人全身跟踪快速稳定学习方法
机构 * DeepMirror Inc.(深镜公司) ; HKUST(香港科技大学) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出LooperMuscle框架,结合结构化混合专家等组件,弥合FastSAC与PPO在人形机器人全身跟踪任务中的速度-性能差距,训练效率高且跟踪精度优。
SIPTraj:无高精地图的物理引导场景交互端到端轨迹预测
机构 * School of Data Science and Engineering, Xingzhi College, South China Normal University(华南师范大学行知学院数据科学与工程学院) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Macau(澳门大学) ; College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学学院) ; School of Electronic Science and Engineering, South China Normal University(华南师范大学电子科学与工程学院)
AI总结 SIPTraj是一种无高精地图的端到端轨迹预测框架,通过分层智能体-场景编码器和物理引导迭代解码器解决场景锚定与物理可行性问题,在两个数据集上性能优于现有方法,推理无需高精地图。
生成图像更易被遗忘:合成图像检测的机器遗忘视角
机构 * University of Science and Technology of China(中国科学技术大学) ; Hong Kong Baptist University(香港浸会大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The University of Sydney(悉尼大学)
AI总结 该研究针对合成图像检测任务,发现大规模视觉模型在机器遗忘时对生成图像的特征退化更快,据此提出两种基于机器遗忘的检测方法,其性能优于传统方法,为合成图像检测建立了新范式。
Comments 19 pages, 10 figures
智能体图令牌推理
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本研究提出智能体图令牌推理,将图令牌化融入推理过程,通过三阶段训练实现,在七个图领域评估中大幅优于基线,可零样本迁移至未见领域,推动图分析向智能体范式发展。
儿童步态行为解码
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; PediaMed AI ; Shenzhen Children’s Hospital(深圳市儿童医院) ; Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。
Journal ref ECCV 2026
SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。
Comments Accepted by KDD 2026. 12 pages, 6 figures
CoT-Core:通过感知思维链的核心集选择加速大语言模型评估
机构 * Nanjing University(南京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 CoT-Core是无训练的核心问题选择框架,通过感知大语言模型的思维链推理轨迹聚类问题,可大幅降低LLMs评估成本,且在GSM8K等多数据集上维持高保真度分数估计。
Comments 23 pages, 3 figures, 10 tables. Includes appendix
用于矢量量化的分布匹配:一个统一的理论和实证框架
机构 * University of Toronto(多伦多大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Boston College(波士顿学院) ; Lehigh University(里海大学) ; Southern University of Science and Technology(南方科技大学)
AI总结 针对现有矢量量化方法训练不稳定和码本崩溃问题,提出分布匹配框架,通过对齐特征和码向量分布缓解上述问题,经理论分析和实验验证,基于瓦瑟斯坦距离目标实例化该框架,在视觉tokenization基准上表现有效且鲁棒。
Comments 33 pages, 17 figures, and 16 tables. arXiv admin note: substantial text overlap with arXiv:2506.15078
多智能体推理中的流式通信
机构 * HKUST(GZ)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; ZJU(浙江大学) ; HKUST(香港科技大学)
AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。
Comments project page: https://zhenyangcs.github.io/StreamMA-website/
代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Qwen Team, Alibaba Group(阿里集团通义实验室)
AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。
Comments Under review
当差分隐私遇见无线联邦学习:一种改进的隐私与收敛分析
机构 * School of Informatics, Xiamen University, China(厦门大学信息学院,中国) ; Internet of Things Thrust, Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)物联网研究组,中国)
AI总结 本文研究了差分隐私无线联邦学习中隐私损失的精确表征及收敛性,提出通用非凸损失目标下的分析方法,明确设备选择与小批量采样影响,证明隐私损失可收敛于常数,建立梯度裁剪下的收敛保证及隐私-效用权衡。
Comments need revision