JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
JoVA:联合视频音频生成的统一多模态学习
机构 * The University of Hong Kong(香港大学) ; ByteDance(字节跳动)
AI总结 JoVA通过联合自注意力机制和嘴巴区域损失,实现了高质量的视频音频生成,提升了嘴唇同步和语音质量。
Comments ECCV 2026
高校专区
JoVA:联合视频音频生成的统一多模态学习
机构 * The University of Hong Kong(香港大学) ; ByteDance(字节跳动)
AI总结 JoVA通过联合自注意力机制和嘴巴区域损失,实现了高质量的视频音频生成,提升了嘴唇同步和语音质量。
Comments ECCV 2026
迈向白盒深度无线感知
机构 * The University of Hong Kong(香港大学) ; MIT(麻省理工学院)
AI总结 该研究针对现有深度无线感知模型为黑盒的问题,提出基于复稀疏率降维原理的全复值Transformer模型RF-CRATE,引入子空间正则化解决数据稀缺问题,在五项数据集的多类任务中验证其性能优于黑盒模型且具备可解释性。
LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; University of Sussex(萨塞克斯大学)
AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。
PanDent:面向牙科放射学中全面的牙级结构-语言一致性
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; Imperial College London(帝国理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。
分歧解码:无训练的能力融合
机构 * Peking University(北京大学) ; International Digital Economy Academy (IDEA)(国际数字经济学院) ; The University of Hong Kong(香港大学)
AI总结 针对通用大模型缺领域知识、专家模型逻辑弱的问题,提出无训练的Divergence Decoding框架,通过Jensen-Shannon散度自适应路由,在科学基准上融合两类模型能力,性能优于单模型基线。
通过稀疏自编码器实现可解释的隐藏规则游戏智能体
机构 * Rutgers University(罗格斯大学) ; The University of Hong Kong(香港大学)
AI总结 研究针对隐藏规则游戏中Transformer智能体的可解释性,通过在其决策令牌嵌入上训练稀疏自编码器,在双规则任务中恢复结构,单个维度对应可解释策略,为解释智能体行为提供方法。
Agent-UCT:应用于树的上置信界,用于具有成本意识的智能工作流优化
机构 * The University of Hong Kong(香港大学) ; School of Artificial Intelligence, Jiangxi Science and Technology Normal University(江西科技师范大学人工智能学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; University of Science and Technology of China(中国科学技术大学) ; New York University(纽约大学)
AI总结 研究针对智能工作流优化中计算冗余和预算分配低效问题,提出Agent-UCT算法,结合RAGSpace框架和WTB,通过重用感知正则化项减少冗余执行,实验证明其能有效识别最佳配置,实现成本感知、可重现且组合高效的智能工作流优化。
Ouroboros-Spatial:闭环数据-模型循环的空间推理
机构 * Peking University(北京大学) ; Ant International(蚂蚁国际) ; The University of Hong Kong(香港大学)
AI总结 提出Ouroboros-Spatial自演化框架,通过提议器与求解器闭环交互,动态生成与模型能力匹配的训练样本,在六个空间推理基准上以十分之一数据量显著提升Qwen3-VL性能。
深度神经网络的泛化:梯度方法的极小化最优速率
机构 * Mathematical Institute for Machine Learning and Data Science, Catholic University of Eichstätt-Ingolstadt(机器学习与数据科学数学研究所,埃施特哈特-因戈尔施塔特天主教大学) ; Department of Computer Science, RPTU Kaiserslautern-Landau(计算机科学系,凯斯莱特恩-兰道大学) ; Department of Mathematics, The University of Hong Kong(数学系,香港大学) ; School of Mathematics and Statistics, The University of Sydney(数学与统计学学院,悉尼大学)
AI总结 本文建立了过参数化深度神经网络与核方法学习动力学的联系,证明了梯度下降和随机梯度下降在足够宽度下能达到极小化最优泛化误差。
Comments 44 pages, 1 figure
对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧
机构 * The University of Hong Kong(香港大学)
AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。
Comments ACM FAccT 2026
具有视觉意识的协同空中跟踪与基于去中心化激光雷达的群体
机构 * Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) ; School of Intelligent System Engineering, Sun Yat-sen University(中山大学智能系统工程学院)
AI总结 本文提出了一种基于去中心化激光雷达的群体协同跟踪框架,通过SSDF度量和电势启发分布度量,实现复杂环境中的可视化目标跟踪与动态群体重构。
用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐
机构 * University of Hong Kong(香港大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Huazhong University of Science and Technology(华中科技大学) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Infiforce(英飞拓)
AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。
Comments 8 pages, 4 figures
分解与重组:利用从示范中学到的原语和视觉运动策略进行规划
机构 * The University of Hong Kong(香港大学) ; JD.com (JingDong)(京东) ; Nanyang Technological University (NTU)(南洋理工大学) ; Southern University of Science and Technology (SUSTech)(南方科技大学) ; Huawei Technologies(华为技术有限公司) ; The Chinese University of Hong Kong (CUHK)(香港中文大学)
AI总结 研究如何使机器人灵巧、长视野操作自动化,提出DR-LfD框架,将视觉运动策略集成到TAMP决策系统,基于接触关系分解示范为原子技能,经实验验证该框架在多类任务中性能强大。
Comments 21 pages, 12 figures
ObliCity:屋顶到地面投影位移校正的基准和基线
机构 * School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; College of Computing, Department of Data Science, City University of Hong Kong(香港城市大学计算学院数据科学系) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电气与计算机工程系)
AI总结 研究斜视图城市遥感影像中屋顶到地面投影位移校正问题,提出将RFOV提取设为独立任务,引入数据集ObliCity,改进DragOSM为DragRoof,实验证明DragRoof性能最优,为投影位移校正奠定基础。
Comments 12 pages
通过学习和搜索理解组合优化中类人解决方案
机构 * The University of Warwick(华威大学) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; South China Normal University(华南师范大学) ; The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
AI总结 研究欧几里得旅行商问题中人类如何找到接近最优解,通过大规模行为和计算研究,对比人类与基于指针网络的神经策略,发现类人解决方案或源于结构化监督学习、强化学习及测试时搜索的结合。
新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估
机构 * Hong Kong Baptist University(香港浸会大学) ; The University of Hong Kong(香港大学) ; Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)
AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。
Comments Accepted at ACM Multimedia (ACM MM), 2026
MemVLN:用于视觉与语言导航的情景记忆和程序记忆
机构 * The Chinese University of Hong Kong(香港中文大学) ; LIGHTSPEED(光速) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。
LAGS:低空高斯点云与群体异构图学习
机构 * The University of Hong Kong(香港大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Southern University of Science and Technology(南方科技大学) ; State Key Laboratory of IOTSC, University of Macau(澳门大学物联网科学国家重点实验室) ; College of Engineering, Istanbul Medipol University(伊斯坦布尔Medipol大学工程学院)
AI总结 LAGS通过聚合分布式无人机的航拍图像实现3D场景重建,但现有低空资源分配方案因未考虑视角差异导致效率低下。本文提出GW-HGNN,通过图学习平衡数据保真度与传输成本,实验表明其在关键渲染指标上优于现有方法,并显著降低计算延迟。
Comments 6 pages, 12 figures, 2 tables
一种用于在离散约束下无线资源分配的通用深度学习框架
机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) ; School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息科技学院) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)
AI总结 本文提出一种通用深度学习框架,通过引入支撑集来表示离散变量,解决深度学习在处理离散变量时的零梯度问题和约束执行难题,应用于混合离散无线资源分配问题。
Comments 15 pages, 20 figures, 2 tables
联合发射与挤压波束成形用于挤压天线系统(PASS):基于优化的或基于学习的?
机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦女王玛丽大学电子工程与计算机科学学院) ; Centre for Wireless Innovation (CWI), Queen’s University Belfast(贝尔法斯特女王大学无线创新中心) ; Department of Electrical and Electronic Engineering, the University of Hong Kong(香港大学电气与电子工程系) ; Faculty of Applied Sciences, Macao Polytechnic University(澳门 polytechnic 大学应用科学学院) ; Department of Electronic Engineering, Kyung Hee University(庆熙大学电子工程系)
AI总结 本文提出基于优化和学习的PASS系统,通过联合优化发射和挤压波束成形,提升多用户MISO系统的速率性能。
Comments Accepted by IEEE Transactions on Wireless Communications (TWC). Reproducible code for KDL-Transformer is available at https://github.com/xiaoxiaxusummer/KDL_Transformer_Beamforming
Journal ref IEEE Trans. Wireless Commun., vol. 25, pp. 11449-11464, 2026
VL-LN基准:通过主动对话实现长视界目标导向导航
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。
OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。
Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026
CodeEvo:通过混合和迭代反馈以交互驱动方式合成以代码为中心的数据
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 为解决高质量指令-代码对获取难题,提出双智能体架构CodeEvo,审查器制定模式并结合混合验证协议,构建CodeEvo-100K数据集,实验表明基于此数据微调的模型在代码生成基准测试中表现出色。
Comments ACL 2026 (Oral)
CARA:用于可解释碰撞预测的概念感知风险注意力
机构 * Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Pennsylvania(宾夕法尼亚大学) ; Renmin University of China(中国人民大学)
AI总结 研究自动驾驶碰撞预测问题,提出CARA框架,从事故叙述中获取风险概念并与视频帧对齐成轨迹,将语义风险因素作为动态证据,结合可解释性与预测过程,实验证明其能提高预测准确性和预警及时性。
Comments Accepted to ACM Multimedia 2026(Oral)
SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法
机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) ; College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) ; Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)
AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。
编译,然后分页:用于过程性语言模型代理的可执行标准操作程序和能力门控运行时
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The University of Hong Kong(香港大学) ; Zhejiang Normal University(浙江师范大学) ; Research Institute for Generative AI, The Hong Kong Polytechnic University(香港理工大学生成式人工智能研究所)
AI总结 研究针对企业代理遵循SOP的问题,将SOP约束编译成可执行伪代码,用程序引导堆栈机运行,通过实验表明编译文本有益,运行时指导受能力门控,给出编译后经模型级纪律检查再启用活动框架分页的实际指导。
Comments 9 pages, 3 figures, 5 tables
OmniCustom: 通过联合音视频生成模型实现同步音视频定制
机构 * The University of Hong Kong(香港大学) ; Shanda AI Research Tokyo(Shanda AI东京研究所) ; XIntelligence Technology Co., Limited(XIntelligence技术有限公司)
AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。
Comments code: https://github.com/OmniCustom-project/OmniCustom
VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆
机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)
AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE
基于多尺度时间片的结构化潜空间建模用于多元时间序列预测
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Innovation Engineering College, Macau University of Science and Technology(澳门科技大学创新工程学院)
AI总结 研究针对多元时间序列预测,提出基于卷积神经网络的M2Patch架构,通过多尺度切片、深度可分离卷积等提取特征并压缩成潜表示,利用尺度内和尺度间约束组织潜空间,在多个基准测试中成绩优异。
EmoEUS:对话中多模态情感识别的不确定性监督
机构 * Dept. of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) ; Speech, Language, and Cognition Laboratory, The University of Hong Kong(香港大学语音、语言与认知实验室)
AI总结 研究对话中多模态情感识别,提出EmoEUS框架,通过动态加权模态执行不确定性感知多模态融合,并引入显式监督损失,实验证明该框架优于现有方法。
Comments Accept by Interspeech 2026