Anisotropic Modality Align
各向异性模态对齐
机构 * HKUST(GZ)(香港科技大学(广州)) ; NUS(国立新加坡大学) ; UCSD(加州大学圣地亚哥分校) ; Stanford(斯坦福大学) ; PKU(北京大学) ; THU(清华大学)
AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。
高校专区
各向异性模态对齐
机构 * HKUST(GZ)(香港科技大学(广州)) ; NUS(国立新加坡大学) ; UCSD(加州大学圣地亚哥分校) ; Stanford(斯坦福大学) ; PKU(北京大学) ; THU(清华大学)
AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。
TextLDM:基于连续潜在扩散的语言建模
机构 * Joy Future Academy(京东探索研究院) ; HIT(Harbin Institute of Technology) ; HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))
AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。
用于具身AI和机器人模拟的3D生成:综述
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Wuhan University(武汉大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Xinjiang University(新疆大学) ; Tencent(腾讯)
AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。
Comments 27 pages, 11 figures, 8 tables
HAIC:通过动态感知世界模型实现人形敏捷物体交互控制
机构 * Tsinghua University(清华大学) ; HKUST(Guangzhou)(香港科技大学(广州)) ; ETH Zurich(苏黎世联邦理工学院) ; Xiaomi Robotics Lab(小米机器人实验室)
AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。
Comments RSS 2026. Webpage: https://haic-humanoid.github.io/
DiffAdapt:面向令牌高效大语言模型推理的难度自适应推理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; New York University(纽约大学)
AI总结 本文提出DiffAdapt框架,通过分析推理轨迹中的熵分布,根据问题难度选择不同的推理策略,减少令牌使用量,提升推理效率。
Comments ICLR 26
从时间序列分析到问答:在大语言模型时代的一次综述
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Aalborg University(奥胡斯大学)
AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。
Comments Accepted by IJCAI 2026 Survey Track
UniD-Shift:通过可解释的共享-私有多模态分解实现统一的语义分割
机构 * HKUST(GZ)(香港科技大学(广州))
AI总结 本文提出UniD-Shift框架,通过结合视觉和几何编码器提取互补特征,并通过共享-私有子空间分解实现2D-3D语义分割的统一。实验表明在SemanticKITTI和nuScenes数据集上优于基线方法,且具有良好的泛化能力。
面向任务的边缘-云协同通信用于人类动作理解
机构 * Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究所) ; School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) ; Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系)
AI总结 本文提出TOAU框架,通过边缘-云协作减少传输负载和延迟,利用单目姿态估计器和VQ-VAE提取动作特征,提升动作理解精度。
Comments 12 pages, 6 figures
当存储的证据不再可用:基于规模的代理记忆评估
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Duke Kunshan University(杜克昆山大学)
AI总结 本文提出了一种基于规模的代理记忆评估方法,用于评估记忆在无关会话积累时的可靠性变化,展示了不同记忆系统在不同规模下的表现差异。
Comments 19 pages, 11 figures, preprint
掌 sized 全向视觉基于的无人机探索与稀疏拓扑图引导
机构 * Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) ; Thrust of Robotics and Autonomous Systems, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统研究所) ; International Digital Economy Academy, Shenzhen, China(深圳国际数字经济学院)
AI总结 本文提出一种轻量级自主探索系统,利用全向视觉和稀疏拓扑图引导,通过多鱼眼相机实现全向视场和深度估计,采用拓扑节点表示前沿区域,减少内存和计算需求,实现在模拟和实际无人机中高效探索。
EnvSimBench:一个评估和改进基于LLM的环境模拟的基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Chongqing University(重庆大学)
AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。
当常规聊天变得有毒:个性化代理中无意的长期状态污染
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))
AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。
Comments 23 pages
从存储到经验:LLM代理记忆机制演化的综述
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; South China Normal University(南方中国师范大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology Beijing(北京科技大学)
AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。
Comments Accepted by ACL 2026 Findings
XDecomposer:学习无先验的多相X射线衍射集分解
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所新型模式识别实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; Guangzhou Municipal Key Laboratory of Materials Informatics, The Hong Kong University of Science and Technology (Guangzhou)(广州市材料信息学重点实验室,香港科技大学(广州)) ; Green Dynamics, Australia(澳大利亚绿动公司)
AI总结 XDecomposer通过无先验假设的方法,实现多相X射线衍射模式的联合分解与识别,无需候选相列表或结构模板,提升重建准确性和相识别能力。
Comments 28pages, 8figures, 6tables
可及性代理框架:验证门控技能协调
机构 * HKUST(GZ)(香港理工大学(广州)) ; Knowin AI ; Harbin Engineering University(哈尔滨工程大学)
AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。
Comments 43 pages, 22 figures, 8 tables. Ongoing work
Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率
机构 * University of Science and Technology of China(中国科学技术大学) ; Hefei University of Technology(合肥工业大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)
AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。
在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆
机构 * University of Macau(澳门大学) ; UESTC(电子科技大学) ; Purdue University(普渡大学) ; McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。