VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling
VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。
高校专区
VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。
通过锚点中心适应摆脱机器人操作中的多样性陷阱
机构 * National University of Singapore(新加坡国立大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Institude for Information Research, A STAR(A*STAR信息研究所)
AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。
Comments 21 pages, 8 figures
RCoT-Seg:强化链式推理用于视频推理与分割
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Pengcheng Laboratory(鹏城实验室) ; Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。
Comments 21 pages
隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)
机构 * College of Software, Nankai University(南开大学软件学院) ; Zhongguancun Academy(中关村学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; East China Normal University(华东师范大学) ; Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学)
AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。
掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测
机构 * Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) ; North China University of Water Resources and Electric Power(华北水利水电大学) ; University of Auckland(奥克兰大学)
AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。
重新思考自演化语言模型代理中的经验利用
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。
Comments 30 pages, 20 figures, 7 tables
UniV2D:连接视觉修复与语义感知以实现水下显著目标检测
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
AI总结 本文提出UniV2D,通过联合优化视觉修复与显著目标检测,解决水下视觉退化问题,提升语义一致性与检测性能。
MASPO:基于大语言模型的多智能体系统的联合提示优化
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。
Comments Accepted at ICML 2026
InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)
AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。
TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。
粒度轴:语言模型中社会角色的微到宏观潜在方向
机构 * The University of Hong Kong(香港大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 研究揭示语言模型中社会角色粒度的潜在方向,通过定义粒度轴,发现其主导了角色表示空间的几何结构,并通过实验验证其在不同层级和模型间的稳定性与因果相关性。
Comments 28 pages, including appendices
事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架
机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) ; Tianjin University(天津大学) ; Institute of Computing and Intelligence(计算与智能研究所) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) ; Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) ; School of Future Technology(未来技术学院) ; Shanghai University(上海大学)
AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。
调度与校准:面向代码LLM的实用导向多任务强化学习
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)
AI总结 本文提出ASTOR框架,通过任务实用性驱动的协调机制,提升多任务强化学习在代码LLM中的效果,实验显示其在多个编码任务中优于专用专家和基线方法。
重新审视不确定性:关于部分相关视频检索的证据学习
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)
AI总结 本文提出Holmes框架,通过多粒度跨模态证据聚合量化和建模不确定性,解决视频检索中因查询简短与视频内容丰富带来的语义模糊问题。
Comments Accepted by ICML 2026. 16 pages, 6 figures, 3 tables
BehaviorGuard: 面向深度强化学习的在线后门防御
机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络安全学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Department of Electronic and Electrical Engineering, University College London(伦敦大学学院电子与电气工程系)
AI总结 本文提出BehaviorGuard,一种基于行为的在线后门检测与缓解框架,通过分析动作分布变化识别并抑制后门行为,在单 agent 和多 agent DRL 中均有效。
Comments 11 pages
Journal ref IJCAI 2026
无人机视角下视觉语言模型能否思考?统一无人机推理与生成
机构 * Beijing Institute of Technology(北京理工大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) ; University of Macau(澳门大学)
AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。
Comments 21 pages, 12 figures, 7 tables
超越分块:面向长文档问答的篇章意识层次检索
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能研究院,哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute (SLAI)(深圳环形区研究院(SLAI))
AI总结 本文提出一种篇章意识层次检索框架,利用修辞结构理论处理长文档问答,通过 discourse parsing 和 LLM 增强实现结构与语义信息的融合,实验表明在多种语言和文档类型上均取得显著提升。
Comments 21 pages, 9 figures. Accepted at ACL 2026 Main conference
MPNet: 一种鲁棒且高效的流形池化网络用于多节奏EEG信号解码
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Guangxi Normal University(广西师范大学)
AI总结 MPNet通过流形池化层有效降低计算成本,实现多节奏EEG信号的高效解码,在两个公开数据集上达到最佳性能,运行速度比传统模型快10倍。
适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。
Comments Accepted to ACL 2026 (Findings)
基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。
Comments Accepted by ACL 2026
GR-Ben:一种通用推理基准,用于评估过程奖励模型
机构 * Research Center for Social Computing(社会计算研究中心) ; Interactive Robotics, Harbin Institute of Technology, China(交互机器人学,哈尔滨工业大学,中国) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
AI总结 GR-Ben旨在评估过程奖励模型在科学和逻辑两大领域及九个子领域的误差检测能力,揭示现有模型在非数学领域和计算错误检测上的不足。
MesonGS++: 3D高斯散射的后训练压缩与超参数搜索
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Shenzhen Technology University(深圳技术大学) ; Xiamen University(厦门大学) ; Simon Fraser University(西蒙弗雷泽大学) ; Jiangxing Intelligence Inc.(江兴智能有限公司)
AI总结 MesonGS++提出了一种基于超参数搜索的3D高斯散射后训练压缩方法,通过联合重要性剪枝、八叉树几何编码等技术,实现34倍压缩并保持渲染质量,优于现有方法并精准满足目标存储预算。
通过视觉-语言校准推进分析类增量学习
机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) ; CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)的CFAR和IHPC) ; College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院)
AI总结 本文提出VILA框架,通过双级视觉语言校准策略解决预训练模型分析类增量学习中的表示刚性问题,提升学习效率与稳定性,在多个基准测试中表现优异。
Comments 20 pages, 11 figures, 9 tables. Accepted by ICML2026
FRISM:通过子空间级模型融合实现细粒度推理注入用于视觉-语言模型
机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院,中国) ; Shanghai Innovation Institute, China(上海创新研究院,中国) ; The Chinese University of Hong Kong, China(香港中文大学,中国) ; Harbin Institute of Technology, China(哈尔滨工业大学,中国) ; Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) ; Sun Yat-Sen University, Shenzhen, China(暨南大学深圳校区,中国)
AI总结 FRISM通过子空间级模型融合实现细粒度推理注入,有效提升视觉-语言模型的推理能力并保持视觉能力。
Comments Accepted by ICML 2026
ESARBench: 一种用于代理无人机体感知搜索与救援的基准
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出ESARBench,首个用于评估基于MLLM的无人机在高真实感搜索与救援场景中的基准,通过构建高保真环境和600个任务数据集,揭示了ESAR中的关键瓶颈。
Comments 20 pages, 7 figures
InsTraj: 通过旅行意图指导扩散模型生成真实世界轨迹
机构 * Southern University of Science and Technology(南方科技大学) ; City University of Hong Kong(香港城市大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州)) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; University of York(约克大学)
AI总结 InsTraj通过自然语言描述指导扩散模型生成真实、多样且符合指令的轨迹,解决传统方法在理解和生成复杂用户意图及约束条件上的不足。
STARRY:面向机器人操作的时空动作中心世界建模
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; East China Normal University(华东师范大学) ; DeepCybo
AI总结 STARRY通过统一扩散过程联合去噪未来时空潜在表示和动作,提升机器人操作中时空协调的精度与成功率。
Comments 19 pages
Auto-FlexSwitch: 通过可学习的任务向量压缩实现高效的动态模型合并
机构 * School of Mathematics, Harbin Institute of Technology, Harbin, P. R. China(哈尔滨工业大学数学学院,哈尔滨,中华人民共和国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, P. R. China(上海人工智能实验室,上海,中华人民共和国)
AI总结 本文提出Auto-FlexSwitch,通过可学习的任务向量压缩实现高效动态模型合并,解决传统方法存储开销大的问题。
具有门控注入的频率感知语义融合用于AI生成图像检测
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出FGINet,通过BMFE和LGFI机制提升AI生成图像检测的泛化能力,采用HCL框架学习紧凑且分离的表示。
ZipCCL: 通信集体的高效无损数据压缩以加速大语言模型训练
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Hong Kong University of Science(香港科学大学)
AI总结 本文提出ZipCCL,通过理论编码、GPU优化内核和自适应策略,实现通信数据的无损压缩,减少通信时间并提升训练速度。