EmambaIR: Efficient Visual State Space Model for Event-guided Image Reconstruction
EmambaIR:用于事件引导图像重建的高效视觉状态空间模型
机构 * Harbin Institute of Technology(哈尔滨理工大学)
AI总结 本文提出EmambaIR,一种高效的视觉状态空间模型,通过跨模态Top-k稀疏注意力模块和门控状态空间模块,提升事件流图像重建的效率与性能,实现更高效的全局上下文捕捉。
高校专区
EmambaIR:用于事件引导图像重建的高效视觉状态空间模型
机构 * Harbin Institute of Technology(哈尔滨理工大学)
AI总结 本文提出EmambaIR,一种高效的视觉状态空间模型,通过跨模态Top-k稀疏注意力模块和门控状态空间模块,提升事件流图像重建的效率与性能,实现更高效的全局上下文捕捉。
SphereVAD: 基于单位超球面几何推断的无训练视频异常检测
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)
AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。
Comments 48 pages, 25 figures
预训练实现非凡全光图像去噪
机构 * Ministry of Industry and Information Technology Key Lab of Micro-Nano Optoelectronic Information System(工业和信息化部微纳光电信息系统重点实验室) ; Guangdong Provincial Key Laboratory of Semiconductor Optoelectronic Materials and Intelligent Photonic System(广东省半导体光电材料与智能光子系统重点实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; School of Electronics and Information Engineering(电子与信息工程学院) ; Zhejiang Provincial Key Laboratory of Intelligent Vehicle Electronics Research(浙江省智能车辆电子研究所) ; Hangzhou Dianzi University(杭州电子科技大学) ; School of Science and Engineering(科学与工程学院) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) ; Key Laboratory of Photonic Technology for Integrated Sensing and Communication, Ministry of Education(教育部光电一体化感知与通信技术重点实验室) ; Guangdong University of Technology(广东工业大学)
AI总结 本文提出一种预训练驱动方法,通过两步优化过程实现高效全光图像去噪,显著提升去噪质量,适用于多种图像风格,且在噪声环境下保持细节并提高PSNR。
用于具身AI和机器人模拟的3D生成:综述
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Wuhan University(武汉大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Xinjiang University(新疆大学) ; Tencent(腾讯)
AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。
Comments 27 pages, 11 figures, 8 tables
精确更简单:合作大语言模型代理的信用分配
机构 * Eastern Institute of Technology(东部技术研究所) ; The Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。
PAIR-Former:预算化的关系多实例学习用于功能miRNA靶点预测
机构 * School of Future Technology(未来技术学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; School of Medicine(医学院) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Medical College, Jinan University(济南大学医学院) ; Shenzhen Jingtai Technology Co., Ltd. (XtalPi)(深圳金泰科技有限公司(XtalPi))
AI总结 本文提出PAIR-Former,通过预算化的关系多实例学习方法,解决功能miRNA靶点预测中的关系模式建模问题,实现高精度预测。
Comments Preprint. Under review. During the preprint stage, inquiries and feedback can be directed to Jiaqi Yin (yjqhit@gmail.com)
VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。
通过锚点中心适应摆脱机器人操作中的多样性陷阱
机构 * National University of Singapore(新加坡国立大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Institude for Information Research, A STAR(A*STAR信息研究所)
AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。
Comments 21 pages, 8 figures
RCoT-Seg:强化链式推理用于视频推理与分割
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Pengcheng Laboratory(鹏城实验室) ; Pazhou Lab (Huangpu)(琶洲实验室(黄埔))
AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。
Comments 21 pages
隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)
机构 * College of Software, Nankai University(南开大学软件学院) ; Zhongguancun Academy(中关村学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; East China Normal University(华东师范大学) ; Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学)
AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。
掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测
机构 * Zhejiang University(浙江大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) ; North China University of Water Resources and Electric Power(华北水利水电大学) ; University of Auckland(奥克兰大学)
AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。
重新思考自演化语言模型代理中的经验利用
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。
Comments 30 pages, 20 figures, 7 tables
UniV2D:连接视觉修复与语义感知以实现水下显著目标检测
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
AI总结 本文提出UniV2D,通过联合优化视觉修复与显著目标检测,解决水下视觉退化问题,提升语义一致性与检测性能。
MASPO:基于大语言模型的多智能体系统的联合提示优化
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。
Comments Accepted at ICML 2026
InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)
AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。
TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。