arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-05-11 至 2026-05-11 共收录 16
2605.08073 2026-05-11 cs.CV cs.AI

EmambaIR: Efficient Visual State Space Model for Event-guided Image Reconstruction

EmambaIR:用于事件引导图像重建的高效视觉状态空间模型

Wei Yu, Yunhang Qian

机构 * Harbin Institute of Technology(哈尔滨理工大学)

AI总结 本文提出EmambaIR,一种高效的视觉状态空间模型,通过跨模态Top-k稀疏注意力模块和门控状态空间模块,提升事件流图像重建的效率与性能,实现更高效的全局上下文捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07810 2026-05-11 physics.optics cs.CV

Pre-training Enables Extraordinary All-optical Image Denoising

预训练实现非凡全光图像去噪

Xudong Lv, Yuxiang Sun, Shuo Wang, Nanxing Chen, Jun Guan, Jingtian Hu

机构 * Ministry of Industry and Information Technology Key Lab of Micro-Nano Optoelectronic Information System(工业和信息化部微纳光电信息系统重点实验室) Guangdong Provincial Key Laboratory of Semiconductor Optoelectronic Materials and Intelligent Photonic System(广东省半导体光电材料与智能光子系统重点实验室) Harbin Institute of Technology(哈尔滨工业大学) School of Electronics and Information Engineering(电子与信息工程学院) Zhejiang Provincial Key Laboratory of Intelligent Vehicle Electronics Research(浙江省智能车辆电子研究所) Hangzhou Dianzi University(杭州电子科技大学) School of Science and Engineering(科学与工程学院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) Key Laboratory of Photonic Technology for Integrated Sensing and Communication, Ministry of Education(教育部光电一体化感知与通信技术重点实验室) Guangdong University of Technology(广东工业大学)

AI总结 本文提出一种预训练驱动方法,通过两步优化过程实现高效全光图像去噪,显著提升去噪质量,适用于多种图像风格,且在噪声环境下保持细节并提高PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26509 2026-05-11 cs.RO cs.CV

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06859 2026-05-11 cs.LG cs.AI

Exact Is Easier: Credit Assignment for Cooperative LLM Agents

精确更简单:合作大语言模型代理的信用分配

Yanjun Chen, Yirong Sun, Hanlin Wang, Jinghan Wang, Xinming Zhang, Xiaoyu Shen, Wenjie Li, Wei Zhang

机构 * Eastern Institute of Technology(东部技术研究所) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00465 2026-05-11 cs.LG cs.AI

PAIR-Former: Budgeted Relational Multi-Instance Learning for Functional miRNA Target Prediction

PAIR-Former:预算化的关系多实例学习用于功能miRNA靶点预测

Jiaqi Yin, Baiming Chen, Jia Fei, Mingjun Yang

机构 * School of Future Technology(未来技术学院) Harbin Institute of Technology(哈尔滨工业大学) School of Medicine(医学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Medical College, Jinan University(济南大学医学院) Shenzhen Jingtai Technology Co., Ltd. (XtalPi)(深圳金泰科技有限公司(XtalPi))

AI总结 本文提出PAIR-Former,通过预算化的关系多实例学习方法,解决功能miRNA靶点预测中的关系模式建模问题,实现高精度预测。

Comments Preprint. Under review. During the preprint stage, inquiries and feedback can be directed to Jiaqi Yin (yjqhit@gmail.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02129 2026-05-11 cs.CV

VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling

VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模

Yuru Xiao, Zihan Lin, Chao Lu, Deming Zhai, Kui Jiang, Wenbo Zhao, Wei Zhang, Junjun Jiang, Huanran Wang, Xianming Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07381 2026-05-11 cs.RO cs.AI

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

通过锚点中心适应摆脱机器人操作中的多样性陷阱

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Institude for Information Research, A STAR(A*STAR信息研究所)

AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07334 2026-05-11 cs.CV

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07146 2026-05-11 cs.CV

UniV2D: Bridging Visual Restoration and Semantic Perception for Underwater Salient Object Detection

UniV2D:连接视觉修复与语义感知以实现水下显著目标检测

Laibin Chang, Shaodong Wang, Yunke Wang, Xu Zhang, Kui Jiang, Chang Xu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

AI总结 本文提出UniV2D,通过联合优化视觉修复与显著目标检测,解决水下视觉退化问题,提升语义一致性与检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06623 2026-05-11 cs.AI cs.CL cs.LG cs.MA

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO:基于大语言模型的多智能体系统的联合提示优化

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)

AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18700 2026-05-11 cs.AI

TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent

TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试

Xingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏