arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-05-28 至 2026-05-28 共收录 13
2605.28721 2026-05-28 cs.AI

LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

LiveBrowseComp: 搜索智能体是在搜索,还是仅仅在验证它们已知的信息?

HuiMing Fan, Xiao Wang, Zheng Chu, Qianyu Wang, Zhuoyao Wang, Ming Liu, Bing Qin, XingYu

机构 * Harbin Institute of Technology(哈尔滨理工大学) Xiaohongshu(小红书)

AI总结 本文通过诊断方法发现基于LLM的搜索智能体存在内在知识依赖(IKD),即依赖模型内部知识而非外部证据,并引入LiveBrowseComp基准来评估超越内在知识覆盖的深度搜索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28097 2026-05-28 cs.RO

ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents

ICAN-Deploy:面向安全关键具身智能体的身份稳定金丝雀部署

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚分校) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所) Soochow University(苏州大学)

AI总结 提出ICAN-Deploy中间件,通过分离能力名称与版本,在安全关键具身智能体的金丝雀部署中保持身份哈希不变,避免重新认证。

Comments 14 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28056 2026-05-28 cs.CV

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

CogPortrait: 通过分层智能体规划实现肖像动画中的细粒度眼部区域控制

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

AI总结 提出CogPortrait两阶段框架,利用多模态大语言模型智能体从高层标签生成关键点,再通过DiT视频生成骨干合成动画,实现细粒度眼部控制,并引入EMH基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28023 2026-05-28 cs.CV cs.AI cs.CL cs.MM

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

VCap: 用于弱到强视觉字幕的超几何奖励

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Chinese Academy of Sciences(中国科学院) Kuaishou Technology(快手科技)

AI总结 提出VCap,一种证人-裁判奖励机制,通过超几何分布级别的精度验证视觉信号中参考字幕与策略生成字幕之间的事实一致性,实现弱到强泛化,在多个图像和视频字幕基准上超越SOTA模型。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28006 2026-05-28 cs.CL cs.AI

Integrated and Cross-Architecture Interpretation of LLM Reasoning

LLM推理的集成与跨架构解释

Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出集成跨架构推理(IAR)框架,通过带宽校准的MIP与Tukey IQR峰值检测、重叠分析及Jaccard稳定性度量,统一解释LLM推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27906 2026-05-28 cs.AI

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

推理至关重要:通过推理条件偏好优化减轻多模态大型推理模型中的幻觉

Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳)

AI总结 提出推理条件直接偏好优化(RC-DPO)方法,通过将思维链作为答案生成的条件并对比不同思维链下的偏好,结合蒙特卡洛树搜索和注意力引导的思维链剪枝生成偏好数据,有效减轻多模态大型推理模型中的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27397 2026-05-28 cs.LG

IGADA-IoT: IoT Sensor Energy Optimization in Wireless Sensor Networks Driven by Automatic Data Augmentation

IGADA-IoT:自动数据增强驱动的无线传感器网络中物联网传感器能量优化

Mingchun Sun, Rongqiang Zhao, Muhammad Abdul Munnaf, Jie Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)

AI总结 提出一种信息间隙引导的自动数据增强框架IGADA-IoT,通过分层多生成器协作与调度,联合利用不同生成器能力减小信息间隙,并引入信息间隙-模型性能联合评估与闭环方法,提升增强决策准确性,实验表明平均准确率提升7.27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23137 2026-05-28 eess.IV cs.CV

STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding

STAMBRIDGE:用于脑电视觉解码的谱时幅度感知中间特征桥

Jiahe Meng, Weiming Zeng, Yueyang Li, Bo Chai, Hongjie Yan, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(数字图像与智能计算实验室,上海 Maritime 大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Department of Neurology, Affiliated Lianyungang Hospital of Xuzhou Medical University(神经内科,徐州医学院附属连云港医院) Institute of Computing and Intelligence, Harbin Institute of Technology Shenzhen(计算与智能研究所,哈尔滨工业大学深圳研究院)

AI总结 提出STAMBRIDGE两阶段框架,通过谱时幅度感知调制(STAM)提取稳健脑电特征,并利用中间特征语义桥(MFSB)实现稳定的跨模态对齐,在THINGS-EEG基准上取得34.50% Top-1和65.95% Top-5的200路零样本检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18530 2026-05-28 cs.AI

OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning

OGER:一种用于混合强化学习的鲁棒离线引导探索奖励

Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Hithink RoyalFlush Information Network, Hangzhou, China(杭州Hithink RoyalFlush信息网络) Computer and Information Science, University of Macau, Macau, China(澳门大学计算机与信息科学学院)

AI总结 提出OGER框架,通过多教师协作训练和基于熵的辅助探索奖励,统一离线教师引导与在线强化学习,提升大语言模型在数学推理和泛化任务中的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05897 2026-05-28 cs.CL

Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models

停止奖励幻觉步骤:面向小型推理模型的忠实感知步骤级强化学习

Shuo Nie, Hexuan Deng, Chao Wang, Ruiyu Fang, Xuebo Liu, Shuangyong Song, Yu Li, Min Zhang, Xuelong Li

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(中国电信人工智能研究院) College of Integrated Circuits, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学集成电路学院) Zhongguancun Academy, Beijing, China(中关村学院)

AI总结 针对小型推理模型在中间推理步骤中容易产生忠实性幻觉的问题,提出忠实感知步骤级强化学习(FaithRL),通过过程奖励模型提供步骤级监督和隐式截断重采样策略,减少幻觉并提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03491 2026-05-28 cs.CV cs.CL

Decoupling Skeleton and Flesh: Efficient Multimodal Table Reasoning with Disentangled Alignment and Structure-aware Guidance

解耦骨架与血肉:基于解缠对齐和结构感知引导的高效多模态表格推理

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Xiaoqiang Zhou, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

AI总结 提出DiSCo解缠结构-内容对齐框架和Table-GLS全局到局部结构引导推理框架,高效增强LVLM的表格理解与推理能力,无需昂贵监督或外部工具。

Comments Accepted as a Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18271 2026-05-28 cs.CV

ObjFiller3D: Scaling 3D Object Inpainting to Dense Multi-View Consistency

ObjFiller3D:将3D物体修复扩展到密集多视图一致性

Haitang Feng, Xinkai Chen, Jie Liu, Jie Tang, Gangshan Wu, Beiqi Chen, Jianhuang Lai, Guangcong Wang

机构 * Nanjing University(南京大学) Great Bay University(大湾大学) Harbin Institute of Technology(哈尔滨工业大学) Sun Yat-sen University(中山大学)

AI总结 提出ObjFiller-3D方法,通过联合优化密集采样视图的时序生成、语义感知补全和循环一致性3D编码,实现高质量且一致的多视图3D物体修复与编辑。

Comments Project page: https://objfiller3d.github.io/ Code: https://github.com/objfiller3d/ObjFiller-3D

详情

展开后加载摘要…

URL PDF HTML 收藏