arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-05-25 至 2026-05-25 共收录 7
2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23422 2026-05-25 cs.LG

Hinge Regression Trees and HRT-Boost: Newton-Optimized Oblique Learning for Compact Tabular Models

铰链回归树与HRT-Boost:面向紧凑表格模型的牛顿优化斜学习

Hongyi Li, Jun Xu, Hong Yan

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区智能科学与工程学院) Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments, Shenzhen(深圳先进运动控制及现代自动化装备重点实验室) Department of Electrical Engineering, City University of Hong Kong, Kowloon(香港城市大学电子工程系)

AI总结 提出铰链回归树(HRT)框架,将斜分割重构为两个线性预测器的非线性最小二乘问题,并通过阻尼牛顿法优化,实现紧凑表格模型的高质量学习;进一步提出HRT-Boost集成方法,结合节点级牛顿更新与阶段式函数梯度下降,在平方损失下保证经验风险降低。

Comments arXiv admin note: substantial text overlap with arXiv:2602.05371

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23372 2026-05-25 cs.LG cs.AI

Curriculum reinforcement learning with measurable task representation learning

基于可度量任务表征学习的课程强化学习

Yongyan Wen, Siyuan Li, Mingjian Fu, Yiqin Yang, Xun Wang, Peng Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Fuzhou University(福州大学) China Academy of Sciences(中国科学院)

AI总结 提出一种基于可度量任务表征学习的自动课程生成方法,通过变分自编码器将任务空间映射到具有相似性度量的潜在空间,并据此生成逐步接近目标任务的课程,在复杂导航任务中优于现有插值和生成对抗网络方法。

Journal ref Neural Networks, 109019 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23372 2026-05-25 cs.CV

UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries

UniEmo: 利用可学习专家查询统一情感理解与生成

Yijie Zhu, Lingsen Zhang, Zitong Yu, Rui Shao, Tao Tan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) School of Computing and Information Technology(计算机与信息学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室) Shenzhen Loop Area Institute(深圳河套学院) Macao Polytechnic University(澳门 polytechnic 大学)

AI总结 提出UniEmo统一框架,通过可学习专家查询的分层情感理解链提取多尺度情感特征,并融合情感表示引导扩散模型生成情感图像,同时利用生成驱动的双重反馈提升理解能力,在情感理解和生成任务上超越现有方法。

Comments Accepted to TIP 2026

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 5165-5180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12455 2026-05-25 cs.CV

Mitigating Object Hallucinations via Sentence-Level Early Intervention

通过句子级早期干预缓解对象幻觉

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12173 2026-05-25 cs.LG cs.AI

SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks

SkillTree: 面向长时域控制任务的可解释基于技能的深度强化学习

Yongyan Wen, Siyuan Li, Rongchang Zuo, Lei Yuan, Hangyu Mao, Peng Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) National Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies SenseTime Research(商汤科技研究院)

AI总结 提出SkillTree框架,通过可微决策树将连续动作空间离散化为技能空间,实现技能级可解释性,在复杂机器人臂控制任务中达到与基于技能的神经网络相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏