arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1439
2604.04634 2026-04-07 cs.CV cs.AI

Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale

保留伪造痕迹:在原生尺度上进行AI生成视频检测

Zhengcen Li, Chenyang Jiang, Hang Zhao, Shiyang Zhou, Yunyang Mo, Feng Gao, Fan Yang, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 本文提出在原生尺度上进行AI生成视频检测的新方法,通过构建大规模数据集和新型框架,有效保留高频率伪影和时空不一致特征,提升检测性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04262 2026-04-07 cs.MA cs.AI cs.CR

Agents for Agents: An Interrogator-Based Secure Framework for Autonomous Internet of Underwater Things

代理为代理:一种基于 interrogator 的安全框架,用于自主水下物联网

Ali Akarma, Toqeer Ali Syed, Abdul Khadar Jilani, Salman Jan, Hammad Muneer, Muazzam A. Khan, Changli Yu

机构 * AI Center, Faculty of Computer and Information Systems, Islamic University of Madinah(伊斯兰麦地那大学计算机与信息系统学院人工智能中心) College of Computer Studies, University of Technology Bahrain(巴林科技大学计算机研究学院) Faculty of Computer Studies, Arab Open University-Bahrain(阿拉伯开放大学巴林分校计算机研究学院) Department of Computer Science, The Islamia University of Bahawalpur(巴哈瓦尔布尔伊斯兰大学计算机科学系) ICESCO Chair in Big Data Analytics and Edge Computing, Quaid-e-Azam University(真纳大学ICESCO大数据分析与边缘计算教席) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海))

AI总结 本文提出一种基于 interrogator 的安全框架,用于自主水下物联网,通过行为信任监控提升协调能力,同时保持可扩展性和部署效率。

Comments This paper was presented in ICETAS 2026 in Bahrain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04190 2026-04-07 cs.AI

Schema-Aware Planning and Hybrid Knowledge Toolset for Reliable Knowledge Graph Triple Verification

基于模式的规划和混合知识工具集的可靠知识图谱三元组验证

Xinyan Ma, Xianhao Ou, Weihao Zhang, Shixin Jiang, Runxuan Liu, Dandan Tu, Lei Chen, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Bay Area International Business School, Beijing Normal University(北京师范大学湾区国际商学院)

AI总结 本文提出SHARP,一种无需训练的自主代理,通过动态策略规划、主动调查和证据推理改进知识图谱三元组验证的稳定性与解释性,实验证明其在FB15K-237和Wikidata5M-Ind上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03039 2026-04-07 cs.CV

GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model

GenSmoke-GS:一种基于生成模型的多阶段方法,用于从烟雾退化图像中生成新视角

Qida Cao, Xinyuan Hu, Changyue Shi, Jiajun Ding, Zhou Yu, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

AI总结 本文提出GenSmoke-GS方法,通过多阶段流程提升烟雾退化图像的可视性,减少场景内容变化,实验表明其在定量和视觉质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06683 2026-04-07 cs.CV

ECHO: Event-Centric Hypergraph Operations via Multi-Agent Collaboration for Multimedia Event Extraction

ECHO:基于多智能体协作的多媒体事件提取的事件中心超图操作

Hailong Chu, Hongbing Li, Yunlong Chu, Shutai Huang, Xingyue Zhang, Tinghe Yan, Jinsong Zhang, Shuo Zhang, Lei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 ECHO通过多智能体协作将多媒体事件提取重构为超图的迭代优化过程,明确事件结构并提高可审查性,实验表明其在事件提及和论证角色上分别提升了7.3和15.5个F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03999 2026-04-07 cs.RO

Dynamic Whole-Body Dancing with Humanoid Robots -- A Model-Based Control Approach

动态全身体舞与人形机器人——一种基于模型的控制方法

Shibowen Zhang, Jiayang Wu, Guannan Liu, Helin Zhu, Junjie Liu, Zhehan Li, Junhong Guo, Xiaokun Leng, Hangxin Liu, Jingwen Zhang, Jikai Wang, Zonghai Chen, Zhicheng He, Jiayi Wang, Yao Su

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出了一种基于模型的框架,用于生成和执行人形机器人上的动态全身体舞动作。框架分为离线动作生成和在线动作执行两个阶段,利用未来状态预测实现鲁棒且动态的舞动动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03657 2026-04-07 cs.CV cs.IR cs.MM

Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

爱我,爱我的标签:重新思考标签在视觉上下文学习中的提示检索中的作用

Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

AI总结 本文提出LaPR框架,通过增强标签信息提升视觉上下文学习中提示检索的性能,实验表明其在分割、检测和着色任务中表现优异。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03653 2026-04-07 cs.CV cs.IR cs.MM

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

想象之前聚焦:扩散引导的寄存器增强部分相关视频检索

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出DreamPRVR,通过粗到细的表示学习范式,利用扩散模型生成全局语义寄存器,提升部分相关视频检索的准确性与鲁棒性。

Comments Accepted to CVPR 2026. 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03306 2026-04-07 cs.CV

Deep Image Clustering Based on Curriculum Learning and Density Information

基于课程学习和密度信息的深度图像聚类

Haiyang Zheng, Ruilin Zhang, Hongpeng Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出IDCL方法,首次引入密度信息的模型训练策略,通过课程学习和密度核心改进聚类鲁棒性与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02804 2026-04-06 cs.CV cs.AI cs.MM

PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis

PaveBench: 一种多功能的路面病害感知及交互视觉-语言分析基准

Dexiang Li, Zhenning Che, Haijun Zhang, Dongliang Zhou, Zhao Zhang, Yahong Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianjin University(天津大学) Hefei University of Technology(合肥工业大学)

AI总结 PaveBench针对路面状况评估中的视觉识别与多模态交互需求,提供分类、检测、分割及视觉-语言问答等四项任务,支持多轮交互与事实推理,填补现有数据集在多模态分析与实际应用连接上的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02654 2026-04-06 cs.CV

Drift-Resilient Temporal Priors for Visual Tracking

具有抗漂移特性的时序先验用于视觉跟踪

Yuqing Huang, Liting Lin, Weijun Zhuang, Zhenyu He, Xin Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Lero, the Research Ireland Centre for Software, University of Limerick(Lero,爱尔兰软件研究中心,利默里克大学) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

AI总结 本文提出DTPTrack模块,通过时序可靠性校准和时序指导合成方法,提升多帧跟踪器的抗漂移能力,在三个不同架构上均取得显著性能提升。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02334 2026-04-06 cs.AI cs.MA

Holos: A Web-Scale LLM-Based Multi-Agent System for the Agentic Web

Holos:一种基于大语言模型的多智能体系统,用于代理网络

Xiaohang Nie, Zihan Guo, Zicai Cui, Jiachi Yang, Zeyi Chen, Leheyi De, Yu Zhang, Junwei Liao, Bo Huang, Yingxuan Yang, Zhi Han, Zimian Peng, Linyao Chen, Wenzheng Tom Tang, Zongkai Liu, Tao Zhou, Botao Amber Hu, Shuyang Tang, Jianghao Lin, Weiwen Liu, Muning Wen, Yuanjian Zhou, Weinan Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) Sun Yat-sen University(中山大学) University of Oxford(牛津大学) Holos Engineering

AI总结 Holos是一种大规模多智能体系统,旨在解决LLM驱动智能体在扩展、协调和价值分配中的挑战,通过五层架构和内生价值循环,推动代理网络的自组织和持续发展。

Comments 38 pages, 8 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01995 2026-04-03 cs.CV

MTLSI-Net: A Linear Semantic Interaction Network for Parameter-Efficient Multi-Task Dense Prediction

MTLSI-Net:一种用于参数高效多任务密集预测的线性语义交互网络

Chen Liu, Hengyu Man, Xiaopeng Fan, Debin Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology SuZhou Research Institute(哈尔滨工业大学苏州研究院)

AI总结 本文提出MTLSI-Net,通过线性注意力机制解决多任务密集预测中全局跨任务交互的挑战,采用三关键组件实现高效参数使用,实验表明其在NYUDv2和PASCAL-Context上达到SOTA性能。

Comments accepted by ICME 2026, to be published

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01974 2026-04-03 cs.CV

Interactive Tracking: A Human-in-the-Loop Paradigm with Memory-Augmented Adaptation

交互跟踪:一种带有记忆增强适应的人机协作范式

Yuqing Huang, Guotian Zeng, Zhenqiao Yuan, Zhenyu He, Xin Li, Yaowei Wang, Ming-Hsuan Yang

机构 * Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学) Pazhou Lab (Huangpu)(琶洲实验室(黄埔)) UC Merced(加州大学默塞德分校) Yonsei University(延世大学)

AI总结 本文提出交互跟踪范式,通过自然语言指令实现人机协作,构建了首个大规模交互跟踪基准,评估25种跟踪器并提出IMAT基线,展示传统方法在交互场景下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01727 2026-04-03 cs.LG

MATA-Former & SIICU: Semantic Aware Temporal Alignment for High-Fidelity ICU Risk Prediction

MATA-Former 及 SIICU:语义感知的时序对齐用于高保真ICU风险预测

Zhichong Zheng, Xiaohang Nie, Xueqi Wang, Yuanjin Zhao, Haitao Zhang, Yichao Tang

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Department of Critical Care Medicine, Shanghai East Hospital, Tongji University School of Medicine(同济大学医学院附属上海东方医院重症医学科) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出MATA-Former和SIICU,通过事件语义动态参数化注意力权重,优先考虑因果有效性而非时间延迟,以提升ICU风险预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01703 2026-04-03 cs.RO

3-D Relative Localization for Multi-Robot Systems with Angle and Self-Displacement Measurements

多机器人系统中基于角度和自身位移测量的三维相对定位

Chenyang Liang, Liangming Chen, Baoyi Cui, Jie Mei

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)智能科学与工程学院) School of Automation and Intelligent Manufacturing, and Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, Southern University of Science and Technology, China(南方科技大学自动化与智能制造学院及广东省全驱系统控制理论与技术重点实验室) Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)广东省智能变体机构与自适应机器人重点实验室)

AI总结 本文提出基于机器人间内角和自身位移测量的三维相对定位框架,解决测量噪声下的定位问题,通过改进的MAP估计器和权重总最小二乘法提高精度与效率。

Comments 29 pages, 28 figures

Journal ref The International Journal of Robotics Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01618 2026-04-03 cs.CV cs.AI

Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models

Tex3D: 通过对抗性3D纹理将物体作为攻击面用于视觉-语言-动作模型

Jiawei Chen, Simin Huang, Jiawei Du, Shuaihang Chen, Yu Tian, Mingjie Wei, Chao Yu, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) CFAR, A*STAR, Singapore(新加坡科技研究局CFAR) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出Tex3D框架,通过对抗性3D纹理攻击视觉-语言-动作模型,揭示其在物理环境中面临的关键漏洞,展示了在仿真和真实机器人任务中显著降低模型性能的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24270 2026-04-03 cs.CV

ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors

ScrollScape: 通过视频扩散先验解锁32K图像生成

Haodong Yu, Yabo Zhang, Donglin Di, Ruyi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto, Beijing, China(理想汽车(中国北京))

AI总结 ScrollScape通过将超大比例图像生成转化为连续视频生成过程,利用视频模型的时序一致性确保结构完整性,实现32K分辨率的高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22862 2026-04-03 cs.SE cs.CL

The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration

大语言模型代理中工具使用的演变:从单工具调用到多工具编排

Haoyuan Xu, Chang Li, Xinyan Ma, Xianhao Ou, Zihan Zhang, Tao He, Xiangyu Liu, Zixiang Wang, Jiafeng Liang, Zheng Chu, Runxuan Liu, Rongchuan Mu, Dandan Tu, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harvard University(哈佛大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文探讨了大语言模型代理中工具使用从单次调用到长期编排的演变,分析了多工具代理的最新进展,涵盖任务规划、安全控制、效率优化及实际应用等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12372 2026-04-03 cs.AI cs.CL cs.LG

Efficient Reasoning with Balanced Thinking

高效平衡思考推理

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong Li, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zhongguancun Academy(中关村学院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03396 2026-04-03 cs.CL

Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective

迈向抗蒸馏的大语言模型:信息论视角

Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文从信息论角度分析蒸馏防御问题,提出通过最小化条件互信息来提升模型抗蒸馏能力,设计变换矩阵净化输出以增强安全性,实验表明方法有效降低蒸馏性能并保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03380 2026-04-03 cs.CV

Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization

通过链看穿:通过CoT压缩和对比偏好优化缓解多模态推理模型的幻觉

Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文提出C3PO框架,通过CoT压缩和对比偏好优化缓解多模态推理模型的幻觉问题,通过过滤冗余思考 token 提升信号效率,并利用高质量反馈和定制诱导器增强对比学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17954 2026-04-03 cs.AI cs.CL

ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling

ExpertFlow:通过预测专家缓存和令牌调度实现高效的混合专家推理

Xin He, Shunkang Zhang, Kaijie Tang, Shaohuai Shi, Yuxin Wang, Zihao Zeng, Zhenheng Tang, Xiaowen Chu, Haiyan Yin, Ivor W. Tsang, Yew Soon Ong

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局CFAR) The Hong Kong University of Science and Technology, Hong Kong(香港科技大学) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, Hong Kong(香港浸会大学) Nanyang Technological University, Singapore(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))

AI总结 本文提出ExpertFlow,通过预测专家缓存和令牌调度实现高效的混合专家推理,减少GPU内存使用达93.72%,提升推理吞吐量达10倍。

Comments Accepted in DAC'26, Mixture-of-Experts, Inference, Offloading

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00955 2026-04-02 cs.CV

Enhancing Gradient Inversion Attacks in Federated Learning via Hierarchical Feature Optimization

通过分层特征优化增强联邦学习中的梯度反向攻击

Hao Fang, Wenbo Yu, Bin Chen, Xuan Wang, Shu-Tao Xia, Qing Liao, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出GIFD方法,通过分解GAN模型并搜索中间层的分层特征,提升梯度反向攻击的表达能力和泛化能力,同时引入正则化约束和OOD场景下的标签映射技术,实现像素级重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00601 2026-04-02 cs.CV

KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering

KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答

Xianyao Zheng, Hong Yu, Hui Cui, Changming Sun, Xiangyu Li, Ran Su, Leyi Wei, Jia Zhou, Junbo Wang, Qiangguo Jin

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Computer Software, Tianjin University(天津大学计算机软件学院) Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心) Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)

AI总结 本文提出KG-CMI框架,通过整合医学知识图谱提升医学视觉问答的准确性与多样性,实验表明其在三个数据集上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00548 2026-04-02 cs.CV

Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations

Reliev3R: 从多视角几何注释中解脱的前馈重建

Youyu Chen, Junjun Jiang, Yueru Luo, Kui Jiang, Xianming Liu, Xu Yan, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 Reliev3R通过弱监督方法训练前馈重建模型,无需昂贵的多视角几何注释,利用单目相对深度和图像稀疏对应关系进行3D知识学习,提升重建效率与可扩展性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00395 2026-04-02 cs.CV

Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge

通过跟踪增强提示推进复杂视频对象分割:第五届PVUW MOSE挑战赛第一名

Jinrong Zhang, Canyang Wu, Xusheng He, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, China(深圳市环区研究所)

AI总结 本文提出TEP方法,通过跟踪增强提示解决SAM3在处理小目标和语义主导对象时的不足,取得PVUW挑战赛优异成绩。

Comments 1st Place Solution for the 5th PVUW MOSE Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28431 2026-04-02 cs.CV cs.AI

LG-HCC: Local Geometry-Aware Hierarchical Context Compression for 3D Gaussian Splatting

LG-HCC:局部几何感知的层次上下文压缩用于3D高斯点扩散

Xuan Deng, Xiandong Meng, Hengyu Man, Qiang Zhu, Tiange Zhang, Debin Zhao, Xiaopeng Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

AI总结 本文提出LG-HCC框架,通过引入局部几何感知的锚点修剪和分层熵编码,提升3D高斯点扩散的存储效率与几何一致性。

Comments 10

详情

展开后加载摘要…

URL PDF HTML 收藏