arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-08-20 至 2026-08-20 共收录 9
2608.18996 2026-08-20 cs.CV cs.AI 新提交

GrabVG: Graph-Attentive Binding for Visual Grounding in UAV Imagery

GrabVG:面向无人机图像视觉 grounding 的图注意力绑定方法

Chaowei Wang, Yan Di, Jingjun Sun, Baozhe Liu, Jiaxu Tian, Yuheng Li, Guangqian Guo, Shan Gao

机构 * Northwestern Polytechnical University(西北工业大学) Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对无人机图像视觉 grounding 的冗余与拓扑歧义问题,提出 GrabVG 框架,通过预注意假设搜索与图注意力特征绑定实现目标定位,在 AerialVG、AerialSense 数据集上精度显著优于基线且精度-速度权衡良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18573 2026-08-20 cs.CV 新提交

PATE-Forensics: Perception-as-Tool for Explainable Deepfake Forensics with General-Purpose MLLMs

PATE-Forensics:以通用多模态大语言模型(MLLM)为工具的可解释深度伪造取证方法

Yaqi Li, Jielun Peng, Yabin Wang, Jincheng Liu, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究提出PATE-Forensics,采用“感知即工具”范式,基于DINOv3构建取证感知工具,结合通用MLLM实现可解释深度伪造取证,在DDL-X Track 3数据集上取得0.89的最佳官方分数,较次席高出0.19分。

Comments 9 pages, 3 figures, 2 tables; DDL-X Track 3, IJCAI 2026 AI Safety Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18532 2026-08-20 cs.CV 新提交

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

StateTrace:面向长视频中隐状态时空推理的以对象为中心的框架

Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) The University of Sydney(悉尼大学) Central South University(中南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) SenseTime Research(商汤科技研究院)

AI总结 StateTrace是一种以对象为中心的框架,为VideoLLMs赋予长视频隐状态推理能力,构建时空状态记忆并经实验显著提升了VideoLLMs在相关基准上的性能。

Comments 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18498 2026-08-20 cs.CV 新提交

DyG$^2$T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

DyG²T:基于3D高斯时空粒子图Transformer的对象动力学建模

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang

机构 * School of Computer Science and Technology, Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 本文针对现有动力学建模方法丢失细粒度细节、轨迹漂移等问题,提出DyG²T框架,通过空间补全关键点、TDN增强时间判别性、粒子图Transformer建模交互,在合成与真实数据集上实现精准动力学建模,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18183 2026-08-20 cs.LG 新提交

Accelerating Visual On-Policy Distillation with Batched Speculative Jacobi Rollouts

利用批量推测雅可比展开加速视觉在线策略蒸馏

Bingqi Shan, Zhehao Yu, Kenhong Lin, Baoquan Zhang

机构 * Shenzhen Key Laboratory of Internet Information Collaboration(深圳市互联网信息协同重点实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 该研究针对视觉在线策略蒸馏中在线展开成本高的问题,提出HB-SJD批量推测雅可比展开后端,仅替换学生展开后端,在LlamaGen上验证可降时间且保生成质量。

Comments 11 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-20 cs.RO 版本更新

EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Jian Hu, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06185 2026-08-20 cs.AI cs.CV 版本更新

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23309 2026-08-20 cs.CV cs.LG 版本更新

STAND: Semantic Anchoring Constraint with Dual-Granularity Disambiguation for Remote Sensing Image Change Captioning

STAND:语义锚定约束与双粒度消歧用于遥感图像变化描述

Yanpei Gong, Beichen Zhang, Hao Wang, Xuhang Fu, Zhaobo Qi, Xinyan Liu, Yuanrong Xu, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai, China(哈尔滨工业大学,威海)

AI总结 STAND通过语义锚定约束与双粒度消歧方法,解决遥感图像变化描述中的视角、尺度和先验知识模糊问题,提升描述精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17566 2026-08-20 cs.CL 版本更新

KA2L: A Knowledge-Aware Active Learning Framework for LLMs

KA2L:一种面向大语言模型的基于知识的主动学习框架

Haoxuan Yin, Chen Tang, Yangfan Wang, Lian Yan, Jingchi Jiang

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Institute for Advanced Algorithms Research(先进算法研究所) National Key Laboratory of Smart Farm Technologies(智能农业技术与系统国家重点实验室)

AI总结 本文提出KA2L框架,通过分析潜在空间评估LLM对特定知识的掌握程度,生成未知问题以提升模型能力,实验表明该方法能有效降低标注和计算成本,并在多个数据集上取得更好性能。

Comments 17 pages, 3 figures. Published in Expert Systems with Applications 333 (2027) 133951

详情

展开后加载摘要…

URL PDF HTML 收藏