arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1439
2608.13395 2026-08-14 cs.RO 新提交

FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving

FIRE-VLA:面向自动驾驶的视觉-语言-动作模型的故障感知自演化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 该研究针对自动驾驶VLA模型,提出FIRE-VLA故障感知自演化框架,结合GRPO与自蒸馏,在nuScenes数据集上降低了规划误差与故障流行率,提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12990 2026-08-14 cs.CL 新提交

LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation

LycheeMemory V2:基于语义片段级整合的LLM智能体高效长期记忆

Dongfang Li, Zixuan Liu, Junmai Wang, Jiahe Huang, Fuhao Li, Bonian Jia, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 LycheeMemory V2用语义片段级整合替代轮次级整合,降低LLM编码成本,在LoCoMo、LongMemEval-S上实现SOTA性能,构建token用量较A-Mem大幅减少且未增加查询开销。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12939 2026-08-14 cs.LG 新提交

Diagnosing JEPA World Models with Action-Conditioned Predictive Consistency

用动作条件预测一致性诊断JEPA世界模型

Guo An, Zijing Wu, Honghua Dong, Yuhao Yan, Zixuan Gui, Haochong Chen, Shanzhao Ruan, Xiang Wang, Yurong Ling, Qi Tian

机构 * Huawei(华为) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

AI总结 本研究针对JEPAs世界模型易受视觉扰动影响的问题,提出动作条件预测一致性(ACPC)诊断方法,定义IR与SR指标,经四视觉控制任务实验验证其可预测扰动带来的预测及代价变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12906 2026-08-14 cs.LG cs.AI 新提交

EGRL: Edge generation-guided relation-aware learning for RNA-protein interaction prediction

EGRL:面向RNA-蛋白质相互作用预测的边生成引导的关系感知学习

Danyu Li, Ling Zhou, Rubing Huang, Xian Zhong, Bin Zou, Kui Jiang

机构 * Macau University of Science and Technology(澳门科技大学) Macau University of Science and Technology Zhuhai Research Institute(澳门科技大学珠海研究院) Wuhan University of Technology(武汉理工大学) Jiangsu University(江苏大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 EGRL是一种用于RNA-蛋白质相互作用预测的新型深度学习框架,通过边生成引导的关系感知学习,在未知分子的冷启动场景中相比现有方法实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12721 2026-08-14 cs.CV 新提交

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12338 2026-08-14 cs.CL 新提交

SDAM: Structure-Difference-Aware Memory Evolution for Complex Text-to-SQL

SDAM:面向复杂文本转SQL的结构差异感知记忆演化

Keyan Xu, Dingzirui Wang, Xuanliang Zhang, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对现有文本转SQL记忆设计的缺陷,提出SDAM方法,集成至SDAM-SQL框架,在BIRD-dev和Spider-test数据集上实现指标提升,验证了方法有效性。

Comments 19 pages, 5 figures, 12tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09233 2026-08-14 cs.LG cs.CV 版本更新

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。

Comments project page: https://sleepy1231.github.io/DreOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02575 2026-08-14 cs.LG stat.ML 版本更新

Pseudorandom Streams within Diffusion Models Act as Learnable Inputs That Affect Generation Quality

扩散模型中的伪随机流是影响生成质量的可学习输入

Shengzhi Deng, Chenqi Ye, Yanze Guo

机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) Software College, Northeastern University(东北大学软件学院)

AI总结 该研究发现扩散模型的伪随机流是可学习输入,会影响生成质量,相关指标与生成退化相关,伪随机源兼具分布选择与结构化输入属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24232 2026-08-14 cs.CV 版本更新

Delving into Cascaded Instability: A Lipschitz Continuity View on Image Restoration and Object Detection Synergy

深入探讨级联不稳定:从Lipschitz连续性视角看图像恢复与目标检测的协同

Qing Zhao, Weijian Deng, Pengxu Wei, ZiYi Dong, Hannan Lu, Xiangyang Ji, Liang Lin

机构 * Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 通过Lipschitz连续性视角,提出LR-YOLO框架,将图像恢复与目标检测整合,提升检测稳定性与准确性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11617 2026-08-13 cs.CV 新提交

KANResDiff: Learning Local Residual Diffusion via Kolmogorov-Arnold Network for Ambiguous Medical Image Segmentation

KANResDiff:基于柯尔莫哥洛夫-阿诺德网络学习局部残差扩散以解决模糊医学图像分割问题

Fanding Li, Chenglin Wang, Xiangyu Li, Xingyu Qiu, Xinghua Ma, Xiangming Yin, Haiyang Li, Suyu Dong, Wei Wang, Kuanquan Wang, Gongning Luo, Shuo Li

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) Case Western Reserve University(凯斯西储大学)

AI总结 针对现有模糊医学图像分割方法无法形成渐进式语义建模的问题,提出KANResDiff模型,通过独立时间编码与残差薛定谔桥实现阶段感知模糊性建模,在公开数据集上取得SOTA性能。

Comments 10 pages, 3 figures, MICCAI 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25758 2026-08-13 cs.CV 版本更新

Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs

基于双分布估计的零样本噪声测试时自适应方法

Wenjie Zhu, Yabin Zhang, Liang Xu, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对噪声测试时自适应中分布外异常值问题,提出双分布估计框架,通过无训练的高斯分布建模实现零样本鲁棒自适应。

Comments Accepted by ECCV2026. Project Page:https://zhuwenjie98.github.io/DDE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04923 2026-08-13 cs.LG cs.AI cs.CL 版本更新

Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning

基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测

Xuekang Wang, Zhuoyuan Hao, Shuo Hou, Hao Peng, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06710 2026-08-13 cs.RO 版本更新

RLinf-VLA: A Unified and Efficient Framework for Reinforcement Learning of Vision-Language-Action Models

RLinf-VLA: 一种用于视觉-语言-动作模型强化学习的统一高效框架

Hongzhi Zang, Mingjie Wei, Si Xu, Yongji Wu, Zhen Guo, Yuanqing Wang, Hao Lin, Peihong Wang, Liangzhi Shi, Yuqing Xie, Zhexuan Xu, Zhihao Liu, Kang Chen, Wenhao Tang, Quanlu Zhang, Weinan Zhang, Chao Yu, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Harbin Institute of Technology(哈尔滨工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 RLinf-VLA是一种统一高效的框架,用于提升视觉-语言-动作模型在具身环境中的强化学习性能,通过统一接口和高效资源分配实现统一和可扩展的训练。

Comments Accepted to RSS 2026. This is the technical report of the RLinf Team, focusing on the algorithm side. For the system-level design, please refer to arXiv:2509.15965. The open-sourced code link: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10804 2026-08-12 cs.CV cs.AI cs.LG 新提交

BPG: Balancing Plasticity and Generalization for Domain Incremental Learning

BPG:面向领域增量学习的可塑性与泛化能力平衡框架

Qiang Wang, Songlin Dong, Shaokun Wang, Jizhou Han, Xiang Song, Chenhao Ding, Yuhang He, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Shenzhen University of Advanced Technology(深圳先进技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

AI总结 本研究提出BPG框架,通过动态适配的BPG-Adapter与软领域混合的BPG-Inference解决领域增量学习的参数冗余或能力不足问题,在多数据集上实现最优平均准确率并大幅降低遗忘率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04726 2026-08-12 cs.CL cs.LG 版本更新

What You See Is What You Get: Observation-Aligned Supervision for Chart-to-Code Generation

所见即所得:图表到代码生成的观察对齐监督

Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究图表到代码生成,指出用参考绘图脚本监督微调存在问题,引入观察对齐监督框架,用视觉观察约束量替代潜在原始数据目标,实验证明可提升可观察值恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09357 2026-08-11 cs.CV 新提交

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09196 2026-08-11 cs.RO 新提交

SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot

SAIN:面向移动机器人的、结合主动对话 grounding 的结构感知交互式导航

Yuhao Cao, Xiao Liu, Yang Xie, Lu Liu, Haoyao Chen

机构 * School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院) Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)

AI总结 本文提出SAIN零样本框架,将主动对话转化为持久导航状态,在VL-LN IIGN基准上提升了导航成功率与加权成功率,无需特定任务策略训练,验证了对话转状态机制的有效性。

Comments 8 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08648 2026-08-11 cs.CV 新提交

Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception

基于主动感知的全切片病理图像智能体视觉推理

Jingyun Chen, Fengchun Liu, Linghan Cai, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Lequan Yu, Yongbing Zhang

机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08623 2026-08-11 cs.AI 新提交

MedCalc-R1: Knowledge-Guided Reward Framework for Medical Mathematical Reasoning

MedCalc-R1:面向医学数学推理的知识引导奖励框架

Haotian Wang, Lian Yan, Xingzhi Yao, Fanshu Meng, Ye He, Jingchi Jiang, Yi Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 该研究针对医学数学推理中RLVR框架的奖励评估缺陷,提出知识引导的混合奖励框架MedCalc-R1,通过强制公式生成与验证、软硬奖励方案提升性能,在安全关键领域表现更优。

Comments 17 pages, 11 figures, work in prograss

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07916 2026-08-11 cs.CV 新提交

SegDem: Segmentation helps Demosaicing

SegDem:分割任务助力去马赛克

Ping Chen, Xiangming Wang, Yongyong Chen, Jiezhang Cao, Kai Zhang, Jingyong Su, Jie Liu, Haijin Zeng

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanjing University (Suzhou)(南京大学(苏州))

AI总结 该研究提出SegDem框架,通过实例分割与跨任务解码器表示迁移,结合DINOv2共享表示空间,在单/四拜耳去马赛克任务上,于多类数据集实现不同架构下的性能稳定提升。

Comments 20 pagess

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01265 2026-08-11 cs.RO cs.CV 版本更新

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

作为视觉-语言-动作模型轨迹先验的埃尔米特曲线

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏赛克德智能科技有限公司) National University of Singapore(新加坡国立大学)

AI总结 该研究针对视觉-语言-动作模型动作块的弱结构化问题,提出埃尔米特轨迹先验,其中埃尔米特正则化变体在仿真与真实机器人任务中显著提升了操纵成功率且无额外推理开销。

Comments Project page is available at https://aopolin-lv.github.io/Hermite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00854 2026-08-11 cs.RO 版本更新

Minute-Scale Training for Microrobot Navigation

微型机器人导航的分钟级训练

Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文针对微型机器人DRL导航训练耗时久的问题,提出含全向量化模拟器与TSR奖励框架的学习框架,将训练缩至10分钟内,支持零样本部署,可缩短设计周期、加速部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06540 2026-08-11 cs.CL 版本更新

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

分层声学-语义建模:全双工口语语言模型的模态分离与语义连贯

Zhenyu Liu, Xuanyu Zhang, Yunxin Li, Qixun Teng, Shenyuan Jiang, Haolan Chen, Minjun Zhao, Fanbo Meng, Yu Xu, Yancheng He, Baotian Hu, Haizhou Li, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Center for Language, Intelligence and Machines, Shenzhen Loop Area Institute, Shenzhen(深圳环智中语言、智能与机器中心) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

AI总结 研究全双工口语语言模型受模态干扰问题,提出Lychee-FD框架及分层参数分离策略,通过实验验证该方法能有效提升模型性能,在语音智能和交互流畅性上取得显著进步,且不影响推理效率。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04425 2026-08-11 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Xiaomi(小米) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。

Comments Technical report. 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01636 2026-08-11 cs.CV 版本更新

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

Pave-GRPO:通过原则性平均速度分解超越瞬时引导

Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出Pave-GRPO方法,通过原则性平均速度分解将粗粒度过渡分解为细粒度子轨迹,在不增加生成成本的情况下将奖励反馈传播到更多中间步骤,实现更全面的偏好对齐。

Comments 18 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20512 2026-08-11 cs.CV 版本更新

Adversarial Concept Distillation for One-Step Diffusion Personalization

对抗概念蒸馏用于一步扩散个性化

Yixiong Yang, Tao Wu, Senmao Li, Shiqi Yang, Yaxing Wang, Joost van de Weijer, Kai Wang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) VCIP, CS, Nankai University(南开大学计算机学院视觉计算与智能感知实验室) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

AI总结 本文提出OPAD框架,结合教师-学生蒸馏与对抗监督,通过多步扩散模型作为教师,一步学生模型联合训练,以实现一步扩散模型的高效个性化。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01742 2026-08-11 cs.CV 版本更新

Dense Point-to-Mask Optimization with Reinforced Point Selection for Crowd Instance Segmentation

密集点到掩码优化与强化点选择用于人群实例分割

Hongru Chen, Jiyang Huang, Jia Wan, Antoni B. Chan

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

AI总结 本文提出DPMO和RPS框架,通过整合SAM与NNEC约束及GRPO训练,实现高效人群实例分割,提升计数精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07405 2026-08-10 cs.CV cs.AI 新提交

GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation

GeoDistill-Refine:面向无标注航天器分割的基于轮廓优先的几何蒸馏方法

Yonglong Zhang, Zongwu Xie, Yang Liu

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(哈尔滨工业大学机电工程学院)

AI总结 本文提出GeoDistill-Refine两阶段框架,将SAM 3伪掩码迁移至紧凑分割网络,通过多提示投票、样本级门控及多几何目标优化,提升航天器图像分割精度,模型高效且适配多域评估。

详情

展开后加载摘要…

URL PDF HTML 收藏