arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-08-19 至 2026-08-19 共收录 5
2608.17747 2026-08-19 cs.CV 新提交

TINA+: Probing Residual Visual Knowledge in Unlearned Diffusion Models via Diffusion-Consistent Text-Free Inversion

TINA+: 通过扩散一致无文本反演探测未学习的扩散模型中的残留视觉知识

Qianlong Xiang, Miao Zhang, Kun Wang, Haoyu Zhang, Junhui Hou, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本研究提出TINA+,一种扩散一致无文本反演攻击,可探测未学习的扩散模型中残留的视觉知识,实验表明现有概念擦除方法多切断文本-图像链接而非消除视觉知识。

Comments The project page is this https URL (https://qianlong0502.github.io/TINA-Plus-Homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17587 2026-08-19 cs.CL 新提交

Write, Execute, Refine: From Skill Followers to Skill Optimizers via Reinforcement Learning from Execution Feedback

编写、执行、优化:通过执行反馈强化学习从技能跟随者到技能优化器

Kang Peng, Zhiwei Zhang, Yichen Zhang, Zezhong Wang, Yiming Du, Geng Tu, Baojun Wang, Bin Liang, Ruifeng Xu, Kam-Fai Wong

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究提出WER多阶段框架,通过冻结执行器、程序验证器打分及混合轨迹优化训练技能优化器,在BFCL v4和tau2-bench上显著提升智能体工具使用性能,4B优化器表现优于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17453 2026-08-19 cs.RO 新提交

EATR-Stereo: Embodiment-Aware Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control

EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由

Songwei Wu, Rui Zhao, Fan Yang, Zhongqiang Nie, Zhiduo Jiang, Wandong Sun, Yuwei Li, Yang Liu, Hong Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17279 2026-08-19 cs.CV 新提交

Key-Frame Reasoning with SAM3: Third Place Solution for the MeViS-Text Track of the 8th LSVOS Challenge

基于SAM3的关键帧推理:第8届LSVOS挑战赛MeViS-Text赛道第三名解决方案

Ce Bian, Xusheng He, Jinrong Zhang, Canyang Wu, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 该研究提出两阶段无训练方案,依托Gemini-3.1 Pro分解视频事件选关键帧,用SAM3-agent生成掩码并双向传播,获第8届LSVOS挑战赛MeViS-Text赛道第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18046 2026-08-19 cs.LG 版本更新

SEE: Structure-aware Exploring & Exploiting for Long-horizon GUI Agent Trajectory Synthesis

SEE:用于长视野GUI代理轨迹合成的结构感知探索与利用

Zhuohang Fan, Beichen Zhang, Yuanfa Li, Changqiao Wu, Wei Liu, Jian Luan, Weigang Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院)

AI总结 针对GUI代理轨迹合成中缺乏高覆盖率长视野轨迹的问题,提出SEE两阶段数据合成框架,通过高效探索和基于图的合成,产生可重复可解释数据,避免虚假循环,提升代理任务成功率和泛化能力,还将发布代码和数据集。

Comments Accepted (Oral) by ACM International Conference on Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏