arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-06-11 至 2026-06-11 共收录 4
2606.12125 2026-06-11 cs.CV 新提交

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11906 2026-06-11 cs.CL 新提交

When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models

语言何时重要?多语言指令揭示视觉-语言-动作模型中的逐步语言敏感性

Xuan Dong, Zhe Han, Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究通过将LIBERO基准翻译成十种语言,首次系统评估了VLA模型的多语言鲁棒性,发现非英语指令下成功率下降30-50%,并基于步骤级语言敏感性提出推理时对齐干预,显著提升性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11619 2026-06-11 cs.CV 新提交

Precision-Aware Illumination-Disentangled Vision Transformer for Spacecraft 6D Pose Estimation

精度感知光照解耦视觉Transformer用于航天器6D姿态估计

Zongwu Xie, Yifan Yang, Yonglong Zhang, Guanghu Xie, Yang Liu, Shuo Zhang

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(哈尔滨工业大学机电工程学院)

AI总结 提出PAID-ViT,通过光照解耦、可靠性感知令牌聚合和掩码监督,在光照变化和反射干扰下实现鲁棒的航天器6D姿态估计。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11577 2026-06-11 cs.RO 新提交

Distortion-Resilient Robotic Imitation Learning for Autonomous Cable Routing

抗畸变机器人模仿学习用于自主电缆布线

Hao Wang, Fu-Zhao Ou, Shiqi Wang, Zhaolin Wan, Xiaopeng Fan

机构 * School of Artificial Intelligence, Harbin Institute of Technology(哈尔滨工业大学人工智能学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Pengcheng Laboratory(鹏城实验室) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)

AI总结 提出一种包含图像质量评估、置信度学习和决策模块的机器人模仿学习框架,在图像畸变下仍保持高性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏