arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-03-17 至 2026-03-17 共收录 5
2603.15410 2026-03-17 cs.RO

End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset

从单视角点云通过多物体场景数据集实现端到端的灵巧抓取学习

Tao Geng, Dapeng Yang, Ziwei Liu, Le Zhang, Le Qi, WangYang Li, Yi Ren, Shan Luo, Fenglei Ni

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出DGS-Net,通过多物体场景的单视角点云学习密集抓取配置,改进了现有抓取数据集的局限性,实验显示其在仿真和真实机器人平台上的抓取成功率较高,且具有较低的穿透深度。

Comments 10 pages, 6 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15153 2026-03-17 cs.CV

TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

TextOVSR: 基于文本引导的现实世界歌剧视频超分辨率

Hua Chang, Xin Xu, Wei Liu, Jiayi Wu, Kui Jiang, Fei Ma, Qi Tian

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Harbin Institute of Technology Zhengzhou Research Institute(哈尔滨工业大学郑州研究所) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Huawei Technologies Ltd(华为技术有限公司)

AI总结 针对歌剧视频因早期拍摄设备限制和长期存储退化导致的视觉质量差问题,本文提出TextOVSR网络,通过引入两种文本提示引导超分辨率过程,结合文本增强判别器和降质鲁棒特征融合模块,提升纹理重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13394 2026-03-17 cs.CV

Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models

基于强化学习的语言引导标记压缩在大视觉-语言模型中

Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology(哈尔滨工业大学) College of Information and Control Engineering(信息与控制工程学院)

AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13348 2026-03-17 cs.AI

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

AutoTool: 通过解耦熵约束实现强化学习中工具使用能力的自动扩展

Yirong Zeng, Xiao Ding, Yufei Liu, Yuxian Wang, Qunyao Du, Yutai Hou, Wu Ning, Haonan Song, Duyu Tang, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology, SCIR Lib(哈尔滨工业大学,SCIR实验室) Peking University(北京大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 本文提出AutoTool方法,通过解耦熵约束实现强化学习中工具使用能力的自动扩展,提升模型在复杂问题上的表现,同时减少计算开销。

Comments ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01050 2026-03-17 cs.CV cs.AI cs.GR

EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos

EgoGrasp:从第一人称视频中估计世界空间手-物体交互

Hongming Fu, Wenjia Wang, Xiaozhen Qiao, Rolandos Alexandros Potamias, Taku Komura, Shuo Yang, Zheng Liu, Bo Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏