arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1439
2603.18627 2026-03-20 cs.AI

Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation

代理流引导与并行展开搜索用于空间感知的文本到图像生成

Ping Chen, Daoxuan Zhang, Xiangming Wang, Yungeng Liu, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11173 2026-03-20 cs.CV cs.MM

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17869 2026-03-20 cs.LG

Modeling Inverse Ellipsometry Problem via Flow Matching with a Large-Scale Dataset

通过大规模数据集进行逆椭圆度测量问题的建模:流匹配

Yiming Ma, Jianzhi Teng, Xinjie Li, Xin Sun, Zhiyong Wang, Yuzhou Song, Lionel Z. Wang, Bin Chen

机构 * Chongqing Research Institute of Harbin Institute of Technology(哈尔滨工业大学重庆研究院) The Hong Kong Polytechnic University(香港理工大学) The Pennsylvania State University(宾夕法尼亚州立大学) Tianjin University(天津大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出EllipBench数据集和Decoupled Conditional Flow Matching框架,解决逆椭圆度测量问题中光常数和膜厚重建的物理不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17828 2026-03-19 cs.CV

TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

TINA:无文本逆向攻击用于未学习的文本到图像扩散模型

Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) Peng Cheng Laboratory(鹏城实验室) Shandong University(山东大学)

AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。

Comments 16 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17813 2026-03-19 cs.CV

M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking

M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪

Qiangqiang Wu, Tianyu Yang, Bo Fang, Jia Wan, Matias Di Martino, Guillermo Sapiro, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Meituan, Shenzhen, China(美团(深圳,中国)) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12220 2026-03-19 cs.CV

TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation

TechImage-Bench: 基于评分标准的技术图像生成评估

Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft Project Website(微软项目网站)

AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17613 2026-03-19 cs.CL cs.PL

VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation

VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成

Yaoxiang Wang, Qi Shi, ShangZhan Li, Qingguo Hu, Xinyu Yin, Bo Guo, Xu Han, Maosong Sun, Jinsong Su

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17566 2026-03-19 cs.CL

KA2L: A Knowledge-Aware Active Learning Framework for LLMs

KA2L:一种面向大语言模型的基于知识的主动学习框架

Haoxuan Yin, Bojian Liu, Chen Tang, Yangfan Wang, Lian Yan, Jingchi Jiang

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Institute for Advanced Algorithms Research(先进算法研究所) National Key Laboratory of Smart Farm Technologies(智能农业技术与系统国家重点实验室)

AI总结 本文提出KA2L框架,通过分析潜在空间评估LLM对特定知识的掌握程度,生成未知问题以提升模型能力,实验表明该方法能有效降低标注和计算成本,并在多个数据集上取得更好性能。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17492 2026-03-19 cs.CV

UAV-CB: A Complex-Background RGB-T Dataset and Local Frequency Bridge Network for UAV Detection

UAV-CB: 一种复杂背景RGB-T数据集和局部频率桥梁网络用于UAV检测

Shenghui Huang, Menghao Hu, Longkun Zou, Hongyu Chi, Zekai Li, Feng Gao, Fan Yang, Qingyao Wu, Ke Chen

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(南方科技大学) Peking University(北京大学) Xinjiang University(新疆大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出UAV-CB数据集和LFBNet网络,针对低空环境中的UAV检测复杂背景和伪装问题,通过局部频率空间建模提升RGB-T融合性能,实验证明其在伪装和杂乱背景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17449 2026-03-19 cs.CL

TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL

TRiMS:通过强化学习实现高效的实时最小充分长度推理跟踪

Tingcheng Bian, Jinchang Luo, Mingquan Cheng, Jinyu Zhang, Xiaoling Xia, Ni Li, Yan Tao, Haiwei Wang

机构 * Baidu Inc.(百度公司) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出TRiMS,通过强化学习和最小充分长度指标,实现高效推理压缩,减少80%以上的推理token数量并提升准确性。

Comments 8 pages (main), 21 pages total including appendix, 18 figures.Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17436 2026-03-19 cs.LG cs.AI

TimeAPN: Adaptive Amplitude-Phase Non-Stationarity Normalization for Time Series Forecasting

TimeAPN: 用于时间序列预测的自适应幅度-相位非平稳归一化

Yue Hu, Jialiang Tang, Siwei Yu, Baosheng Yu, Jing Zhang, Dacheng Tao

机构 * School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出TimeAPN框架,通过时间与频率域联合建模和预测非平稳因素,结合自适应归一化机制提升长周期时间序列预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17435 2026-03-19 cs.DC cs.AR cs.LG cs.PF

ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression

ZipServ: 一种快速且内存高效的LLM推理方法,结合硬件感知的无损压缩

Ruibo Fan, Xiangrui Yu, Xinglin Pan, Zeyu Li, Weile Luo, Qiang Wang, Wei Wang, Xiaowen Chu

机构 * The Hong Kong University of Science(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 ZipServ通过硬件感知的无损压缩技术,提升LLM推理效率,减少内存占用,实现比cuBLAS快2.21倍的内核速度和1.22倍的端到端推理加速。

Comments ASPLOS'26 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16895 2026-03-19 eess.SP cs.LG

EEG-SeeGraph: Interpreting functional connectivity disruptions in dementias via sparse-explanatory dynamic EEG-graph learning

EEG-SeeGraph: 通过稀疏解释性动态EEG图学习解读痴呆症的功能连接紊乱

Fengcheng Wu, Zhenxi Song, Guoyang Xu, Kaisong Hu, Zirui Wang, Yi Guo, Zhiguo Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Institute of Neurological Diseases, Shenzhen Bay Laboratory, Shenzhen, China(深圳湾实验室神经疾病研究院)

AI总结 本文提出EEG-SeeGraph,通过稀疏解释性动态EEG图学习方法,解析痴呆症中功能连接紊乱,具备噪声鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13293 2026-03-19 cs.CV eess.IV

NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving

NutVLM: 一种针对自动驾驶中视觉语言模型全维度攻击的自适应防御框架

Xiaoxu Peng, Dong Zhou, Jianwen Zhang, Guanghui Sun, Anh Tu Ngo, Anupam Chattopadhyay

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本文提出NutVLM框架,通过NutNet++ sentinel检测并净化良性样本、局部修补和全局扰动,结合高效灰度遮蔽和专家引导的对抗提示调优,提升自动驾驶中视觉语言模型的鲁棒性与性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02341 2026-03-19 cs.CV

TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction

TALO:推动3D视觉基础模型向全球一致的在线重建迈进

Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出基于薄板样条的高自由度长期对齐框架,通过全局传播控制点纠正空间变化不一致,并采用点无关子图注册设计提升鲁棒性,实验表明其在多数据集和相机配置下均能获得更一致的几何和更低的轨迹误差。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26219 2026-03-19 cs.CV cs.AI

Parameterizing Dataset Distillation via Gaussian Splatting

通过高斯点撒技术参数化数据集

Chenyang Jiang, Zhengcen Li, Hang Zhao, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * The School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳校区计算机科学与技术学院) Institute of Perceptual Intelligence, Pengcheng Laboratory(感知智能研究院,鹏城实验室)

AI总结 本文提出GSDD,一种基于高斯点撒的数据集参数化技术,通过高效存储结构提升数据集压缩效率,增强多样性并提升蒸馏性能。

Comments 19 pages; Code is available on https://github.com/j-cyoung/GSDatasetDistillation

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08485 2026-03-19 cs.CV

Test-Time 3D Occupancy Prediction

测试时3D占用预测

Fengyi Zhang, Xiangyu Sun, Huitong Yang, Zheng Zhang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Harbin Institute of Technology(哈尔滨工程大学)

AI总结 本文提出TT-Occ框架,通过实时集成视觉基础模型,实现灵活的3D高斯表示和占用预测,适用于不同体素分辨率和新类别识别。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16671 2026-03-18 cs.CV

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16241 2026-03-18 cs.CV

Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting

基于排斥性的掩码学习的半监督人群实例分割与计数

Jiyang Huang, Hongru Cheng, Wei Lin, Jia Wan, Antoni B. Chan

机构 * Harbin Institute of Technology(哈尔滨工业大学) City University of Hong Kong(香港城市大学)

AI总结 本文提出Exclusivity-Guided Mask Learning方法,通过判别性掩码目标实现空间分离,结合高斯平滑和可微中心采样策略提升特征连续性和训练稳定性,从而在统一框架下实现人群实例分割与计数的半监督学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16154 2026-03-18 cs.CV cs.AI

GATS: Gaussian Aware Temporal Scaling Transformer for Invariant 4D Spatio-Temporal Point Cloud Representation

GATS: 基于高斯意识的时间缩放变换器的不变四维时空点云表示

Jiayi Tian, Jiaze Wang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出GATS框架,通过不确定性引导的高斯卷积和时间缩放注意力模块,解决四维点云视频中时间尺度偏差和分布不确定性问题,提升鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13961 2026-03-18 cs.CV

USIS-PGM: Photometric Gaussian Mixtures for Underwater Salient Instance Segmentation

USIS-PGM:用于水下显著实例分割的光度高斯混合

Lin Hong, Xiangtong Yao, Mürüvvet Bozkurt, Xin Wang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering(电子与计算机工程系) The Hong Kong University of Science and Technology(香港科学与技术大学) School of CIT, Chair i6(CIT学院,Chair i6) Technical University of Munich(慕尼黑技术大学) School of CIT(CIT学院) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出USIS-PGM框架,通过频率感知模块增强边界线索,结合动态加权模块进行内容自适应特征重加权,利用光度高斯混合生成多尺度高斯热图以监督解码器特征,提升水下显著实例分割的定位精度和掩码预测的结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21083 2026-03-18 cs.RO

Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry

双代理强化学习用于自适应和成本感知的视觉惯性里程计

Feiyang Pan, Shenghe Zheng, Chunyan Yin, Guangbin Dou

机构 * Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出双代理强化学习框架,通过智能选择代理和融合代理优化视觉惯性里程计的运行时机和信任度,提升精度与效率的平衡。

Comments Accepted to the CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13911 2026-03-18 cs.CV

PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis

PhysGM:用于前馈4D合成的大型物理高斯模型

Chunji Lv, Zequn Chen, Donglin Di, Weinan Zhang, Hao Li, Wei Chen, Yinjie Lei, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学) Li Auto(利汽车) Harbin Institute of Technology(哈尔滨工业大学) Sichuan University(四川大学) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)

AI总结 PhysGM通过单图像联合预测3D高斯表示和物理属性,实现高效4D渲染。该方法采用物理感知重建模型和直接偏好优化,提升模拟精度并降低计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15410 2026-03-17 cs.RO

End-to-End Dexterous Grasp Learning from Single-View Point Clouds via a Multi-Object Scene Dataset

从单视角点云通过多物体场景数据集实现端到端的灵巧抓取学习

Tao Geng, Dapeng Yang, Ziwei Liu, Le Zhang, Le Qi, WangYang Li, Yi Ren, Shan Luo, Fenglei Ni

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出DGS-Net,通过多物体场景的单视角点云学习密集抓取配置,改进了现有抓取数据集的局限性,实验显示其在仿真和真实机器人平台上的抓取成功率较高,且具有较低的穿透深度。

Comments 10 pages, 6 figures. Submitted to IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15153 2026-03-17 cs.CV

TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

TextOVSR: 基于文本引导的现实世界歌剧视频超分辨率

Hua Chang, Xin Xu, Wei Liu, Jiayi Wu, Kui Jiang, Fei Ma, Qi Tian

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Harbin Institute of Technology Zhengzhou Research Institute(哈尔滨工业大学郑州研究所) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Huawei Technologies Ltd(华为技术有限公司)

AI总结 针对歌剧视频因早期拍摄设备限制和长期存储退化导致的视觉质量差问题,本文提出TextOVSR网络,通过引入两种文本提示引导超分辨率过程,结合文本增强判别器和降质鲁棒特征融合模块,提升纹理重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13394 2026-03-17 cs.CV

Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models

基于强化学习的语言引导标记压缩在大视觉-语言模型中

Sihan Cao, Jianwei Zhang, Pengcheng Zheng, Jiaxin Yan, Caiyan Qin, Yalan Ye, Wei Dong, Peng Wang, Yang Yang, Chaoning Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) School of Robotics and Advanced Manufacture(机器人与先进制造学院) Harbin Institute of Technology(哈尔滨工业大学) College of Information and Control Engineering(信息与控制工程学院)

AI总结 本文提出TPRL框架,通过语言引导的序列优化实现视觉标记压缩,减少推理成本并提升效率,实验显示可减少66.7%的视觉标记和54.2%的FLOPs,精度损失仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13348 2026-03-17 cs.AI

AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints

AutoTool: 通过解耦熵约束实现强化学习中工具使用能力的自动扩展

Yirong Zeng, Xiao Ding, Yufei Liu, Yuxian Wang, Qunyao Du, Yutai Hou, Wu Ning, Haonan Song, Duyu Tang, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology, SCIR Lib(哈尔滨工业大学,SCIR实验室) Peking University(北京大学) Huawei Technologies Ltd(华为技术有限公司)

AI总结 本文提出AutoTool方法,通过解耦熵约束实现强化学习中工具使用能力的自动扩展,提升模型在复杂问题上的表现,同时减少计算开销。

Comments ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01050 2026-03-17 cs.CV cs.AI cs.GR

EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos

EgoGrasp:从第一人称视频中估计世界空间手-物体交互

Hongming Fu, Wenjia Wang, Xiaozhen Qiao, Rolandos Alexandros Potamias, Taku Komura, Shuo Yang, Zheng Liu, Bo Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13089 2026-03-16 cs.CV

V-Bridge: Bridging Video Generative Priors to Versatile Few-shot Image Restoration

V-Bridge:将视频生成先验与多功能少样本图像恢复相连接

Shenghe Zheng, Junpeng Jiang, Wenbo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出V-Bridge框架,将视频生成模型的潜在能力应用于多功能少样本图像恢复任务,通过将图像恢复视为渐进生成过程,利用视频模型实现从退化输入到高保真输出的逐步细化,仅用1000个多任务样本即可实现竞争性性能。

Comments Transfer the prior knowledge of video generative models to image restoration tasks

详情

展开后加载摘要…

URL PDF HTML 收藏