arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-04-02 至 2026-04-02 共收录 10
2604.00969 2026-04-02 cs.CV

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30008 2026-04-02 cs.CV

Conditional Polarization Guidance for Camouflaged Object Detection

基于条件极化引导的伪装物体检测

QIfan Zhang, Hao Wang, Xiangrong Qin, Ruijie Li

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出CPGNet框架,通过条件极化引导机制优化RGB特征学习,结合轻量极化交互模块和极化边缘引导频率细化策略,提升伪装物体检测性能。

Comments 11 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19053 2026-04-02 cs.CV cs.RO

TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

TeFlow:实现多帧监督以实现自监督前馈场景流估计

Qingwen Zhang, Chenhan Jiang, Xiaomeng Zhu, Yunqi Miao, Yushan Zhang, Olov Andersson, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Warwick(华威大学) Linköping University(林雪平大学) Scania(斯堪尼亚)

AI总结 TeFlow通过挖掘时间一致的监督信号,改进多帧监督以提升自监督前馈场景流估计的稳定性与性能,实现33%的性能提升。

Comments CVPR 2026; 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05144 2026-04-02 cs.AI

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型

Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速)

AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。

Comments 31 pages, Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09388 2026-04-02 cs.CV

Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition

通过邻域感知语义学习,通过开放形式流决策:面向鲁棒零样本骨架动作识别

Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) China University of Geoscience(中国地质大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Flora方法,通过灵活调整文本语义和开放形式分布感知流分类器,解决零样本骨架动作识别中的语义对齐和分类器鲁棒性问题,实验验证其有效性。

Comments Accepted by CVPR 2026 Findings; Project Code: https://github.com/cseeyangchen/Flora

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18314 2026-04-02 cs.AI

Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming

Genesis:为LLM网络代理红队测试演变攻击策略

Zheng Zhang, Jiarui He, Yuchen Cai, Deheng Ye, Peilin Zhao, Ruili Feng, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Nvidia(英伟达)

AI总结 本文提出Genesis框架,通过遗传算法与混合策略表示生成对抗注入,动态发现有效策略并持续优化,提升网络代理攻击效果。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19715 2026-04-02 cs.CL cs.AI cs.LG

Graceful Forgetting in Generative Language Models

生成语言模型中的优雅遗忘

Chunyang Jiang, Chi-min Chan, Yiyang Cai, Yulong Liu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Learning With Forgetting框架,通过Fisher信息矩阵评估并周期性删除无关知识,提升生成语言模型的微调性能。

Comments 8 pages, 6 figures. EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏