arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-04 至 2026-03-04 共收录 9
2603.02681 2026-03-04 cs.CV

VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation

VisionCreator: 一种具有理解、思考、规划和创作能力的原生视觉生成智能体模型

Jinxiang Lai, Zexin Lu, Jiajun He, Rongwei Quan, Wenzhe Zhao, Qinyu Yang, Qi Chen, Qin Lin, Chuyue Li, Tao Gao, Yuhao Shan, Shuai Shao, Song Guo, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文言) Hong Kong University of Science and Technology(香港科技大学)

AI总结 VisionCreator是一种结合理解、思考、规划和创作能力的原生视觉生成智能体模型,通过创新方法提升复杂创作任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02602 2026-03-04 cs.RO

Wukong-Omni: Design, Modeling and Control of a Multi-mode Robot for Air, Land, and Underwater Exploration with All-in-One Propulsion Unit

Wukong-Omni: 多模式机器人设计、建模与控制,用于空气、陆地和水下探索的多功能推进单元

Yufan Liu, Rixi Yu, Junjie Li, Yishuai Zeng, Zhenting Wen, Cheng Li, Haifei Zhu, Shikang Lian, Wei Meng, Fumin Zhang

机构 * School of Automation, Guandong University of Technology(广东技术大学自动化学院) School of Electromechanical Engineering, Guangdong University of Technology(广东技术大学机电工程学院) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系)

AI总结 Wukong-Omni是一种多模式机器人,通过统一推进系统实现陆地、空气和水下环境的无缝切换,提升救援任务效率和适应性。

Comments 19 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02582 2026-03-04 cs.CV eess.SP

Neural Electromagnetic Fields for High-Resolution Material Parameter Reconstruction

神经电磁场用于高分辨率材料参数重建

Zhe Chen, Peilin Zheng, Wenshuo Chen, Xiucheng Wang, Yutao Yue, Nan Cheng

机构 * Xidian University(西安电子科技大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 NEMF通过非侵入式物理反演构建功能数字孪生,实现高精度材料参数重建与物理模拟。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02522 2026-03-04 cs.CV

NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining

NeighborMAE: 利用邻近遥感图像间的空间依赖性在掩码自编码器预训练中进行建模

Liang Zeng, Valerio Marsocci, Wufan Zhao, Andrea Nascetti, Maarten Vergauwen

机构 * KU Leuven(卢森堡大学) ESA Φ \Phi -lab(欧洲航天局Φ实验室) HKUST(GZ)(香港科技大学(珠海)) KTH(皇家理工学院)

AI总结 NeighborMAE通过联合重建邻近遥感图像,利用空间依赖性提升掩码自编码器在遥感图像预训练中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02215 2026-03-04 cs.LG cs.AI

RxnNano:Training Compact LLMs for Chemical Reaction and Retrosynthesis Prediction via Hierarchical Curriculum Learning

RxnNano:通过层次化课程学习训练紧凑的LLM用于化学反应和逆合成预测

Ran Li, Shimin Di, Haowei LI, Luanshi Bu, Jiachuan Wang, Wangze Ni, Lei Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southeast University(东南大学) Zhejiang University(浙江大学)

AI总结 RxnNano通过层次化课程学习训练紧凑LLM,提升化学反应和逆合成预测性能,实现23.5%准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23191 2026-03-04 cs.CV

Uni-Animator: Towards Unified Visual Colorization

Uni-Animator:迈向统一的视觉着色

Xinyuan Chen, Yao Xu, Shaowen Wang, Pengjie Song, Bowen Deng

机构 * Mississippi State University(密苏里州立大学) UIUC(伊利诺伊大学香槟分校) Hunan University(湖南大学) HKUST(香港科技大学)

AI总结 Uni-Animator通过视觉参考增强、物理细节强化和动态RoPE编码,实现了统一的图像和视频草图着色,兼顾高细节保真度和时间一致性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18833 2026-03-04 cs.SD cs.CV eess.AS eess.IV

PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation

PrismAudio:分解的思维链与多维奖励用于视频到音频生成

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Peiwen Sun, Rongjie Huang, Xiangang Li, Jieping Ye, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) The Chinese University of Hong Kong (CUHK)(香港中文大学)

AI总结 PrismAudio通过分解思维链与多维奖励,解决视频到音频生成中的目标纠缠问题,实现更高质量的生成效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18560 2026-03-04 cs.SE cs.AI

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

WebDevJudge: 评估 (M)LLMs 作为 Web 开发质量的批评者

Chunyang Li, Yilun Zheng, Xinting Huang, Tianqing Fang, Jiahao Xu, Lihui Chen, Yangqiu Song, Han Hu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学)

AI总结 WebDevJudge 提出了一种评估 LLM 作为 Web 开发质量批评者的基准,揭示了 LLM 与人类专家之间的显著差距,指出了模型在功能等价性识别、任务可行性验证和偏见缓解方面的根本性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07218 2026-03-04 cs.LG cs.AI cs.CV

Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward

Perception-R1: 通过视觉感知奖励提升多模态大语言模型的多模态推理能力

Tong Xiao, Xin Xu, Zhenya Huang, Hongyu Gao, Quan Liu, Qi Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 Perception-R1通过引入视觉感知奖励提升多模态大语言模型的多模态推理能力

详情

展开后加载摘要…

URL PDF HTML 收藏