arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2801
2512.00369 2025-12-02 cs.CV

POLARIS: Projection-Orthogonal Least Squares for Robust and Adaptive Inversion in Diffusion Models

POLARIS:用于扩散模型中鲁棒和自适应逆向的投影正交最小二乘法

Wenshuo Chen, Haosen Li, Shaofeng Liang, Lei Wang, Haozhe Jia, Kaishen Yuan, Jieming Wu, Bowen Tian, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Griffith University(格里菲斯大学) Data61/CSIRO Project(Data61/CSIRO项目)

AI总结 POLARIS通过将逆向问题转化为误差来源问题,以单行代码提升扩散模型逆向的鲁棒性和适应性,显著减少噪声近似误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00305 2025-12-02 cs.AI

ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning

ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理

Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo

机构 * Tsinghua University(清华大学) International Digital Economy Academy(国际数字经济学院) Beihang University(北航) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 ChartPoint通过引入 grounding 反射机制,提升 MLLMs 在图表推理中的表现,开发了两个指令微调模型,在多个图表基准上取得显著提升。

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00290 2025-12-02 cs.CL cs.AI

EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education

EduEval: 一个用于评估大语言模型在中文教育中表现的分层认知基准

Guoqing Ma, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Jiawei Shen, Zilong Li, Yidan Liang

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 EduEval通过分层认知基准评估大语言模型在中文教育中的表现,揭示其在事实性任务与创造性任务上的差异,并发现开源模型在复杂教育推理上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00004 2025-12-02 cs.IR cs.AI cs.LG

Enhancing Talent Search Ranking with Role-Aware Expert Mixtures and LLM-based Fine-Grained Job Descriptions

通过角色感知专家混合与基于大语言模型的细粒度职位描述增强人才搜索排名

Jihang Li, Bing Xu, Zulong Chen, Chuanfei Xu, Minping Chen, Suyu Liu, Ying Zhou, Zeyi Wen

机构 * HKUST (GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) Zhijiang Lab(浙江实验室) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 本文提出基于大语言模型和角色感知专家混合的方法,提升人才搜索排名效果,通过细粒度职位描述提取和行为建模,提升CTR和CVR,实现招聘效率和成本节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23475 2025-12-01 cs.CV

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19637 2025-12-01 cs.CV

Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction

通过互样本分析和内样本分析增强部分相关视频检索

Junlong Ren, Gangjian Zhang, Yu Hu, Jian Shu, Hui Xiong, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出了一种增强部分相关视频检索的方法,通过互样本分析和内样本分析,结合时间一致性预测模块,提升视频与文本查询的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22471 2025-12-01 cs.CV

Rethinking Cross-Generator Image Forgery Detection through DINOv3

重新思考通过DINOv3进行跨生成器图像伪造检测

Zhenglin Huang, Jason Li, Haiquan Wen, Tianxiao Li, Xi Yang, Lu Qi, Bei Peng, Xiaowei Huang, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) HKUST(香港科技大学) UC Merced(加州大学默塞德分校) University of Sheffield(谢菲尔德大学)

AI总结 通过DINOv3发现无需训练即可实现跨生成器图像伪造检测,利用令牌排名策略提升检测准确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22355 2025-12-01 cs.LG

AutoTailor: Automatic and Efficient Adaptive Model Deployment for Diverse Edge Devices

AutoTailor: 为异构边缘设备实现自动且高效的自适应模型部署

Mengyang Liu, Chenyu Lu, Haodong Tian, Fang Dong, Ruiting Zhou, Wei Wang, Dian Shen, Guangtong Li, Ye Wan, Li Li

机构 * Southeast University(东南大学) Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) University of Macau(澳门大学)

AI总结 AutoTailor通过自动化端到端SuperNet自适应模型部署,显著提升边缘设备的推理效率和模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22147 2025-12-01 cs.CV cs.AI cs.CR

RemedyGS: Defend 3D Gaussian Splatting against Computation Cost Attacks

RemedyGS: 保护3D高斯散射免受计算成本攻击

Yanping Li, Zhening Liu, Zijian Li, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 RemedyGS通过检测和净化被污染的图像,有效防御3DGS中的计算成本攻击,提升系统安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22080 2025-12-01 cs.LG cs.AI cs.DC

A Fast and Flat Federated Learning Method via Weighted Momentum and Sharpness-Aware Minimization

一种通过加权动量和尖锐意识最小化实现快速且平坦的联邦学习方法

Tianle Li, Yongzhi Huang, Linshan Jiang, Chang Liu, Qipeng Xie, Wenfeng Du, Lu Wang, Kaishun Wu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shenzhen University(深圳大学)

AI总结 FedWMSAM通过加权动量和尖锐意识最小化解决非IID联邦学习中的局部-全局曲率不一致和动量-回声振荡问题,提升模型收敛速度和泛化能力。

Journal ref Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21887 2025-12-01 cs.CV

UniArt: Unified 3D Representation for Generating 3D Articulated Objects with Open-Set Articulation

UniArt: 一种统一的3D表示方法,用于从单张图像生成具有开集关节的3D可动物体

Bu Jin, Weize Li, Songen Gu, Yupeng Zheng, Yuhang Zheng, Zhengyi Zhou, Yao Yao

机构 * Hong Kong University of Science and Technology(香港理工大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 UniArt通过统一的潜在表示和开集关节预测方法,实现了从单张图像生成高质量可动3D物体的端到端合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02009 2025-12-01 cs.RO

Trust-Preserved Human-Robot Shared Autonomy enabled by Bayesian Relational Event Modeling

基于贝叶斯关系事件建模的信任保留人机协同自主性

Yingke Li, Fumin Zhang

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(电子与计算机工程学院,佐治亚理工学院) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学)

AI总结 本文提出基于贝叶斯关系事件建模的信任保留协同自主策略,通过动态推断人类信任提升人机协作效率与用户接受度。

Journal ref in IEEE Robotics and Automation Letters, vol. 9, no. 11, pp. 10716-10723, Nov. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21021 2025-11-27 cs.CV cs.AI

Structure-Aware Prototype Guided Trusted Multi-View Classification

具有结构意识的原型引导可信多视图分类

Haojian Huang, Jiahao Shi, Zhe Liu, Harold Haodong Chen, Han Fang, Hao Sun, Zhongjiang He

机构 * HKUST(GZ)(香港科技大学(广州)) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) Harbin Engineering University(哈尔滨工程大学) Universiti Sains Malaysia(马来西亚理科大学)

AI总结 本文提出一种基于原型的可信多视图分类框架,通过动态对齐视图间结构提升跨视图一致性,实现高效且可靠的分类性能。

Comments 12 pages, 8 figures, 7 tables, Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12029 2025-11-27 cs.LG cs.AI

Dual-Balancing for Multi-Task Learning

多任务学习中的双平衡

Baijiong Lin, Weisen Jiang, Feiyang Ye, Yu Zhang, Pengguang Chen, Ying-Cong Chen, Shu Liu, Ivor W. Tsang, James T. Kwok

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) HKUST(GZ) - SmartMore Joint Lab(HKUST(广州)- SmartMore联合实验室) The Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学) Centre for Frontier AI Research, A$^*$STAR(前沿人工智能研究中心,A$^*$STAR)

AI总结 本文提出DB-MTL方法,通过损失和梯度双角度平衡提升多任务学习性能。

Comments Accepted by Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20468 2025-11-26 cs.AI

DRAFT-RL: Multi-Agent Chain-of-Draft Reasoning for Reinforcement Learning-Enhanced LLMs

DRAFT-RL: 多智能体链式草稿推理用于强化学习增强的大型语言模型

Yuanhao Li, Mingshan Liu, Hongbo Wang, Yiding Zhang, Yifei Ma, Wei Tan

机构 * BUPT(北京邮电大学) HKUST(GZ)(香港科技大学(广州)) University of Bristol(布里斯托大学)

AI总结 DRAFT-RL通过多智能体链式草稿推理提升强化学习增强的LLM在复杂推理任务中的准确性和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20109 2025-11-26 cs.LG

CLIMATEAGENT: Multi-Agent Orchestration for Complex Climate Data Science Workflows

CLIMATEAGENT: 多智能体编排用于复杂气候数据科学工作流

Hyeonjae Kim, Chenyue Li, Wen Deng, Mengxi Jin, Wen Huang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 ClimateAgent通过多智能体编排和动态API意识,实现端到端自动化气候数据分析,取得优于基线方法的高任务完成率和报告质量。

Comments 30 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19971 2025-11-26 cs.CV

VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction

VGGT4D: 从视觉几何变换器中挖掘运动线索用于4D场景重建

Yu Hu, Chong Cheng, Sicheng Yu, Xiaoyang Guo, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 VGGT4D通过挖掘视觉几何变换器中的运动线索,提出无需训练的4D场景重建框架,提升动态物体分割、姿态估计和密集重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18808 2025-11-26 cs.CL cs.AI

HyperbolicRAG: Enhancing Retrieval-Augmented Generation with Hyperbolic Representations

HyperbolicRAG: 通过双曲表示增强检索增强生成

Linxiao Cao, Ruitao Wang, Jindong Li, Zhipeng Zhou, Menglin Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

AI总结 HyperbolicRAG通过整合双曲几何提升基于图的检索增强生成,以更准确地捕捉语义和层次结构关系。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17818 2025-11-26 cs.CV

ContextFlow: Training-Free Video Object Editing via Adaptive Context Enrichment

ContextFlow: 无训练视频物体编辑通过自适应上下文增强

Yiyang Chen, Xuanhua He, Xiujun Ma, Yue Ma

机构 * State Key Laboratory of General Artifical Intelligence, Peking University, Beijing, China(北京人工智能基础理论国家重点实验室,北京大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 ContextFlow通过自适应上下文增强解决无训练视频物体编辑中的保真度和时间一致性问题,实现高精度编辑效果。

Comments The project page is at https://yychen233.github.io/ContextFlow-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11895 2025-11-26 cs.CV

Adversarial Robustness for Unified Multi-Modal Encoders via Efficient Calibration

通过高效校准实现统一多模态编码器的对抗鲁棒性

Chih-Ting Liao, Zhangquan Chen, Chunlei Meng, Tzu-Yu Huang, Xin Cao, Xu Zheng

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Tsinghua University(清华大学) Fudan University(复旦大学) UTS(澳大利亚UTS大学) HKUST(GZ)(香港理工大学(广州))

AI总结 本研究提出高效对抗校准框架,提升统一多模态编码器的对抗鲁棒性,同时保持清洁性能,提升47.3%的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08896 2025-11-26 cs.LG cs.AI

Position: Beyond Euclidean -- Foundation Models Should Embrace Non-Euclidean Geometries

位置:超越欧几里得——基础模型应拥抱非欧几里得几何

Neil He, Jiahong Liu, Buze Zhang, Ngoc Bui, Ali Maatouk, Menglin Yang, Irwin King, Melanie Weber, Rex Ying

机构 * Yale University(耶鲁大学) Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科学大学) Harvard University(哈佛大学)

AI总结 本文主张基础模型应超越欧几里得几何,以更高效地利用非欧几里得结构,提升模型性能与适应性。

Comments 27 pages, 6 figures, LoG Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19528 2025-11-26 cs.RO cs.AI

Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories

发现、学习与强化:通过多样化强化学习生成轨迹扩展视觉-语言-动作预训练

Rushuai Yang, Zhiyuan Feng, Tianxiang Zhang, Kaixin Wang, Chuheng Zhang, Li Zhao, Xiu Su, Yi Chen, Jiang Bian

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Central South University(中南大学) Microsoft Research(微软研究院)

AI总结 本文提出DLR框架,通过多样化强化学习生成轨迹,提升VLA预训练的多样性和扩展性,实现更广泛的状态-动作空间覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19437 2025-11-25 cs.CV

LumiTex: Towards High-Fidelity PBR Texture Generation with Illumination Context

LumiTex: 向高保真PBR纹理生成迈进:基于照明上下文

Jingzhi Bao, Hongze Chen, Lingting Zhu, Chenyu Liu, Runze Zhang, Keyang Luo, Zeyu Hu, Weikai Chen, Yingda Yin, Xin Wang, Zehong Lin, Jun Zhang, Xiaoguang Han

机构 * CUHK(SZ)(香港中文大学(深圳)) HKUST(香港理工大学) HKU(香港大学) PKU(北京大学) LIGHTSPEED

AI总结 LumiTex通过结合光照上下文和几何引导的修补模块,实现了高保真的PBR纹理生成,提升了材料分解和无缝纹理完成的性能。

Comments Project page: https://lumitex.vercel.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18902 2025-11-25 cs.LG cs.AI

VADE: Variance-Aware Dynamic Sampling via Online Sample-Level Difficulty Estimation for Multimodal RL

VADE:基于在线样本级难度估计的方差感知动态采样用于多模态强化学习

Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) HKUST(香港科技大学)

AI总结 VADE通过在线样本级难度估计实现方差感知动态采样,提升多模态强化学习的性能与样本效率,减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18834 2025-11-25 cs.CV cs.AI

FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories

FlowSteer: 通过真实轨迹引导少步图像合成

Lei Ke, Hubery Yin, Gongye Liu, Zhengyao Lv, Jingcai Guo, Chen Li, Wenhan Luo, Yujiu Yang, Jing Lyu

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司微信视觉部门) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 FlowSteer通过引导学生沿教师真实生成轨迹提升ReFlow蒸馏效果,解决分布不匹配和优化调度器问题,提升少步图像合成质量。

Comments Few-Step Image Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18831 2025-11-25 cs.CV

VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction

VideoCompressa: 通过联合时间压缩和空间重建实现数据高效的视频理解

Shaobo Wang, Tianle Niu, Runkang Yang, Deshan Liu, Xu He, Zichen Wen, Conghui He, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) KTH(瑞典皇家理工学院) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

AI总结 VideoCompressa通过联合时间压缩和空间重建,实现视频数据高效合成,显著提升数据效率和模型性能。

Comments 15 pages, 6 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏