arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2407
2512.04837 2025-12-05 cs.CV

A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World

多域现实世界面部伪造检测的 sanity 检查

Jikang Cheng, Renye Yan, Zhiyuan Yan, Yaozhong Gan, Xueyi Zhang, Zhongyuan Wang, Wei Peng, Ling Liang

机构 * Peking University(北京大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Wuhan University(武汉大学) Stanford University(斯坦福大学)

AI总结 本文提出多域现实世界面部伪造检测范式,通过DevDet框架提升真实伪造区分能力,实现在无域指定条件下的准确判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03783 2025-12-05 cs.AI cs.SD

Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning

Omni-AutoThink: 通过强化学习实现自适应多模态推理

Dongchao Yang, Songxiang Liu, Disong Wang, Yuanyuan Wang, Guanglu Wan, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan(美团)

AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12723 2025-12-05 cs.CL

On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding

基于组等价偏好的多编程语言理解的在线优化

Haoyuan Wu, Rui Ming, Jilong Gao, Hangyu Zhao, Xueyi Chen, Yikai Yang, Haisheng Zheng, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) ChatEDA Tech(ChatEDA科技)

AI总结 本文提出OORL框架和GEPO方法,通过代码翻译任务提升LLMs对多编程语言代码功能的理解和跨语言关系的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04530 2025-12-05 cs.LG

Explainable Graph Representation Learning via Graph Pattern Analysis

通过图模式分析实现可解释的图表示学习

Xudong Wang, Ziheng Sun, Chris Ding, Jicong Fan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文提出PXGL-GNN框架,通过图模式分析实现图表示的可解释性,解决了传统方法在节点特征忽略和高维问题上的局限。

Comments Full version with appendix of the paper published in the Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), Main Track

Journal ref Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), Main Track, pages 3426-3434, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23075 2025-12-05 cs.CV cs.AI

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01903 2025-12-05 cs.SD eess.AS

MelTok: 2D Tokenization for Single-Codebook Audio Compression

MelTok:单代码本音频压缩的2D分token化

Jingyi Li, Zhiyuan Zhao, Zhisheng Zhang, Yunfei Liu, Lijian Lin, Ye Zhu, Jiahao Wu, Qiuqiang Kong, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) Chinese University of Hong Kong(香港中文大学) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 MelTok通过二维分token化和基于分token的vocoder,实现单代码本下的高效音频压缩与高质量重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15610 2025-12-05 cs.LG cs.AI

A general language model for peptide function identification

一种用于肽功能识别的通用语言模型

Jixiu Zhai, Zikun Wang, Chupei Tang, Haitian Zhong, Ziyang Xu, Yuhuan Liu, Shengrui Xu, Jingwan Wang, Dan Huang, Tianchi Lu

机构 * School of Mathematics and Statistics, Lanzhou University(兰州大学数学与统计学学院) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shanghai Innovation Institute(上海创新研究院) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Cuiying Honors College, Lanzhou University(崔莹荣誉学院,兰州大学) Department of Mathematics, Harbin Engineering University(哈尔滨工程大学数学系)

AI总结 PDeepPP是一种整合预训练蛋白质语言模型与混合Transformer-CNN架构的通用语言模型,用于高效识别多种肽类和PTM位点,实现高精度和可解释的肽表示。

Comments 15 pages, 5 figures, 3 tables, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03620 2025-12-04 cs.CR cs.AI cs.CL cs.LG

SELF: A Robust Singular Value and Eigenvalue Approach for LLM Fingerprinting

SELF:一种用于LLM指纹识别的鲁棒奇异值和特征值方法

Hanxiu Zhang, Yue Zheng

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SELF通过奇异值和特征值分解LLM注意力权重,提出一种鲁棒的指纹识别方法,有效抵御虚假声明和权重操纵,提升知识产权保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03548 2025-12-04 cs.RO cs.AI

A Learning-based Control Methodology for Transitioning VTOL UAVs

一种基于学习的过渡VTOL无人机控制方法

Zexin Lin, Yebin Zhong, Hanwen Wan, Jiu Cheng, Zhenglong Sun, Xiaoqiang Ji

机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院)

AI总结 本文提出基于强化学习的VTOL无人机过渡控制方法,通过将巡航模式视为悬停模式的特殊情况,实现更高效的控制器开发和更精确的轨迹跟踪,减少过渡过程中的振动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03413 2025-12-04 cs.IR cs.AI

BookRAG: A Hierarchical Structure-aware Index-based Approach for Retrieval-Augmented Generation on Complex Documents

BookRAG: 一种面向复杂文档的基于层次结构的索引方法用于检索增强生成

Shu Wang, Yingli Zhou, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 BookRAG通过构建层次化索引结构,提升复杂文档在问答任务中的检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03052 2025-12-04 cs.GR cs.CV

LATTICE: Democratize High-Fidelity 3D Generation at Scale

LATTICE:大规模实现高保真3D生成

Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Haolin Liu, Qingxiang Lin, Jingwei Huang, Chunchao Guo, Xiangyu Yue

机构 * MMLab, CUHK(CUHK人工智能实验室) Tencent Hunyuan(腾讯文言)

AI总结 LATTICE通过VoxSet半结构化表示实现高效高保真3D生成,支持任意分辨率解码和灵活推理,达到最先进的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21004 2025-12-04 cs.SD

CoHear: Conversation Enhancement via Multi-Earphone Collaboration

CoHear:通过多耳机协作提升对话

Lixing He, Yunqi Guo, Zhenyu Yan, Guoliang Xing

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 CoHear通过多耳机协作提升对话质量,采用对话驱动网络协议和稳健的目标对话提取模型,实现高准确率和实时语音增强。

Comments Submitted to IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19094 2025-12-04 cs.CV cs.AI

SATORI-R1: Incentivizing Multimodal Reasoning through Explicit Visual Anchoring

SATORI-R1: 通过显式视觉锚定激励多模态推理

Chuming Shen, Wei Wei, Xiaoye Qu, Yu Cheng

机构 * Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 SATORI-R1通过显式视觉锚定提升多模态推理,采用三个可验证阶段和VQA-Verify数据集,在VQA任务中实现15.7%的准确率提升。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23793 2025-12-04 cs.CV

Pan-LUT: Efficient Pan-sharpening via Learnable Look-Up Tables

Pan-LUT:通过可学习的查找表实现高效的全景锐化

Zhongnan Cai, Yingying Wang, Hui Zheng, Panwang Pan, ZiXu Lin, Ge Meng, Chenxin Li, Chunming He, Jiaxin Xie, Yunlong Lin, Junbin Lu, Yue Huang, Xinghao Ding

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) ByteDance(字节跳动) The Chinese University of Hong Kong(香港中文大学) Duke University(杜克大学) University of Washington(华盛顿大学)

AI总结 Pan-LUT通过可学习的查找表实现高效全景锐化,适用于大遥感图像,兼具高性能与低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03046 2025-12-03 cs.CV

MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues

MagicQuillV2: 基于分层视觉提示的精确交互式图像编辑

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Shuailei Ma, Ka Leong Cheng, Wen Wang, Qingyan Bai, Yuxuan Zhang, Yanhong Zeng, Yixuan Li, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) NEU(南京大学) ZJU(浙江大学) CUHK(香港中文大学)

AI总结 MagicQuillV2通过分层视觉提示实现精确交互式图像编辑,解决传统生成模型与图形软件间的控制与语义平衡问题。

Comments Code and demo available at https://magicquill.art/v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03036 2025-12-03 cs.CV cs.AI

ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation

ViSAudio:端到端视频驱动的双耳空间音频生成

Mengchen Zhang, Qi Chen, Tong Wu, Zihan Liu, Dahua Lin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Beihang University(北航) The Chinese University of Hong Kong(香港中文大学)

AI总结 ViSAudio通过端到端双耳空间音频生成框架,从静音视频直接生成高质量空间音频,提升空间沉浸感和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02523 2025-12-03 cs.SD cs.LG

Generative Multi-modal Feedback for Singing Voice Synthesis Evaluation

生成式多模态反馈用于歌唱语音合成评估

Xueyan Li, Yuxin Wang, Mengjie Jiang, Qingzi Zhu, Jiang Zhang, Zoey Kim, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出生成式多模态反馈框架,通过音频-语言模型生成多维语言和音频反馈,提升歌唱语音合成评估的准确性和可解释性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02515 2025-12-03 cs.SD

VibOmni: Towards Scalable Bone-conduction Speech Enhancement on Earables

VibOmni: 向耳戴设备的可扩展骨传导语音增强迈进

Lixing He, Yunqi Guo, Haozheng Hou, Zhenyu Yan

机构 * department of information engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

AI总结 VibOmni通过骨传导振动与音频融合,提升耳戴设备在嘈杂环境中的语音质量与噪声抑制能力。

Comments Submitted to TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02485 2025-12-03 cs.CV cs.AI

UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making

UCAgents: 视觉证据锚定的多智能体医学决策收敛

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 UCAgents通过结构化证据审计和单向收敛机制,在医疗视觉问答中提升准确率并降低计算成本,平衡视觉证据揭示与文本干扰避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07958 2025-12-03 cs.CV

Detect Anything 3D in the Wild

在野外检测任意3D对象

Hanxue Zhang, Haoran Jiang, Qingsong Yao, Yanan Sun, Renrui Zhang, Hao Zhao, Hongyang Li, Hongzi Zhu, Zetong Yang

机构 * OpenDriveLab at Shanghai AI Laboratory(上海人工智能实验室开放驾驶实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Stanford University(斯坦福大学) CUHK MMLab(香港大学多模态实验室) Tsinghua University(清华大学) GAC R&D Center(广汽研发中心)

AI总结 DetAny3D通过结合2D基础模型知识和3D解释器,实现了在任意相机配置下检测任意新物体的3D检测基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02013 2025-12-02 cs.RO

ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

ManualVLA: 一种统一的VLA模型用于链式思维手动生成和机器人操作

Chenyang Gu, Jiaming Liu, Hao Chen, Runzhong Huang, Qingpo Wuwu, Zhuoyang Liu, Xiaoqi Li, Ying Li, Renrui Zhang, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Project(Simplexity机器人项目)

AI总结 ManualVLA通过融合多模态手册生成与动作执行,提升机器人长周期任务中的规划与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01820 2025-12-02 stat.ML cs.LG math.PR math.ST stat.TH

Dimension-free error estimate for diffusion model and optimal scheduling

扩散模型的无维误差估计与最优调度

Valentin de Bortoli, Romuald Elie, Anna Kazeykina, Zhenjie Ren, Jiacheng Zhang

机构 * Google DeepMind(谷歌DeepMind) Université Paris Saclay(巴黎萨克雷大学) Université Evry - Paris Saclay(埃夫里-巴黎萨克雷大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种无维误差界,用于评估扩散模型生成与真实数据分布的差异,并通过变分问题推导出最优时间调度策略以减少离散化误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21309 2025-12-02 cs.CV

CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

CaliTex: 用于视图一致3D纹理生成的几何校准注意力

Chenyu Liu, Hongze Chen, Jingzhi Bao, Lingting Zhu, Runze Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Keyang Luo, Xin Wang

机构 * PKU(北京大学) HKUST(香港科技大学) CUHK(SZ)(香港中文大学(深圳)) HKU(香港大学) LIGHTSPEED

AI总结 CaliTex通过几何校准注意力机制,解决3D纹理生成中的跨视图不一致问题,提升纹理的视图一致性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01396 2025-12-02 cs.SE cs.CL cs.CR

BackportBench: A Multilingual Benchmark for Automated Backporting of Patches

BackportBench: 一种多语言的自动化补丁回退基准测试

Zhiqing Zhong, Jiaming Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

AI总结 BackportBench是一个多语言基准测试,用于评估自动化补丁回退技术,展示了代理方法在处理复杂补丁回退任务中的优越性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01357 2025-12-02 cs.DC cs.AI cs.AR

Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity

Tangram: 通过GPU内存重用和亲和力加速无服务器LLM加载

Wenbin Zhu, Zhaoyan Shen, Zili Shao, Hongjun Dai, Feng Chen

机构 * Shandong University(山东大学) The Chinese University of Hong Kong(香港中文大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

AI总结 Tangram通过GPU内存重用和亲和力调度技术,显著提升无服务器LLM的加载速度和冷启动性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01061 2025-12-02 cs.RO cs.CV

Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer

为人类oid像素到动作策略转移打开仿真到现实的大门

Haoru Xue, Tairan He, Zi Wang, Qingwei Ben, Wenli Xiao, Zhengyi Luo, Xingye Da, Fernando Castañeda, Guanya Shi, Shankar Sastry, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) CUHK(香港中文大学)

AI总结 本文提出了一种基于教师-学生-Bootstrap框架的人形机器人仿真到现实策略转移方法,通过分阶段重置探索策略和GRPO微调程序,实现了在多样化可动物体交互任务中的高效零样本性能。

Comments https://doorman-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00473 2025-12-02 cs.CV cs.AI

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07931 2025-12-02 cs.SD cs.AI cs.CL

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

SpeechJudge: 向人类水平的语音自然度判断迈进

Xueyao Zhang, Chaoren Wang, Huan Liao, Ziniu Li, Yuancheng Wang, Li Wang, Dongya Jia, Yuanzhe Chen, Xiulin Li, Zhuo Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SpeechJudge通过构建大规模人类反馈数据集和生成奖励模型,提升语音自然度判断的准确性,显著优于现有方法。

Comments Dataset, Model, and Code: https://github.com/AmphionTeam/SpeechJudge

详情

展开后加载摘要…

URL PDF HTML 收藏