arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-05-11 至 2026-05-11 共收录 18
2605.07810 2026-05-11 physics.optics cs.CV

Pre-training Enables Extraordinary All-optical Image Denoising

预训练实现非凡全光图像去噪

Xudong Lv, Yuxiang Sun, Shuo Wang, Nanxing Chen, Jun Guan, Jingtian Hu

机构 * Ministry of Industry and Information Technology Key Lab of Micro-Nano Optoelectronic Information System(工业和信息化部微纳光电信息系统重点实验室) Guangdong Provincial Key Laboratory of Semiconductor Optoelectronic Materials and Intelligent Photonic System(广东省半导体光电材料与智能光子系统重点实验室) Harbin Institute of Technology(哈尔滨工业大学) School of Electronics and Information Engineering(电子与信息工程学院) Zhejiang Provincial Key Laboratory of Intelligent Vehicle Electronics Research(浙江省智能车辆电子研究所) Hangzhou Dianzi University(杭州电子科技大学) School of Science and Engineering(科学与工程学院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) Key Laboratory of Photonic Technology for Integrated Sensing and Communication, Ministry of Education(教育部光电一体化感知与通信技术重点实验室) Guangdong University of Technology(广东工业大学)

AI总结 本文提出一种预训练驱动方法,通过两步优化过程实现高效全光图像去噪,显著提升去噪质量,适用于多种图像风格,且在噪声环境下保持细节并提高PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05957 2026-05-11 cs.LG

Knowing but Not Correcting: Routine Task Requests Suppress Factual Correction in LLMs

明知而不纠正:常规任务请求抑制大语言模型中的事实纠正

Zixuan Chen, Hao Lin, Zizhe Chen, Yizhou Tian, Garry Yang, Depeng Wang, Ya Guo, Huijia Zhu, James Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

AI总结 研究发现常规任务请求会抑制大语言模型的事实纠正能力,通过构建300个虚假前提的基准测试,揭示了模型在任务上下文中对错误信息的处理机制,并提出两种无需训练的干预方法提升事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00814 2026-05-11 cs.CV cs.AI

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

持久视觉记忆:在大型视觉-语言模型中维持感知以实现深度生成

Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tongji University(同济大学) Wuhan University(武汉大学)

AI总结 本文提出PVM模块,通过增强视觉证据的持续访问能力,解决LVLMs中视觉信号稀释问题,提升复杂推理任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00465 2026-05-11 cs.LG cs.AI

PAIR-Former: Budgeted Relational Multi-Instance Learning for Functional miRNA Target Prediction

PAIR-Former:预算化的关系多实例学习用于功能miRNA靶点预测

Jiaqi Yin, Baiming Chen, Jia Fei, Mingjun Yang

机构 * School of Future Technology(未来技术学院) Harbin Institute of Technology(哈尔滨工业大学) School of Medicine(医学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Medical College, Jinan University(济南大学医学院) Shenzhen Jingtai Technology Co., Ltd. (XtalPi)(深圳金泰科技有限公司(XtalPi))

AI总结 本文提出PAIR-Former,通过预算化的关系多实例学习方法,解决功能miRNA靶点预测中的关系模式建模问题,实现高精度预测。

Comments Preprint. Under review. During the preprint stage, inquiries and feedback can be directed to Jiaqi Yin (yjqhit@gmail.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06571 2026-05-11 cs.CL cs.AI cs.LG

Rep2Text: Decoding Full Text from a Single LLM Token Representation

Rep2Text:从单个LLM标记表示解码完整文本

Haiyan Zhao, Zirui He, Yiming Tang, Fan Yang, Ali Payani, Dianbo Liu, Mengnan Du

机构 * New Jersey Institute of Technology(新泽西理工学院) National University of Singapore(国立新加坡大学) Cisco Research(思科研究) Wake Forest University(威克森林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究探讨如何从LLM单个最后标记表示恢复原始文本,提出Rep2Text框架,通过可训练适配器将目标模型的最后标记表示映射到解码语言模型的token嵌入空间,实现文本自回归重建,实验显示在16-token序列中约半数token可被恢复且保持语义连贯。

Comments 18 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00886 2026-05-11 cs.AI

Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary

位置:智能体应仅在知识上必要时调用外部工具

Hongru Wang, Cheng Qian, Manling Li, Jiahao Qiu, Boyang Xue, Mengdi Wang, Heng Ji, Amos Storkey, Kam-Fai Wong

机构 * University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) Princeton University(普林斯顿大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07478 2026-05-11 cs.CV

AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

AudioFace: 基于语言的语音驱动面部动画与多模态语言模型

Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tiangong University(天工大学) Hunan University(湖南大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07442 2026-05-11 cs.LG

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07402 2026-05-11 cs.CV

InsHuman: Towards Natural and Identity-Preserving Human Insertion

InsHuman: 向自然且身份保持的人体插入迈进

Jie Li, Shulian Zhang, Yangyang Gao, Wenbo Li, Yulun Zhang, Yong Guo, Jian Chen

机构 * South China University of Technology(南方科技大学) Chinese University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Max Planck Institute for Informatics(马克斯·普朗克研究所)

AI总结 本文提出InsHuman,通过HBAF、FFIP和BDP方法实现自然且身份保持的人体插入,提升生成图像的合理性与身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07276 2026-05-11 cs.AI

Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

信号重塑用于弱反馈代理代码修复中的GRPO

Jia Li, Yuxin Su, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Tencent(腾讯)

AI总结 本文研究了在弱反馈环境下,通过信号重塑提升GRPO在代理代码修复中的性能,通过三种信号重塑方法改进轨迹排名、轨迹内信用分配和组内可比性,实验表明信号重塑显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07192 2026-05-11 cs.CV

AsyncEvGS: Asynchronous Event-Assisted Gaussian Splatting for Handheld Motion-Blurred Scenes

AsyncEvGS: 异步事件辅助高斯点云法用于手持运动模糊场景

Jun Dai, Renbiao Jin, Bo Xu, Yutian Chen, Linning Xu, Mulin Yu, Tianfan Xue, Shi Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) CUHK MMLab(香港大学多模态实验室) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出异步事件辅助高斯点云法,通过高分辨率双相机系统和跨域姿态估计模块,解决运动模糊场景下的3D重建问题,提出AsyncEv-Deblur数据集,提升重建鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07175 2026-05-11 cs.LG cs.AI

Learning Multi-Relational Graph Representations for DNA Methylation-Based Biological Age Estimation

学习多关系图表示以用于基于DNA甲基化的生物年龄估计

Qing Qing, Xikun Zhang, Zhongyuan Zhang, Jiarui Liu, Xingtong Yu, Xiaotao Shen, Ziqi Xu, Qixin Zhang, Zhe Wang, Renqiang Luo

机构 * Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出RelAge-GNN框架,通过构建三种互补图捕捉CpG位点间的共甲基化、基因组共定位和基因级关联,提升DNA甲基化数据的生物年龄预测准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06978 2026-05-11 cs.CL cs.AI

Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries

技能组:面向智能体技能库的分组结构技能检索

Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Sun Yat-sen University(孙中山大学) University of California, San Diego(加州大学圣地亚哥分校) Taiyuan University of Technology(太原理工大学)

AI总结 本文提出GoSkills,一种分组结构技能检索方法,通过构建基于类型技能图的锚点中心技能组,提升智能体在有限技能预算下对可见需求的覆盖能力,改进了传统技能检索方法的性能。

Comments 30 pages, 4 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05927 2026-05-11 cs.CL cs.SD eess.AS

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

从输入侧最小化模态差距:你的语音大语言模型可以成为具有语调意识的文本大语言模型

Wenqian Cui, Xiao-Hui Li, Daxin Tan, Qiyong Zheng, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

AI总结 本文提出TextPro-SLM,通过改进语音输入使其更接近具有语调意识的文本大语言模型,从而有效减少模态差距,实验表明其在3B和7B规模下表现最佳,且数据效率高。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24789 2026-05-11 cs.LG stat.ML

Fidel-TS: A High-Fidelity Multimodal Benchmark for Time Series Forecasting

Fidel-TS:一种高保真多模态时间序列预测基准

Zhijian Xu, Wanxu Cai, Xilin Dai, Zhaorong Deng, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学) School of Software(软件学院) Tsinghua University(清华大学) ZJU-UIUC Institute(浙大-UIUC研究院) Zhejiang University(浙江大学) School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(深圳香港中文大学)

AI总结 本文提出Fidel-TS,一种高保真多模态时间序列预测基准,解决现有基准数据源不纯、泄露问题及结构不清晰的问题,通过实验揭示现有基准的局限性和模型评估中的潜在差异。

Comments new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05085 2026-05-11 cs.CL cs.SD eess.AS

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models

S2S-Arena:评估语音到语音模型的副语言指令遵循

Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec分校) National University of Singapore(新加坡国立大学)

AI总结 S2S-Arena通过四级交互协议和双阶段数据构建流程,评估语音模型在语义理解和副语言表达上的能力,揭示了现有系统在复杂副语言需求下的性能差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏