arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2392
2603.13224 2026-05-12 cs.CV cs.AI

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26574 2026-05-12 cs.AI cond-mat.other cs.CL hep-th quant-ph

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

探测人工智能推理的临界点(CritPt):一个前沿物理研究基准

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

机构 * Argonne National Laboratory(阿贡国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Ohio State University(俄亥俄州立大学) Independent(独立) Northeastern University(东北大学) Caltech(加州理工学院) University of Florida(佛罗里达大学) University of Waterloo(滑铁卢大学) University of Maryland, College Park(马里兰大学学院公园分校) Columbia University(哥伦比亚大学) Perimeter Institute for Theoretical Physics(理论物理研究所) University of Connecticut(康涅狄格大学) University of Cologne(科隆大学) The Chinese University of Hong Kong(香港中文大学) Utrecht University(乌得勒支大学) Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院) Paul Scherrer Institute(保罗·谢尔研究所)

AI总结 本文提出CritPt基准,用于测试LLM在未发表的科研级推理任务中的能力,涵盖现代物理多个领域,发现当前LLM在复杂科研挑战中表现有限,仅能实现5.7%的准确率。

Comments 40 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20909 2026-05-12 cs.CL

LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories

LogitTrace:通过层间logit轨迹检测基准污染

Zirui He, Haiyan Zhao, Yingcong Li, Ali Payani, Mengnan du

机构 * New Jersey Institute of Technology(新泽西理工学院) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出LogitTrace框架,通过分析中间logit轨迹检测记忆化决策动态,发现污染样本更早承诺,而干净样本证据积累更渐进,帮助区分污染与干净样本。

Comments 23pages, 10 figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08323 2026-05-12 cs.LG cs.AI

The Reciprocity Gradient

互惠梯度

Yue Lin, Pascal Poupart, Shuhui Zhu, Dan Qiao, Wenhao Li, Yuan Liu, Hongyuan Zha, Baoxiang Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁库大学) Vector Institute(向量研究所) Tongji University(同济大学) LIGHTSPEED

AI总结 本文提出互惠梯度方法,通过反向传播奖励梯度优化策略,解决学习代理在战略互动中因声誉链复杂性导致的间接渠道优化难题,实现近最优的上下文敏感策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08269 2026-05-12 cs.RO cs.SY eess.SY

Anatomical Landmark-Guided Deep Reinforcement Learning for Autonomous Gastric Navigation

基于解剖标志的深度强化学习用于自主胃部导航

Haoxuan Wu, Sishen Yuan, Haitao Gao, Zhen Li, Xiuli Zuo, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学电子工程系)

AI总结 本文提出基于解剖标志的深度强化学习框架,用于自主胃部导航,通过轻量边缘轮廓深度融合模块,利用低维地标坐标提升导航性能,实验显示在模拟和体外实验中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08231 2026-05-12 cs.LG cs.AI cs.AR

TRAM: Training Approximate Multiplier Structures for Low-Power AI Accelerators

TRAM:用于低功耗AI加速器的近似乘法结构训练

Chang Meng, Hanyu Wang, Yuyang Ye, Mingfei Yu, Wayne Burleson, Giovanni De Micheli

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of California, Los Angeles(加州大学洛杉矶分校) Chinese University of Hong Kong(香港中文大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

AI总结 TRAM通过联合优化近似乘法结构与AI模型参数,实现低功耗与小精度损失的平衡,实验显示在CNN和视觉Transformer上分别达到25.05%和27.09%的功耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08144 2026-05-12 cs.LG cs.AI cs.CV

NoiseRater: Meta-Learned Noise Valuation for Diffusion Model Training

NoiseRater: 用于扩散模型训练的元学习噪声估值

Fang Wu, Haokai Zhao, Da Xing, Hanqun Cao, Tinson Xu, Yanchao Li, Xiangru Tang, Zehong Wang, Aaron Tu, Kuan Pang, Hanchen Wang, Hongbin Lin, Zeqi Zhou, Yinxi Li, Peng Xia, Li Erran Li, Molei Tao, Jure Leskovec, Aditya Joshi, Yejin Choi

机构 * Stanford University(斯坦福大学) UNSW(新南威尔士大学) UCL(伦敦大学学院) The University of Chicago(芝加哥大学) CUHK(香港中文大学) Nanjing University(南京大学) Brown University(布朗大学) Yale University(耶鲁大学) University of Notre Dame(Notre Dame 大学) University of Waterloo(滑铁卢大学) UCB(加州大学伯克利分校) Georgia Technology(佐治亚理工学院) Amazon(亚马逊)

AI总结 本文提出NoiseRater,通过元学习实现实例级噪声估值,提升扩散模型训练效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07810 2026-05-11 physics.optics cs.CV

Pre-training Enables Extraordinary All-optical Image Denoising

预训练实现非凡全光图像去噪

Xudong Lv, Yuxiang Sun, Shuo Wang, Nanxing Chen, Jun Guan, Jingtian Hu

机构 * Ministry of Industry and Information Technology Key Lab of Micro-Nano Optoelectronic Information System(工业和信息化部微纳光电信息系统重点实验室) Guangdong Provincial Key Laboratory of Semiconductor Optoelectronic Materials and Intelligent Photonic System(广东省半导体光电材料与智能光子系统重点实验室) Harbin Institute of Technology(哈尔滨工业大学) School of Electronics and Information Engineering(电子与信息工程学院) Zhejiang Provincial Key Laboratory of Intelligent Vehicle Electronics Research(浙江省智能车辆电子研究所) Hangzhou Dianzi University(杭州电子科技大学) School of Science and Engineering(科学与工程学院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) Key Laboratory of Photonic Technology for Integrated Sensing and Communication, Ministry of Education(教育部光电一体化感知与通信技术重点实验室) Guangdong University of Technology(广东工业大学)

AI总结 本文提出一种预训练驱动方法,通过两步优化过程实现高效全光图像去噪,显著提升去噪质量,适用于多种图像风格,且在噪声环境下保持细节并提高PSNR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05957 2026-05-11 cs.LG

Knowing but Not Correcting: Routine Task Requests Suppress Factual Correction in LLMs

明知而不纠正:常规任务请求抑制大语言模型中的事实纠正

Zixuan Chen, Hao Lin, Zizhe Chen, Yizhou Tian, Garry Yang, Depeng Wang, Ya Guo, Huijia Zhu, James Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

AI总结 研究发现常规任务请求会抑制大语言模型的事实纠正能力,通过构建300个虚假前提的基准测试,揭示了模型在任务上下文中对错误信息的处理机制,并提出两种无需训练的干预方法提升事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00814 2026-05-11 cs.CV cs.AI

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

持久视觉记忆:在大型视觉-语言模型中维持感知以实现深度生成

Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tongji University(同济大学) Wuhan University(武汉大学)

AI总结 本文提出PVM模块,通过增强视觉证据的持续访问能力,解决LVLMs中视觉信号稀释问题,提升复杂推理任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00465 2026-05-11 cs.LG cs.AI

PAIR-Former: Budgeted Relational Multi-Instance Learning for Functional miRNA Target Prediction

PAIR-Former:预算化的关系多实例学习用于功能miRNA靶点预测

Jiaqi Yin, Baiming Chen, Jia Fei, Mingjun Yang

机构 * School of Future Technology(未来技术学院) Harbin Institute of Technology(哈尔滨工业大学) School of Medicine(医学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Medical College, Jinan University(济南大学医学院) Shenzhen Jingtai Technology Co., Ltd. (XtalPi)(深圳金泰科技有限公司(XtalPi))

AI总结 本文提出PAIR-Former,通过预算化的关系多实例学习方法,解决功能miRNA靶点预测中的关系模式建模问题,实现高精度预测。

Comments Preprint. Under review. During the preprint stage, inquiries and feedback can be directed to Jiaqi Yin (yjqhit@gmail.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06571 2026-05-11 cs.CL cs.AI cs.LG

Rep2Text: Decoding Full Text from a Single LLM Token Representation

Rep2Text:从单个LLM标记表示解码完整文本

Haiyan Zhao, Zirui He, Yiming Tang, Fan Yang, Ali Payani, Dianbo Liu, Mengnan Du

机构 * New Jersey Institute of Technology(新泽西理工学院) National University of Singapore(国立新加坡大学) Cisco Research(思科研究) Wake Forest University(威克森林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究探讨如何从LLM单个最后标记表示恢复原始文本,提出Rep2Text框架,通过可训练适配器将目标模型的最后标记表示映射到解码语言模型的token嵌入空间,实现文本自回归重建,实验显示在16-token序列中约半数token可被恢复且保持语义连贯。

Comments 18 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00886 2026-05-11 cs.AI

Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary

位置:智能体应仅在知识上必要时调用外部工具

Hongru Wang, Cheng Qian, Manling Li, Jiahao Qiu, Boyang Xue, Mengdi Wang, Heng Ji, Amos Storkey, Kam-Fai Wong

机构 * University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) Princeton University(普林斯顿大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07478 2026-05-11 cs.CV

AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models

AudioFace: 基于语言的语音驱动面部动画与多模态语言模型

Kai Zheng, Zejian Kang, Rui Mao, Hongyuan Zou, Yuanchen Fei, Xuanyang Xu, Xiangru Huang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tiangong University(天工大学) Hunan University(湖南大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07442 2026-05-11 cs.LG

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07402 2026-05-11 cs.CV

InsHuman: Towards Natural and Identity-Preserving Human Insertion

InsHuman: 向自然且身份保持的人体插入迈进

Jie Li, Shulian Zhang, Yangyang Gao, Wenbo Li, Yulun Zhang, Yong Guo, Jian Chen

机构 * South China University of Technology(南方科技大学) Chinese University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Max Planck Institute for Informatics(马克斯·普朗克研究所)

AI总结 本文提出InsHuman,通过HBAF、FFIP和BDP方法实现自然且身份保持的人体插入,提升生成图像的合理性与身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07276 2026-05-11 cs.AI

Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

信号重塑用于弱反馈代理代码修复中的GRPO

Jia Li, Yuxin Su, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Tencent(腾讯)

AI总结 本文研究了在弱反馈环境下,通过信号重塑提升GRPO在代理代码修复中的性能,通过三种信号重塑方法改进轨迹排名、轨迹内信用分配和组内可比性,实验表明信号重塑显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07192 2026-05-11 cs.CV

AsyncEvGS: Asynchronous Event-Assisted Gaussian Splatting for Handheld Motion-Blurred Scenes

AsyncEvGS: 异步事件辅助高斯点云法用于手持运动模糊场景

Jun Dai, Renbiao Jin, Bo Xu, Yutian Chen, Linning Xu, Mulin Yu, Tianfan Xue, Shi Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) CUHK MMLab(香港大学多模态实验室) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出异步事件辅助高斯点云法,通过高分辨率双相机系统和跨域姿态估计模块,解决运动模糊场景下的3D重建问题,提出AsyncEv-Deblur数据集,提升重建鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07175 2026-05-11 cs.LG cs.AI

Learning Multi-Relational Graph Representations for DNA Methylation-Based Biological Age Estimation

学习多关系图表示以用于基于DNA甲基化的生物年龄估计

Qing Qing, Xikun Zhang, Zhongyuan Zhang, Jiarui Liu, Xingtong Yu, Xiaotao Shen, Ziqi Xu, Qixin Zhang, Zhe Wang, Renqiang Luo

机构 * Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出RelAge-GNN框架,通过构建三种互补图捕捉CpG位点间的共甲基化、基因组共定位和基因级关联,提升DNA甲基化数据的生物年龄预测准确性与相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06978 2026-05-11 cs.CL cs.AI

Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries

技能组:面向智能体技能库的分组结构技能检索

Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Sun Yat-sen University(孙中山大学) University of California, San Diego(加州大学圣地亚哥分校) Taiyuan University of Technology(太原理工大学)

AI总结 本文提出GoSkills,一种分组结构技能检索方法,通过构建基于类型技能图的锚点中心技能组,提升智能体在有限技能预算下对可见需求的覆盖能力,改进了传统技能检索方法的性能。

Comments 30 pages, 4 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05927 2026-05-11 cs.CL cs.SD eess.AS

Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM

从输入侧最小化模态差距:你的语音大语言模型可以成为具有语调意识的文本大语言模型

Wenqian Cui, Xiao-Hui Li, Daxin Tan, Qiyong Zheng, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

AI总结 本文提出TextPro-SLM,通过改进语音输入使其更接近具有语调意识的文本大语言模型,从而有效减少模态差距,实验表明其在3B和7B规模下表现最佳,且数据效率高。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24789 2026-05-11 cs.LG stat.ML

Fidel-TS: A High-Fidelity Multimodal Benchmark for Time Series Forecasting

Fidel-TS:一种高保真多模态时间序列预测基准

Zhijian Xu, Wanxu Cai, Xilin Dai, Zhaorong Deng, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学) School of Software(软件学院) Tsinghua University(清华大学) ZJU-UIUC Institute(浙大-UIUC研究院) Zhejiang University(浙江大学) School of Data Science(数据科学学院) The Chinese University of Hong Kong, Shenzhen(深圳香港中文大学)

AI总结 本文提出Fidel-TS,一种高保真多模态时间序列预测基准,解决现有基准数据源不纯、泄露问题及结构不清晰的问题,通过实验揭示现有基准的局限性和模型评估中的潜在差异。

Comments new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05085 2026-05-11 cs.CL cs.SD eess.AS

S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models

S2S-Arena:评估语音到语音模型的副语言指令遵循

Feng Jiang, Zhiyu Lin, Yiyang Liu, Liumeng Xue, Fan Bu, Yuhao Du, Xiangying Chen, Benyou Wang, Haizhou Li

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanjing University(南京大学) Shenzhen Loop Area Institute(深圳河套学院) CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学CentraleSupélec分校) National University of Singapore(新加坡国立大学)

AI总结 S2S-Arena通过四级交互协议和双阶段数据构建流程,评估语音模型在语义理解和副语言表达上的能力,揭示了现有系统在复杂副语言需求下的性能差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06665 2026-05-08 cs.LG cs.AI

UniPool: A Globally Shared Expert Pool for Mixture-of-Experts

UniPool: 一种全局共享专家池的混合专家架构

Minbin Huang, Han Shi, Chuanyang Zheng, Yimeng Wu, Guoxuan Chen, Xintong Yu, Yichun Yin, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术有限公司) The University of Hong Kong(香港大学)

AI总结 UniPool通过全局共享专家池替代传统每层独立专家资源,减少专家参数线性增长需求,提升模型效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06658 2026-05-08 cs.CV

Relit-LiVE: Relight Video by Jointly Learning Environment Video

Relit-LiVE: 通过联合学习环境视频实现视频照明

Weiqing Xiao, Hong Li, Xiuyu Yang, Houyuan Chen, Wenyi Li, Tianqi Liu, Shaocong Xu, Chongjie Ye, Hao Zhao, Beibei Wang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。

Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06642 2026-05-08 cs.CL cs.AI

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

StraTA: 通过战略轨迹抽象激励代理强化学习

Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Georgia(佐治亚大学) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出StraTA框架,通过引入显式的轨迹级策略提升代理强化学习的样本效率和最终性能,实验显示其在ALFWorld、WebShop和SciWorld上均优于基线模型。

Comments 26 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏