arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-24 至 2026-07-24 共收录 3
2505.17639 2026-07-24 cs.LG 版本更新

PreMoE: Proactive Inference for Efficient Mixture-of-Experts

PreMoE:面向高效混合专家的主动推理

Zehua Pei, Ying Zhang, Hui-Ling Zhen, Tao Yuan, Xianzhi Yu, Zhenhua Dong, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 PreMoE通过主动编译稀疏混合专家变体,在无需重新训练的情况下生成领域感知的专家排名,实现高达50%的稀疏度,同时保持性能。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11838 2026-07-24 cs.CL q-fin.GN 版本更新

DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining

DatedGPT:通过时间感知预训练防止大语言模型中的前瞻性偏差

Yutong Yan, Raphael Tang, Zhenyu Gao, Wenxi Jiang, Yao Lu

机构 * Department of Finance, CUHK Business School, The Chinese University of Hong Kong(香港中文大学商学院金融系,香港中文大学) Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心)

AI总结 DatedGPT通过时间感知预训练和指令微调,防止大语言模型中的前瞻性偏差,确保模型知识受限于数据截止年份,并在基准测试中表现出竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05502 2026-07-24 cs.CV cs.AI cs.CL 版本更新

MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs

MELLA:弥合低资源语言多模态大语言模型的语言能力与文化根基

Yufei Gao, Jiaying Fei, Nuo Chen, Ruirui Chen, Guohang Yan, Yunshi Lan, Botian Shi

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR)

AI总结 研究针对低资源语言MLLMs文化内涵不足问题,提出MELLA数据集,采用双源策略,结合母语网络图像-替代文本对与生成翻译的图像描述进行监督,经实验表明能减轻文化幻觉,强调数据对齐对低资源语言文化基础多模态理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏