arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 78 篇

2604.17880 2026-04-21 cs.RO cs.CV 67%

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

ST-$π$: 结构化时空VLA用于机器人操作

Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 本文提出ST-$π$模型,通过结构化时空视觉语言模型和动作专家,解决机器人操作中精细时空推理问题,同时引入结构化时空标注数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16659 2026-04-21 cs.CR cs.SD 67%

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

良性微调破坏音频大语言模型的安全对齐

Jaechul Roh, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 研究探讨了音频大语言模型中良性微调对安全对齐的影响,发现通过嵌入空间距离筛选良性音频可降低安全风险,但不同架构和模态的微调风险存在差异,提出两种防御措施以降低安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12606 2026-04-21 cs.CL cs.AI 62%

An Exploration of Mamba for Speech Self-Supervised Models

对Mamba在语音自监督模型中的探索

Tzu-Quan Lin, Heng-Cheng Kuo, Tzu-Chieh Wei, Hsi-Chun Cheng, Chun Wei Chen, Hsien-Fu Hsiao, Yu Tsao, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Graduate Institute of Communication Engineering(通信工程研究所) Research Center for Information Technology Innovation, Academia Sinica(学术院信息技术创新研究中心) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立台湾大学人工智能卓越研究中心)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了Mamba在语音自监督学习中的应用,提出基于Mamba的HuBERT模型,相比Transformer架构在长上下文ASR任务中计算更高效,且在流式ASR和SUPERB基准测试中表现更优。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20211 2026-04-21 cs.LG cs.AI 62%

PiCa: Parameter-Efficient Fine-Tuning with Column Space Projection

PiCa:基于列空间投影的参数高效微调

Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PiCa,一种基于列空间投影的理论支撑的参数高效微调方法,通过梯度投影和新权重共享策略提升参数效率,在多种NLP和视觉任务中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16657 2026-04-21 cs.LG cs.AI 62%

Cross-Modal Bayesian Low-Rank Adaptation for Uncertainty-Aware Multimodal Learning

跨模态贝叶斯低秩适应用于不确定性感知的多模态学习

Habibeh Naderi, Behrouz Haji Soleimani, Stan Matwin

机构 * Dalhousie University(达尔豪斯大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CALIBER框架,通过跨模态注意力机制实现多模态不确定性感知的参数高效微调,实验表明其在文本和音频模型上均优于传统基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 57%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18002 2026-04-21 cs.LG 57%

Neural Garbage Collection: Learning to Forget while Learning to Reason

神经垃圾回收:在学习推理的同时学习遗忘

Michael Y. Li, Jubayer Ibn Hamid, Emily B. Fox, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出神经垃圾回收(NGC),通过端到端学习使语言模型在推理时自动管理内存,无需人工设计规则,实现内存压缩与效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10448 2026-04-21 cs.CL 57%

Instruction Data Selection via Answer Divergence

通过答案分歧进行指令数据选择

Bo Li, Mingda Wang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) PKU-CMCC(Hubei) Joint Research Lab for LLM Industrial Applications(北京大学-CMCC(湖北)大语言模型工业应用联合实验室) School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.CL

AI总结 本文提出通过多样本输出的几何结构选择指令数据,通过计算答案分歧分数提升下游性能,实验表明仅使用10K个ADG选择的例子在六个基准上表现更优。

Comments Github: https://github.com/WisdomShell/ADG Project: https://wisdomshell.github.io/ADG/

Journal ref ACL2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 57%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08313 2026-04-21 cs.CV 50%

Weakly-Supervised Lung Nodule Segmentation via Training-Free Guidance of 3D Rectified Flow

基于无监督指导的3D校正流肺结节分割

Richard Petersen, Fredrik Kahl, Jennifer Alvén

机构 * Chalmers University of Technology, Gothenburg, Sweden(楚德大学技术学院,哥德堡,瑞典)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出一种无监督分割方法,结合预训练的校正流和预测器模型,通过无需训练的指导生成高质量肺结节分割结果,实验表明在LUNA16数据集上优于基线方法。

Comments Submitted to MICCAI 2026 Added references for section 2 Added Acknowledgment

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08564 2026-04-21 cs.CR 50%

MASH: Evading Black-Box AI-Generated Text Detectors via Style Humanization

MASH:通过风格人化规避黑盒AI生成文本检测器

Yongtong Gu, Songze Li, Xia Hu

专题命中 指令微调 :preference optimization(abstract)

AI总结 本文提出MASH框架,通过风格迁移技术规避黑盒检测器,实验显示其在6个数据集和5个检测器上优于11种基线方法,攻击成功率达92%。

Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). 21 pages. Code is available at: https://github.com/githigher/MASH

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16680 2026-04-21 cs.CV 50%

C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion

C-GenReg:基于多视角一致的几何到图像生成的无训练3D点云配准

Yuval Haitman, Amit Efraim, Joseph M. Francos

机构 * Ben-Gurion University(本·古里安大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 C-GenReg通过多视角一致的几何到图像生成,结合概率模态融合,实现无训练的3D点云配准,解决了跨模态、采样差异和环境的泛化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01332 2026-04-21 cs.CV 50%

Perspective-Equivariant Fine-tuning for Multispectral Demosaicing without Ground Truth

视角等变微调用于无地面真实多光谱去马赛克

Andrew Wang, Mike Davies

机构 * School of Engineering(工程学院) University of Edinburgh(爱丁堡大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出PEFD框架,通过利用相机成像系统的投影几何,利用更丰富的群结构恢复更多空域信息,并通过微调预训练模型实现高效多光谱去马赛克,优于现有方法,接近监督学习性能。

Comments To appear in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20471 2026-04-21 cs.AR 50%

SegSEM: Enabling and Enhancing SAM2 for SEM Contour Extraction

SegSEM:使SAM2适用于SEM轮廓提取

Da Chen, Guangyu Hu, Kaihong Xu, Kaichao Liang, Songjiang Li, Wei Yang, XiangYu Wen, Mingxuan Yuan

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出SegSEM框架,通过高效微调策略和传统算法融合,解决SEM图像轮廓提取中数据稀缺问题,验证了基础模型在工业应用中的有效性。

Comments 4 pages, 6 figures, accpeted by ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 27 篇

2604.16918 2026-04-21 cs.CL cs.LG 92%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17174 2026-04-21 cs.CL 92%

Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive Crowding

在认知拥挤下对大语言模型中的多维认知状态建模

Lin Zhong, Siyu Zhu, Zizhen Yuan, Jinhao Cui, Xinyang Zhao, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology(哈尔滨工业大学) City University of Macau(澳门城市大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CognitiveBench基准,通过统一标注四个认知维度,发现LLM在多维建模中表现下降,提出HyCoLLM在双曲空间中建模,提升多维认知理解。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14267 2026-04-21 cs.LG cs.AI 91%

Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization

通过贡献加权群体相对策略优化增强基于LLM的搜索代理

Junzhe Wang, Zhiheng Xi, Yajie Yang, Hao Luo, Shihan Dou, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出CW-GRPO框架,通过整合过程监督与群体相对策略优化,提升搜索代理的信用分配效率,实验表明其在多个知识密集型基准上表现优异。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17763 2026-04-21 cs.CR cs.LG 91%

A Quasi-Experimental Developer Study of Security Training in LLM-Assisted Web Application Development

一个关于LLM辅助Web应用开发中安全培训的准实验开发者研究

Mohammed Kharma, Ahmed Sabbah, Radi Jarrar, Samer Zain, Mohammad Alkhanafseh, David Mohaisen

机构 * Department of Computer Science(计算机科学系) Birzeit University(巴里兹大学) University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.LG

AI总结 本文通过准实验研究探讨了基于层的安全培训包是否能提升LLM辅助身份中心Java Spring Boot后端的安全质量,结果显示培训后安全缺陷显著减少。

Comments 8 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18327 2026-04-21 cs.AI cs.CL 91%

PARM: Pipeline-Adapted Reward Model

PARM:流水线适应的奖励模型

Xingyu Fan, Wei Shao, Jiacheng Liu, Linqi Song, Pheng Ann Heng

机构 * Graduate Student Member, IEEE(IEEE研究生会员) Member, IEEE(IEEE会员) Senior Member, IEEE(IEEE高级会员)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多阶段LLM流水线中奖励指导不足的问题,提出PARM模型,通过整合奖励模型到 formulation 和 solution 阶段,提升代码生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17747 2026-04-21 cs.LG 90%

Efficient Federated RLHF via Zeroth-Order Policy Optimization

高效联邦RLHF via零阶策略优化

Deyi Wang, Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.LG

AI总结 本文提出一种高效联邦RLHF算法Par-S$^2$ZPO,通过零阶优化和二进制扰动降低通信、计算和内存复杂度,理论分析证明其在样本复杂度上与集中式方法相当,但策略更新迭代更快,在MuJoCo任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18731 2026-04-21 cs.CL cs.AI 86%

One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment

一个适应任何:面向个性化大语言模型对齐的元奖励建模

Hongru Cai, Yongqi Li, Tiezheng Yu, Fengbin Zhu, Wenjie Wang, Fuli Feng, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Huawei Technologies Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出元奖励建模(MRM)方法,通过元学习框架优化奖励模型初始化,提升个性化对齐的效率与鲁棒性,实验表明其在少样本场景下表现优异。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18512 2026-04-21 cs.CV 86%

S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

S2H-DPO:面向视觉-语言模型的硬度感知偏好优化

Nitish Shukla, Surgan Jandial, Arun Ross

机构 * Michigan State University(密歇根州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title)

AI总结 本文提出S2H-DPO框架,通过三级层次推理构建多图象偏好数据,提升多图象推理性能,同时保持单图象推理能力,推动视觉偏好对齐的前沿发展。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16453 2026-04-21 cs.LG cs.AI stat.ML 84%

Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo

采样以保证质量:通过序列蒙特卡洛方法实现无训练奖励引导的大语言模型解码

Jelena Markovic-Voronov, Wenhui Zhu, Bo Long, Zhipeng Wang, Suyash Gupta, Kayhan Behdin, Bee-Chung Chen, Deepak Agarwal

机构 * LinkedIn

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于概率框架的奖励引导解码方法,通过结合模型转移概率和前缀依赖的奖励势能,改进传统解码方法的序列级质量优化。实验表明,该方法在代码生成和数学推理任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18547 2026-04-21 stat.ML cs.CL cs.LG 82%

FUSE: Ensembling Verifiers with Zero Labeled Data

FUSE:无需标注数据的验证器集成

Joonhyuk Lee, Virginia Ma, Sarah Zhao, Yash Nair, Asher Spector, Regev Cohen, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FUSE通过无监督集成验证器提升大语言模型输出验证质量,无需标注数据,在多种生成模型和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24235 2026-04-21 cs.LG cs.AI 82%

PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling

PaTaRM:通过偏好感知任务自适应奖励模型弥合成对和点状信号

Ai Jian, Jingqing Ruan, Xing Ma, Xiaoyun Zhang, Dailin Li, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PaTaRM通过偏好感知奖励机制实现成对和点状信号的弥合,无需显式评分标签,提升奖励模型的鲁棒性和任务适应性,实验显示在多个基准测试中表现优异。

Comments ACL Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07506 2026-04-21 cs.AI cs.CL 82%

ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework

ReflectRM: 通过统一判断框架内的自我反思提升生成奖励模型

Kai Qin, Liangxin Liu, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Houde Liu, Daiting Shi

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReflectRM通过自我反思评估分析质量,提升偏好建模,实验表明其在四个基准测试中平均准确率提升3.7%,并有效缓解位置偏差。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI 82%

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17663 2026-04-21 cs.LG cs.AI cs.CL 82%

ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data

ATLAS:宪法条件下的潜在几何与语言模型及神经扰动数据的再分配

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 后训练与偏好优化 :language model(title);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ATLAS通过分析模型学习的表示几何结构,揭示了宪法条件下的潜在几何再分配机制,展示了在不同模型和子系统中几何结构的稳定性与可恢复性。

Comments 49 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06767 2026-04-21 cs.CL cs.AI cs.LG 80%

GanitLLM: Difficulty-Aware Bengali Mathematical Reasoning through Curriculum-GRPO

GanitLLM:通过课程-GRPO实现难度感知的孟加拉数学推理

Shubhashis Roy Dipta, Khairul Mahbub, Nadia Najjar

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GanitLLM模型及新的难度感知孟加拉数学语料库和基于课程的GRPO流程,提升低资源环境下孟加拉数学推理能力。

Comments Accepted at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18473 2026-04-21 cs.LG 79%

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

分开训练,合并一起:模块化后训练与专家混合

Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia, Matei Zaharia, Noah A. Smith, Sewon Min

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.LG

AI总结 本文提出BAR方法,通过独立训练领域专家并采用专家混合架构实现高效更新,避免了传统重训练的高成本和性能下降问题,实验显示其在多个领域任务中表现优异。

Comments 9 content pages, 23 pages overall, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏