arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 56 篇

2410.07809 2026-07-28 cs.CL cs.LG 版本更新 81%

No Optimal Language Set Exists for Multilingual Instruction Tuning: Insights from a Linguistically-Informed Study

多语言指令微调不存在最优语言集:基于语言信息研究的见解

Gürkan Soykan, Gözde Gül Şahin

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究多语言指令微调中语言集选择问题,通过评估基于多种特征的语言信息选择策略与随机基线对比,发现固定预算下无通用语言选择策略,性能因任务和模型而异,超阈值加语言会致性能下降,还讨论了相关影响和评估陷阱。

Comments 7 pages, 4 figures Updated the title and revised the manuscript for submission to the Workshop on Insights from Negative Results in NLP (Insights 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24330 2026-07-28 eess.SP 新提交 80%

Toward Alias-Free Channel Extrapolation in Upper Mid-Band Systems: A Spatial-Frequency-Temporal Tensor Learning Approach

迈向中高频段系统中无别名信道外推:一种空间 - 频率 - 时间张量学习方法

Jiawei Zhuang, Hongwei Hou, Yafei Wang, Xinping Yi, Wenjin Wang, Jiangzhou Wang, Björn Ottersten

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 针对中高频段MIMO系统导频开销大问题,提出张量结构多域信道外推框架,利用有限散射特性恢复CSI。开发基于塔克的SFT域信号模型,揭示ADD域混叠问题,引入支持先验辅助去混叠机制,提出TANN,经训练得统一模型,数值结果验证其有效性和泛化能力。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23394 2026-07-28 cs.AI 新提交 79%

Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning

用于减轻大语言模型微调中隐藏行为的推理时共识

Adhyyan Narang, Artin Tajdini, Claire Zhang, Jamie Morgenstern

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型微调中隐藏行为问题,通过从不同源收集多数据集并学习共性,在解码时聚合参考模型下一个token分布,引入两种共识解码器,有效抑制特定源不当行为,保留共享期望行为。

Comments 21 pages, 4 figures. Code: https://github.com/AdhyyanNarang/consensus-aggregation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22861 2026-07-28 cs.CV cs.AI 新提交 79%

Robustifying pathology foundation models via fine-tuning

通过微调增强病理学基础模型的鲁棒性

Alexandre Filiot, Oskar Thaeter, Benoit Schmauch, Lionel Guillou

机构 * Waiv Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理学研究所) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对病理学基础模型对采集因素敏感问题,开发新颖微调方法,应用于十个不同模型提升鲁棒性与下游性能,平均鲁棒性指数提高23%,综合性能提高43%,并公开两个模型的微调版本。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05658 2026-07-28 physics.ao-ph cs.LG physics.geo-ph 版本更新 79%

Integrating GNSS-Derived Zenith Wet Delay into a Weather Foundation Model Improves Precipitation Forecasting

将全球导航卫星系统(GNSS)导出的天顶湿延迟整合到天气基础模型中可改善降水预报

Leonardo Trentini, Fanny Lehmann, Laura Crocetti, Benedikt Soja

机构 * Weather Foundation(天气基金会)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究将GNSS导出的ZWD整合到Aurora天气基础模型中,扩展后的模型学习ZWD能力与预训练变量相当,微调时纳入ZWD可改善降水预报,增益随严重程度增加,能让降水功率谱更现实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23837 2026-07-28 cs.LG cs.CL 新提交 79%

Latent-LoRA: Compact Latent-Space Adapters with Gradient-Free Routing for Continual Learning

Latent-LoRA:用于持续学习的具有无梯度路由的紧凑潜在空间适配器

Reza Rahimi Azghan, Gautham Krishna Gudur, Giulia Pedrielli, Pavan Turaga, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) Department of Electrical and Computer Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校电气与计算机工程系) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) The GAME School, Arizona State University(亚利桑那州立大学GAME学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型持续学习的灾难性遗忘问题,提出Latent-LoRA系统。利用冻结嵌入层池化令牌嵌入分离任务分布,无需可训练路由组件,通过奇异值分解和正交正则化控制任务干扰,实验显示其有近零遗忘的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23124 2026-07-28 cs.AI cs.CL 新提交 79%

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications

AgentOmnia:用于全场景应用的规模化智能体模型

Hao Jiang, Gangtao Xin, Yingdi Huang, Guojie Zhu, Jiangshan Zhang, Xinyuan Lin, Yunkun Xu, Chengyu Shen, Wenlong Fei, Jiawei Li, Yujie Fu, Sichen Kang, Tingyu Xie, Yedi Hu, Jingren Zhang, Hongcheng Gao, Jianshu Zeng, Chong Chen, Chang Guo, Chao Feng, Feng Wang, Fulin Lin, Jinchao Ma, Lang Mei, Li Huang, Liyan Liu, Qing He, Shuting Tao, Siyu Mo, Xiangnan Chen, Xiaohan Yu, Xiaoyang Li, Yanheng Hou, Yanyu Wu, Zhihan Yang, Wentao Zhang, Yang Gao, Zhao Cao

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型智能体全场景扩展问题,提出AgentOmnia框架,结合多种技术构建环境、工具和任务,通过多种方式支持训练后处理,能将多个基准测试通过率和宏平均率大幅提高,实现广泛改进并为自我进化提供证据。

Comments 69 pages, 18 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24422 2026-07-28 cs.CV 新提交 78%

IJCB-AFMFR 2026: Competition on Adapting Foundation Models for Face Recognition Using Synthetic Training Data

IJCB-AFMFR 2026:使用合成训练数据进行人脸识别基础模型适配竞赛

Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira, Arturas Nakvosas, Hatef Otroshi Shahreza, Sébastien Marcel, Rishabh Shukla, Aditya Takkar, Rushil Khullar, Lalak Yadav, Gourav Gupta, Anant Gupta, Shiqi Yu, Vitomir Struc, Naser Damer, Fadi Boutros

专题命中 指令微调 :foundation model(title,abstract)

AI总结 介绍IJCB 2026上的AFMFR竞赛,含全数据和有限数据两个赛道,用IDPERTURB生成训练数据,基于多种基准评估。结果显示合成训练数据适配CLIP模型有改进,全数据赛道全量微调领先,有限数据条件下秩稳定的LoRA适配最有效。

Comments Accepted at the IEEE International Joint Conference on Biometrics 2026 (IJCB 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31513 2026-07-28 cs.CV 版本更新 78%

Personalize Your Large Vision-language Models With In-context Prompt Tuning

用上下文提示调优个性化你的大型视觉语言模型

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Purdue University(普渡大学) Rutgers University(罗格斯大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。

Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09179 2026-07-28 eess.SP 版本更新 78%

WiFo-M$^2$: Empower Wireless Communications With Plug-and-Play Environment Sensing via Foundation Model

WiFo-M$^2$:通过基础模型利用插件式环境感知增强无线通信

Haotian Zhang, Shijian Gao, Xiang Cheng

专题命中 指令微调 :foundation model(title,abstract)

AI总结 WiFo-M$^2$通过基础模型实现环境感知与无线通信的无缝集成,提升物理层行为的性能和泛化能力。

Comments 16 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15845 2026-07-28 cs.AI 版本更新 77%

Knowledge-Centric Agents for Workflow Generation in ComfyUI

用于工作流生成的以知识为中心的智能体

Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

机构 * INSAIT(未知机构) Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”分校) Adobe Research(Adobe研究院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视觉创作系统中工作流生成问题,提出以知识为中心的框架,通过知识反转、注入和可逆推理进行工作流生成,实验证明该方法生成的工作流在多样性、结构连贯性和执行成功率上优于现有系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23917 2026-07-28 cs.CV 新提交 75%

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

凝视到文本生成:超越人类注意力的分类解码

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

机构 * Stony Brook University(纽约州立大学石溪分校) Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。

Comments To appear in European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23446 2026-07-28 cs.CL cs.AI 新提交 73%

Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh

小模型会遵循你赋予它们的法律吗?孟加拉国法律问答的上下文注入微调

Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa, Mir Mohammad Asif Abdullah, Swakkhar Shatabda, Md Adnan Arefeen

机构 * North South University(南北大学) BRAC University(BRAC大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 研究孟加拉国法律问答,通过整理双语问答记录对不同参数的Qwen3.5进行微调,发现微调能提升部分模型表现,降低答案语言偏差,表明检索质量非唯一瓶颈,小型双语法律模型运用法律和语言回答有差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22625 2026-07-28 cs.AI cs.LG 新提交 73%

TokenMem: Faithful Knowledge Injection for Frozen LLMs

TokenMem:为冻结的语言模型进行忠实的知识注入

Chengzhang Yu, Chenyang Zheng, Zening Lu, Yingru He, Yutong Huang, Yiming Zhang, Yue Xu, Zhanpeng Jin

机构 * South China University of Technology(华南理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对RAG增强LLMs时的知识冲突问题,提出TokenMem轻量级记忆系统,通过专用通道向冻结LLMs注入知识,经两阶段课程训练薄门控适配器,实验显示其在反事实基准上知识一致性远超普通RAG,两阶段课程关键,门控适配器能自主学习策略。

Comments 15 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23335 2026-07-28 cs.CV 新提交 71%

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

门总是关闭:关于向冻结的视觉语言模型注入辅助信号

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

机构 * University of Doha for Science and Technology(多哈科技大学) Pluralis Research(普卢拉利斯研究公司) North South University(南北大学)

专题命中 指令微调 :language model(title)

AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24570 2026-07-28 cs.CV cs.AI 新提交 70%

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

视觉瓶颈:用于联合时空视频定位的多模态大语言模型的稀疏帧适配

Jiameng Zhang, Srikanth Madikeri

机构 * University of Zurich(苏黎世大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型在视频定位中训练与部署条件不匹配问题,通过实验表明视觉特征提取是稀疏帧输入瓶颈,提出适配特定层及边界感知采样策略,证明训练策略对稀疏帧视频定位比模型规模更关键。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21151 2026-07-28 cs.AI 版本更新 70%

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

V-DEAL:将视频安全去校准诊断为理解-拒绝耦合失败

Zhetong Zhang, Honghao Fu, Miao Xu, Yiwei Wang, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频大语言模型安全对齐问题,提出V-DEAL三级诊断框架分析漏洞机制,通过测试发现模型识别有害视频内容有一定准确率,但配对有害视频与良性查询时攻击成功率高,视觉理解激活拒绝倾向弱,还引入提示注入干预方法降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10292 2026-07-28 cs.CL cs.AI 版本更新 62%

Flick: Few Labels Text Classification using K-Aware Intermediate Learning in Multi-Task Low-Resource Languages

Flick:在多任务低资源语言中使用K感知中间学习进行少标签文本分类

Ali Almutairi, Abdullah Alsuhaibani, Shoaib Jameel, Aditya Joshi, Gelareh Mohammadi, Imran Razzak

机构 * University of New South Wales Australia(新南威尔士大学(澳大利亚)) University of Technology Sydney Australia(悉尼科技大学(澳大利亚)) University of Southampton United Kingdom(南安普顿大学(英国)) Macquarie University Australia(麦考瑞大学(澳大利亚)) MBZUAI UAE(阿联酋人工智能研究所)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言少标签文本分类难题,Flick提出从更广泛初始簇提炼高置信度伪标签,引入新的伪标签细化组件及自适应top-k选择机制,经14个数据集验证,展现出优越性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.11546 2026-07-28 cs.CL cs.AI 版本更新 62%

Like a Baby: Visually Situated Neural Language Acquisition

像婴儿一样:视觉情境下的神经语言习得

Alexander G. Ororbia, Ankur Mali, Mary Alexandria Kelly, David Reitter

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉情境对神经语言模型下一词预测的好处,引入多模态神经架构,微调预训练BERT嵌入,发现多模态环境下语言模型表现更好,符合情境认知理论,不同语言和模型中视觉情境训练优势明显。

Comments Final submission (camera-ready), accepted to ACL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23271 2026-07-28 cs.CV cs.AI 新提交 57%

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

CLIP 所知道但无法表达的:从冻结的中间特征中恢复否定信息

Chen-Yi Lu, Yueh-Shao Chen, Somali Chaterji

机构 * Purdue University(普渡大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 对比视觉语言模型如CLIP对否定不敏感,研究发现是表征坍缩所致。提出轻量级事后校正系统PeakPatch,在不改变预训练权重下恢复否定信号,通过特定网络提取信号、预测偏差向量等,经实验验证其有效性及泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23083 2026-07-28 cs.CL 新提交 57%

LoRA for Gender-Inclusive Rewriting and Activation Steering for Counter-Narrative Generation

用于性别包容性改写和反叙事生成的激活引导的LoRA

Akhil Rajeev P, Manoj Balaji J

机构 * IHLC(未提及具体中文译名)

专题命中 指令微调 :prompting(abstract);分类 cs.CL

AI总结 本文针对LT-EDI 2026共享任务,用参数高效的LoRA微调实现性别包容性改写,还用推理时表示工程方法结合约束提示生成反叙事,通过PCA得出主引导方向注入中间表示,取得一定分数,同时分析了引导行为的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19060 2026-07-28 cs.CV cs.LG 版本更新 57%

Shift-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment

用于微调CLIP的移位感知校准:利用图像-文本对齐

Song-Lin Lv, Yu-Yang Chen, Zhi Zhou, Lan-Zhe Guo

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24465 2026-07-28 cs.CV 新提交 50%

Rethinking Expert Training for Model Merging with Prompt Learning

重新思考用于模型合并和提示学习的专家训练

Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno, Simone Calderara, Dimosthenis Karatzas, Joost van de Weijer

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) AImageLab, University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学AImageLab)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究重新思考模型合并的专家训练,提出基于提示自适应的强大基线,引入双调谐专家两阶段训练策略,可减少特定任务参数更新幅度,提升合并性能,组合异构专家集时也有效。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23694 2026-07-28 cs.CV 新提交 50%

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

用于提示驱动手术概念分割的 SAM3 的参数高效适配

Changjing Liu, Yiming Huang, Beilei Cui, Liangjing Shao, Long Bai, Yanheng Li, Haoxuan Che, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) XGEN Labs(XGEN实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 针对手术数据与预训练数据的领域差距及现有方法计算消耗大效率低的问题,提出用低秩适配(LoRA)对 SAM3 进行参数高效适配用于手术概念分割,该方法在单个 GPU 上训练且性能优于主流基线,结果可支持下游手术场景重建和模拟。

Comments Accepted by The 2nd MICCAI Workshop on Efficient Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23511 2026-07-28 cs.CV 新提交 50%

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

MOJITO:用于统一端到端自动驾驶的模态联合学习

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(理想汽车) University of New South Wales(新南威尔士大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 研究针对端到端自动驾驶系统问题,提出基于模态联合学习的MOJITO框架,去除级联接口,执行逐块模态联合注意力更新多模态特征,在数据集上取得新的最优成绩,展现出强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23042 2026-07-28 cs.DC 新提交 50%

Application-Driven Architecture Exploration for Cross-Layer Heterogeneous Systems

跨层异构系统的应用驱动架构探索

Yuchen Fan, Minghong Sun, Jikui Ma, Yunpeng Xu, Shunyu Mao, Liu He, Shunan Dong, Jiahao Yang, Yu Zhu, Xinhao Yang, Tianyan Zhong, Haoran Sun, Daoqi Liu, Zongle Huang, Xinyuan Lin, Huazhong Yang, Maokun Li, Yongpan Liu, Yu Wang, Zhenhua Zhu, Hongyang Jia, Shuwen Deng

专题命中 指令微调 :LLM(abstract)

AI总结 研究跨层异构系统设计空间难探索的问题,提出应用驱动框架CHASE,通过分层图表示候选方案,用解耦两级循环避免联合硬件映射搜索难的问题,在稀疏计算和大语言模型工作负载上评估,实现加速并降本降耗。

Comments 20 pages, 15 figures. The first five authors contributed equally. Zhenhua Zhu, Hongyang Jia, and Shuwen Deng are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 17 篇

2606.29758 2026-07-28 cs.LG cs.AI 版本更新 92%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14032 2026-07-28 cs.CL 版本更新 89%

RM-Distiller: Exploiting Generative LLM for Reward Model Distillation

RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏

Hongli Zhou, Hui Huang, Wei Liu, Chenglong Wang, Xingyuan Bu, Lvyuan Han, Fuhai Song, Muyun Yang, Wenhao Jiang, Hailong Cao, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。

Comments Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 88%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24720 2026-07-28 cs.CL cs.AI cs.LG 新提交 85%

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

多轮长期规划的物理学:通过单教师和多教师策略蒸馏从预训练到训练后

Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮长期规划问题,通过引入统一可控环境,利用预训练、GRPO、OPD及MOPD等方法,研究规划能力在不同阶段的获取、塑造与整合,展示了多教师策略蒸馏对跨环境能力整合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏