arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 34 篇

2604.12378 2026-04-15 cs.CL 93%

ReasonXL: Shifting LLM Reasoning Language Without Sacrificing Performance

ReasonXL: 不牺牲性能的LLM推理语言迁移

Daniil Gurgurov, Tom Röhr, Sebastian von Rohrscheidt, Josef van Genabith, Alexander Löser, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔兰州立大学) Berliner Hochschule für Technik(柏林技术学院)

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ReasonXL,首个跨领域多语言推理平行语料库,通过SFT+RLVR方法实现LLM在目标语言中推理,保留性能并提升跨语言迁移能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01455 2026-04-15 cs.AI cs.LG quant-ph 92%

Infeasibility Aware Large Language Models for Combinatorial Optimization

面向组合优化的可行性感知大语言模型

Yakun Wang, Min Chen, Zeguan Wu, Junyu Liu, Sitao Zhang, Zhenwen Shao

机构 * Lehigh University(莱荷大学) University of Pittsburgh(匹兹堡大学) Johnson & Johnson(强生公司)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合可验证数据集构建、监督微调和LLM辅助下游搜索的框架,用于解决组合优化问题中的可行性检测,实验显示模型在准确率和搜索速度上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12016 2026-04-15 cs.AI cs.LG 92%

Identity as Attractor: Geometric Evidence for Persistent Agent Architecture in LLM Activation Space

身份作为吸引子:LLM激活空间中持久代理架构的几何证据

Vladimir Vasilenko

机构 * Independent Researcher(独立研究者) Rapallo, Italy(意大利拉帕洛)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过对比不同条件下的隐藏状态,发现语义相似的提示在LLM激活空间中呈现吸引子行为,证明代理身份文档在激活空间中诱导吸引子几何结构。

Comments 16 pages, 5 figures. Code and data: https://github.com/b102e/yar-attractor-experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13851 2026-04-15 cs.SE cs.AI 92%

Evaluating LLM-Generated ACSL Annotations for Formal Verification

评估LLM生成的ACSL注解用于形式验证

Arshad Beg, Diarmuid O'Donoghue, Rosemary Monahan

机构 * Maynooth University(迈诺特大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了自动ACSL注解生成策略,比较了规则基Python脚本、Frama-C的RTE插件及三种LLM,发现规则方法更可靠,LLM性能波动大。

Comments 12 pages. Formal Techniques for Judicious Programming FTfJP-2026 at ECOOP. Conditionally Accepted. Final Revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17902 2026-04-15 cs.AI 92%

Activation Manifold Projection: Liberating Task-Specific Behaviors from LLM Architectures

激活流形投影:从LLM架构中解放任务特定行为

Al Kari

机构 * Manceps, Inc.(Manceps公司)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CAST框架,通过学习不同LLM架构激活流形间的非线性映射,解放LoRA编码的行为,实现零样本翻译,实验显示其性能优于现有权重空间转移方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12401 2026-04-15 cs.DC 91%

Three Birds, One Stone: Solving the Communication-Memory-Privacy Trilemma in LLM Fine-tuning Over Wireless Networks with Zeroth-Order Optimization

三鸟一石:在无线网络上通过零阶优化解决LLM微调中的通信-内存-隐私三重困境

Zhijie Cai, Yuhao Zheng, Haolong Chen, Dongzhu Liu, Bin Wang, Guangxu Zhu

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出pAirZero框架,结合零阶优化与空中计算,解决LLM微调中的通信、内存和隐私三重问题,实现低开销的安全高效微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12469 2026-04-15 cs.LG 91%

Analyzing the Effect of Noise in LLM Fine-tuning

分析在LLM微调中的噪声影响

Lingfang Li, Procheta Sen

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究不同噪声类型对LLM微调内部学习动态的影响,分析噪声在不同任务和模型中的表现,发现标签噪声导致最大性能下降,而语法和拼写噪声可能带来轻微正则化收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07177 2026-04-15 cs.CL 90%

Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector

迈向EnergyGPT:一种专门用于能源领域的大型语言模型

Amal Chebbi, Babajide Kolade

机构 * Meta

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出EnergyGPT,通过微调LLaMA 3.1-8B模型提升能源领域语言理解与生成能力,两种适应策略在性能与成本间取得平衡。

Comments Code and artifacts available at: https://github.com/fitila/energygpt-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07248 2026-04-15 cs.MA cs.HC 89%

DarwinTOD: LLM-driven Lifelong Self-evolution for Task-oriented Dialog Systems

DarwinTOD: 基于LLM的持续自我进化任务导向对话系统

Shuyu Zhang, Yujie Liu, Xinru Wang, Cheng Zhang, Yanmin Zhu, Bin Li

专题命中 指令微调 :LLM(title,title_cn)

AI总结 DarwinTOD通过整合进化计算与LLM驱动的自我改进,提出一种持续自我进化对话框架,实现零样本基础下的持续策略优化,无需任务特定微调。

Comments Accepted in ACL2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12384 2026-04-15 cs.AI 89%

Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints

通过耦合权重和激活约束防止大语言模型中的安全漂移

Songping Peng, Zhiheng Zhang, Daojian Zeng, Lincheng Jiang, Xieping Gao

机构 * Hunan Normal University(湖南师范大学) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,中国科学院自动化研究所) National University of Defense Technology(国防科技大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出耦合权重和激活约束方法,通过同时约束权重更新和关键特征正则化,有效提升大语言模型的安全性,实验显示其在多种任务中表现优于现有方法。

Comments 17 pages, 6 figures, 6 tables, The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12179 2026-04-15 cs.CL cs.IR 89%

AgenticAI-DialogGen: Topic-Guided Conversation Generation for Fine-Tuning and Evaluating Short- and Long-Term Memories of LLMs

AgenticAI-DialogGen:基于主题引导的对话生成用于微调和评估LLM的短期和长期记忆

Manoj Madushanka Perera, Adnan Mahmood, Kasun Eranda Wijethilake, Quan Z. Sheng

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AgenticAI-DialogGen框架,通过生成基于角色和主题的对话来微调和评估LLM的短期和长期记忆,引入了TopicGuidedChat数据集以提升对话质量和模型性能。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10676 2026-04-15 cs.CL cs.AI cs.LG 89%

Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data

针对报告摘要的LLM微调:对监督和非监督数据的分析

Swati Rallapalli, Shannon Gallagher, Andrew O. Mellinger, Jasmine Ratchford, Anusha Sinha, Tyler Brooks, William R. Nichols, Nick Winski, Bryan Brown

机构 * Software Engineering Institute, Carnegie Mellon University(软件工程研究院,卡内基梅隆大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLM微调在报告摘要任务中的有效性,探讨在资源有限和本地计算环境下微调的可行性及摘要质量评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03234 2026-04-15 cs.LG 88%

TeRA: Vector-based Random Tensor Network for High-Rank Adaptation of Large Language Models

TeRA: 基于向量的随机张量网络用于大语言模型的高秩适应

Yuxuan Gu, Wuyang Zhou, Giorgos Iacovides, Danilo Mandic

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 TeRA提出一种新型PEFT方法,通过将张量化的权重更新矩阵参数化为Tucker-like张量网络,实现高秩权重更新的同时保持向量方法的参数效率。

Comments Accepted at ACL main conference 2026. Code is available at https://github.com/guyuxuan9/TeRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12148 2026-04-15 cs.CV 87%

ViLL-E: Video LLM Embeddings for Retrieval

ViLL-E:用于检索的视频大语言模型嵌入

Rohit Gupta, Jayakrishnan Unnikrishnan, Fan Fei, Sheng Liu, Son Tran, Mubarak Shah

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ViLL-E通过引入新的嵌入生成机制,提升复杂视频处理能力,在视频检索和时间定位任务中表现优异,同时在视频问答任务中保持竞争力。

Comments Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12640 2026-04-15 cs.SE 86%

LLMs Are Not a Silver Bullet: A Case Study on Software Fairness

LLMs并非银弹:软件公平性的一项案例研究

Xinyue Li, Sixuan Li, Ying Xiao, Jie M. Zhang, Zhou Yang, Xuanzhe Liu, Zhenpeng Chen

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过对比传统机器学习与大语言模型在软件公平性中的表现,发现传统方法在公平性和预测性能上均优于LLM,指出LLM在现实数据中效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 85%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12479 2026-04-15 cs.CL 84%

Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning

面对动态个体偏好:通过配对微调解决冲突的人类价值观

Shanyong Wang, Shuhang Lin, Yining Zhao, Xi Zhu, Yongfeng Zhang

机构 * Rutgers University—New Brunswick(罗杰斯大学—新布伦斯维克分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Preference-Paired Fine-Tuning框架,通过Value Conflict Dilemma数据集解决动态个体偏好冲突问题,实验显示其在多选分类和开放生成任务中表现优异,优于传统方法。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15467 2026-04-15 cs.CL cs.AI 84%

Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning

联合回溯适应用于抗遗忘的指令微调

Yukun Zhao, Lingyong Yan, Zhenyang Li, Shuaiqiang Wang, Zhumin Chen, Zhaochun Ren, Dawei Yin

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出联合回溯适应方法,通过引入旧任务的有限提示来缓解增量学习中的灾难性遗忘问题,提升模型在新任务上的泛化能力。

Comments The experimental setting is wrong, i.e., not a real continual learning setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11867 2026-04-15 cs.LG cs.AI 82%

Disposition Distillation at Small Scale: A Three-Arc Negative Result

小规模下的行为蒸馏:一个三弧否定结果

Hari Sadasivan

机构 * Tinman Lab(Tinman实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究尝试通过四阶段MIT蒸馏流程在小语言模型中训练行为倾向,但发现无操作能改变倾向而不损害内容或导致模仿。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12666 2026-04-15 cs.LG cs.CL cs.HC 79%

From Imitation to Discrimination: Progressive Curriculum Learning for Robust Web Navigation

从模仿到鉴别:面向鲁棒网络导航的渐进课程学习

Chuang Peng, Wei Zhang, Renshuai Tao, Xinhao Zhang, Jian Yang

机构 * Beijing Jiaotong University(北京交通大学) Beihang University(北京航空航天大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Triton数据集和渐进训练课程,通过结构-语义硬负样本挖掘和双代理共识流程构建,提升网络导航中对复杂页面的鉴别能力与泛化能力,最终在Mind2Web上验证了专用数据课程优于单纯参数规模的优势。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25843 2026-04-15 cs.AI 77%

ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

ASGuard:激活-缩放防护:缓解针对性劫持攻击

Yein Park, Jungwoo Park, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASGuard框架,通过电路分析识别与针对性劫持相关的注意力头,训练通道缩放向量重新校准激活,结合预防性微调提升模型拒绝能力,有效降低攻击成功率并保持模型性能。

Comments ICLR 2026, 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11841 2026-04-15 cs.LG cs.AI 73%

Polynomial Expansion Rank Adaptation: Enhancing Low-Rank Fine-Tuning with High-Order Interactions

多项式展开秩适应:通过高阶交互增强低秩微调

Wenhao Zhang, Lin Mu, Li Ni, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PERA方法,通过在低秩因子空间中引入结构化多项式展开,提升低秩微调的表达能力,实验证明其在多种基准上表现优异。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11838 2026-04-15 cs.LG cs.AI 73%

A Layer-wise Analysis of Supervised Fine-Tuning

对监督微调的分层分析

Qinghua Zhao, Xueling Gong, Xinyu Chen, Zhongfeng Kang, Xinlu Li

机构 * Hefei University(合肥大学) Lanzhou University(兰州大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过信息论、几何和优化指标分析模型规模,揭示了中间层稳定而顶层敏感的分层特性,并提出Mid-Block Efficient Tuning方法,在GSM8K数据集上优于LoRA,证明有效对齐是局部而非分布的。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13789 2026-04-15 cs.CR cs.AI 70%

Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks

揭示并对齐异常注意力头以防御NLP后门攻击

Haotian Jin, Yang Li, Haihui Fan, Lin Shen, Xiangfang Li, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于注意力相似性的后门检测方法,通过检测异常注意力头相似性来防御后门攻击,结合头部微调修复污染的注意力头,有效降低攻击成功率并保持下游任务性能。

Journal ref "Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 70%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 67%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12309 2026-04-15 cs.CV 67%

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

通过3D基础先验实现逼真且一致的轨道视频生成

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) Amazon(亚马逊)

专题命中 指令微调 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出利用3D基础生成模型的丰富形状先验作为辅助约束,以生成几何逼真且一致的轨道视频,通过多尺度latent特征提升生成效率和形状真实感。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19820 2026-04-15 cs.CV cs.AI cs.CL cs.LG 67%

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception

CropVLM: 为细粒度视觉语言感知学习动态聚焦

Miguel Carvalho, Helder Dias, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CropVLM通过强化学习提升VLM在细粒度图像理解任务中的性能,无需人工标注或合成数据,有效增强模型对细节的捕捉能力。

Comments Accepted to the GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13961 2026-04-15 cs.CL cs.LG 62%

Olmo 3

Olmo 3:先进全开源语言模型家族

Team Olmo, :, Allyson Ettinger, Amanda Bertsch, Bailey Kuehl, David Graham, David Heineman, Dirk Groeneveld, Faeze Brahman, Finbarr Timbers, Hamish Ivison, Jacob Morrison, Jake Poznanski, Kyle Lo, Luca Soldaini, Matt Jordan, Mayee Chen, Michael Noukhovitch, Nathan Lambert, Pete Walsh, Pradeep Dasigi, Robert Berry, Saumya Malik, Saurabh Shah, Scott Geng, Shane Arora, Shashank Gupta, Taira Anderson, Teng Xiao, Tyler Murray, Tyler Romero, Victoria Graf, Akari Asai, Akshita Bhagia, Alexander Wettig, Alisa Liu, Aman Rangapur, Chloe Anastasiades, Costa Huang, Dustin Schwenk, Harsh Trivedi, Ian Magnusson, Jaron Lochner, Jiacheng Liu, Lester James V. Miranda, Maarten Sap, Malia Morgan, Michael Schmitz, Michal Guerquin, Michael Wilson, Regan Huff, Ronan Le Bras, Rui Xin, Rulin Shao, Sam Skjonsberg, Shannon Zejiang Shen, Shuyue Stella Li, Tucker Wilde, Valentina Pyatkin, Will Merrill, Yapei Chang, Yuling Gu, Zhiyuan Zeng, Ashish Sabharwal, Luke Zettlemoyer, Pang Wei Koh, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(Allen人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) University of Maryland(马里兰大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 Olmo 3是一款7B和32B参数规模的先进语言模型,专注于长上下文推理、函数调用、编程、指令遵循、通用聊天和知识回忆。

Comments minor edit updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14420 2026-04-15 cs.CL cs.AI 62%

Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following

指令即一切:用于指令遵循的自监督强化学习

Qingyu Ren, Qianyu He, Powei Chang, Jie Zeng, Zeye Sun, Fei Yu, Jiaqing Liang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(上海数据科学 key laboratory,复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需外部监督的自监督强化学习框架,通过直接从指令中生成奖励信号和伪标签来解决多约束任务中稀疏奖励问题,实验表明其在多个领域数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏