arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11511 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11511 篇

2605.29559 2026-05-29 cs.CL 90%

LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境

Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29401 2026-05-29 cs.LG 90%

Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

重新思考多模态时间序列预测的后训练方法

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究)

专题命中 指令微调 :post-training(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 提出PostTime后训练方法,结合监督微调和基于可验证奖励的强化学习,利用大语言模型根据多模态上下文修正数值时间序列基础模型的预测,显著提升多模态时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29000 2026-05-29 cs.CL 90%

Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction

保留文本的有损文本压缩:策略性删除与LLM重建研究

Yuchun Zou, Junhong Tong, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约大学皇后学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究有损语义文本压缩,通过策略性删除文本并用大语言模型重建,比较多种删除策略,发现词频删除是低成本基线,语义方法在中度压缩时优势明显,QLoRA微调可得到强解码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21972 2026-05-27 cs.AI cs.DC cs.MA 90%

Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic

基于多智能体Actor-Critic的分散式LLM协作学习

Shuo Liu, Tianle Chen, Ryan Amiri, Christopher Amato

机构 * Northeastern University, Boston, MA(波士顿马萨诸塞大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 针对分散式LLM协作优化,提出两种多智能体Actor-Critic方法(CoLLM-CC和CoLLM-DC),实验表明在长时域或稀疏奖励任务中集中式Critic方法优于蒙特卡洛方法和分散式Critic方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16984 2026-05-22 cs.CL 90%

Closing the Gap at CRAC 2026: Two-Stage Adaptation for LLM-Based Multilingual Coreference Resolution

在CRAC 2026上缩小差距:基于LLM的多语言核心指代解析的两阶段适应

Antoine Bourgois, Olga Seminck, Thierry Poibeau

机构 * Lattice (CNRS UMR 8094 & ENS-PSL & Université Sorbonne Nouvelle)(Lattice(CNRS UMR 8094 和 ENS-PSL 和 索邦学院新欧))

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出了一种基于LLM的多语言核心指代解析方法,通过两阶段适应策略,在CRAC 2026共享任务中取得了74.32的平均CoNLL F1分数,排名第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12913 2026-05-14 cs.LG 90%

Revisiting DAgger in the Era of LLM-Agents

重新审视LLM代理时代的DAgger

Changhao Li, Rushi Qiang, Jiawei Huang, Chenxiao Gao, Chao Zhang, Niao He, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :LLM(title,title_cn);post-training(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出通过DAgger算法改进长周期LLM代理,通过学生与教师策略的回合级插值收集轨迹,并利用教师提供的监督标签训练学生,有效缓解协变量偏移并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09760 2026-05-12 cs.CL 90%

ConFit v3: Improving Resume-Job Matching with LLM-based Re-Ranking

ConFit v3:通过基于LLM的重排序提升简历-岗位匹配

Xiao Yu, Ruize Xu, Chengyuan Xue, Junyu Chen, Matthew So, Shijun Ma, Bo Liu, Xiangye Liang, Zhou Yu

机构 * Columbia University(哥伦比亚大学) John Hopkins University(约翰霍普金斯大学) Intellipro Group Inc.(Intellipro集团)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出ConFit v3,通过改进重排序算法和数据处理方法,提升简历与岗位匹配的准确性,优于现有最佳系统和大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09195 2026-05-12 cs.AI 90%

The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations

遗忘的几何学:时间知识漂移作为LLM表示中的独立轴

Rania Elbadry, Ahmed Heakl, Fan Zhang, Dani Bouch, Yuxia Wang, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) INSAIT, Sofia University(索菲亚大学INSAIT)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示LLM中时间知识漂移作为独立轴的几何结构,通过验证六种模型发现漂移检测的几何正交性,指出传统方法无法捕捉漂移的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06596 2026-05-08 cs.CR cs.LG 90%

FedAttr: Towards Privacy-preserving Client-Level Attribution in Federated LLM Fine-tuning

FedAttr: 向联邦LLM微调中实现隐私保护的客户端级归因

Su Zhang, Junfeng Guo, Heng Huang

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FedAttr提出一种新的联邦学习协议,通过配对子集差分机制识别训练过水印文档的客户端,同时保持隐私保障和性能。该方法在理论和实验上均表现出色,具有高召回率和低误报率。

Comments 39 pages, 4 figures, 21 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06166 2026-05-08 cs.LG 90%

One Algorithm, Two Goals: Dual Scoring for Parameter and Data Selection in LLM Fine-Tuning

一个算法,两个目标:在LLM微调中用于参数和数据选择的双评分

Xinrui Chen, Liu Yang, Ou Wu

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DualSFT算法,通过共享梯度统计生成参数掩码和数据子集,提升微调性能与稳定性-可塑性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-04-21 cs.AI cs.GR cs.MA 90%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM 90%

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17650 2026-04-21 cs.CL 90%

Measuring Distribution Shift in User Prompts and Its Effects on LLM Performance

评估用户提示分布转移及其对LLM性能的影响

Parker Seegmiller, Sarah Masud Preum

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 研究用户提示分布转移对部署LLM性能的影响,通过大规模评估发现提示行为的适度变化会导致LLM性能显著下降,强调了数据驱动监控的重要性。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16472 2026-04-21 cs.GT cs.AI cs.MA econ.GN econ.TH q-fin.EC 90%

Training Language Models for Bilateral Trade with Private Information

利用私人信息训练语言模型进行双边贸易

Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

机构 * Department of Economics, Yale University(耶鲁大学经济学系) Yale School of Management, Yale University(耶鲁大学管理学院) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文研究了在不完全信息下双边谈判中语言模型的能力,通过结构化谈判环境评估模型表现,发现有效策略通过连续报价实现价格歧视,训练实验表明监督微调和强化学习影响收益分配和交易完成率。

Comments 67 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15388 2026-04-20 cs.AR cs.AI 90%

Exploring LLM-based Verilog Code Generation with Data-Efficient Fine-Tuning and Testbench Automation

探索基于LLM的Verilog代码生成:数据高效微调与测试平台自动化

Mu-Chi Chen, Po-Hsuan Huang, Yu-Hung Kao, Yen-Fu Liu, Yu-Kai Hung, Cheng Liang, Shao-Chun Ho, Chia-Heng Tu, Shih-Hao Hung

机构 * National Taiwan University(国立台湾大学) National Cheng Kung University(国立成功大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用多智能体模型生成高质量微调数据的测试平台,实现比现有方法更少训练数据下的Verilog生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18288 2025-10-22 cs.CL 90%

BrailleLLM: Braille Instruction Tuning with Large Language Models for Braille Domain Tasks

Tianyuan Huang, Zepeng Zhu, Hangdi Xing, Zirui Shao, Zhi Yu, Chaoxiong Yang, Jiaxian He, Xiaozhong Liu, Jiajun Bu

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江无障碍感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Worcester Polytechnic Institute(沃斯特理工学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and DataSecurity(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(title);language model(title);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15155 2025-09-19 cs.LG cs.RO 90%

Self-Improving Embodied Foundation Models

Seyed Kamyar Seyed Ghasemipour, Ayzaan Wahid, Jonathan Tompson, Pannag Sanketi, Igor Mordatch

机构 * Generalist Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Appearing in the Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17003 2025-04-08 cs.CR cs.AI 90%

Safety Layers in Aligned Large Language Models: The Key to LLM Security

Shen Li, Liuyi Yao, Lan Zhang, Yaliang Li

专题命中 指令微调 :LLM(title,abstract);large language model(title);language model(title);分类 cs.AI

Comments Accepted by ICLR 2025. The code is available at https://github.com/listen0425/Safety-Layers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19480 2026-06-19 physics.comp-ph astro-ph.CO cond-mat.stat-mech gr-qc 新提交 90%

sft-wick: A formalism and package for Feynman-diagram expansion and evaluation in stochastic field theories

sft-wick: 随机场理论中费曼图展开与评估的形式化与软件包

Zheng Zhang

专题命中 指令微调 :SFT(title,title_cn)

AI总结 提出sft-wick开源Python包,通过路径积分形式化随机场动力学,自动枚举拓扑不同的费曼图并计算代数系数和数值积分,验证与Langevin模拟一致。

Comments 32 pages, 5 figures, 2 tables. Submitted to Computer Physics Communications. The sft-wick package is open source and available at https://github.com/StatFieldTheory/sft-wick

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13891 2026-08-13 cs.CL cs.AI 版本更新 90%

Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation

大型语言模型在用于文本标注时会再现种族刻板印象

Petter Törnberg

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现大型语言模型在文本标注中会因身份线索产生系统性偏见,再现种族刻板印象,尤其在名字相关任务中表现显著。

Comments Withdrawn by the author due to a confound in stimulus assignment that invalidates the main results; addressing it requires re-running the experiment with matched stimuli

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10090 2026-08-12 cs.AI cs.LG 新提交 90%

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

CHORUS:用于高覆盖率测试平台激励生成的互补专家

Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对芯片设计中高覆盖率测试平台激励生成任务,提出CHORUS后训练框架,整合分阶段SFT与密集奖励RL得到的互补专家,构建4B模型,在CVDP-ECov上的Pass@1指标优于671B参数的DeepSeek-R1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00062 2026-08-11 cs.CY cs.CL cs.CR cs.LG 90%

SafeCOMM: A Study on Safety Degradation in Fine-Tuned Telecom Large Language Models

SafeCOMM: 对于在电信领域微调的大型语言模型安全退化的研究

Aladin Djuhera, Swanand Ravindra Kadhe, Farhan Ahmed, Syed Zawad, Fernando Koch, Walid Saad, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院) Florida Atlantic University(佛罗里达 Atlantic 大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在电信领域微调的大型语言模型的安全退化问题,提出TeleHarm基准测试及三种防御方法,展示了如何通过安全重对齐提升模型安全性,实现SafeCOMM模型。

Journal ref IEEE Wireless Communications and Networking Conference (WCNC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11480 2026-08-11 cs.CL cs.AI cs.PF cs.PL cs.SE 版本更新 90%

SuperCoder: Assembly Program Superoptimization with Large Language Models

SuperCoder:基于大语言模型的汇编程序超优化

Anjiang Wei, Tarun Suresh, Huanmi Tan, Yinglun Xu, Gagandeep Singh, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 SuperCoder利用大语言模型实现汇编程序超优化,通过强化学习微调后,正确性达95%且平均速度提升1.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27912 2026-07-31 cs.AI cs.CL 新提交 90%

IFHierBench: Hierarchical Instruction Following for Large Language Models

IFHierBench:面向大语言模型的分层指令遵循基准

Yuetian Mao, Chunyang Chen

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出分层指令遵循基准IFHierBench,评估发现现有大语言模型遵循嵌套约束的能力不足,为提升指令遵循能力的训练方法提供了研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19973 2026-07-31 cs.AI cs.CL cs.IR 90%

Leveraging Fine-Tuned Large Language Models for Interpretable Pancreatic Cystic Lesion Feature Extraction and Risk Categorization

Ebrahim Rasromani, Stella K. Kang, Yanqi Xu, Beisong Liu, Garvit Luhadia, Wan Fung Chui, Felicia L. Pasadyn, Yu Chih Hung, Julie Y. An, Edwin Mathieu, Zehui Gu, Carlos Fernandez-Granda, Ammar A. Javed, Greg D. Sacks, Tamas Gonda, Chenchan Huang, Yiqiu Shen

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Journal ref American Journal of Roentgenology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21498 2026-07-29 cs.CL cs.AI 版本更新 90%

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

人工矫正:为什么大语言模型过度使用一种古典修辞格,以及如何缓解这一问题

Federico Boggia

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型过度使用矫正格修辞格的问题,基于模型与人类修辞风格差异及相关分类,提出用矫正格指数评分,通过测量发现校准错误,给出以LoRA适配器为中心的缓解技术、指令及适配器效果,强调校准到人类比率而非消除的重要性。

Comments 18 pages, 7 tables. v2: corrections to the classical sources (Quintilian, Cicero) and to several cited figures, and Appendix B corpus statistics aligned to the delivered dataset; measurements, results and conclusions unchanged. Data, code, and the trained LoRA adapter: https://federicoboggia.binatomy.com/pubblicazioni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20537 2026-07-24 cs.LG cs.AI 新提交 90%

ReliableTableQA:How Much Supervision Does Reliability Annotation Need?

可靠表格问答:可靠性标注需要多少监督?

Huei-Chung Hu, Hsin-Tai Wu, Koyo Kobayashi

机构 * DOCOMO Innovations, Inc.(都科摩创新公司) NTT DOCOMO, Inc.(日本电报电话公司都科摩)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究提出ReliableTableQA框架训练LLM标注表格问答结果统计可靠性,贡献分类法、数据管道及监督量研究。发现小的模式分层SFT集效果显著,GRPO在SFT不足时才有用,重新界定可靠性标注为数据效率问题,明确强化微调效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07380 2026-06-29 cs.CL cs.AI 90%

SpecFuse: Ensembling Large Language Models via Next-Segment Prediction

SpecFuse:通过下一段预测进行大语言模型的集成

Bo Lv, Nayu Liu, Chen Tang, Xin Liu, Yue Yu, Ping Luo

机构 * Peng Cheng Laboratory(鹏城实验室) Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tianjin Laboratory Autonomous Intelligence Technology and Systems, School of Computer Science and Technology, Tiangong University(天津工业大学计算机科学与技术学院天津市自主智能技术与系统实验室) Institute for Advanced Algorithms Research, Shanghai(上海高级算法研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SpecEM框架,通过动态调整模型贡献提升集成效果,结合推测解码实现段级语义协作,实验表明在多个LLM家族和基准数据集上性能优于现有方法。

Comments 15 pages, 5 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05933 2026-06-25 cs.CL cs.AI 版本更新 90%

Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs

强化学习改善LLM中参数化知识的遍历

Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer abd Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);language model(abstract);post-training(abstract);prompting(abstract)

AI总结 本文发现强化学习提升LLM知识回忆能力,原因在于改进了模型对参数化知识层次结构的遍历技能,而非获取新知识。

Comments `

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16140 2026-06-16 cs.AI cs.CL 新提交 90%

VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models

VibeThinker-3B:探索小型语言模型中可验证推理的前沿

Sen Xu, Shixi Liu, Wei Wang, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Xin Zhou, Junlin Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :language model(title);small language model(title);SFT(summary_cn);post-training(abstract)

AI总结 提出3B参数紧凑模型VibeThinker-3B,通过频谱到信号后训练范式(课程SFT、多域强化学习、离线自蒸馏)在可验证推理任务上达到前沿性能,匹配甚至超越大模型,并验证推理增强不损害指令可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏