arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 83 篇

2603.20910 2026-04-07 cs.LG 92%

LLM-ODE: Data-driven Discovery of Dynamical Systems with Large Language Models

LLM-ODE:利用大语言模型发现动态系统的数据驱动方法

Amirmohammad Ziaei Bideh, Jonathan Gryak

机构 * The Graduate Center, CUNY(纽约市立大学研究生中心) Queens College and The Graduate Center, CUNY(纽约市立大学皇后学院与研究生中心)

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出LLM-ODE框架,利用大语言模型指导符号进化,提升动态系统方程发现的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04651 2026-04-07 cs.AI 90%

Search, Do not Guess: Teaching Small Language Models to Be Effective Search Agents

搜索,不要猜测:教小语言模型成为有效的搜索代理

Yizhou Liu, Qi Sun, Yulin Chen, Siyue Zhang, Chen Zhao

机构 * New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04233 2026-04-07 cs.RO cs.CL 90%

Precise Robot Command Understanding Using Grammar-Constrained Large Language Models

利用语法约束大语言模型实现精确的机器人指令理解

Xinyun Huo, Raghav Gnanasambandam, Xinyao Zhang

机构 * Industrial and Manufacturing Engineering, Florida State University(佛罗里达州立大学工业与制造工程系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 本文提出一种结合语法驱动NLU系统和微调LLM的混合模型,通过两阶段过程确保生成的指令在机器人可读的JSON格式中有效,提升工业人机协作的安全性和效率。

Comments Accepted at ASME MSEC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04013 2026-04-07 cs.CL 90%

RUQuant: Towards Refining Uniform Quantization for Large Language Models

RUQuant: 向大语言模型的均匀量化精修迈进

Han Liu, Haotian Gao, Changya Li, Feng Zhang, Xiaotong Zhang, Wei Wang, Hong Yu

机构 * Dalian University of Technology(大连理工大学) Peking University(北京大学) Macao Polytechnic University(澳门理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出RUQuant方法,通过理论分析和两阶段正交变换,解决激活分布非均匀导致的量化精度下降问题,在不需微调的情况下实现高精度量化。

Comments Accepted to KDD 2026. 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03888 2026-04-07 cs.AI cs.CL cs.MA q-fin.TR 90%

PolySwarm: A Multi-Agent Large Language Model Framework for Prediction Market Trading and Latency Arbitrage

PolySwarm:一种多智能体大语言模型框架,用于预测市场交易和延迟套利

Rajat M. Barot, Arjun S. Borkhatariya

机构 * Department of Computer Science, State University of New York, Binghamton(纽约州立大学宾汉姆顿分校计算机科学系) Department of Software Engineering, Arizona State University(亚利桑那州立大学软件工程系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PolySwarm框架,通过多智能体大语言模型实时预测市场交易和去中心化平台上的延迟套利,结合贝叶斯方法和信息论分析,展示其在概率校准上的优越性能。

Comments 13 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03258 2026-04-07 cs.CL cs.AI 90%

SoLA: Leveraging Soft Activation Sparsity and Low-Rank Decomposition for Large Language Model Compression

SoLA:利用软激活稀疏性和低秩分解实现大语言模型压缩

Xinhao Huang, You-Liang Huang, Zeyi Wen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 SoLA通过软激活稀疏性和低秩分解技术,在无需训练的情况下压缩大语言模型,显著提升语言模型和下游任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03286 2026-04-07 cs.AI cond-mat.mtrl-sci cs.HC 89%

Toward Full Autonomous Laboratory Instrumentation Control with Large Language Models

迈向完全自主实验室仪器控制的大型语言模型

Yong Xie, Kexin He, Andres Castellanos-Gomez

机构 * Key Laboratory of Wide Band-Gap Semiconductor Technology, School of Advanced Materials and Nanotechnology, Xidian University(西安电子科技大学先进材料与纳米技术学院宽禁带半导体技术重点实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在实验室仪器自动化中的应用,展示如何通过ChatGPT生成定制脚本,降低技术门槛,并展示LLM辅助工具如何发展为自主AI代理,实现仪器的自主操作与策略优化。

Comments 16 pages, 5 figures. Accepted manuscript published in Small Structures. Supporting data and code available at https://doi.org/10.5281/zenodo.15065601

Journal ref Small Structures, 2025, 6(8), 2500173

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03857 2026-04-07 cs.NI 89%

CCA Reimagined: An Exploratory Study of Large Language Models for Congestion Control

CCA Reimagined: 一种大型语言模型用于拥塞控制的探索性研究

Xiaoxuan Qin, Yufei Wang, Longfei Shangguan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过模拟引导研究,系统探讨了大型语言模型驱动的拥塞控制可行性,提出更通用的LLM拥塞控制策略,实验表明LLM方案在动态网络条件下可降低延迟达50%,仅牺牲极小吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03414 2026-04-07 cs.CV 89%

KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models

KiToke:基于核的区间感知令牌压缩用于视频大语言模型

Haifeng Huang, Yang Li

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 KiToke通过全局核冗余度测量和区间感知令牌合并,有效压缩视频大语言模型的视觉令牌,提升效率并保持关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00446 2026-04-07 cs.CR 89%

Exposing the Ghost in the Transformer: Abnormal Detection for Large Language Models via Hidden State Forensics

揭示Transformer中的幽灵:通过隐藏状态取证实现大语言模型的异常检测

Shide Zhou, Kailong Wang, Ling Shi, Haoyu Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出通过隐藏状态取证检测大语言模型异常行为,实现实时高效的安全威胁识别,检测准确率超95%,计算开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04493 2026-04-07 cs.LG cs.AI 88%

SLaB: Sparse-Lowrank-Binary Decomposition for Efficient Large Language Models

SLaB:用于高效大语言模型的稀疏低秩二进制分解

Ziwei Li, Yuang Ma, Yi Kang

机构 * School of Microelectronics, University of Science and Technology of China(中国科学技术大学微电子学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 SLaB通过将线性层权重分解为稀疏矩阵、低秩矩阵和二进制矩阵,实现大语言模型的高效压缩,在50%压缩下使困惑度降低36%,在零样本任务中提升准确率8.98%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00733 2026-04-07 cs.LG cs.AI 88%

Spectral Compact Training: Pre-Training Large Language Models via Permanent Truncated SVD and Stiefel QR Retraction

谱紧凑训练:通过永久截断SVD和Stiefel QR回退预训练大语言模型

Björn Roman Kohlberger

机构 * EctoSpace

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCT方法,通过永久截断SVD和Stiefel QR回退减少内存占用,实现大语言模型的高效预训练,实验显示内存占用降低达199倍,提升训练效率。

Comments 8 pages, 3 figures, 4 tables. Patent pending: Irish Application PTIE20260000000219. Code at https://github.com/EctoSpace/SCT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04482 2026-04-07 cs.AI 88%

Scalable and Explainable Learner-Video Interaction Prediction using Multimodal Large Language Models

基于多模态大语言模型的可扩展且可解释的学习者-视频交互预测

Dominik Glandorf, Fares Fawzi, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型预测学习者观看、暂停、跳过和回放行为,以评估视频内容的认知负荷,通过7700万次视频控制事件验证了模型的可扩展性和解释性。

Comments Accepted as long paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24535 2026-04-07 cs.LG cs.AI cs.CL 87%

Beyond Linear Steering: Unified Multi-Attribute Control for Language Models

超越线性操控:语言模型的统一多属性控制

Narmeen Oozeer, Luke Marks, Shreyans Jain, Fazl Barez, Amirali Abdullah

机构 * Martian University of Oxford(牛津大学) Thoughtworks

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出K-Steering方法,通过训练非线性多标签分类器实现语言模型的多属性控制,避免线性假设,无需存储和调整个别属性向量,支持动态行为组合。

Comments Accepted to Findings of EMNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07985 2026-04-07 cs.LG cs.AI cs.CR 87%

Fewer Weights, More Problems: A Practical Attack on LLM Pruning

更少的权重,更多的问题:对LLM剪枝的一种实用攻击

Kazuki Egashira, Robin Staab, Thibaud Gloaguen, Mark Vero, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次揭示了现代LLM剪枝方法可能被恶意利用的问题,通过构造看似无害的模型,在剪枝后表现出恶意行为,展示了剪枝过程中的安全风险。

Comments ICLR 2026. Code: https://github.com/eth-sri/llm-pruning-attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03524 2026-04-07 cs.AI 86%

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

结构刚性和57个标记的预测窗口:一种用于大语言模型推理层可控性的物理框架

Gregory M. Ruddell

专题命中 效率与部署 :large language model(title);language model(title);post-training(abstract);分类 cs.AI

AI总结 本文提出一种物理框架,通过分析大语言模型的推理行为,揭示了预提交信号的存在条件,并展示了结构刚性在不同几何区域中的统一度量。

Comments Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03257 2026-04-07 cs.CL cs.AI 86%

Robust LLM Performance Certification via Constrained Maximum Likelihood Estimation

通过约束最大似然估计实现鲁棒的大语言模型性能认证

Minghe Shen, Ananth Balashankar, Adam Fisch, David Madras, Miguel Rodrigues

机构 * University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于约束最大似然估计的方法,结合人工标注集、自动标注数据和领域约束,提升大语言模型失败率估计的准确性和稳定性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04370 2026-04-07 cs.HC 86%

Decoding Student Dialogue: A Multi-Dimensional Comparison and Bias Analysis of Large Language Models as Annotation Tools

解码学生对话:大型语言模型作为标注工具的多维比较与偏见分析

Jie Cao, Zhanxin Hao, Jifan Yu

专题命中 效率与部署 :large language model(title);language model(title);prompting(abstract)

AI总结 本文评估GPT-5.2和Gemini-3在不同学科、教育阶段和四个编码维度上的标注效果,发现多代理提示法准确性最高但未达统计显著性,且在K-12数据集上表现优于大学数据,情感维度表现最佳而认知维度最差,同时揭示四种偏见模式。

Comments This paper has been accepted in AIED2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03867 2026-04-07 cs.LG 85%

Where to Steer: Input-Dependent Layer Selection for Steering Improves LLM Alignment

转向何处:输入依赖的层选择用于转向以改进LLM对齐

Soham Gadgil, Chris Lin, Su-In Lee

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出W2S框架,通过输入依赖的层选择改进LLM对齐,证明固定层方法不足,展示适应性层选择的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04783 2026-04-07 cs.CR cs.AR 85%

GPU Acceleration of TFHE-Based High-Precision Nonlinear Layers for Encrypted LLM Inference

基于GPU的TFHE高精度非线性层加速用于加密LLM推理

Guoci Chen, Xiurui Pan, Qiao Li, Bo Mao, Congming Gao, Chengying Huan, Mingzhe Zhang, Jie Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TIGER框架,通过GPU优化的WoP-PBS方法和数值算法,实现高精度加密LLM非线性层计算,提升GPU效率,实现GELU、Softmax和LayerNorm的加速效果。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04654 2026-04-07 cs.DC 85%

Communication-Efficient Collaborative LLM Inference over LEO Satellite Networks

高效协作的低地球轨道卫星网络大语言模型推理

Songge Zhang, Wen Wu, Liang Li, Ye Wang, Xuemin, Shen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种高效的协作大语言模型推理方案,通过将模型拆分并部署在卫星上,利用中间激活信息交换减少延迟,并通过自适应激活压缩保持精度。

Comments 13 pages, 12 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04461 2026-04-07 cs.LG cs.AI cs.CL 85%

DP-OPD: Differentially Private On-Policy Distillation for Language Models

DP-OPD:基于差分隐私的在线策略蒸馏

Fatemeh Khadem, Sajad Mousavi, Yi Fang, Yuhong Liu

机构 * Santa Clara University(圣克拉拉大学) Independent Researcher(独立研究员)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DP-OPD,一种无需合成的差分隐私在线策略蒸馏框架,通过在学生模型上应用DP-SGD实现隐私保护,利用冻结的教师模型提供密集的token级目标,提升压缩效率和隐私-效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04247 2026-04-07 cs.AI cs.CL cs.LG 85%

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

Combee:用于自我改进语言模型代理的提示学习扩展

Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh Gradient Network

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Combee通过并行扫描和增强洗牌机制,提升提示学习效率,实现多代理并行训练,同时保持学习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03676 2026-04-07 cs.IR 85%

Are LLM-Based Retrievers Worth Their Cost? An Empirical Study of Efficiency, Robustness, and Reasoning Overhead

基于大语言模型的检索器是否值得其成本?对效率、鲁棒性和推理开销的实证研究

Abdelrahman Abdallah, Jamie Holdcroft, Mohammed Ali, Adam Jatowt

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过12个任务和14个检索器评估了基于大语言模型的检索器在效率、鲁棒性和推理开销方面的表现,发现部分专门化检索器在吞吐量上具有竞争力,而某些大语言模型双编码器则带来显著延迟。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03291 2026-04-07 cs.AR cs.AI 84%

RAGnaroX: A Secure, Local-Hosted ChatOps Assistant Using Small Language Models

RAGnaroX:一种使用小型语言模型的安全、本地托管的ChatOps助手

Benedikt Dornauer, Mircea-Cristian Racasan

机构 * University of Innsbruck(因斯布鲁克大学) c.c.com Moser GmbH(c.c.com Moser有限公司)

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.AI

AI总结 RAGnaroX是一种基于本地硬件的高效ChatOps助手,采用Rust实现,提供可审计的本地解决方案,通过模块化数据摄入、混合检索和函数调用实现灵活安全的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04514 2026-04-07 cs.AI cs.CL cs.IR 84%

SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems

SuperLocalMemory V3.3:活脑——生物启发的遗忘、认知量化与多通道检索用于零LLM代理记忆系统

Varun Pratap Bhardwaj

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SuperLocalMemory V3.3,通过生物启发的遗忘机制、认知量化和多通道检索,实现零LLM代理的记忆系统,提升了多跳和对抗场景下的性能。

Comments 19 pages, 4 figures, 11 tables. Third paper in the SuperLocalMemory trilogy. Code: https://github.com/qualixar/superlocalmemory (v3.3.26). npm: superlocalmemory. PyPI: superlocalmemory

URL PDF HTML 收藏
2601.00263 2026-04-07 cs.CL cs.AI 84%

Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation

平行宇宙,平行语言:对基于大语言模型的多语言反事实示例生成的全面研究

Qianli Wang, Van Bach Nguyen, Yihong Liu, Fedor Splitt, Nils Feldhus, Christin Seifert, Hinrich Schütze, Sebastian Möller, Vera Schmitt

机构 * Technische Universität Berlin(柏林工业大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Marburg(马尔堡大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所(BIFOLD))

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在多语言反事实示例生成中的有效性,发现翻译生成的反事实示例在有效性上优于直接生成,但质量仍不如英文反事实示例,并揭示了多语言反事实数据增强对模型性能的提升效果。

Comments ACL 2026 main conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11749 2026-04-07 cs.CL cs.AI 84%

Truth as a Compression Artifact in Language Model Training

真相作为语言模型训练中的压缩特征

Konstantin Krestnikov

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究发现语言模型在矛盾数据训练中更倾向于正确答案,这源于错误的可压缩性而非真相本身。通过小规模Transformer模型实验,发现当错误遵循一致规则时,模型无法区分虚假系统与真相,提出压缩-一致性原则解释这一现象。

Comments v3: Added Qwen3 architecture check (0.6B), ~1B experiment on FineWeb-Edu, generative eval at all scales, matched-random ablation. Formal MDL predictions. Softened claims, fixed bibliography, added NeurIPS checklist. 210+ models (was 160+)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27905 2026-04-07 cs.LG 83%

ATLAS-RTC: Closing the Loop on LLM Agent Output with Token-Level Runtime Control

ATLAS-RTC:通过令牌级运行时控制闭合LLM代理输出的循环

Christopher Cruz

机构 * Purdue University(普渡大学)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 ATLAS-RTC通过实时监控和干预减少解码错误,提升任务成功率和效率,实现LLM系统中的运行时控制新层次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02007 2026-04-07 cs.LG 83%

Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning

阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理

Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin

机构 * ServiceNow

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。

Comments 20 pages, 4 tables, 6 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏