arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 30 篇

2605.09853 2026-05-12 cs.LG 79%

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

基于探索的优化用于测试时大语言模型推理

Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出EDO框架,通过扩展奖励偏差探索目标到迭代后训练,提升大语言模型推理中的探索与利用平衡,实验表明ED-iDPO和ED-GRPO在推理能力和多样性上优于基线模型。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI 79%

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08478 2026-05-12 cs.LG 79%

When Independent Sampling Outperforms Agentic Reasoning

独立采样优于代理推理

Yihe Dong, Boris Shigida

机构 * Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究在固定预算下如何分配推理时间计算以提高编程竞赛表现,发现独立采样在准确率与成本、查询数的权衡上优于代理推理,且在资源受限条件下独立探索更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16253 2026-05-12 cs.CV cs.AI 72%

Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models

将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证

Junxin Wang, Dai Guan, Weijie Qiu, Zhihang Li, Yongbo Gai, Zhengyi Yang, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.AI

AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。

Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10716 2026-05-12 cs.LG stat.ML 70%

What should post-training optimize? A test-time scaling law perspective

在测试时间视角下,后训练应优化什么?

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, The University of Hong Kong(香港大学人工智能与数据科学系)

专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);分类 cs.LG

AI总结 本文研究了测试时间预算不匹配场景下,基于奖励尾部统计的后训练优化方法,提出TEA和Prefix-TEA估计器提升最佳N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10158 2026-05-12 cs.LG 70%

Unsupervised Process Reward Models

无监督过程奖励模型

Artyom Gadetsky, Maxim Kodryan, Siba Smarak Panigrahi, Hang Guo, Maria Brbic

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 本文提出无监督过程奖励模型(uPRM),通过无需人工监督的评分函数,提升大语言模型在复杂推理任务中的鲁棒性与准确性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09959 2026-05-12 cs.LG cs.AI cs.CL cs.ET 67%

G-Zero: Self-Play for Open-Ended Generation from Zero Data

G-Zero:从零数据开始的自主开放生成自我学习

Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Virginia(弗吉尼亚大学) University of Maryland(马里兰大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 G-Zero通过无验证器的共进化框架实现自主改进,利用Hint-δ内在奖励量化生成模型在无辅助响应与带提示响应间的预测偏移,通过GRPO训练提出者模型持续针对生成器的盲区,同时通过DPO优化生成器内部化提示引导的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09739 2026-05-12 cs.CL cs.AI 62%

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

沉默投票:通过聚合语义邻域提高零样本LLM可靠性

Sanket Badhe, Priyanka Tiwari, Deep Shah

机构 * Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Semantic Softmax方法,通过聚合目标标签的语义邻域得分,解决零样本分类中的Renormalization Bias问题,提升模型校准性和准确性。

Comments Accepted at GEM Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09188 2026-05-12 cs.LG cs.AI 62%

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

DARE: 基于共进化难度估计的难度自适应强化学习

Yang Zhou, Can Jin, Zihan Dong, Zhepeng Wang, Yanting Yang, Shiyu Zhao, Lei Li, Runxue Bao, Yaochen Xie, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学) Amazon(亚马逊) Washington University(华盛顿大学) Google(谷歌)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DARE通过自归一化重要性采样和对称Beta分布实现政策与难度估计的共进化,提升训练效率和推理效率,使模型在易任务中生成更简洁响应,在难任务中提高正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08658 2026-05-12 cs.LG cs.AI cs.SE 62%

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

Sketch-and-Verify: 通过程序草图实现推理时间扩展

Shan Jiang, Zijian Yi, Chenguang Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SKETCHVERIFY方法,通过程序草图生成多样化候选方案,验证后选择最优,提升模型性能,同时探讨K与M的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26326 2026-05-12 cs.LG cs.CL stat.ML 62%

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

通过精确熵曲线控制解决LLM RL中的性能饱和问题

Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Entrocraft方法,通过偏差优势分布实现用户定制的熵调度,解决LLM RL中的性能饱和问题,提升泛化能力、输出多样性及长期训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA 62%

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08427 2026-05-12 cs.AI cs.GT cs.LG 62%

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

镜中的攻击者:通过锚定双策略自我博弈打破安全性中的自我一致性

Gabriele La Malfa, Emanuele La Malfa, Saar Cohen, Jie M. Zhang, Michael Luck, Michael Wooldridge, Elizabeth Black

机构 * Department of Informatics, King’s College London(伦敦国王学院信息学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) University of Sussex(Sussex大学) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出锚定双策略自我博弈方法,通过训练角色特定的LoRA适配器提升安全性与参数效率,实验证明在安全基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08313 2026-05-12 cs.CR cs.AI cs.LG 62%

Seed Hijacking of LLM Sampling and Quantum Random Number Defense

LLM采样中的种子劫持与量子随机数防御

Ziyang You, Xiaoke Yang, Zhanling Fan, Feng Guo, Xiaogen Zhou, Xuxing Lu

机构 * School of Electronic, Electrical and Physics, Fujian University of Technology(福建工程学院电子、电气与物理系) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Department of Investigation, Fujian Police College(福建警察学院调查系) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SeedHijack攻击,通过操控PRNG输出实现指定token注入,提出基于量子随机数生成器的防御方案,解决LLM采样层的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08177 2026-05-12 cs.LG cs.AI 62%

Echo-LoRA: Parameter-Efficient Fine-Tuning via Cross-Layer Representation Injection

Echo-LoRA:通过跨层表示注入实现参数高效微调

Yihang Peng, Peng Jin, Jie Gong, Xingyuan Chen, Lingjiao Xu, Ning Su, Yan Ran

机构 * School of Computer Science and Software Engineering, Southwest Petroleum University(西南石油大学计算机科学与软件工程学院) School of Electronic Information and Artificial Intelligence, Leshan Normal University(乐山师范学院电子信息与人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Echo-LoRA通过跨层表示注入提升参数高效微调效果,在八个常识推理基准上超越LoRA基线,减少训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10223 2026-05-12 cs.AI cs.SE 57%

Beyond Autonomy: A Dynamic Tiered AgentRunner Framework for Governable and Resilient Enterprise AI Execution

超越自主性:一种动态分层代理运行框架用于可控且具有弹性的企业AI执行

Kai Pan, Rong Hou

机构 * a2alab(a2alab实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出动态分层代理运行框架,通过风险自适应分层、权力分离架构和容错设计,解决企业AI执行中的可控性和可靠性问题。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09278 2026-05-12 cs.AI 57%

EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium

EquiMem:通过博弈论均衡校准多智能体辩论中的共享内存

Yuqiao Meng, Sakshi Sunil Narvekar, Luoxi Tang, Rupali Rajendra Vaje, Yingxue Zhang, Muchao Ye, Zhaohan Xi

机构 * Binghamton University, State University of New York(宾夕法尼亚州立大学布林茅尔分校) University of Iowa(爱荷华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EquiMem,通过博弈论均衡校准多智能体辩论中的共享内存,解决传统方法在过滤错误信息时的不足,提升内存增强推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG 57%

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04899 2026-05-12 cs.LG 57%

A geometric relation of the error introduced by sampling a language model's output distribution to its internal state

语言模型输出分布采样引入的误差与内部状态的几何关系

Albert F. Modenbach

机构 * Department of Mathematics, King's College London, United Kingdom(伦敦国王学院数学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究揭示语言模型输出分布采样误差与内部状态几何结构的关系,通过几何方法分析token嵌入空间,发现其曲率在棋类任务中反映模型对问题的内部表示。

Comments 12 Pages, 10 Figures, 2 Appendices. To appear in Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14234 2026-05-12 cs.LG 57%

Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision

计算作为教师:将推理计算转化为无参考监督

Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten

机构 * University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Meta Superintelligence Labs(元宇宙超级智能实验室)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出计算作为教师框架,通过推理计算生成参考估计,实现无监督学习,尤其在非可验证领域如医疗指导中表现优异,测试时计算开销减少9倍。

Comments Published as a conference paper at ICML 2026. 23 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08386 2026-05-12 cs.AI 57%

SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents

SkillLens: 适应性多粒度技能重用以实现成本高效的LLM代理

Yongliang Miao, Ziyang Yu, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 SkillLens通过分层技能进化框架实现多粒度技能重用,解决技能重用中的相关性与成本矛盾,提升LLM代理在MuLocbench和ALFWorld中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10850 2026-05-12 cs.CV 50%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09203 2026-05-12 cs.CR 50%

Removing the Watermark Is Not Enough: Forensic Stealth in Generative-AI Watermark Removal

去除水印并不足够:生成式AI水印去除的取证隐秘性

Yevin Nikhel Goonatilake, Giuseppe Ateniese

专题命中 测试时计算 :verifier(abstract)

AI总结 研究指出当前水印去除方法无法同时满足水印逃避、图像实用性保持和取证隐秘性,需重新设计评估标准。

Comments 17 pages, 12 pages main text plus 5 pages appendix, includes figures and tables; under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 50%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 测试时计算 :verifier(abstract)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 35 篇

2605.09346 2026-05-12 cs.CL cs.AI 89%

RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step

RuPLaR : 通过基于规则的先验概率实现LLM推理链的高效潜在压缩

Xiaocheng Luo, Kang Wang, Zaifu Zhan, Yuechi Zhou, Xiangyu Duan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出RuPLaR框架,通过基于规则的先验概率指导LLM生成单阶段潜在推理令牌,提升推理效率与准确性,实验表明其比现有方法提升11.1%的准确率且消耗更少token。

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09614 2026-05-12 cs.CV 87%

Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning

反射锚点用于长链多模态推理中的传播感知视觉保留

Xuan Gong, Hanbo Huang, Hao Zheng, Yiran Zhang, Wenbin Dai, Weishu Zhao, Shiyu Liang

机构 * Shanghai Jiao Tong University(上海交通大学) Lanzhou University(兰州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出RAPO方法,通过信息论分析优化视觉传播潜力和局部分支空间,提升长链多模态推理的视觉信息保留效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07436 2026-05-12 cs.CV cs.AI cs.ET 86%

Prompt to Protection: A Comparative Study of Multimodal LLMs in Construction Hazard Recognition

提示到保护:多模态大语言模型在建筑危险识别中的比较研究

Nishi Chaudhary, S M Jamil Uddin, Sathvik Sharath Chandra, Anto Ovid, Alex Albert

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系) Department of Civil, Construction, and Environmental Engineering, North Carolina State University(北卡罗来纳州立大学土木、建设与环境工程系)

专题命中 复杂问题求解 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文比较了五种先进多模态大语言模型在建筑危险识别中的表现,发现提示策略显著影响性能,CoT提示效果最佳,GPT-4.5和GPT-o3表现突出,强调了提示设计在提升建筑安全应用准确性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL 84%

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08936 2026-05-12 cs.AI cs.LG 84%

Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

Self-ReSET: 通过学习自我恢复来应对不安全推理轨迹

Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Self-ReSET框架,通过纯强化学习使大推理模型具备自我恢复能力,提升对抗攻击下的鲁棒性并高效利用数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10766 2026-05-12 cs.LG cs.AI cs.CL 82%

How Instruction and Reasoning Data shape Post-Training: Data Quality through the Lens of Layer-wise Gradients

指令和推理数据如何塑造训练后阶段:通过层梯度的视角探讨数据质量

Ming Li, Yanhong Li, Ziyue Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Allen Institute for AI(Allen人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过层梯度的谱分析,揭示了高质量指令和推理数据对大语言模型训练后阶段的影响,统一了数据评估指标,并展示了数据质量与训练稳定性之间的关系。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏