arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 62 篇

2605.07186 2026-05-11 cs.CL cs.AI 92%

The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval

文本恐怖谷:LLM信息检索中的非单调性能退化

Zekai Tong, Ruiyao Xu, Aryan Shrivastava, Chenhao Tan, Ari Holtzman

机构 * University of Chicago(芝加哥大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了文本碎片化对LLM信息检索性能的影响,发现性能呈现U型曲线,提出模式过渡假说解释LLM在不同文本状态下的工作模式变化。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06728 2026-05-11 q-bio.GN cs.AI q-bio.CB 90%

OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

OmicsLM:一种多模态大语言模型用于多样本组学推理

Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński, Remigiusz Kinas, Przemysław Pietrzak, Tomasz Jetka, Rafał Powalski

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 OmicsLM通过整合定量组学数据与自然语言任务,实现多样本组学推理,其在多任务类型上表现优异,尤其在生物语言指导的推理任务中超越专用模型和通用LLM。

Comments 13 pages (main text), 14 pages (appendix), 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07442 2026-05-11 cs.LG 90%

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07040 2026-05-11 cs.CL cs.AI cs.CY 90%

Cognitive Agent Compilation for Explicit Problem Solver Modeling

认知代理编译用于显式问题求解器建模

Hyeongdon Moon, Carolyn Rosé, John Stamper

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出Cognitive Agent Compilation框架,利用强教师LLM将问题解决知识编译为显式目标代理,旨在提高教育场景中问题解决的可检查性和可编辑性。

Comments Accepted to AIED 2026 Blue Sky

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20338 2026-05-11 cs.LG 89%

Emergent Manifold Separability during Reasoning in Large Language Models

大语言模型推理中的涌现流形分离

Chanwoo Chun, Alexandre Polo, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Center for Data Science, New York University(纽约大学数据科学中心) Kempner Institute, Harvard University(哈佛大学 Kempner 研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron 机构计算神经科学中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 研究大语言模型推理过程中的流形分离现象,通过曼福容量理论分析两种组合推理任务,发现概念流形在计算前解耦为线性可分子空间,揭示动态流形管理机制。

Comments Alexandre Polo and Chanwoo Chun contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 89%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10693 2026-05-11 cs.LG cs.AI 88%

VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training

VESPO:变分序列级软策略优化用于稳定的反政策LLM训练

Guobin Shen, Chenxiao Zhao, Xiang Cheng, Lei Huang, Xing Yu

机构 * Xiaohongshu Inc(小红书公司)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VESPO,通过变分方法减少反政策更新中的方差,提升大语言模型在严重反政策条件下的稳定性,实验显示其在数学推理和代码生成任务中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07301 2026-05-11 cs.AI 87%

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

基于结构因果模型的对手建模:通过结构因果模型实现基于大语言模型的智能体

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Beijing China National Key Laboratory of Cognition Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences Beijing China Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences Institute of Automation, Chinese Academy of Sciences

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SOM框架,通过结构因果模型明确分离对手建模与预测,提升多智能体环境中的预测准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06957 2026-05-11 cs.AI 87%

Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents

基于LLM代理的分层通用规划中的策略分解学习与重用

Shirin Sohrabi, Haritha Ananthakrishnan, Harsha Kokel, Kavitha Srinivas, Michael Katz

机构 * IBM

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一种结合通用规划与分层任务分解的动态策略学习方法,通过自动分解学习可重用的策略组件,提升任务执行效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08011 2026-05-11 cs.AI stat.CO 86%

Abductive Reasoning with Probabilistic Commonsense

基于概率常识的归纳推理

Joseph Cotnareanu, Chiara Roverato, Han Zhou, Didier Chetelat, Yingxue Zhang, Mark Coates

机构 * International Laboratory on Learning Systems(学习系统国际实验室) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PACS算法,通过LLM和形式求解器结合,建模常识认知的个体差异,提升大语言模型的归纳推理能力。

Journal ref Proceedings of the International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07568 2026-05-11 cs.CV cs.CL 86%

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

追踪时间之箭:诊断视频大语言模型中的时间信息流

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa

机构 * The University of Osaka(大阪大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(信息与通信技术国家研究所) Kyoto University(京都大学) NII LLMC(日本信息处理学会LLMC)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究视频大语言模型(Video-LLMs)中时间信息流的瓶颈问题,通过分析编码器、投影器和LLM的结构,发现视频中心编码器能有效编码时间信息,但投影器设计影响信息传递,改进后模型在时间推理任务中表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06908 2026-05-11 cs.LG cs.AI 86%

Same Signal, Opposite Meaning: Direction-Informed Adaptive Learning for LLM Agents

同信号,异意义:方向感知的自适应学习用于大语言模型代理

Ziming Li, Jiatan Huang, Xiaoguang Guo, Guilin Wang, Chuxu Zhang

机构 * University of Connecticut(康奈尔大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出DIAL方法,通过方向感知的自适应学习解决LLM代理中计算需求与计算适宜性差异问题,提升性能-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 86%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL 84%

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07137 2026-05-11 cs.LG cs.AI 84%

Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR

自适应负强化用于大语言模型推理:在强化学习中动态平衡纠正与多样性

Yash Ingle, Jaival Chauhan, Ankit Yadav, Sudhakar Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布希·尼尔马伊技术学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应负强化方法,通过时间依赖调度函数动态平衡纠正与多样性,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07600 2026-05-11 cs.LG cs.AI cs.CL 83%

Mathematical Reasoning via Intervention-Based Time-Series Causal Discovery Using LLMs as Concept Mastery Simulators

通过基于干预的时间序列因果发现进行数学推理:利用LLMs作为概念掌握模拟器

Tsuyoshi Okita

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CIKA框架,利用LLM自身作为干预模拟器,通过干预能力探针区分因果相关概念,提升数学推理能力。

Comments 17 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22831 2026-05-11 cs.LG cs.AI cs.CL cs.CV cs.CY 83%

Direction-Flipped Influence Audits Reveal Hidden Structure in Moral Choices of LLMs

反向影响审计揭示大语言模型道德选择中的隐藏结构

Phil Blandfort, Tushar Karayil, Alex McKenzie, Urja Pawar, Robert Graham, Dmitrii Krasheninnikov

机构 * Predictably Weird Independent AE Studio

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向影响审计发现,短上下文提示使LLM道德选择率变化12-18个百分点,揭示基线评分遗漏的结构,且部分显著效应出现反向效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07307 2026-05-11 cs.CL 83%

Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts

重新审视密集顺序链:推理语言模型可以从稀疏、顺序打乱的思维链中提取答案

Yi-Chang Chen, Feng-Ting Liao, Da-shan Shiu, Hung-yi Lee

机构 * MediaTek Research(联发科技研究) Artificial Intelligence Center of Research Excellence, National Taiwan University(台湾大学人工智能研究中心)

专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文挑战了密集顺序思维链的假设,通过系统干预发现顺序不重要、信息不全且结构鲁棒,为并行化和高效推理生成开辟了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL 83%

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21839 2026-05-11 cs.CY cs.AI cs.GT cs.LG 82%

Test-Time Compute Games

测试时计算博弈

Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Hasso Plattner Institute(哈索·普拉特纳研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型作为服务市场的社会效率问题,提出反第二种价格拍卖机制以减少计算量浪费,通过实验验证了该机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07776 2026-05-11 cs.LG cs.AI cs.CL 82%

Tracing Uncertainty in Language Model "Reasoning"

追踪语言模型推理中的不确定性

Nils Grünefeld, Bertram Højer, Philipp Mondorf, Barbara Plank, Anna Rogers, Christian Hardmeier, Stefan Heinrich, Jes Frellsen

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根技术大学数据科学部门) MaiNLP, Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心MaiNLP) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过不确定性量化分析语言模型推理轨迹,发现其不确定性特征可预测最终答案正确性,且早期即可检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08061 2026-05-11 cs.AI 81%

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

基于评分标准的强化学习:用于通用推理的结构化评判奖励

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出基于评分标准的强化学习框架,通过LLM评判器生成多标准奖励,提升模型在通用推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL 81%

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16130 2026-05-11 cs.HC cs.AI 81%

Replicating Human Motivated Reasoning Studies with LLMs

用LLMs复制人类动机性推理研究

Neeley Pate, Adiba Mahbub Proma, Hangfeng He, James N. Druckman, Daniel C. Molden, Gourab Ghoshal, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究通过复制四项政治动机性推理研究,发现基础LLM行为与人类行为不一致,且不同模型在回避回答和整合论点方面有相似表现,表明基础LLM可能不模拟人类动机性推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06859 2026-05-11 cs.LG cs.AI 81%

Exact Is Easier: Credit Assignment for Cooperative LLM Agents

精确更简单:合作大语言模型代理的信用分配

Yanjun Chen, Yirong Sun, Hanlin Wang, Jinghan Wang, Xinming Zhang, Xiaoyu Shen, Wenjie Li, Wei Zhang

机构 * Eastern Institute of Technology(东部技术研究所) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出C3方法,通过精确历史恢复实现合作大语言模型代理的信用分配,证明精确方法在效果、成本和效率上均优于近似方法,并引入三种可审计指标用于信用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07260 2026-05-11 cs.LG cs.CL 81%

When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models

专家误路由何时发生?混合专家语言模型中的反事实路由分析

Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH, South Korea(韩国POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH, South Korea(韩国POSTECH人工智能研究生院) Microsoft Research Asia, Beijing, China(中国北京微软亚洲研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了混合专家模型中路由选择的质量评估,发现标准路由在自信 token 上表现良好,但在脆弱 token 上存在误分配问题,通过更新路由层可提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI 79%

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :post-training(title);LLM(abstract);分类 cs.AI

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO 78%

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07660 2026-05-11 cs.CL 77%

Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning

并非所有令牌都以相同方式学习:注意力熵揭示了强化学习推理中的异质信号

Gengyang Li, Zheng-Fan Wu, Siqi Bao, Yunfang Wu

机构 * Baidu(百度) School of Computer Science, Peking University(北京大学计算机科学系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究通过注意力熵揭示强化学习推理中令牌层面的异质性,发现高熵令牌(探索者)与低熵令牌(锚点)在学习信号上有显著差异,动态熵感知的软重加权干预提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09782 2026-05-11 cs.LG cs.AI cs.CL 75%

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

在RLVR中采用梯度保持视角实现灵活熵控制

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从梯度保持裁剪角度出发,提出动态裁剪阈值机制和动态熵控制策略,有效缓解熵崩溃问题并提升多基准性能。

Comments https://github.com/Kwen-Chen/Flexible-Entropy-Control

详情

展开后加载摘要…

URL PDF HTML 收藏