arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 152 篇

2508.07809 2026-04-21 cs.LG 81%

EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning

EvoCoT:克服强化学习中的探索瓶颈

Huanyu Liu, Jia Li, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) Imperial College London(伦敦帝国理工学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 EvoCoT通过两阶段链式思维优化框架,解决强化学习中稀疏奖励下的探索瓶颈问题,提升大语言模型的推理能力。

Comments Camera-ready version for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17648 2026-04-21 cs.CL 81%

ThreadSumm: Summarization of Nested Discourse Threads Using Tree of Thoughts

ThreadSumm: 使用思维树进行嵌套讨论线的摘要

Olubusayo Olabisi, Ekata Mitra, Ameeta Agrawal

机构 * PortNLP Lab, Portland State University(波特兰州立大学PortNLP实验室) Department of Computer Science, Portland State University(波特兰州立大学计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 ThreadSumm通过多阶段LLM框架处理嵌套讨论线中的交错回复和引用,生成逻辑结构更清晰的摘要,同时提升观点覆盖和方面保留。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17562 2026-04-21 cs.AI cs.MA 81%

SafeAgent: A Runtime Protection Architecture for Agentic Systems

SafeAgent: 代理系统的一种运行时保护架构

Hailin Liu, Eugene Ilyushin, Jie Ni, Min Zhu

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SafeAgent,一种运行时安全架构,通过分离执行治理与语义风险推理,提升代理系统在多步骤流程中的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17419 2026-04-21 cs.MA cs.LG 81%

ARMove: Learning to Predict Human Mobility through Agentic Reasoning

ARMove: 通过代理推理学习预测人类移动

Chuyue Wang, Jie Feng, Yuxi Wu, Shenglin Yi, Hang Zhang

机构 * Tencent(腾讯) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Meituan(美团)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ARMove通过代理推理方法,解决人类移动预测中的可解释性、迭代学习和迁移性问题,实验表明其在六个指标上优于现有方法,且在不同地区和用户群体中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06328 2026-04-21 cs.AI 81%

C-World: A Computer Use Agent Environment Creator

C-World:一个计算机使用代理环境创建者

Ziqiao Xi, Shuang Liang, Qi Liu, Jiaqing Zhang, Letian Peng, Fang Nan, Meshal Nayim, Tianhui Zhang, Rishika Mundada, Lianhui Qin, Biwei Huang, Kun Zhou

机构 * UC San Diego(UC圣迭戈大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 C-World通过四个组件构建代理环境,解决LLM代理在规划和推理中与人类的差距问题,展示其作为评估环境和数据引擎的双重价值。

Comments Submitted to ACL 2026 12 pages, 4 figures Ziqiao Xi and Shuang Liang contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16982 2026-04-21 cs.AI 81%

A phenotype-driven and evidence-governed framework for knowledge graph enrichment and hypotheses discovery in population data

一种以表型驱动和证据为导向的知识图谱丰富与假设发现框架

Adela Bâra, Simona-Vasilica Oprea

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济大学信息与自动化系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种以表型驱动和证据为导向的知识图谱增强与假设发现框架,通过整合图神经网络、因果推理和大语言模型,实现结构化假设发现和受控知识图谱扩展,提升解释性和科学证据一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16896 2026-04-21 q-bio.QM cs.AI 81%

ProtoCycle: Reflective Tool-Augmented Planning for Text-Guided Protein Design

ProtoCycle:基于反思的工具增强规划用于文本引导的蛋白质设计

Yutang Ge, Guojiang Zhao, Sihang Li, Zheng Cheng, Zifeng Zhao, Hanchen Xia, Guolin Ke, Linfeng Zhang, Zhifeng Gao, Yuguang Wang

机构 * Shanghai Jiao Tong University, School of Mathematical Sciences(上海交通大学数学科学学院) DP Technology(DP技术) University of Science and Technology of China(中国科学技术大学) AI for Science Institute(AI for Science研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ProtoCycle框架,通过LLM驱动的反馈循环和轻量级工具环境,提升文本引导蛋白质设计的序列质量。

Comments 25 pages, 11 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 81%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14846 2026-04-21 cs.LG cs.AI cs.CL 80%

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17422 2026-04-21 cs.CV cs.MM 80%

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 9 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01645 2026-04-21 cs.CR 80%

Contextualizing Sink Knowledge for Java Vulnerability Discovery

在Java漏洞发现中 contextualizing sink knowledge

Fabian Fleischer, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14264 2026-04-21 cs.CE 80%

AlphaQuanter: An End-to-End Tool-Augmented Agentic Reinforcement Learning Framework for Stock Trading

AlphaQuanter:一个端到端的工具增强型代理强化学习框架用于股票交易

Zheye Deng, Weixiang Yan, Changlong Yu, Jiashu Wang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 AlphaQuanter通过强化学习在透明的工具增强决策流程中学习动态策略,实现端到端优化,提升股票交易性能并提供可解释的交易策略。

Comments Accepted to ACL findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02930 2026-04-21 cs.CV 80%

TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos

TemporalVLM:长视频中的时间推理视频大语言模型

Fawad Javed Fateh, Umer Ahmed, Hamza Khan, M. Zeeshan Zia, Quoc-Huy Tran

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TemporalVLM,一种用于长视频时间推理和细粒度理解的视频大语言模型,通过时间感知编码和BiLSTM模块实现全局特征聚合,并引入IndustryASM数据集进行评估。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18293 2026-04-21 cs.CL 79%

An Existence Proof for Neural Language Models That Can Explain Garden-Path Effects via Surprisal

神经语言模型解释路径效应的存在性证明

Ryo Yoshida, Shinnosuke Isono, Taiga Someya, Yohei Oseki, Tatsuki Kuribayashi

机构 * The University of Tokyo(东京大学) NINJAL NII LLMC(日本国家研究所语言模型中心) MBZUAI(穆桑大学人工智能研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文通过微调神经语言模型,证明其能通过惊奇度解释路径效应,并提升对自然语料阅读时间的预测能力,同时引发对惊奇度理论的质疑。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18133 2026-04-21 cs.AI 79%

Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures

多智能体系统:从经典范式到基于大基础模型的未来

Zixiang Wang, Mengjia Gong, Qiyu Sun, Jing Xu, Shuai Mao, Xin Jin, Qing-Long Han, Yang Tang

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai 200237, China(能源化学过程智能制造重点实验室,教育部,东华大学,上海200237,中国) School of Information Science and Engineering, East China University of Science and Technology, Shanghai 200237, China(信息科学与工程学院,东华大学,上海200237,中国) School of Electrical Engineering and Automation, Nantong University, Nantong 226019, China(电气工程与自动化学院,南通大学,南通226019,中国) Research Institute of Intelligent Complex Systems, Fudan University, Shanghai 200433, China(智能复杂系统研究院,复旦大学,上海200433,中国) School of Science, Computing and Engineering Technologies, Swinburne University of Technology, Hawthorn VIC 3122, Australia(科学、计算与工程技术学院,斯威本理工大学,澳大利亚霍桑市VIC 3122)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文综述了多智能体系统从经典范式向基于大基础模型的演进,分析了经典多智能体系统与大基础模型多智能体系统的架构、机制、适应性及应用,展望了未来研究方向与挑战。

Comments Accepted by IEEE/CAA Journal of Automatica Sinica

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22368 2026-04-21 cs.CV cs.AI 79%

When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations

当视觉不是问题:在误导性数据可视化上评估视觉-语言模型

Harsh Nishant Lalai, Raj Sanjay Shah, Hanspeter Pfister, Sashank Varma, Grace Guo

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度理工学院和科学学院,皮拉尼) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文评估视觉-语言模型在识别误导性数据可视化中的能力,发现模型在检测可视化设计错误上更可靠,但常误判非误导性可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16517 2026-04-21 cs.CV cs.CL 79%

SmoGVLM: A Small, Graph-enhanced Vision-Language Model

SmoGVLM:一种小型、图增强的视觉-语言模型

Debjyoti Mondal, Rituraj Singh, Subhadarshi Panda

机构 * Samsung R\&D Institute India-Bangalore

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出SmoGVLM,一种结合图神经网络的视觉-语言模型,通过结构化知识提升小规模多模态推理性能,实验表明小型模型性能提升达16.24%。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14902 2026-04-21 cs.AI cs.CL cs.CV cs.RO 79%

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

ADAPT:在未指定 affordance 约束下评估常识规划的基准测试

Pei-An Chen, Yong-Ching Liang, Jia-Fong Yeh, Hung-Ting Su, Yi-Ting Chen, Min Sun, Winston Hsu

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ADAPT 模块,通过显式 affordance 推理提升智能具身代理的鲁棒性和任务成功率,展示了领域适应的视觉语言模型在 affordance 推理中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17290 2026-04-21 cs.CL cs.AI cs.PL 79%

Probabilistic Programs of Thought

思维概率程序

Poorva Garg, Renato Lui Geh, Daniel Israel, Todd Millstein, Kyle Richardson, Guy Van den Broeck

机构 * University of California Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(Allen人工智能研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出思维概率程序框架,通过利用生成程序的分布,减少GPU计算开销,提升代码生成和数学推理任务的效率。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17252 2026-04-21 cs.CL cs.AI cs.RO 79%

Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents

看见并不等于相信:通过主动干预缓解具身智能体中的信念惯性

Hanlin Wang, Chak Tou Leong, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过主动干预缓解具身智能体中的信念惯性问题,引入EVU机制提升任务成功率。

Comments Accepted by ACL2026 Fingdings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03559 2026-04-21 cs.CL 78%

DiffCoT: Diffusion-styled Chain-of-Thought Reasoning in LLMs

DiffCoT:在大语言模型中采用扩散风格的推理链推理

Shidong Cao, Hongzhan Lin, Yuxuan Gu, Ziyang Luo, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 DiffCoT通过扩散风格的推理链框架,改进了大语言模型在多步数学问题解决中的鲁棒性和错误纠正能力,通过迭代去噪过程实现中间步骤的统一生成与回顾性修正。

Comments DiffCoT improves multi-step LLM reasoning by applying diffusion-based iterative denoising to correct intermediate Chain-of-Thought steps

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17241 2026-04-21 cs.RO 78%

GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning

GaLa:基于超图的视觉语言模型用于程序规划

Kun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Chongqing Research Institute of HIT(重庆哈尔滨工业大学研究院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 GaLa通过超图表示学习,有效捕捉物体间的隐含语义关系和功能区域的层次结构,提升多模态程序规划的性能。

Comments 14pages, 7figures

Journal ref ACL 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16857 2026-04-21 cs.CV cs.RO 78%

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04334 2026-04-21 cs.CV 78%

GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models

GeoArena:在大视觉-语言模型中评估开放世界地理推理

Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出GeoArena框架,通过人偏好评估动态图像中的地理推理能力,评估17种前沿LVLM,分析模型行为与人类偏好可靠性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17010 2026-04-21 cs.CL cs.AI cs.LG cs.PL 78%

Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal Verification

通过形式验证的语义等价自博弈提升大语言模型代码推理

Antonio Valerio Miceli Barone, Poon Tsz Nok

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于形式验证的语义等价自博弈框架,利用对抗训练提升代码推理能力,通过验证等价性与非等价性,释放OpInstruct-HSx数据集,实验显示在EquiBench上提升13.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16348 2026-04-21 cs.HC cs.CY 78%

Beyond the Townhall: Spatial Anchoring and LLM Agents for Scalable Participatory Urban Planning

超越市政厅:空间锚定与大语言模型代理用于可扩展的参与式城市规划

Carina I Hausladen, Javier Argota Sánchez-Vaquerizo, Michael Siebenmann, Arthur Capozzi, Sachit Mahajan, Dirk Helbing

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出一种可扩展的数字参与平台,通过空间锚定和大语言模型代理提升公众在可持续城市规划中的参与度,实验显示沉浸式展示提高了信息回忆并促进集体可持续发展反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17225 2026-04-21 cs.CL 77%

A Multi-Agent Approach for Claim Verification from Tabular Data Documents

从表格数据文档中验证声明的多智能体方法

Rudra Ranajee Saha, Laks V. S. Lakshmanan, Raymond T. Ng

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MACE,通过规划器、执行器和验证器三个智能体,实现可解释的表格数据验证,实验显示其在多个数据集上达到SOTA性能,且在参数较少时仍表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18567 2026-04-21 cs.LG cs.AI cs.CL 75%

Latent Phase-Shift Rollback: Inference-Time Error Correction via Residual Stream Monitoring and KV-Cache Steering

潜在相位偏移回滚:通过残差流监控和KV-缓存引导进行推理时的误差校正

Manan Gupta, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯派恩大学,帕利尼校区)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LPSR方法,通过监控残差流和引导KV缓存来校正大语言模型中的推理错误,显著提升在MATH-500上的性能,同时在参数和token成本上更具优势。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21244 2026-04-21 cs.LG cs.AI cs.CL 75%

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

更少的噪声,更多的声音:通过指令净化进行推理的强化学习

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

机构 * Department of Computer Science, Aarhus University(计算机科学系,阿arhus大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LENS框架,通过去除干扰标记提升强化学习推理效率,实验显示其在数学推理和科学推理中性能更优,收敛更快。

Comments Accepted at ACL 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05993 2026-04-21 cs.CL cs.AI cs.LG 75%

Revisiting Entropy in Reinforcement Learning for Large Reasoning Models

重新审视强化学习在大推理模型中的熵

Renren Jin, Pengzhi Gao, Yuqi Ren, Zhuowen Han, Tongxuan Zhang, Wuwei Huang, Wei Liu, Jian Luan, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院 TJUNLP 实验室,中国) Independent Researcher(独立研究者) College of Computer and Information Engineering, Tianjin Normal University, China(天津师范大学计算机与信息工程学院,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了强化学习可验证奖励中大语言模型熵崩溃问题,分析了熵与响应多样性、校准及性能的关系,提出正优势重加权方法以调节熵并保持性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏