arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 24 篇

2604.11563 2026-04-14 cs.CL cs.AI cs.LG 67%

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

Synthius-Mem: 基于大脑启发的hallucination抵抗性人格记忆实现94.4%的记忆准确率和99.6%的对抗鲁棒性于LoCoMo

Artem Gadzhiev, Andrew Kislov

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Synthius-Mem通过结构化人格记忆系统在LoCoMo基准上实现94.4%的记忆准确率和99.6%的对抗鲁棒性,优于现有系统并超越人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-04-14 cs.CL cs.AI 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09066 2026-04-14 cs.CL 57%

Anchored Sliding Window: Toward Robust and Imperceptible Linguistic Steganography

基于锚定滑动窗口:迈向稳健且不可察觉的语言隐写术

Ruiyi Yan, Shiao Meng, Yugo Murawaki

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) School of Software, Tsinghua University(清华大学软件学院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文提出锚定滑动窗口框架,通过引入提示和桥接上下文提升语言隐写术的隐蔽性和鲁棒性,实验表明其在文本质量、隐蔽性和鲁棒性上均优于基线方法。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22241 2026-04-14 cs.CL 57%

MemDLM: Memory-Enhanced DLM Training

MemDLM:增强记忆的DLM训练

Zehua Pei, Hui-Ling Zhen, Weizhe Lin, Sinno Jialin Pan, Yunhe Wang, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 MemDLM通过引入双通道记忆机制,利用Bi-level优化在训练中嵌入模拟去噪轨迹,提升长上下文表示和训练效率,同时在推理时启用内循环实现特定提示适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05467 2026-04-14 cs.CV cs.CL cs.RO 57%

MerNav: A Highly Generalizable Memory-Execute-Review Framework for Zero-Shot Object Goal Navigation

MerNav:一种高度可泛化的记忆-执行-审查框架用于零样本物体目标导航

Dekang Qi, Shuang Zeng, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Mu Xu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Xi’an Jiaotong University(西安交通大学)

专题命中 长上下文与记忆 :SFT(abstract);分类 cs.CL

AI总结 本文提出MerNav框架,通过记忆、执行和审查模块提升视觉语言导航任务中的成功率和泛化能力,在多个数据集上均取得显著提升。

Comments 9 pages, 2 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10332 2026-04-14 cs.AI 57%

From GPT-3 to GPT-5: Mapping their capabilities, scope, limitations, and consequences

从GPT-3到GPT-5:映射其能力、范围、限制及后果

Hina Afridi, Habib Ullah, Sultan Daud Khan, Mohib Ullah

机构 * University of Bergen(卑尔根大学) Norwegian University of Life Sciences(挪威生命科学大学) Sohar University(苏哈尔大学) Norwegian University of Science and Technology(挪威科技大学) Kristiania University of Applied Sciences(克里斯蒂安尼亚应用科学大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文比较分析GPT系列从GPT-3到GPT-5的发展,探讨技术演进、能力变化、部署转变、持续限制及下游影响,强调后续版本不仅是更大更准的模型,而是更复杂的系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10235 2026-04-14 cs.CL 57%

CodeComp: Structural KV Cache Compression for Agentic Coding

CodeComp: 用于代理编程的结构化KV缓存压缩

Qiujiang Chen, Jing Xiong, Chenyang Zhao, Sidi Yang, Ngai Wong

机构 * The University of Hong Kong(香港大学) LMSYS Org(LMSYS组织)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 CodeComp通过引入静态程序分析,在LLM推理中整合代码属性图先验,有效压缩KV缓存,提升代码定位和生成任务的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 112 篇

2604.11778 2026-04-14 cs.CL cs.AI 90%

General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力

Junlin Liu, Shengnan An, Shuang Zhou, Dan Ma, Shixiong Luo, Ying Xie, Yuan Zhang, Wenling Yuan, Yifan Zhou, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13621 2026-04-14 cs.CL cs.CV cs.LG 90%

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14800 2026-04-14 eess.SY cs.AI cs.SY 89%

Large Language Model as An Operator: An Experience-Driven Solution for Distribution Network Voltage Control

大语言模型作为算子:一种经验驱动的配电网电压控制解决方案

Xu Yang, Chenhui Lin, Licheng Sha, Liping Yang, Shuzhou Wu, Xichen Tian, Haotian Liu, Wenchuan Wu

机构 * State Key Laboratory of Power Systems(电力系统国家重点实验室) State Grid Beijing Electric Power Company(国网北京市电力公司) Department of Electrical Engineering, Tsinghua University(清华大学电机工程与应用电子技术系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的经验驱动日提前电压/无功调度方案,通过多模块协作实现调度策略的自进化,实验验证了该方法在信息不完整情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09866 2026-04-14 cs.SE cs.AI 89%

Automating Structural Analysis Across Multiple Software Platforms Using Large Language Models

利用大型语言模型在多个软件平台间自动化结构分析

Ziheng Geng, Jiachen Liu, Ian Franklin, Ran Cao, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) HBC Engineering Company(HBC工程公司) Hunan University(湖南大学) Lehigh University(里海大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种多软件平台结构分析自动化方法,通过两阶段多智能体架构实现跨平台建模与分析,实验表明其在多个主流软件中均达到90%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11008 2026-04-14 cs.CL 89%

CounterBench: Evaluating and Improving Counterfactual Reasoning in Large Language Models

CounterBench: 评估和改进大型语言模型中的反事实推理

Yuefei Chen, Vivek K. Singh, Jing Ma, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出CounterBench基准数据集,评估大型语言模型在反事实推理中的表现,并提出CoIn方法提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 89%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10031 2026-04-14 cs.CL cs.AI 88%

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

CoSToM: 为大语言模型内在理论思维对齐的因果导向引导

Mengfan Li, Xuanhua Shi, Yang Deng

机构 * National Engineering Research Center for Big Data Technology and System, Services Computing Technology and System Lab, Cluster and Grid Computing Lab, Huazhong University of Science and Technology(华中科技大学国家大数据技术与系统工程技术研究中心、服务计算技术与系统实验室、集群与网格计算实验室) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSToM框架,通过因果追踪和激活引导提升大语言模型的社会推理能力与对话质量。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09712 2026-04-14 cs.CV cs.AI 88%

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

LAST:利用工具作为提示以增强多模态大语言模型的空间推理能力

Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LAST通过整合专用视觉模型,解决多模态大语言模型在复杂几何布局解析中的幻觉和不精确问题,提出统一框架提升空间推理能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 88%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22403 2026-04-14 cs.LG 87%

MoveFM-R: Advancing Mobility Foundation Models via Language-driven Semantic Reasoning

MoveFM-R: 通过语言驱动的语义推理推进移动基础模型

Fanjin Meng, Yuan Yuan, Jingtao Ding, Jie Feng, Chonghua Han, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系,BNRist) New York University (NYU)(纽约大学)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MoveFM-R通过语言驱动的语义推理解决移动基础模型中地理坐标与语言 token 的词汇不匹配及潜在向量与语义世界之间的表示差距问题,实现更全面、可解释的人类移动建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10701 2026-04-14 cs.LG cs.AI cs.CL 87%

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

带回价值模型:生成式批评者在大语言模型强化学习中的价值建模

Zikang Shan, Han Zhong, Liwei Wang, Li Zhao

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成式批评者GenAC,通过链式推理改进价值建模,提升RL性能。

Comments 16 pages including appendix, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11791 2026-04-14 cs.LG cs.AI 86%

A Mechanistic Analysis of Looped Reasoning Language Models

循环推理语言模型的机理分析

Hugh Blayney, Álvaro Arroyo, Johan Obando-Ceron, Pablo Samuel Castro, Aaron Courville, Michael M. Bronstein, Xiaowen Dong

机构 * University of Oxford(牛津大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了循环推理语言模型中潜在状态的机理,揭示了循环块在潜在空间中的稳定轨迹及注意力头行为的稳定特性。

Comments 39 pages, 63 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11209 2026-04-14 cs.CL cs.AI 86%

Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method

探索知识冲突以实现忠实的LLM推理:基准与方法

Tianzhe Zhao, Jiaoyan Chen, Shuxiu Zhang, Haiping Zhu, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11041 2026-04-14 cs.AI 85%

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

从拓扑到轨迹:LLM驱动的世界模型用于供应链韧性

Jia Luo

机构 * Huazhong University and Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ReflectiChain框架,通过生成世界模型和回顾代理强化学习,提升供应链韧性,实验显示在极端场景下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01544 2026-04-14 cs.AI 85%

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards

通过去噪过程奖励推进扩散语言模型的推理能力

Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28653 2026-04-14 cs.NE cs.SE 85%

BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations

BACE:基于大语言模型的代码生成:通过贝叶斯锚定的代码与测试种群共演化

Kaushitha Silva, Srinath Perera

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 BACE通过贝叶斯锚定的共演化方法,改进代码生成中的测试反馈机制,提升代码与测试种群的协同进化性能。

Comments 10 Pages, 3 Figures. To appear in Proceedings of the 2026 Genetic and Evolutionary Computation Conference (GECCO '26), July 13-17, 2026, San Jose, Costa Rica

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10587 2026-04-14 cs.HC 85%

CogInstrument: Modeling Cognitive Processes for Bidirectional Human-LLM Alignment in Planning Tasks

CogInstrument: 为规划任务中的双向人-大语言模型对齐建模认知过程

Anqi Wang, Dongyijie Pan, Xin Tong, Pan Hui

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 CogInstrument通过认知动机建模实现人与大语言模型在规划任务中的双向对齐,通过可编辑的图形结构揭示隐含推理过程,提升用户对协作的控制力和信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26163 2026-04-14 cs.CY 85%

Exploring Dissatisfaction in Bus Route Reduction through LLM-Calibrated Agent-Based Modeling

通过LLM校准的Agent-Based建模探索公交路线削减中的不满

Qiumeng Li, Xinxi Yang, Suhong Zhou

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究通过LLM校准的ABM探讨公交路线削减对不同群体不满及网络韧性的影响,发现网络结构对系统稳定性影响大于容量因素,路线削减导致不满指数急剧上升,尤其影响残疾人士和老年人。

Comments The authors have withdrawn this preprint due to errors in figure presentation and labeling. A revised manuscript will be submitted once these issues are resolved

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00487 2026-04-14 cs.MA cs.GT cs.SY eess.SY 85%

Competition and Cooperation of LLM Agents in Games

博弈中的大语言模型代理竞争与合作

Jiayi Yao, Cong Chen, Baosen Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型代理在资源分配和Cournot竞争博弈中的行为,发现多轮提示和非零和上下文促进合作,基于公平性推理提出分析框架。

Comments Submitted to CDC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10690 2026-04-14 cs.AI 84%

Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks

大型语言模型构建空间世界模型了吗?基于网格世界迷宫任务的证据

Weijiang Li, Yilin Zhu, Rajarshi Das, Parijat Dube

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) MQube Cognition(MQube认知实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文通过迷宫任务评估LLM的空间理解能力,发现其空间推理依赖于表示形式而非任务类型,表明LLM缺乏稳健的空间世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21380 2026-04-14 cs.CL 84%

Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models

挑战推理的边界:为大语言模型设计的奥林匹克级数学基准

Haoxiang Sun, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 OlymMATH是一个包含350道题的奥林匹克级数学基准,通过自然语言和形式验证两种方式评估大语言模型,揭示语言间性能差异及模型推理不足问题。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10905 2026-04-14 cs.SD cs.AI cs.CL eess.AS 84%

Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music

音频Flamingo Next:下一代开放音频-语言模型用于语音、声音和音乐

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Zhifeng Kong, Siddharth Gururani, Sang-gil Lee, Jaehyeon Kim, Aya Aljafari, Chao-Han Huck Yang, Sungwon Kim, Ramani Duraiswami, Dinesh Manocha, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(英伟达,美国) University of Maryland, USA(马里兰大学,美国)

专题命中 推理与问题求解 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 AF-Next通过改进基础模型、扩展数据集和引入时序推理方法,提升了语音、环境声音和音乐的理解与推理能力,展示了更强的性能和实用性。

Comments Project website: https://afnext-umd-nvidia.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13755 2026-04-14 cs.LG cs.AI 84%

Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration

在RLVR中深度与广度的协同作用:通过自适应探索解锁LLM推理增益

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Dongchun Xie, Hanhui Li, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院ETH人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARS方法,通过自适应探索提升LLM推理能力,发现扩大批量大小能显著提升Pass@1指标,同时结合DARS-Breadth方法实现深度与广度的协同增益。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏