arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 91 篇

2605.29578 2026-05-29 cs.AI 90%

GPS-Enhanced Tourist Mobility Modeling with Seasonal Spatial Priors and LLM-Based Activity Chain Generation

基于季节性空间先验和LLM活动链生成的GPS增强游客移动性建模

Yifan Liu, Yanling Sang, Xishun Liao, Morgan Sun, Bo Yang, Zhiyuan Zhang, Chris Stanford, Haoxuan Ma, Jiaqi Ma

机构 * UCLA Mobility Lab, Department of Civil and Environmental Engineering, University of California, Los Angeles(加州大学洛杉矶分校移动实验室,土木与环境工程系,加州大学洛杉矶分校) Novateur Research Solutions(Novateur研究解决方案) University of Central Florida(中央佛罗里达大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种四阶段仿真框架,结合GPS和调查数据推导的月份条件空间先验、游客人口统计信息、距离可行区域序列分配以及基于LLM的活动链生成,以解决游客移动性建模中非例行、吸引驱动且对旅行目的、季节和成员组成高度敏感的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29247 2026-05-29 cs.AI cs.CL cs.LG 89%

DenseSteer: Steering Small Language Models towards Dense Math Reasoning

DenseSteer: 引导小型语言模型进行密集数学推理

Yang Ouyang, Shuhang Lin, Jung-Eun Kim

机构 * North Carolina State University(北卡罗来纳州立大学) Rutgers University(罗格斯大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DenseSteer,一种无需训练的推理时引导框架,通过调节内部表征向密集推理模式靠拢,提升小型模型在多步数学推理中的准确性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30231 2026-05-29 cs.CV cs.AI 89%

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

机构 * FAIR at Meta(Meta的FAIR)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。

Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29656 2026-05-29 cs.AI 89%

TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation

TRACE: 基于图尔敏论证元素的 LLM 思维链推理评估

Yundong Kim, Heyoung Yang

机构 * Applied Agent Research Center, Korea Institute of Science(应用智能代理研究中心,韩国科学技术信息研究所) Department of Computer Science and Engineering, University of Seoul, Republic of Korea(首尔大学计算机科学与工程系,大韩民国)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 TRACE 指标,结合图尔敏论证理论与弗拉维尔元认知框架分析思维链推理结构,实验表明与基准准确率强相关(r=0.74)并可作为有效强化学习奖励信号。

Comments 23 pages, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30343 2026-05-29 cs.CL cs.AI 88%

Unlocking the Working Memory of Large Language Models for Latent Reasoning

解锁大型语言模型的工作记忆以实现潜在推理

Lukas Aichberger, Sepp Hochreiter

机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria(林茨ELLIS单元和LIT AI实验室,机器学习研究所,约翰·凯撒大学林茨,奥地利) NXAI GmbH, Linz, Austria(NXAI公司,林茨,奥地利)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种名为RiM的潜在推理方法,通过固定记忆块替代自回归生成中间推理步骤,在单次前向传播中实现计算高效的潜在推理。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07525 2026-05-29 cs.CL cs.AI 88%

Thinking Before Constraining: A Unified Decoding Framework for Large Language Models

先思考再约束:大型语言模型的统一解码框架

Ngoc Trinh Hung Nguyen, Alonso Silva, Laith Zumot, Liubov Tupikina, Armen Aghasaryan, Mehwish Alam

机构 * Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院) Nokia Bell Labs(诺基亚贝尔实验室) Nokia(诺基亚)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出In-Writing混合方法,通过触发令牌将自由形式推理与结构化解码解耦,在分类和推理任务上准确率提升高达27%。

Comments v2-EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29458 2026-05-29 cs.CL cs.AI 88%

Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment

面向LLM人格模拟的自适应访谈:基于证据的推理提升决策对齐

Ruoxi Su, Yuhan Liu, Jingyu Hu

机构 * University of Cambridge(剑桥大学) Independent Researcher(独立研究员)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出自适应访谈框架,通过结构化三阶段对话收集人格相关信息,并基于访谈记录评估LLM在道德困境场景中模拟个体决策的能力,发现基于后续追问的证据推理能显著提升预测准确性。

Comments 20 pages, 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30002 2026-05-29 cs.AI 88%

KairosAgent: Agentic Time Series Forecasting with Fused Semantic Reasoning

KairosAgent:融合语义推理的智能体时间序列预测

Kun Feng, Ziwei Shan, Yuchen Fang, Yiyang Tan, Sihan Lu, Shuqi Gu, Lintao Ma, Xingyu Lu, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出KairosAgent框架,通过结合基于LLM的推理器和基于TSFM的预测器,并引入强化学习范式,实现跨模态时间序列的零样本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30214 2026-05-29 cs.CL 87%

GRUFF: LLM Pronoun Fidelity, Reasoning, and Biases in German

GRUFF:德语中LLM的代词忠实度、推理与偏见

Fabian Mewes, Anne Lauscher, Vagrant Gautam

机构 * JobMatchMe GmbH(JobMatchMe公司) Trustworthy AI Lab(可信人工智能实验室) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 通过构建大规模德语数据集GRUFF,研究大型语言模型在四种性别一致系统与四组代词上的代词忠实度,发现模型在无显式上下文时对阳性和阴性实体表现出强语法一致,但对新代词xier和en较弱,且职业刻板印象在不同语法格和模型间相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30058 2026-05-29 cs.CL 87%

HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?

HEART-Bench: 大语言模型智能体是否表现出类似人类的心理学?

Weihan Peng, Chenxu Zhang, Qianao Wang, Yuling Shi, Heng Lian, Qihong Mao, Jiahao Pang, Chunliang Feng, Bowen Li, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) Quwan Group(启元集团) University of Washington(华盛顿大学) South China Normal University(华南师范大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 提出HEART-Bench基准,通过构建基于大五人格和自传体记忆的虚拟角色,在DIAMONDS情境框架下评估LLM智能体能否展现一致的人类心理特征。

Comments GitHub: https://github.com/peng-weihan/HEART-BENCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00777 2026-05-29 cs.LG 87%

In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration

原地反馈:多轮专家-LLM协作的可靠精炼方法

Youngbin Choi, Minjong Lee, Saemi Moon, Seunghyuk Cho, Chaehyeon Chung, MoonJeong Park, Dongwoo Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 提出原地反馈交互范式,通过用户直接编辑模型先前响应并让模型从编辑上下文继续生成,在五个推理密集型基准上优于标准多轮反馈且更省token,用户研究证实其能提高最终输出满意度并降低疲劳。

Comments 42pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23571 2026-05-29 cs.CR cs.AI 87%

Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting

通过标准化威胁狩猎评估LLM辅助蓝队

Yuqiao Meng, Luoxi Tang, Feiyang Yu, Xi Li, Guanhua Yan, Ping Yang, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布ingham顿分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Duke University(杜克大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CyberTeam基准,通过构建标准化工作流和模块化操作步骤,评估大语言模型在蓝队威胁狩猎中的有效性,并揭示标准化设计带来的改进与开放式推理的局限性。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-05-29 cs.RO cs.AI cs.LG 87%

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30314 2026-05-29 cs.MA 87%

SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents

SpecBench: 评估软件工程LLM代理的规约级推理能力

Grant Hamblin, Kevin Song, Zhanda Zhu, Anand Jayarajan, Sihang Liu, Nandita Vijaykumar, Gennady Pekhimenko

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出SpecBench基准,通过从RFC过程中提取任务,评估LLM代理在无执行反馈下识别初始设计提案中遗漏、歧义、不一致或错误假设的规约级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29822 2026-05-29 cs.SE cs.AI 86%

Inferring Code Correctness from Specification

从规约推断代码正确性

Tambon Florian, Papadakis Mike

机构 * University of Luxembourg(卢森堡大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TRAILS方法,通过基于规约的类别划分生成测试输入并执行,利用LLM评估输入输出对是否符合规约,从而推断代码正确性,在LiveCodeBench和CoCoClaNeL数据集上相比基线方法提升了马修斯相关系数并增强了稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29262 2026-05-29 cs.AI 86%

Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling

协调实时约束与长视距推理:一种用于动态调度的异步智能体框架

Shijie Cao, Yuan Yuan, Jing Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学计算机科学与工程学院) Shenzhen Loop Area Institute, Shenzhen, China(深圳环形区研究所) Qingdao Research Institute, Beihang University(青岛研究院) Hangzhou Innovation Institute, Beihang University(杭州创新研究院) School of Artificial Intelligence, Xidian University, Xi’an 710071, Shaanxi, China(西安电子科技大学人工智能学院) Guangzhou Institute of Technology, Xidian University, Guangzhou 510555, Guangdong, China(广州技术研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RACE-Sched异步智能体框架,通过双流架构解耦策略执行与逻辑推理,利用LLM合成和验证符号启发式规则,在保证实时性的同时提升动态调度质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27150 2026-05-29 cs.AI cs.MA 86%

MediHive: A Decentralized Agent Collective for Medical Reasoning

MediHive:用于医学推理的去中心化智能体集体

Xiaoyang Wang, Christopher C. Yang

机构 * College of Computing and Informatics, Drexel University(德雷塞尔大学计算与信息学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种去中心化多智能体框架MediHive,通过共享记忆池和迭代融合机制,使LLM智能体自主分配角色、进行条件性基于证据的辩论并融合观点,在MedQA和PubMedQA上分别达到84.3%和78.4%的准确率。

Comments Accepted by Journal of Healthcare Informatics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28919 2026-05-29 cs.LG cs.AI cs.CL 85%

CosmicFish-HRM: Adaptive Reasoning via Hierarchical Recurrent Mechanisms in Compact Language Models

CosmicFish-HRM:紧凑语言模型中基于层次循环机制的适应性推理

Venkat Akhil Lakkapragada

机构 * Mistyoz AI Hyderabad, India(Mistyoz AI 德里, 印度)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种紧凑语言模型CosmicFish-HRM,通过层次推理模块动态分配推理深度,在保持较小参数量的同时实现适应性推理。

Comments 17 pages, 4 figures. Exploratory study of adaptive reasoning depth in compact autoregressive language models. Code available at https://github.com/MistyozAI/CosmicFish-HRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29461 2026-05-29 cs.CV 85%

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

FlowSeg: 面向大语言模型条件分割的动态语义引导

Zekang Zhang, Guangyu Gao, Youyun Tang, ChengJing Wu, Xiaochao Qu, Chi Harold Liu, Jianbo Jiao, Yunchao Wei, Luoqi Liu, Ting Liu

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) WEI Lab, Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院WEI实验室) Beijing Key Laboratory of Advanced Information Science(北京高级信息科学重点实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型条件分割中语义错位问题,提出FlowSeg方法,通过双向语义流动态引导掩码生成,实现语义对齐并达到最优性能。

Comments 18 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29192 2026-05-29 cs.AI cs.CL 84%

ReasonOps: Operator Segmentation for LLM Reasoning Traces

ReasonOps: 大语言模型推理轨迹的算子分割

Daniel Lee, Owen Queen, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 提出无监督方法ReasonOps,从思维链轨迹中提取7种通用推理算子,揭示模型推理结构并用于模型识别与正确性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30245 2026-05-29 cs.CL 83%

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

知道在如何解决之前该解决什么:预规划赋能的大语言模型数学推理

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出PPC框架,通过引入显式的问题理解阶段(预规划)来弥补现有规划推理方法中“如何解决”与“该解决什么”之间的范式差距,在多个数学推理基准上取得最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10520 2026-05-29 cs.LG 83%

Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models

优先过程而非结果:奖励潜在思维轨迹改善循环语言模型的推理能力

Jonathan Williams, Esin Tureci

机构 * Department of Computer Science, Princeton University, Princeton NJ, U.S.A(普林斯顿大学计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 针对循环语言模型(LoopLM)中标准强化学习(如GRPO)仅奖励最终潜在状态导致推理改进失败的问题,提出RLTT框架,通过在整个潜在推理轨迹上分配奖励实现密集的轨迹级信用分配,显著提升数学推理性能并泛化至非数学任务。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13230 2026-05-29 cs.LG cs.AI 82%

Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence

教师引导的策略优化:大策略差异下的在线推理蒸馏

Xinyu Liu, Kechen Jiao, Chunyang Xiao, Runsong Zhao, Junhao Ruan, Bei Li, Jiahao Liu, Qifan Wang, Xin Chen, Jingang Wang, Chenglong Wang, Tong Xiao, JingBo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Tsinghua University(清华大学) Meituan(美团) Meta AI NiuTrans Research, Shenyang, China(新译研究院,沈阳,中国)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对在线蒸馏中教师与学生策略差异大时反向KL监督失效的问题,提出教师引导策略优化(TGPO),通过教师直接指导学生上下文的token级生成并结合RLVR奖励,在推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02103 2026-05-29 cs.LG cs.CL 82%

How Far Ahead Do LLMs Plan? Uncovering the Latent Horizon in Chain-of-Thought Reasoning

LLMs 能提前多远规划?揭示思维链推理中的潜在视界

Liyan Xu, Mo Yu, Fandong Meng, Jie Zhou

机构 * WeChat AI, Tencent Inc(腾讯AI实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过探测方法 Tele-Lens 研究 LLMs 在思维链推理中的潜在规划能力,发现其具有短视视界,并基于此提出利用稀疏枢轴位置增强不确定性估计及自动识别 CoT 绕过的假设。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29190 2026-05-29 cs.LG cs.CL 82%

When RL Suppresses Its Own Vocabulary: Recovering Reasoning Diversity in Puzzle-to-Math Transfer

当RL抑制自身词汇:在谜题到数学迁移中恢复推理多样性

Mayug Maniparambil, Arjun Karuvally, Terrence Sejnowski, Fergal Reid

机构 * Fin AI Research(Fin AI研究院) Salk Institute for Biological Studies(萨尔克生物医学研究所)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于可验证奖励的强化学习框架,通过引入新颖性奖励机制恢复被抑制的探索性推理原语,实现从约束满足谜题到数学问题的跨领域迁移,在无需数学数据的情况下将OlymMATH-Hard的pass@32从16%提升至36%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29168 2026-05-29 cs.AI cs.LG 82%

Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-grounded Post-extraction Correction

晚做总比早做好:基于本体后提取校正的神经符号知识图谱构建

Lorenzo Loconte, Timothy Hospedales, Cristina Cornelio

机构 * University of Edinburgh, UK(爱丁堡大学) Samsung AI Center, Cambridge, UK(三星人工智能中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出一种神经符号框架,通过后提取校正解决LLM提取知识图谱时的本体不一致问题,减少token使用并提升图谱一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28842 2026-05-29 cs.CL cs.AI 82%

Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning

思想即规划:通过强化规划进行思维链优化的潜在世界模型

Dong Liu, Yanxuan Yu, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Thoughts-as-Planning框架,将思维链优化形式化为潜在语义空间中的序贯决策过程,通过潜在世界模型模拟推理链编辑对下游输出的影响,并利用梯度下降或强化学习进行规划,在语言理解和生成任务上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02909 2026-05-29 cs.AI cs.FL cs.LG 82%

Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs

关于推理的推理:LLM中思维链令牌复杂度的BAPO界限

Kiran Tomlinson, Tobias Schnabel, Adith Swaminathan, Jennifer Neville

机构 * Microsoft Research, Redmond, WA(微软研究院,西雅图,华盛顿)

专题命中 推理与问题求解 :LLM(title_cn,abstract);分类 cs.AI、cs.LG

AI总结 通过扩展BAPO模型,证明二元多数、三元组匹配和图可达性三个任务需要Ω(n)个思维链令牌,实验验证了线性缩放与理论下界一致。

Comments 31 pages; accepted to ICML '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23730 2026-05-29 cs.AI 81%

EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance

EAPO: 利用按需专家协助增强策略优化

Siyao Song, Cong Ma, Zhihao Cheng, Shiye Lei, Minghao Li, Ying Zeng, Huaixiao Tou, Kai Jia

机构 * ByteDance BandAI(字节跳动BandAI)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出专家辅助策略优化(EAPO)框架,通过训练中与外部专家的多轮交互增强探索,解决强化学习中的稀疏奖励和低效探索问题,在多个基准上平均提升5个点。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29556 2026-05-29 cs.AI 81%

Opt-Verifier: Unleashing the Power of LLMs for Optimization Modeling via Dual-Side Verification

Opt-Verifier:通过双面验证释放大语言模型在优化建模中的潜力

Haoyang Liu, Jie Wang, Boxuan Niu, Xiongwei Han, Yian Xu, Mingxuan Ye, Zijie Geng, Fangzhou Zhu, Tao Zhong, Mingxuan Yuan, Jianye Hao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition(脑启发式感知与认知MoE实验室) University of Science and Technology of China(中国科学技术大学) Noah's Ark Lab, Huawei Technologies(华为技术诺亚实验室) Tianjin University(天津大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Opt-Verifier框架,通过结构侧和解决方案侧的双面验证,利用大语言模型自动构建数学优化模型,显著提升建模准确性。

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏