arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-14 至 2026-04-14 共收录 233 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2601.06993 2026-04-14 cs.CV 85%

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11188 2026-04-14 cs.CL cs.AI 81%

MathAgent: Adversarial Evolution of Constraint Graphs for Mathematical Reasoning Data Synthesis

MathAgent: 基于约束图的对抗进化用于数学推理数据合成

Zixiong Yu, Jun Rao, Guhan Chen, Songtao Tian, Bohan Li, Jiansheng Wei, Min Zhang, Xiaojun Meng

机构 * Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kyoto University(京都大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MathAgent框架,通过约束图的对抗进化生成高质量数学推理数据,提升模型在八个数学基准上的泛化能力。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 75%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19509 2026-04-14 cs.CL cs.AI cs.LG 67%

Pyramid MoA: A Probabilistic Framework for Cost-Optimized Anytime Inference

金字塔MoA:一种用于成本优化的任何时间推断概率框架

Arindam Khaled

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Pyramid MoA框架,通过概率方法优化任何时间推断,实现高效查询路由和计算节省。

Comments 12 pages, 6 figures, 4 tables. v3: corrected router direction, added multi-benchmark context-aware escalation analysis, added Dean & Boddy and Horvitz citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09852 2026-04-14 cs.AI cs.LG 62%

MEMENTO: Teaching LLMs to Manage Their Own Context

MEMENTO:教大模型管理自身上下文

Vasilis Kontonis, Yuchen Zeng, Shivam Garg, Lingjiao Chen, Hao Tang, Ziyan Wang, Ahmed Awadallah, Eric Horvitz, John Langford, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MEMENTO通过将推理分块并压缩为密集状态摘要,减少上下文、KV缓存和计算开销,提升模型效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09741 2026-04-14 cs.LG cs.AI 62%

ExecTune: Effective Steering of Black-Box LLMs with Guide Models

ExecTune: 通过引导模型有效控制黑盒大语言模型

Vijay Lingam, Aditya Golatkar, Anwesan Pal, Ben Vo, Narayanan Sadagopan, Alessandro Achille, Jun Huan, Anoop Deoras, Stefano Soatto

机构 * AWS AI(亚马逊云科技人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExecTune方法,通过结合教师引导采样、监督微调和结构感知强化学习,优化引导模型生成策略的可执行性与效率,提升大语言模型在数学推理和代码生成任务中的性能。

Comments Accepted at Lifelong Agents Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 9 篇

2509.13356 2026-04-14 cs.CY cs.CL 79%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11206 2026-04-14 cs.SE cs.AI 74%

Designing Adaptive Digital Nudging Systems with LLM-Driven Reasoning

基于LLM驱动推理的自适应数字引导系统设计

Tiziano Santilli, Mina Alipour, Mahyar Tourchi Moghaddam

机构 * Syddansk Universitet(南丹麦大学)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 本文提出一种将行为科学与软件设计结合的自适应数字引导系统架构,通过整合多维用户建模与伦理合规,验证了其在住宅能源可持续性中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10087 2026-04-14 cs.AI 70%

Ontological Trajectory Forecasting via Finite Semigroup Iteration and Lie Algebra Approximation in Geopolitical Knowledge Graphs

通过有限半群迭代和李代数近似进行本体轨迹预测:在地缘政治知识图谱中的应用

Qihang Wu

机构 * Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业及系统工程学系)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出EL-DRUIN系统,结合形式本体、有限半群代数和李代数近似,预测地缘政治长期关系轨迹,通过半群操作和李代数空间向量嵌入实现可解释的概率预测。

Comments 18 pages. Code and system available at https://github.com/wuqihang-brave/El-druin

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17270 2026-04-14 cs.LG cs.AI cs.CL 67%

Understanding Generalization in Role-Playing Models via Information Theory

通过信息论理解角色扮演模型的泛化能力

Yongqi Li, Hao Lang, Fei Huang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息理论提出R-EMID指标,分析角色扮演模型在分布偏移下的泛化问题,提出协同强化学习框架提升对话生成概率,发现用户偏移对泛化影响最大。

Comments Accepted to ACL 2026 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10392 2026-04-14 cs.LG cs.AI cs.LO cs.PL cs.SE 62%

Intent-aligned Formal Specification Synthesis via Traceable Refinement

通过可追溯的细化实现意图对齐的正式规范合成

Zhe Ye, Aidan Z. H. Yang, Huangyuan Su, Zhenyu Liao, Samuel Tenka, Zhizhen Qin, Udaya Ghai, Dawn Song, Soonho Kong

机构 * Amazon Web Services(亚马逊云服务) Harvard University(哈佛大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeriSpecGen框架,通过需求级归因和局部修复生成意图对齐的规范,提升规范合成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11514 2026-04-14 cs.SE cs.CL 57%

DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode

DuET:通过生成代码和伪代码的双执行进行测试输出预测

Hojae Han, Jaejin Kim, Seung-won Hwang, Yu Jin Kim, Moontae Lee

机构 * ETRI(韩国电子通信研究院) Seoul National University(首尔大学) SNU-LG AI Research Center(首尔大学-LG人工智能研究中心) LG AI Research(LG人工智能研究院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DuET框架,结合生成代码和伪代码执行,通过功能多数投票提升测试输出预测的准确性,实验表明其在LiveCodeBench上达到最优性能,Pass@1提升13.6个百分点。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11378 2026-04-14 cs.AI cs.SY eess.SY 57%

From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution

从代理循环到结构化图:一个用于LLM代理执行的调度理论框架

Hu Wei

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出SGH框架,通过将控制流显式化为静态DAG,解决代理循环的隐式依赖、无限恢复循环和调试困难问题,同时分析可控性、表达性和可实现性之间的权衡。

Comments 51 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10989 2026-04-14 cs.AI 57%

MAFIG: Multi-agent Driven Formal Instruction Generation Framework

MAFIG:多智能体驱动的正式指令生成框架

Shixing Zhao, Zheng Si, Pengpeng Ouyang, Zhengqing Hu, Wanqi Zhu, Dong Chen, Yibo Guo, Mingliang Xu

机构 * School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能集群系统工程研究中心) National Supercomputing Center in Zhengzhou(国家超级计算郑州中心) Henan Research Center for Large Model Technology and New Quality Software Engineering(河南省大模型技术与新质软件工程研究中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MAFIG框架,通过多智能体生成局部正式指令以应对调度系统紧急情况,采用span-focused loss-driven local distillation机制提升决策效率,实验结果显示在港口、仓储和甲板调度数据集上成功率高且处理速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17330 2026-04-14 cs.SE 50%

Agentic Verification of Software Systems

软件系统的代理验证

Haoxin Tu, Huan Zhao, Yahui Song, Mehtab Zafar, Ruijie Meng, Abhik Roychoudhury

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出AutoRocq代理,通过与Rocq定理证明器协作实现程序验证,采用迭代优化提升证明质量,实验显示在SV-COMP和Linux内核模块上具有良好的自动验证效果。

Comments Camera-ready version appeared in the Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 11 篇

2604.10973 2026-04-14 cs.AI cs.CL 86%

CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning

CFMS:一种用于增强表格推理的粗到细多模态合成框架

Qixian Huang, Hongqiang Lin, Tong Fu, Yingsen Wang, Zhenghui Fu, Qirui Wang, Yiding Sun, Dongxu Zhang

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFMS框架,通过粗到细的多模态合成方法提升表格推理能力,实验表明其在处理大表格和小模型时具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 83%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13331 2026-04-14 cs.LG 83%

Mixture of Cognitive Reasoners: Modular Reasoning with Brain-Like Specialization

认知推理的混合:类脑的专业化模块推理

Badr AlKhamissi, C. Nicolò De Sabbata, Greta Tuckute, Zeming Chen, Martin Schrimpf, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院洛桑) Brain and Cognitive Sciences at MIT(麻省理工学院脑与认知科学系) Kempner Institute at Harvard University(哈佛大学肯普纳研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文提出MiCRo模型,通过类脑专业化模块实现认知行为,提供可解释的推理模块,支持动态路由并优于基线模型。

Comments ICLR 2026. Project Page at https://cognitive-reasoners.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05549 2026-04-14 cs.CL 79%

Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents

不要执着于提示:针对LLM代理的推理劫持与约束紧缩

Yanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出JailAgent框架,通过触发提取、推理劫持和约束紧缩三个阶段,避免修改用户提示,提升跨模型和跨场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04272 2026-04-14 cs.IR cs.AI 79%

PoTable: Towards Systematic Thinking via Plan-then-Execute Stage Reasoning on Tables

PoTable:通过表格推理中的计划-执行阶段推理实现系统性思维

Qingyang Mao, Qi Liu, Zhi Li, Mingyue Cheng, Zheng Zhang, Rui Li

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PoTable,一种基于计划-执行阶段的表格推理方法,通过明确的分析阶段和代码生成机制提升推理的系统性和可解释性。

Comments Accepted by IEEE TKDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23964 2026-04-14 cs.AI 70%

From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments

从像素到数字代理:关于强化学习环境分类和技术趋势的实证研究

Lijing Luo, Yiben Luo, Alexey Gorbatovski, Sergey Kovalchuk, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Yancheng Institute of Technology(盐城工学院) Central University Moscow(莫斯科中央大学) ITMO University(ITMO大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文通过大规模数据分析,研究强化学习环境从物理模拟到通用代理的演变,揭示领域分为语义优先和领域特定泛化两大生态,并提出设计下一代具身语义模拟器的路线图。

Comments 32 pages main text, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11699 2026-04-14 cs.CL cs.AI cs.LG 67%

Legal2LogicICL: Improving Generalization in Transforming Legal Cases to Logical Formulas via Diverse Few-Shot Learning

Legal2LogicICL: 通过多样少量样本学习提升将法律案例转换为逻辑公式的一般化能力

Jieying Xue, Phuong Minh Nguyen, Ha Thanh Nguyen, May Myo Zin, Ken Satoh

机构 * Center for Juris-Informatics, ROIS-DS(法信息学中心,ROIS-DS) Japan Advanced Institute of Science and Technology(日本先端科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Legal2LogicICL框架,通过检索增强生成实现有效上下文学习,构建信息丰富且稳定的少量样本演示,提升法律案例转逻辑表示的准确性与稳定性。

Comments Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11320 2026-04-14 cs.RO 67%

CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping

CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取

Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室) Peng Cheng Laboratory(鹏城实验室) Northeastern University(东北大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出CLASP框架,通过异步闭环机制整合多模态感知、逻辑推理与状态反馈,解决低级抓取中多模态演示不足、空间幻觉和开放环执行脆弱性问题,实现87%的成功率和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10667 2026-04-14 cs.CL cs.AI cs.LG 67%

Learning and Enforcing Context-Sensitive Control for LLMs

学习与强制上下文敏感控制用于大语言模型

Mohammad Albinhassan, Pranava Madhyastha, Mark Law, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院) City University of London(伦敦城市大学) ILASP Limited, UK(英国ILASP有限公司) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种自动学习上下文敏感约束的框架,通过两阶段过程提升LLM生成的有效性,使小型模型也能完美遵守约束,优于其他方法。

Comments ACL 2025 Student Research Workshop

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop), pages 834-842, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10114 2026-04-14 cs.CL cs.AI 62%

CircuitSynth: Reliable Synthetic Data Generation

CircuitSynth:可靠的合成数据生成

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * University of Oxford(牛津大学) TU Wien(维也纳工业大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CircuitSynth提出了一种新的神经符号框架,通过将语义推理与表层实现解耦,结合概率句法决策图和凸优化机制,实现高保真合成数据生成,确保逻辑约束和分布目标。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16771 2026-04-14 cs.SE cs.LG 57%

Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation

使大语言模型具备全球、以人为本的解释能力:从token到可解释的代码和测试生成

Dipin Khati, Daniel Rodriguez-Cardenas, David N. Palacio, Alejandro Velasco, Michele Tufano, Denys Poshyvanyk

机构 * Microsoft(微软) Google(谷歌)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出code rationales框架,通过将token级解释映射到高层编程类别,实现大语言模型代码生成的全局可解释性,验证了其在减少解释不确定性方面的有效性。

Comments Accepted to ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 47 篇

2604.10517 2026-04-14 cs.AI 91%

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning

从感知到规划:通过课程学习进化自主任务导向的空间时间推理

Xiaoda Yang, Yuxiang Liu, Shenzhou Gao, Can Wang, Jingyang Xue, Lixin Yang, Yao Mu, Tao Jin, Shuicheng Yan, Zhimeng Zhang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Qingdao University(青岛大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09580 2026-04-14 cs.AI cs.LG 91%

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

OOWM: 通过面向对象的程序化世界建模结构化具身推理与规划

Hongyu Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 OOWM通过软件工程形式化方法构建具身推理框架,利用UML类图和活动图实现环境状态与控制策略的显式建模,结合监督微调与分组相对策略优化提升规划效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10775 2026-04-14 cs.CL cs.GT cs.LG 90%

LLMs for Game Theory: Entropy-Guided In-Context Learning and Adaptive CoT Reasoning

大型语言模型用于博弈论:基于熵的上下文学习与自适应推理

Tommaso Felice Banfi, Sashenka Gamage

专题命中 规划推理 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于LLM的框架,通过熵引导的链式推理和自适应上下文检索,提升离散博弈任务的推理能力,实验显示其显著提高决策质量。

Comments Published at the AAAI 2026 Bridge: Logical and Symbolic Reasoning in Language Models (OpenReview)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27484 2026-04-14 cs.LG cs.AI cs.CL 88%

Thought Branches: Interpreting LLM Reasoning Requires Resampling

思维分支:解释大语言模型推理需要重采样

Uzay Macar, Paul C. Bogdan, Senthooran Rajamanoharan, Neel Nanda

机构 * MATS

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文通过重采样研究大语言模型推理过程中的因果影响,探讨了单个推理链的局限性,并提出了基于重采样的方法来分析模型决策和推理步骤的影响。

Comments Uzay Macar and Paul C. Bogdan contributed equally to this work, and their listed order was determined by coinflip

详情

展开后加载摘要…

URL PDF HTML 收藏