arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18731 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18731 篇

2608.08168 2026-08-11 cs.CL 新提交 90%

Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders

思考与非思考:基于稀疏自编码器的大语言模型推理机制可解释性研究

Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究基于稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的推理机制,揭示思考与非思考模式的神经差异,为大语言模型推理可解释性提供新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24140 2026-08-04 cs.AI 版本更新 90%

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide: 用于大型语言模型高效多步推理的双曲引导

Yuyu Liu, Haotian Xu, Yanan He, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石英布鲁克大学) Department of Applied Mathematics and Statistics(应用数学与统计学系) Yale University(耶鲁大学) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22580 2026-08-03 cs.SE cs.AI 版本更新 90%

RePaCA: Leveraging Reasoning Large Language Models for Static Automated Patch Correctness Assessment

RePaCA:利用推理型大语言模型实现静态自动化补丁正确性评估

Marcos Fuster-Pena, David de-Fitero-Dominguez, Antonio Garcia-Cabot, Eva Garcia-Lopez

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RePaCA是利用推理型大语言模型的静态APCA技术,经强化学习微调后在Defects4J测试集上达83.1%准确率,泛化能力优于现有方法,可准确识别过拟合补丁并提升可解释性。

Comments Final published version in the Neurocomputing journal. Volume 701, 7 November 2026, 134583. DOI: https://doi.org/10.1016/j.neucom.2026.134583

Journal ref Neurocomputing (7 November 2026), Volume 701, 134583

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08825 2026-07-24 cs.CL cs.IR 90%

Search-on-Graph: Iterative Informed Navigation for Large Language Model Reasoning on Knowledge Graphs

图上搜索:面向知识图谱的大语言模型推理的迭代式知情导航

Jia Ao Sun, Hao Yu, Fabrizio Gotti, Fengran Mo, Yihong Wu, Yuchen Hui, Zhan Su, Lingfeng Xiao, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Digital Media, CBC(数字媒体,CBC) Halmstad University College(哈姆斯塔德大学学院) University of Waterloo(滑铁卢大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Search-on-Graph方法,通过让大语言模型自身基于知识图谱结构和完整推理历史选择关系路径,遵循观察-思考-导航范式,在六个KGQA基准上超越现有方法,无需任务特定微调。

Comments Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19365 2026-07-23 cs.AI 新提交 90%

Logic-Guided Data Extraction with Answer Set Programming and Large Language Models

使用回答集编程和大语言模型进行逻辑引导的数据提取

Mario Alviano, Lorenzo Grillo, Nicola Leone, Fabrizio Lo Scudo

机构 * University of Calabria(卡拉布里亚大学) University of Campania Luigi Vanvitelli(坎帕尼亚路易吉·万维泰利大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对大语言模型用于语义数据提取时的不足,提出结合回答集编程与大语言模型的逻辑引导数据提取框架,通过交错调用与推导减少大语言模型调用次数,提高提取质量。

Comments 42nd International Conference on Logic Programming, to appear in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17331 2026-07-21 cs.AI cs.MA 新提交 90%

Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning

智能企业资源规划(Agentic ERP):用于自主企业资源规划的多智能体大语言模型架构

Zhihao Liu, Tianyu Wang, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering(生产工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 研究针对ERP系统过度依赖人类决策的问题,提出Agentic ERP架构,结合角色对齐的LLM智能体、人工参与框架和图编排器。通过特定决策问题表述、编排解耦及多层面评估,证明该方法优于基线,能让ERP主动执行决策,提供了参考架构与评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05775 2026-07-08 cs.AI 新提交 90%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00048 2026-07-02 cs.SE cs.AI 新提交 90%

Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns

在Scrum认证风格问题上比较大型语言模型:准确性、稳定性和错误模式

Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, João Paiva, Kyller Gorgônio, Angelo Perkusich

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 评估GPT-5 mini、Gemini 3 Flash和DeepSeek Chat 3.2在993个Scrum认证问题上的表现,发现模型间差异显著,Gemini 3 Flash准确率最高,错误模式具有系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14985 2026-06-19 cs.CV cs.CL 版本更新 90%

IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models

IdealGPT: 通过大型语言模型迭代分解视觉与语言推理

Haoxuan You, Rui Sun, Zhecan Wang, Long Chen, Gengyu Wang, Hammad A. Ayyubi, Kai-Wei Chang, Shih-Fu Chang

机构 * Columbia University(哥伦比亚大学) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出IdealGPT框架,利用大型语言模型迭代分解视觉语言推理任务,通过子问题生成、子答案获取和最终答案推理的循环过程,在零样本设置下显著提升多步推理性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19308 2026-06-18 cs.CL cs.MA 新提交 90%

Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play

通过多智能体虚拟博弈增强大语言模型的决策能力

Leyang Shen, Yang Zhang, Xiaoyan Zhao, Chun Kai Ling, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多智能体系统中决策任务因立场纠缠而难以分解的问题,提出基于虚拟博弈的多智能体虚拟博弈(MAFP)范式,通过迭代最佳响应实现均衡求解,提升决策质量和鲁棒性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02802 2026-06-09 cs.AI 版本更新 90%

ChatHealthAI: Aligning Electronic Health Record Representations with Large Language Models for Grounded Clinical Reasoning

ChatHealthAI: 将电子健康记录表示与大语言模型对齐以实现基于临床的推理

Bo-Hong Wang, Baicheng Peng, Ruilin Wang, Jun Bai, Ziyang Song, Yue Li

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学系) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 提出ChatHealthAI框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,实现可解释的临床推理并保持预测性能。

Comments Main paper with appendix, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06865 2026-06-08 cs.CL 新提交 90%

Are Large Language Models Suitable for Graph Computation? Progress and Prospects

大型语言模型是否适合图计算?进展与展望

Yuting Zhang, Yi Han, Kai Wang, Wei Ni, Angela Bonifati, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Edith Cowan University(埃迪斯科文大学) Lyon 1 University(里昂第一大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL

AI总结 本文通过角色分类法综述LLM在图计算中的应用,分析作为执行者和规划者的两种范式,指出LLM适用于简单小规模任务,但在大规模和精确性要求高的任务中不可靠,并总结数据集和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06684 2026-06-08 cs.LG 版本更新 90%

GraphWalker: Patient Analogy Meets Information Gain for Clinical Reasoning with Large Language Models

GraphWalker: 患者类比与信息增益结合用于大型语言模型的临床推理

Yue Fang, Weibin Liao, Yuxin Guo, Jiaran Gao, Hongxin Ding, Jinyang Zhang, Xinke Jiang, Zhibang Yang, Junfeng Zhao, Yasha Wang, Liantao Ma

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) National Engineering Research Center for Software Engineering, Peking University, Beijing, China(软件工程国家工程研究中心,北京大学,北京,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出GraphWalker框架,通过联合数据驱动和模型驱动视角、发现患者队列以及采用懒惰贪心搜索,从电子健康记录中检索患者案例进行类比推理,无需参数更新即可提升临床推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06188 2026-06-05 cs.CL 90%

The Tell-Tale Norm: $\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models

告密范数:$\ell_2$ 幅度作为大语言模型推理动态的信号

Jinyang Zhang, Hongxin Ding, Yue Fang, Weibin Liao, Muyang Ye, Junfeng Zhao, Yasha Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出隐藏状态的 $\ell_2$ 范数作为大语言模型推理强度的内生信号,并通过稀疏自编码器分析、理论证明和因果干预验证其有效性,进而引入三种基于 $\ell_2$ 范数的测试时缩放技术以提升推理性能。

Comments ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02041 2026-06-02 cs.CL 90%

SentGuard: Sentence-Level Streaming Guardrails for Large Language Models

SentGuard:面向大型语言模型的句子级流式护栏

Jiaqi Yu, Xin Wang, Yixu Wang, Jie Li, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SentGuard,一种与生成并行运行的句子级流式护栏,通过轻量级等待缓冲区将流式令牌分组为句子块并仅释放已验证块,以在低延迟下实现高精度不安全内容检测。

Comments 16 pages, 5 figures, submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01416 2026-06-02 cs.AI 90%

Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems

用于可靠的工具增强型大语言模型系统的自愈代理编排器

Rahul Suresh Babu, Adarsh Agrawal

机构 * Independent Researcher(独立研究者) Senior Member, IEEE(IEEE高级成员)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种自愈代理编排器,通过将可靠性视为有界运行时控制问题,映射故障信号、选择恢复动作并验证轨迹,在100任务故障注入基准上达到98.8%任务成功率,优于重试和完全重规划基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00049 2026-06-02 cs.CY cs.AI 90%

Measuring and Mitigating Bias in Code Generated by Large Language Models

测量和减轻大型语言模型生成代码中的偏见

Yuxi Chen, Yutian Tang, Timothy Storer

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对GPT-4o和Gemini等主流代码生成工具,提出评估框架,使用代码偏见分数和属性变化比率量化偏见,并探索四种轻量级缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03556 2026-06-02 cs.LG 90%

VRPRM: Process Reward Modeling via Visual Reasoning

VRPRM: 通过视觉推理的过程奖励建模

Xinquan Chen, Chongying Yue, Bangwei Liu, Xuhong Wang, Yingchun Wang, Chaochao Lu

机构 * PJ Lab(PJ实验室)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出VRPRM,一种结合视觉推理的过程奖励模型,通过两阶段训练策略(少量CoT-PRM SFT数据+大量非CoT-PRM RL数据)以较低成本实现高质量推理,性能提升达118%。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08884 2026-06-02 cs.CV cs.AI cs.GR 90%

ShapeLib: Designing a library of programmatic 3D shape abstractions with Large Language Models

ShapeLib: 利用大型语言模型设计程序化3D形状抽象库

R. Kenny Jones, Paul Guerrero, Niloy J. Mitra, Daniel Ritchie

机构 * Stanford University(斯坦福大学) Adobe Research(Adobe研究) University College London(伦敦大学学院) Brown University(布朗大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ShapeLib方法,利用大型语言模型的先验知识,通过引导式工作流自动设计可泛化的程序化3D形状抽象库,并支持下游形状编辑与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29678 2026-05-29 cs.CL 90%

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

虚假提示:无关提示能否引导大型语言模型?

Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

机构 * Heinrich Heine University Düsseldorf(海因里希·海因斯大学多特蒙德分校) Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 研究语义无关的提示(虚假提示)对大型语言模型行为的影响,提出黑盒搜索方法发现此类提示,并证明其在多个基准和模型上能显著影响模型输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27596 2026-05-28 cs.CL 90%

Can Hallucinations Be Useful? Solving Multi-Hop Questions With SLMs By Chaining System-I/II Reasoning

幻觉能否有用?通过链式系统I/II推理用SLM解决多跳问题

Saptarshi Sengupta, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :SLM(title_cn,summary_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种“先回答后推理”的认知启发框架,利用SLM的初始答案(可能包含幻觉)作为假设来检索证据,再通过系统II深度推理,从而在多跳问答任务上超越传统的“先思考后检索”方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25566 2026-05-26 cs.AI 90%

Uncertainty Reasoning with Large Language Models for Explainable Disease Diagnosis

基于大语言模型的不确定性推理用于可解释疾病诊断

Xiaoyang Fan, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种神经符号推理框架,将大语言模型与模糊逻辑和声明式规则结合,实现可解释且形式可验证的医学诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10906 2026-05-26 cs.AI 90%

PCGRLLM: Large Language Model-Driven Reward Design for Procedural Content Generation Reinforcement Learning

PCGRLLM:面向程序化内容生成强化学习的大语言模型驱动奖励设计

In-Chang Baek, Sung-Hyun Kim, Sam Earle, Zehua Jiang, Jin-Ha Noh, Julian Togelius, Kyung-Joong Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院) New York University(纽约大学) Corresponding author(通讯作者)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 提出PCGRLLM架构,利用大语言模型和反馈机制生成奖励函数,在二维环境中实现故事到奖励的生成,性能接近人类水平。

Comments 14 pages, 8 figures, Acccepted to Transactions on Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19167 2026-05-25 cs.CL 90%

Evaluating Counterfactual Strategic Reasoning in Large Language Models

评估大型语言模型中的反事实策略推理

Dimitrios Georgousis, Maria Lymperaiou, Angeliki Dimitriou, Giorgos Filandrianos, Giorgos Stamou

机构 * National Technical University of Athens(希腊雅典国家技术大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 通过引入反事实变体(改变收益结构和行动标签)的囚徒困境和石头剪刀布博弈,评估大型语言模型的策略表现是否基于真正的推理而非记忆模式,并揭示其在激励敏感性、结构泛化和反事实环境中的策略推理方面的局限性。

Comments Accepted at GEM@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22287 2026-05-22 cs.AI 90%

SciCore-Mol: Augmenting Large Language Models with Pluggable Molecular Cognition Modules

SciCore-Mol: 通过可插拔分子认知模块增强大语言模型

Yuxuan Chen, Changwei Lv, Yunduo Xiao, Zhongjing Du, Daquan Zhou, Yukun Yan, Zheni Zeng, Zhiyuan Liu

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) Tsinghua University, Beijing, China(清华大学,北京) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(智能科学与技术学院,南京大学苏州校区)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SciCore-Mol框架,通过三个深度集成的可插拔认知模块解决大语言模型处理异构科学数据(如分子)时的语义鸿沟问题,实现分子理解、生成、反应预测和化学知识的综合性能提升。

Comments 15 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20177 2026-05-20 cs.CL cs.CV 90%

From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

从感知到思考:解耦感知与推理提升视觉语言模型的训练

Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu, Hanqing Lu, Cihang Xie, Yuyin Zhou

机构 * Amazon(亚马逊) University of Waterloo(滑铁卢大学) Vector Institute, Canada CIFAR AI Chair(向量研究所,加拿大CIFAR人工智能主席)

专题命中 推理与问题求解 :language model(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过解耦感知与推理,发现视觉任务性能受限于感知能力不足而非推理本身,通过分阶段训练提升模型的感知与推理能力,从而在多个视觉数学和感知任务中取得更优表现。

Comments 19 pages, 9 figures; Accepted to ICML 2026; Project Page: https://ucsc-vlaa.github.io/VLM-CapCurriculum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18827 2026-05-20 cs.IR cs.LG cs.PL 90%

Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds

为小型语言模型引导的推理:评估可执行的多项选择题问答框架

Prateek Biswas, Dhaval Patel, Vedant Khandelwal, Shuxin Lin, Amit Sheth

机构 * IBM New York City,NY(IBM纽约市) University of South Carolina(南卡罗来纳大学) Artificial Intelligence Institute at University of South Carolina(南卡罗来纳大学人工智能学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Code-Guided Reasoning(CGR)评估协议和生成程序资源,用于衡量可执行推理框架如何提升小型语言模型在多项选择题问答任务中的表现,通过实验展示了使用可执行框架带来的性能提升。

Comments 28 Pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21841 2026-05-19 cs.CL 90%

Embodied Task Planning via Graph-Informed Action Generation with Large Language Models

通过大型语言模型的图引导动作生成进行具身任务规划

Xiang Li, Ning Yan, Masood Mortazavi

机构 * Purdue University(普渡大学) Futurewei Technologies(未来科技)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出GiG框架,通过图神经网络编码环境状态并构建动作连接执行轨迹图,结合有限前瞻性模块提升具身代理的规划能力,在三个具身规划基准测试中取得显著性能提升。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15301 2026-05-18 cs.AI 90%

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution

Solvita:通过代理进化增强大型语言模型以应对编程竞赛

Han Li, Jinyu Tian, Rili Feng, Yuqiao Du, Chong Zheng, Chenyu Wang, Chenchen Liu, Shihao Li, Xinping Lei, Yifan Yao, Weihao Xie, Letian Zhu, Jiaheng Liu

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Solvita通过闭环系统和可训练知识网络,使代理动态学习,提升编程竞赛任务的准确性和经验积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27859 2026-05-18 cs.AI cs.ET 90%

Rethinking Agentic Reinforcement Learning In Large Language Models

重新思考大型语言模型中的代理强化学习

Fangming Cui, Ruixiao Zhu, Cheng Fang, Sunan Li, Jiahong Li

机构 * Beijing Beijing China(北京北京中国) Shanghai Beijing China(上海北京中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨了在大型语言模型中引入代理强化学习的新方法,强调自主代理的目标设定、长期规划和动态策略适应能力,提出新的方法论和设计,并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏