arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2509.25835 2026-04-13 cs.AI 87%

Chain-in-Tree: Back to Sequential Reasoning in LLM Tree Search

链式树搜索:LLM树搜索中的回归顺序推理

Xinzhe Li

机构 * Independent Researcher(独立研究员)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Chain-in-Tree框架,通过在搜索过程中决定分支时机而非每步扩展,显著减少计算开销,在GSM8K和Math500上提升效率达75-85%。

Comments ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20224 2026-03-24 cs.CL 87%

Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference

超越测试时计算策略:倡导语言模型推理中的能耗-token指标

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文探讨了在小模型中测试时计算策略的能耗-准确率权衡,提出能耗-token指标和受控推理策略,以实现可持续的AI部署。

Journal ref EuroMLSys2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14730 2026-03-18 cs.LG 87%

GNNVerifier: Graph-based Verifier for LLM Task Planning

GNNVerifier:基于图的LLM任务规划验证器

Yu Hao, Qiuyu Wang, Cheng Yang, Yawen Li, Zhiqiang Zhang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于图的验证器,通过构建任务计划的图结构,利用图神经网络评估计划的合理性,从而纠正LLM生成的计划中的错误。

Comments 17pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 87%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13230 2026-03-17 cs.CL 87%

Slang Context-based Inference Enhancement via Greedy Search-Guided Chain-of-Thought Prompting

基于贪心搜索的链式推理提示的俚语推理增强

Jinghan Cao, Qingyang Ren, Xiangyun Chen, Xinjin Li, Haoxiang Gao, Yu Zhao

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出一种基于贪心搜索的链式推理框架,通过改进小语言模型的推理能力,提升俚语解释的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04948 2026-03-06 cs.LG 87%

$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理

Peihao Wang, Ruisi Cai, Zhen Wang, Hongyuan Mei, Qiang Liu, Pan Li, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC San Diego(圣地亚哥大学) TTIC Georgia Tech(佐治亚理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00923 2026-03-03 cs.CL 87%

Hybrid Neural-LLM Pipeline for Morphological Glossing in Endangered Language Documentation: A Case Study of Jungar Tuvan

混合神经-大语言模型管道在濒危语言文档中的形态学 glossing:朱加尔图瓦语案例研究

Siyu Liang, Talant Mawkanuli, Gina-Anne Levow

机构 * Department of Linguistics, University of Washington(语言学系,华盛顿大学) Department of Middle Eastern Languages and Cultures, University of Washington(中东语言与文化系,华盛顿大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种混合神经-大语言模型管道,用于朱加尔图瓦语的形态学 glossing,通过结合神经序列标注和 LLM 后修正,显著减少标注工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19364 2026-03-02 cs.AI cs.MA 87%

Integrating LLM in Agent-Based Social Simulation: Opportunities and Challenges

将大语言模型整合到基于代理的社会模拟中:机遇与挑战

Patrick Taillandier, Jean Daniel Zucker, Arnaud Grignard, Benoit Gaudou, Nghi Quang Huynh, Alexis Drogoul

机构 * UR MIAT, University of Toulouse, INRAE, Castanet-Tolosan, France(法国图卢兹大学UR MIAT,INRAE,Castanet-Tolosan分校) UMI 209 UMMISCO, IRD/Sorbonne University, Bondy, France(法国Bondy IRD/索邦大学UMI 209 UMMISCO) LMI ACROSS, Thuyloi University, Hanoi, Vietnam(越南胡志明大学LMI ACROSS) UMR 5505 IRIT, University of Toulouse Capitole, Toulouse, France(法国图卢兹大学Capitole UMR 5505 IRIT) CICT, Can Tho University, Can Tho, Vietnam(越南金瓯大学CICT)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文探讨了大语言模型在社会模拟中的应用,分析其潜力与局限,并提出混合宪法架构作为整合LLM与传统代理模型的可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15325 2026-02-18 cs.AI 87%

AgriWorld:A World Tools Protocol Framework for Verifiable Agricultural Reasoning with Code-Executing LLM Agents

AgriWorld:一个用于可验证农业推理的代码执行LLM代理工具协议框架

Zhixing Zhang, Jesen Zhang, Hao Liu, Qinhan Lv, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 AgriWorld通过代码执行LLM代理实现农业推理,结合执行-观察-反思循环提升农业数据处理与预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11706 2026-02-13 cs.CV cs.AI cs.RO 87%

LLM-Driven 3D Scene Generation of Agricultural Simulation Environments

基于大语言模型的农业模拟环境3D场景生成

Arafa Yoncalik, Wouter Jansen, Nico Huebel, Mohammad Hasan Rahmani, Jan Steckel

机构 * Faculty of Applied Engineering – Dept. of Electronics and ICT, University of Antwerp(应用工程学院——电子与信息通信技术系,安特卫普大学) Flanders Make Strategic Research Centre(弗拉芒制造战略研究中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于多LLM流水线的农业模拟环境3D场景生成方法,通过模块化设计提升领域特定场景生成的可靠性与精度。

Comments Accepted at IEEE Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09341 2026-02-11 cs.AI 87%

Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge

对多智能体大语言模型推理树进行审计优于多数投票和LLM作为裁判

Wei Yang, Shixuan Li, Heng Ping, Peiyu Zhang, Paul Bogdan, Jesse Thomason

机构 * University of Southern California, Los Angeles, CA, USA(美国南加州大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 通过构建推理树路径搜索机制,AgentAuditor在多智能体系统中实现了优于多数投票和LLM作为裁判的推理准确性提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05544 2026-02-06 cs.AI 87%

Reasoning-guided Collaborative Filtering with Language Models for Explainable Recommendation

基于语言模型的推理引导协同过滤用于可解释推荐

Fahad Anwaar, Adil Mehmood Khan, Muhammad Khalid, Usman Zia, Kezhi Wang

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 RGCF-XRec通过融合推理引导的协同过滤知识与语言模型,实现可解释的序列推荐,提升了推荐性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17406 2026-02-06 cs.AI 87%

Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning

鲁棒答案,脆弱逻辑:在LLM推理中探究解耦假说

Enyi Jiang, Changming Xu, Nischay Singh, Tian Qiu, Gagandeep Singh

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究揭示LLM在面对微小输入扰动时,仍能保持正确答案但推理过程不稳定,提出MATCHA框架以探测解耦假说,发现多步骤和常识任务更易受此影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03979 2026-02-05 cs.CL 87%

Likelihood-Based Reward Designs for General LLM Reasoning

基于似然的奖励设计用于通用大语言模型推理

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

机构 * Meta FAIR University of Amsterdam(阿姆斯特丹大学) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出基于对数概率的奖励设计,用于提升大语言模型在推理任务中的表现,尤其在可验证和不可验证场景中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12726 2026-02-03 cs.CL 87%

DESIGNER: Design-Logic-Guided Multidisciplinary Data Synthesis for LLM Reasoning

DESIGNER: 多学科数据合成用于LLM推理的设计逻辑引导

Weize Liu, Yongchi Zhao, Yijia Luo, Mingyu Xu, Jiaheng Liu, Yanan Li, Xiguo Hu, Zhiqi Bai, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Nanjing University(南京大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 DESIGNER通过设计逻辑引导生成多学科推理数据集,提升LLM跨学科推理能力。

Comments Accepted to ICLR 2026. Project page: https://attention-is-all-i-need.github.io/Design-Logic-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 87%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02846 2026-01-26 cs.LG physics.comp-ph 87%

Towards Reasoning for PDE Foundation Models: A Reward-Model-Driven Inference-Time-Scaling Algorithm

面向PDE基础模型的推理:一种基于奖励模型的推理时扩展算法

Siddharth Mansingh, James Amarel, Ragib Arnab, Arvind Mohan, Kamaljeet Singh, Gerd J. Kunde, Nicolas Hengartner, Benjamin Migliori, Emily Casleton, Nathan A. Debardeleben, Ayan Biswas, Diane Oyen, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于奖励模型的推理时扩展算法,用于提升PDE基础模型在分布外情况下的预测准确性,减少对训练样本和模型规模的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03589 2026-01-08 cs.CL 87%

OLA: Output Language Alignment in Code-Switched LLM Interactions

OLA:代码切换交互中的输出语言对齐

Juhyun Oh, Haneul Yoo, Faiz Ghifari Haznitrama, Alice Oh

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20059 2026-01-07 cs.CL 87%

Enhancing Reasoning Skills in Small Persian Medical Language Models Can Outperform Large-Scale Data Training

增强小规模波斯语医疗语言模型的推理能力可超越大规模数据训练

Mehrdad Ghassabi, Sadra Hakim, Hamidreza Baradaran Kashani, Pedram Rostami

机构 * Faculty of Computer Engineering University of Isfahan(计算机工程系 布鲁金斯大学) School of Computer Science University of Windsor(计算机科学学院 温莎大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 通过RLAIF和DPO方法,提升小规模波斯语医疗模型推理能力,使其在有限数据下超越大规模训练模型。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 87%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG 87%

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20935 2025-12-17 cs.AI 87%

GALAX: Graph-Augmented Language Model for Explainable Reinforcement-Guided Subgraph Reasoning in Precision Medicine

GALAX:图增强语言模型用于可解释的强化引导子图推理在精准医学中

Heming Zhang, Di Huang, Wenyu Li, Michael Province, Yixin Chen, Philip Payne, Fuhai Li

机构 * I2DB, Washington University School of Medicine(I2DB,华盛顿大学医学学院) Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校) Department of Genetics, Washington University School of Medicine(遗传学系,华盛顿大学医学学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 GALAX通过整合图神经网络与大语言模型,利用强化学习实现子图推理,提升精准医学中目标发现的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17116 2025-12-17 cs.AI 87%

MCTS-EP: Empowering Embodied Planning with Online Preference Optimization

MCTS-EP:通过在线偏好优化增强具身规划

Hang Xu, Zang Yu, Yehui Tang, Pengbo Hu, Yuhao Tang, Hao Dong

机构 * School of Management, Fudan University, Shanghai, China(复旦大学管理学院) Independent Researcher(独立研究者) CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学) PKU-AgiBot Lab, Peking University, Beijing, China(北京大学)

专题命中 推理与问题求解 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MCTS-EP通过结合大语言模型与蒙特卡洛树搜索,实现具身智能体的在线偏好优化,提升多模态任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05256 2025-12-08 cs.CL q-bio.QM 87%

Enhancing Clinical Note Generation with ICD-10, Clinical Ontology Knowledge Graphs, and Chain-of-Thought Prompting Using GPT-4

利用ICD-10、临床本体知识图谱和链式推理提示法提升临床笔记生成

Ivan Makohon, Mohamad Najafi, Jian Wu, Mathias Brochhausen, Yaohang Li

机构 * Computer Science, Old Dominion University(旧 Dominion 大学计算机科学系) Biomedical Informatics, University of Arkansas for Medical Sciences(阿肯色医学科学大学生物医学信息学系)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究利用ICD-10、临床本体知识图谱和链式推理提示法提升临床笔记生成质量,通过GPT-4在六个临床案例中验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02249 2025-11-20 cs.RO cs.AI 87%

Natural Selection via Foundation Models for Soft Robot Evolution

Changhe Chen, Xiaohao Xu, Xiangdong Wang, Xiaonan Huang

机构 * University of Michigan-Ann Arbor(密歇根大学安娜堡分校)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12782 2025-11-18 cs.CL cs.CR 87%

LLM Reinforcement in Context

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11954 2025-11-18 cs.AI 87%

LLM-Assisted Formalization Enables Deterministic Detection of Statutory Inconsistency in the Internal Revenue Code

Borchuluun Yadamsuren, Steven Keith Platt, Miguel Diaz

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 29 pages, 3 appendices with Prolog code and full codebase available at: https://github.com/borchuluun/section121-inconsistency-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05758 2025-11-05 cs.AI cs.LO 87%

APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning

Azim Ospanov, Farzan Farnia, Roozbeh Yousefzadeh

机构 * Huawei Hong Kong Research Center(华为香港研究中心) Department of Computer Science & Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16854 2025-10-30 cs.AI cs.CV 87%

Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models

Jiaqi Wang, Kevin Qinghong Lin, James Cheng, Mike Zheng Shou

机构 * The Chinese University of Hong Kong(香港中文大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);post-training(abstract);SFT(abstract)

Comments camera ready revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21148 2025-10-27 cs.AI 87%

How to Auto-optimize Prompts for Domain Tasks? Adaptive Prompting and Reasoning through Evolutionary Domain Knowledge Adaptation

Yang Zhao, Pu Wang, Hao Frank Yang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏