arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18731 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18731 篇

2310.14420 2023-11-07 cs.AI 90%

Monte Carlo Thought Search: Large Language Model Querying for Complex Scientific Reasoning in Catalyst Design

Henry W. Sprueill, Carl Edwards, Mariefel V. Olarte, Udishnu Sanyal, Heng Ji, Sutanay Choudhury

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Journal ref In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP2023) Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14909 2023-11-03 cs.AI 90%

Leveraging Pre-trained Large Language Models to Construct and Utilize World Models for Model-based Task Planning

Lin Guan, Karthik Valmeekam, Sarath Sreedharan, Subbarao Kambhampati

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16436 2023-10-27 cs.CV cs.CL 90%

DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models

Ge Zheng, Bin Yang, Jiajin Tang, Hong-Yu Zhou, Sibei Yang

专题命中 推理与问题求解 :language model(title,abstract);prompting(title,abstract);large language model(abstract);small language model(abstract)

Comments 24 pages, 13 figures, to be published in NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15166 2023-10-24 cs.CV cs.CL 90%

Large Language Models are Visual Reasoning Coordinators

Liangyu Chen, Bo Li, Sheng Shen, Jingkang Yang, Chunyuan Li, Kurt Keutzer, Trevor Darrell, Ziwei Liu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01684 2023-10-24 cs.CL 90%

Baby's CoThought: Leveraging Large Language Models for Enhanced Reasoning in Compact Models

Zheyu Zhang, Han Yang, Bolei Ma, David Rügamer, Ercong Nie

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments CoNLL 2023 BabyLM Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13002 2023-10-23 cs.CL 90%

Are Large Language Models Geospatially Knowledgeable?

Prabin Bhandari, Antonios Anastasopoulos, Dieter Pfoser

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15630 2023-10-20 cs.CL 90%

NLPBench: Evaluating Large Language Models on Solving NLP Problems

Linxin Song, Jieyu Zhang, Lechao Cheng, Pengyuan Zhou, Tianyi Zhou, Irene Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09830 2023-09-29 cs.AI 90%

Synergistic Integration of Large Language Models and Cognitive Architectures for Robust AI: An Exploratory Analysis

Oscar J. Romero, John Zimmerman, Aaron Steinfeld, Anthony Tomasic

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments AAAI 2023 Fall Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01825 2023-09-14 cs.CL 90%

Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Zheng Yuan, Hongyi Yuan, Chengpeng Li, Guanting Dong, Keming Lu, Chuanqi Tan, Chang Zhou, Jingren Zhou

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00108 2023-08-21 cs.SE cs.LG 90%

Better patching using LLM prompting, via Self-Consistency

Toufique Ahmed, Premkumar Devanbu

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted at ASE-NIER (2023) track

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01293 2023-06-05 cs.CL 90%

ThinkSum: Probabilistic reasoning over sets using large language models

Batu Ozturkler, Nikolay Malkin, Zhen Wang, Nebojsa Jojic

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09014 2023-03-17 cs.CL 90%

ART: Automatic multi-step reasoning and tool-use for large language models

Bhargavi Paranjape, Scott Lundberg, Sameer Singh, Hannaneh Hajishirzi, Luke Zettlemoyer, Marco Tulio Ribeiro

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11610 2022-10-26 cs.CL 90%

Large Language Models Can Self-Improve

Jiaxin Huang, Shixiang Shane Gu, Le Hou, Yuexin Wu, Xuezhi Wang, Hongkun Yu, Jiawei Han

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06726 2022-10-14 cs.CL 90%

Explanations from Large Language Models Make Small Reasoners Better

Shiyang Li, Jianshu Chen, Yelong Shen, Zhiyu Chen, Xinlu Zhang, Zekun Li, Hong Wang, Jing Qian, Baolin Peng, Yi Mao, Wenhu Chen, Xifeng Yan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09638 2026-05-28 cs.CY 90%

A Methodological Guide on Using Large Language Models for Reproducible Text Annotation in the Social Sciences and Humanities with Python and R

使用大型语言模型进行社会科学和人文学科可重复文本注释的方法论指南:基于Python和R

Qixiang Fang, Javier Garcia Bernardo, Erik-Jan van Kesteren

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提供了一步一步的方法论指南,指导社会科学和人文学科研究者使用大型语言模型进行文本注释,包括设置项目、编程交互、提示设计、统计整合和可重复性管理,并附有Python和R代码示例。

Comments Accompanying Python and R notebooks are available at https://github.com/sodascience/workshop_llm_data_collection or https://zenodo.org/records/20073016

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06176 2026-02-09 cs.AI cs.CL cs.LG 90%

Large Language Model Reasoning Failures

大语言模型推理失败

Peiyang Song, Pengrui Han, Noah Goodman

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) Carleton College(卡尔顿学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文首次系统调查大语言模型推理失败问题,提出分类框架并分析其根本原因,旨在提升模型的推理能力与鲁棒性。

Comments Repository: https://github.com/Peiyang-Song/Awesome-LLM-Reasoning-Failures. Published at TMLR 2026 with Survey Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10601 2023-12-05 cs.CL cs.AI cs.LG 90%

Tree of Thoughts: Deliberate Problem Solving with Large Language Models

Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);LLM(abstract,comments);prompting(abstract)

Comments NeurIPS 2023 camera ready version. Code repo with all prompts: https://github.com/princeton-nlp/tree-of-thought-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13315 2026-08-14 cs.GT cs.AI cs.LG cs.SY eess.SY 新提交 90%

Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

保留、定制还是退出:大语言模型推理服务中的默认设计与代币定价

Ahmet Bugra Gundogan, Yigit Turkmen, Melih Bastopcu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM推理服务的供需交互建立Stackelberg博弈模型,推导最优解,明确默认设置的影响条件,实验验证模型并展示均衡相关因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09128 2026-08-11 cs.CL cs.AI cs.MA 新提交 90%

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进

Keyu He, Xuhui Zhou, Maarten Sap

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新 90%

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Houine, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-05 cs.AI cs.LG cs.MA 新提交 90%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18767 2026-07-22 cs.CV cs.AI cs.CL 新提交 90%

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

使用边界框提高小语言模型在基于视觉的评分任务中的性能

Lachlan McGinness

机构 * Australian National University(澳大利亚国立大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究在基于视觉的简答题评分任务中,用边界框裁剪学生答案对小语言模型性能的影响,通过实验表明此方法能显著提高评分准确性并降低计算成本,是大规模视觉教育评估中部署小语言模型的关键预处理步骤。

Comments Accepted for 1st Workshop on Small Language Models for Education (SLM4ED '26) at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14905 2026-07-21 cs.CL cs.AI 版本更新 90%

Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution

告诉我你如何推理,我就能说出你是谁:用于可靠大语言模型作者归属的推理图

Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz

机构 * University of Passau(帕绍大学) University of Dundee(邓迪大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM生成文本检测和作者归属问题,此前方法易受改写等影响。本文提出利用论证挖掘管道提取推理图的图神经网络方法,在混淆攻击及新模型版本文本评估中,相比传统基线展现更强鲁棒性和泛化能力,提升了检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-07-13 cs.AI cs.CL 新提交 90%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Ales Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Preprint. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07989 2026-07-10 cs.CR cs.AI cs.IR cs.LG cs.MA 新提交 90%

Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems

谁破坏了系统?基于大语言模型的多智能体系统中的故障定位

Yufei Xia, Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(得克萨斯大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的多智能体系统故障定位问题,提出AgentLocate框架,结合基于LLM的判断与多视角验证,通过置信感知策略聚合评估结果并微调判断,实验表明该框架在识别责任智能体和故障步骤上优于现有方法且高效。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23800 2026-07-09 cs.RO cs.AI cs.LG 版本更新 90%

Object Search in Partially-Known Environments via LLM-informed Model-based Planning and Prompt Selection

通过LLM引导的基于模型的规划与提示选择进行部分已知环境中的物体搜索

Abhishek Paudel, Abhish Khanal, Raihan I. Arnob, Shahriar Hossain, Gregory J. Stein

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM的模型规划框架和提示选择方法,用于部分已知环境中的物体搜索。利用LLM估计不同位置搜索目标物体的可能性,并结合环境地图提取的旅行成本,以实现有效的搜索性能。

Comments 10 pages, 8 figures. Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07832 2026-07-07 cs.LG cs.AI 版本更新 90%

rePIRL: Learn PRM with Inverse RL for LLM Reasoning

rePIRL: 通过逆强化学习学习PRM以提高LLM推理

Xian Wu, Kaijie Zhu, Ying Zhang, Lun Wang, Wenbo Guo

机构 * Meta AI Department of Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出rePIRL框架,通过逆强化学习学习高效的PRM,无需依赖专家策略的强假设,解决了传统方法中熵崩溃等固有限制问题,通过双学习过程和定制技术提升LLM推理性能,并在数学和编程任务数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15267 2026-07-07 cs.GT cs.AI cs.CL cs.CY cs.MA 版本更新 90%

CoopEval: Benchmarking Cooperation-Sustaining Mechanisms and LLM Agents in Social Dilemmas

CoopEval:社会困境中合作维持机制与LLM代理的基准测试

Emanuel Tewolde, Xiao Zhang, David Guzman Piedrahita, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University Foundations of Cooperative AI Lab (FOCAL) Jinesis Lab, University of Toronto \& Vector Institute ETH Z\" u rich Max Planck Institute for Intelligent Systems, T\" u bingen, Germany

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了社会困境中合作维持机制与LLM代理的交互效果,发现重复游戏和声誉系统最有效,但合作效果随对手变化而下降,且在进化压力下更有效。

Comments Published paper at the International Conference on Machine Learning (ICML) 2026. 65 pages, 38 Figures, 8 Tables, 17 Listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02070 2026-07-07 cs.AI cs.CL cs.HC cs.MA 版本更新 90%

Exploring Plan Space through Conversation: An Agentic Framework for LLM-Mediated Explanations in Planning

通过对话探索计划空间:一种用于LLM介导规划解释的代理框架

Guilhem Fouilhé, Rebecca Eifler, Antonin Poché, Sylvie Thiébaux, Nicholas Asher

机构 * IRIT, Toulouse, France(法国图卢兹计算机科学研究所) LAAS-CNRS, Toulouse, France(法国国家科学研究中心图卢兹系统分析与架构实验室) IRT Saint Exupery, Toulouse, France(法国图卢兹圣埃克苏佩里技术研究所) CNRS, Toulouse, France(法国国家科学研究中心) Australian National University, Canberra, Australia(澳大利亚国立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种代理框架,通过对话帮助用户理解规划解决方案,提升系统信任度,通过目标冲突解释进行用户研究。

Comments Preprint; Accepted at EUMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26103 2026-06-26 cs.CL cs.AI 新提交 90%

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

探究大语言模型的问题解决能力——基于静力学问题的研究

Tanner Culleton, Hung-Fu Chang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过模型蒸馏方法评估LLM在静力学问题上的表现,发现引入图表和多步推理时准确率下降,主要源于多步推理和视觉信息应用困难。

Comments 9 pages, Engineering and Technology Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏