arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2604.14550 2026-04-21 cs.AR cs.AI cs.LG cs.MA cs.PL 87%

VeriGraphi: A Multi-Agent Framework of Hierarchical RTL Generation for Large Hardware Designs

VeriGraphi:一种用于大规模硬件设计的分层RTL生成多智能体框架

Sazzadul Islam, Tasnim Tabassum, Hao Zheng

机构 * Dept. of Computer Science \& Eng. University of South Florida Tampa, Florida, United States

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VeriGraphi通过构建基于规范的图谱,解决LLM在生成分层RTL时的结构失真问题,实现可靠生成并保持功能正确性。

Comments 9 pages, 2 figures, Case studies, v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03682 2026-04-21 cs.CL cs.AI 87%

From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMs

从隐式到显式:面向大语言模型数学推理的高效令牌逻辑监督

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FSLR框架,通过显式监督提升大语言模型对逻辑关系的理解能力,实验显示其在推理准确率和训练效率上均优于CoT-SFT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16022 2026-04-20 cs.AI cs.LG cs.MA 87%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12487 2026-04-15 cs.CL cs.AI 87%

KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning

KG-Reasoner: 一种用于端到端多跳知识图谱推理的强化模型

Shuai Wang, Yinan Yu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KG-Reasoner,通过强化学习整合多步推理至LLM的'思考'阶段,实现动态探索推理路径,实验表明其在多跳和知识密集型推理任务中表现优异。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06428 2026-03-09 cs.CL cs.AI 87%

Abductive Reasoning with Syllogistic Forms in Large Language Models

基于三段论形式的大型语言模型演绎推理

Hirohiko Abe, Risako Ando, Takanobu Morishita Kentaro Ozeki, Koji Mineshima, Mitsuhiro Okada

机构 * Keio University(Keio大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本文研究大型语言模型在演绎推理中的准确性,通过转换三段论数据集探讨其偏见及改进方向,强调上下文推理的重要性。

Comments Published in Proceedings of the 3rd International Conference on Human and Artificial Rationalities (HAR 2024), LNCS 15504, pp. 3-17

Journal ref Lecture Notes in Computer Science, vol. 15504, pp. 3-17, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14986 2026-02-12 cs.AI cs.CL 87%

Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models

隐式概率推理不反映大语言模型中的显式答案

Manuel Mondal, Ljiljana Dolamic, Gérôme Bovet, Philippe Cudré-Mauroux, Julien Audiffren

机构 * University of Fribourg, Switzerland(弗里堡大学) armasuisse S+T, Switzerland(armasuisse S+T)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大语言模型在显式概率推理中表现良好,但在隐式概率推理中预测与真实情况存在显著差异,且传统评估方法无法检测此类错误。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07820 2026-02-10 cs.AI cs.CL 87%

Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach

在大语言模型中的确定性引导推理:一种动态思维预算方法

João Paulo Nogueira, Wentao Sun, Alonso Silva, Laith Zumot

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 CGR通过动态调整推理预算,在保持准确性的同时减少token使用,通过确定性评估实现高效的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10350 2026-02-02 cs.LG cs.AI 87%

Geometric Dynamics of Agentic Loops in Large Language Models

大语言模型中代理循环的几何动力学

Nicolas Tacheny

机构 * University of Mons(蒙斯大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大语言模型中代理循环的动力学特性,通过几何方法分类其收缩、振荡或探索行为,并展示提示设计对动力学模式的控制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05019 2026-01-09 cs.CL cs.AI q-bio.NC 87%

Hán Dān Xué Bù (Mimicry) or Qīng Chū Yú Lán (Mastery)? A Cognitive Perspective on Reasoning Distillation in Large Language Models

模仿(Mimicry)还是精通(Mastery)?从认知视角看大语言模型中的推理蒸馏

Yueqing Hu, Xinyang Peng, Shuting Peng, Hanqi Wang, Tianhong Wang

机构 * School of Philosophy, Anhui University(安徽大学哲学学院) Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) Faculty of Education, University of Cambridge(剑桥大学教育学院) School of Foreign Studies, South China Normal University(华南师范大学外语学院) Division of Psychology and Language Sciences, University College London(伦敦大学学院心理学与语言科学系)

专题命中 推理与问题求解 :large language model(title);language model(title);SFT(abstract);分类 cs.CL、cs.AI

AI总结 从认知视角研究大语言模型推理蒸馏,发现其导致功能对齐崩溃,揭示人类样样的认知是主动强化的涌现属性而非被动模仿。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05434 2026-01-06 cs.CL cs.AI 87%

LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models

LTLBench: 为评估大语言模型中的时间推理能力而设计的基准测试

Weizhi Tang, Kwabena Nuamah, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 LTLBench通过线性时序逻辑评估大语言模型的时间推理能力,构建包含2000个挑战的数据集并测试12个模型,揭示时间推理中的主要问题及复杂性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20586 2025-12-24 cs.AI cs.CL cs.HC 87%

Automated stereotactic radiosurgery planning using a human-in-the-loop reasoning large language model agent

利用人类在回路的推理大型语言模型代理进行自动化立体定向放射手术计划

Humza Nusrat, Luke Francisco, Bing Luo, Hassan Bagher-Ebadian, Joshua Kim, Karen Chin-Snyder, Salim Siddiqui, Mira Shah, Eric Mellon, Mohammad Ghassemi, Anthony Doemer, Benjamin Movsas, Kundan Thind

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用人类在回路的推理大型语言模型代理进行自动化立体定向放射手术计划,通过对比推理模型与非推理模型,展示了推理模型在剂量优化和计划行为上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13063 2025-12-16 cs.CL cs.AI 87%

LLM Rationalis? Measuring Bargaining Capabilities of AI Negotiators

LLM Rationalis? 测量AI谈判者的协商能力

Cheril Shah, Akshit Agarwal, Kanak Garg, Mourad Heddaya

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文研究了AI谈判者的协商能力,发现LLMs在谈判中系统性地锚定在极端位置,缺乏策略多样性,且协商能力不随模型改进而提升。

Comments Published in the First Workshop on Multi-Turn Interactions in Large Language Models at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02390 2025-11-14 cs.CL cs.AI 87%

CoAT: Chain-of-Associated-Thoughts Framework for Enhancing Large Language Models Reasoning

Jianfeng Pan, Senyou Deng, Shaomang Huang

机构 * Security Technology Inc.(360安全技术公司)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 10 figures, Accepted by EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00079 2025-11-06 cs.CL cs.AI 87%

PhysicsEval: Inference-Time Techniques to Improve the Reasoning Proficiency of Large Language Models on Physics Problems

Oshayer Siddique, J. M Areeb Uzair Alam, Md Jobayer Rahman Rafy, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted in Findings of the Association for Computational Linguistics: IJCNLP-AACL 2025, 23 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18032 2025-11-04 cs.AI cs.CL cs.MA 87%

GraphTeam: Facilitating Large Language Model-based Graph Analysis via Multi-Agent Collaboration

Xin Li, Qizhi Chu, Yubin Chen, Yang Liu, Yaoqi Liu, Zekai Yu, Weize Chen, Chen Qian, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24405 2025-09-30 cs.CL cs.AI cs.DB cs.ET cs.IR 87%

Multilingual Text-to-SQL: Benchmarking the Limits of Language Models with Collaborative Language Agents

Khanh Trinh Pham, Thu Huong Nguyen, Jun Jo, Quoc Viet Hung Nguyen, Thanh Tam Nguyen

机构 * Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :language agent(title,abstract);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12734 2025-09-24 cs.CL cs.AI 87%

Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge

Yongrui Chen, Junhao He, Linbo Fu, Shenyu Zhang, Rihui Jin, Xinbang Dai, Jiaqi Li, Dehai Min, Nan Hu, Yuxin Zhang, Guilin Qi, Yi Huang, Tongtong Wu

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments New version is arXiv:2508.17905

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11881 2025-08-11 cs.AI cs.CL 87%

Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models

Hyunwoo Kim, Melanie Sclar, Tan Zhi-Xuan, Lance Ying, Sydney Levine, Yang Liu, Joshua B. Tenenbaum, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) MIT(麻省理工学院) Harvard University(哈佛大学) Amazon(亚马逊公司) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments COLM 2025. For code and data, see https://hyunw.kim/thought-tracing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04196 2025-08-07 cs.CL cs.AI cs.CR 87%

Eliciting and Analyzing Emergent Misalignment in State-of-the-Art Large Language Models

Siddhant Panpatil, Hiskias Dingeto, Haon Park

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00574 2025-08-04 cs.CL cs.AI 87%

SynAdapt: Learning Adaptive Reasoning in Large Language Models via Synthetic Continuous Chain-of-Thought

Jianwei Wang, Ziming Wu, Fuming Lai, Shaobing Lian, Ziqian Zeng

机构 * Tencent Inc.(腾讯公司)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23382 2025-08-01 cs.CL cs.AI cs.CV 87%

MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models

Yiyan Ji, Haoran Chen, Qiguang Chen, Chengyue Wu, Libo Qin, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Central South University(中南大学)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03726 2025-07-08 cs.AI cs.CL cs.IR 87%

Agent-Based Detection and Resolution of Incompleteness and Ambiguity in Interactions with Large Language Models

Riya Naik, Ashwin Srinivasan, Swati Agarwal, Estrid He

机构 * BITS Pilani, K K Birla Goa Campus(比特学院,KK Birla Goa校区) PandaByte Innovations Pvt Ltd(PandaByte创新私人有限公司) RMIT University(皇家墨尔本理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 14 pages. arXiv admin note: text overlap with arXiv:2503.17936

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13811 2025-06-18 cs.MA cs.AI cs.CL 87%

Investigating the Potential of Large Language Model-Based Router Multi-Agent Architectures for Foundation Design Automation: A Task Classification and Expert Selection Study

Sompote Youwai, David Phim, Vianne Gayl Murcia, Rianne Clair Onas

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04149 2025-06-05 cs.SE cs.AI cs.CL 87%

Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination

Simin Chen, Pranav Pusarla, Baishakhi Ray

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments This paper is accepted to ICML 2025. Website: https://codekaleidoscope.github.io/dycodeeval.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24864 2025-06-02 cs.CL cs.AI 87%

ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models

Mingjie Liu, Shizhe Diao, Ximing Lu, Jian Hu, Xin Dong, Yejin Choi, Jan Kautz, Yi Dong

机构 * NVIDIA

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16450 2025-03-12 cs.LG cs.AI cs.PL 87%

Synthesizing Programmatic Reinforcement Learning Policies with Large Language Model Guided Search

Max Liu, Chan-Hung Yu, Wei-Hsu Lee, Cheng-Wei Hung, Yen-Chun Chen, Shao-Hua Sun

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09682 2025-02-25 cs.CL cs.AI 87%

MacGyver: Are Large Language Models Creative Problem Solvers?

Yufei Tian, Abhilasha Ravichander, Lianhui Qin, Ronan Le Bras, Raja Marjieh, Nanyun Peng, Yejin Choi, Thomas L. Griffiths, Faeze Brahman

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09775 2025-01-28 cs.CL cs.AI 87%

Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident Even When They Are Wrong

Tairan Fu, Javier Conde, Gonzalo Martínez, María Grandury, Pedro Reviriego

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00254 2025-01-03 cs.AI cs.CL 87%

Automatically Planning Optimal Parallel Strategy for Large Language Models

Zongbiao Li, Xiezhao Li, Yinghao Cui, Yijun Chen, Zhixuan Gu, Yuxuan Liu, Wenbo Zhu, Fei Jia, Ke Liu, Qifeng Li, Junyao Zhan, Jiangtao Zhou, Chenxi Zhang, Qike Liu

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15314 2024-12-23 cs.CL cs.AI 87%

Eliciting Causal Abilities in Large Language Models for Reasoning Tasks

Yajing Wang, Zongwei Luo, Jingzhe Wang, Zhanke Zhou, Yongqiang Chen, Bo Han

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏