arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18788 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18788 篇

2605.15053 2026-05-18 cs.LG cs.AI 90%

TFGN: Task-Free, Replay-Free Continual Pre-Training Without Catastrophic Forgetting at LLM Scale

TFGN:无需任务和回放的连续预训练,避免灾难性遗忘的LLM规模

Anurup Ganguli

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 TFGN通过输入条件化、参数高效更新,在无需回放或任务标签的情况下,实现了在异构文本领域连续预训练,避免灾难性遗忘,展示了跨领域正向迁移和高梯度分离。

Comments 65 pages, 10 figures, 40 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14937 2026-05-12 cs.LG cs.CL 90%

LLM as Graph Kernel: Rethinking Message Passing on Text-Rich Graphs

LLM作为图核:重新思考文本丰富图上的消息传递

Ying Zhang, Hang Yu, Haipeng Zhang, Peng Di

机构 * Ant Group(蚂蚁集团) ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出RAMP方法,将LLM作为图原生聚合算子,通过双表示方案实现文本丰富图的高效推理,解决传统方法信息瓶颈问题,提升图传播与深度文本推理的结合性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11198 2026-05-12 cs.CL cs.AI 90%

Temperature and Persona Shape LLM Agent Consensus With Minimal Accuracy Gains in Qualitative Coding

温度与人设塑造LLM代理共识:在定性编码中获得最小的准确性提升

Conrad Borchers, Bahar Shahrokhian, Francesco Balzan, Elham Tajik, Sreecharan Sankaranarayanan, Sebastian Simon

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多代理系统中温度与人设对共识构建和编码准确性的影响,发现多人设延迟共识但未显著提升准确性,单代理表现更优。

Comments Accepted as full paper to the 19th International Conference on Educational Data Mining (EDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26326 2026-05-12 cs.LG cs.CL stat.ML 90%

Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control

通过精确熵曲线控制解决LLM RL中的性能饱和问题

Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Entrocraft方法,通过偏差优势分布实现用户定制的熵调度,解决LLM RL中的性能饱和问题,提升泛化能力、输出多样性及长期训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 90%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08326 2026-05-12 cs.LG cs.AI 90%

LLM Advertisement based on Neuron Auctions

基于神经拍卖的大型语言模型广告

Peiran Yun, Wenxin Xu, Jiayuan Liu, Yihang Zhang, Liang Zeng, Lingkai Kong, Tonghan Wang

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。

Comments 17 pages, 9 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05737 2026-05-08 cs.AI cs.CL 90%

ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning

ReFlect:一种有效的复杂长周期LLM推理Harness系统

Fan Huang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 ReFlect通过创建确定性封装逻辑,有效检测和恢复LLM推理中的错误,提升多阶段任务的成功率,尤其在SWE-bench中显著提高代码补全质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 90%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11480 2026-04-28 cs.LG cs.AI 90%

LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment

LearnAlign: 用于改进梯度对齐的LLM强化学习数据选择

Shipeng Li, Zhiqin Yang, Shikun Li, Xiaobo Xia, Hengyu Liu, Xinghua Zhang, Gaode Chen, Dong Fang, Ying Tai, Zhe Peng

机构 * Nanjing University(南京大学) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 LearnAlign通过改进梯度对齐方法,智能选择训练数据以提升LLM推理能力,减少训练数据需求且性能表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL 90%

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22977 2026-04-20 cs.LG cs.AI 90%

The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination

推理陷阱:增强大语言模型推理能力如何放大工具幻觉

Chenlong Yin, Zeyang Sha, Shiwen Cui, Changhua Meng, Zechao Li

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Nanjing University of Science and Technology(南京理工大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16260 2025-04-22 cs.LG cs.CL 90%

Unraveling Arithmetic in Large Language Models: The Role of Algebraic Structures

Fu-Chieh Chang, You-Chen Lin, Pei-Yuan Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Journal ref ICLR 2025 Workshop on Reasoning and Planning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19622 2025-03-06 cs.CL cs.AI 90%

Weaker LLMs' Opinions Also Matter: Mixture of Opinions Enhances LLM's Mathematical Reasoning

Yanan Chen, Ali Pesaranghader, Tanmana Sadhu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 12 pages, 1 figure, 3 tables, 4 prompt/data templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08029 2024-07-12 cs.LG cs.CL 90%

A Critical Review of Causal Reasoning Benchmarks for Large Language Models

Linying Yang, Vik Shirvaikar, Oscar Clivio, Fabian Falck

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments AAAI 2024 Workshop on ''Are Large Language Models Simply Causal Parrots?''

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03414 2024-04-05 cs.CL cs.AI 90%

Can Small Language Models Help Large Language Models Reason Better?: LM-Guided Chain-of-Thought

Jooyoung Lee, Fan Yang, Thanh Tran, Qian Hu, Emre Barut, Kai-Wei Chang, Chengwei Su

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);small language model(title);分类 cs.CL、cs.AI

Comments This paper is accepted to LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10625 2023-04-18 cs.AI cs.CL 90%

Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Denny Zhou, Nathanael Schärli, Le Hou, Jason Wei, Nathan Scales, Xuezhi Wang, Dale Schuurmans, Claire Cui, Olivier Bousquet, Quoc Le, Ed Chi

专题命中 推理与问题求解 :prompting(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

Comments ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 90%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22082 2026-07-27 cs.MA 新提交 90%

When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

当语言模型遇上神经图谱:探索用于脑网络分析的增强型智能语言模型框架

Jiaxing Li, Rui Dong, Muyao Tang, Youyong Kong

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 研究针对脑网络分析中现有方法解释性有限等问题,提出BrainAgent智能语言模型框架,将连接组分类设为迭代过程,经特定工具转换、知识检索等步骤生成结构化预测,实验证明其优于基线,为脑网络分析提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03633 2026-07-15 cs.CL cs.AI cs.LG 90%

Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models

探索BERT和GPT类大语言模型中的反向诅咒及其他演绎逻辑推理

Da Wu, Jingye Yang, Kai Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现BERT对反向诅咒免疫,而GPT在处理多集合逻辑推理时存在困难,揭示了两种模型在简单与复杂逻辑推理中的差异。

Comments Final revision. To appear in Patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00260 2026-07-03 eess.AS 新提交 90%

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

多模态大语言模型是否需要推理来从语音中分类痴呆症?

Liming Wang, Neguine Rezaii, Bradford C. Dickerson, James Glass

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 90%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04788 2026-06-26 cs.SE 版本更新 90%

Adaptive Intellect Unleashed: The Feasibility of Knowledge Transfer in Large Language Models

自适应智能释放:大型语言模型中知识迁移的可行性

Qing Huang, Yishun Wu, Zhenchang Xing, He Jiang, Yu Cheng, Huan Jin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 通过知识迁移提升大型语言模型在软件工程任务中的泛化能力,实验发现迁移跨度、策略和架构是关键因素,层次策略优于直接迁移,AI-Chain优于CoT。

Comments The paper is withdrawn for further clarification of the alignment between the proposed knowledge transfer framework and its implementation, and for refinement of the transfer span definition and experimental evaluation design

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 90%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05228 2026-06-05 cs.SE cs.PL 90%

Where Do Large Language Models Fail on Competitive Programming? A Taxonomy of Failures by Algorithm Type and Difficulty Rating

大型语言模型在竞赛编程中哪里失败?基于算法类型和难度评级的失败分类

Ayush Kumar Jha, Shalini Jha

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 通过系统实证研究,发现链式思维推理会显著降低GPT-4o的通过率并增加Claude的编译错误,且错误答案主导了两种模型的失败模式。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01558 2026-06-02 cs.CV 90%

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning

注意力引导的多模态大语言模型微调提升思维链推理能力

Sanchit Sinha, Guangzhi Xiong, Bohan Liu, Zhenghao He, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);prompting(abstract)

AI总结 针对多模态大语言模型中思维链推理效果不佳的问题,提出注意力引导的微调目标Attentive-CoT,通过延迟答案承诺和维持视觉令牌访问来提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26414 2026-05-27 cs.AI cs.CL cs.LG 90%

Reasoning, Code, or Both? How Large Language Models Handle Variations in Math Questions

推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化

Matthew Kutakh

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过对比链式思维推理、单次代码执行和迭代代码执行三种方法在GSM-Symbolic数据集上的表现,发现代码执行并未提升大型语言模型在数学问题变体上的推理鲁棒性。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24619 2026-05-26 cs.SE 90%

Synthesizing Inductive Invariants for Distributed Protocols via IC3 and Large Language Models

通过IC3和大语言模型综合分布式协议的归纳不变量

Weining Cao, Guangyuan Wu, Yuan Yao, Hengfeng Wei, Taolue Chen, Xiaoxing Ma

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出IC3Syn框架,结合符号IC3控制器和大语言模型,自动综合分布式协议的归纳不变量,无需逻辑限制或人工模板,在29个协议上验证了有效性。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22870 2026-05-25 cs.LG cs.AI cs.CL 90%

The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models

读出捷径:位置数字复制主导小语言模型中的算术思维链读出

Ming Liu

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过前缀补全实验,发现小语言模型在算术思维链中主要依赖位置捷径(复制答案分隔符前的最后一个数字),而非逻辑推理,并分析了不同模型的行为差异。

Comments 18 pages (8 main + 10 appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21821 2026-05-22 cs.CR 90%

A Large Language Model Approach to Generating Bypass Rules for Malware Evasion in Analysis Sandbox

利用大型语言模型生成恶意软件规避规则以应对分析沙箱中的规避行为

Zhiyong Sui, Lamine Noureddine, Mst Eshita Khatun, Sideeq Bello, Justin Woodring, Aisha Ali-Gombe

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出了一种基于大型语言模型的方法,用于自动生成绕过沙箱环境中的恶意软件规避检查的YARA规则,通过分析恶意软件的执行轨迹并采用多种推理策略生成针对性的绕过规则,最终在多个真实恶意软件样本上实现了79%的绕过成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 90%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏