arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18731 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18731 篇

2512.10110 2026-01-19 cs.CL cs.HC 91%

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06859 2025-12-09 cs.AI 91%

JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models

JT-DA:利用工具集成的表格推理大语言模型提升数据分析

Ce Chi, Xing Wang, Zhendong Wang, Xiaofan Liu, Ce Li, Zhiyan Song, Chen Zhao, Kexin Yang, Boshen Shi, Jingjing Yang, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile, Beijing, China(钧天研究,中国移动,北京)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 JT-DA-8B通过工具集成的表格推理方法,提升复杂表格分析任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09170 2025-08-08 cs.CL 91%

Distilling Reasoning Ability from Large Language Models with Adaptive Thinking

Xiaoshu Chen, Sihang Zhou, Ke Liang, Xinwang Liu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments This work has been accepted by IEEE for publication. Early access in IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12393 2024-09-20 cs.CL 91%

Small Language Models are Equation Reasoners

Bumjun Kim, Kunha Lee, Juyeon Kim, Sangam Lee

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08735 2024-07-12 cs.RO cs.AI cs.SY eess.SY 91%

Real-Time Anomaly Detection and Reactive Planning with Large Language Models

Rohan Sinha, Amine Elhafsi, Christopher Agia, Matthew Foutter, Edward Schmerling, Marco Pavone

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Accepted to Robotics: Science and Systems (RSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04384 2025-02-10 cs.CL cs.AI cs.LG cs.SY eess.SY 91%

Enhancing Reasoning to Adapt Large Language Models for Domain-Specific Applications

Bo Wen, Xin Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract,comments);LLM(abstract)

Comments NeurIPS 2024 Workshop AFM (Adaptive Foundation Models: Evolving AI for Personalized and Efficient Learning)

Journal ref https://neurips.cc/virtual/2024/104981

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 91%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00515 2026-08-04 cs.CR cs.AI cs.CL 新提交 91%

Auditable Release Control for Pedagogical Leakage in LLM Tutors

LLM辅导器中教学式泄露的可审计发布控制

Nizam Kadir

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。

Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21083 2026-06-23 cs.AI cs.LG 新提交 91%

Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

承诺下的一致性:探究LLM逻辑推理中的泛化与空洞记忆

Noor Islam S. Mohammad, Mahmudul Hasan

机构 * Department of Computer Science, Informatics Institute, Istanbul Technical University(伊斯坦布尔技术大学信息学研究所计算机科学系) School of Information Technology, Deakin University(迪肯大学信息技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出双查询评估范式CUC,联合测量一致性与决断力,揭示LLM通过系统性弃权实现空洞一致性的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07078 2026-06-23 cs.LG cs.AI 版本更新 91%

The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

最优Token基线:长程LLM-RL的方差缩减

Yingru Li, Jiawei Xu, Ziniu Li, Jiacai Liu, Wei Liu, Yuxuan Tong, Longtao Zheng, Zhenghai Xue, Yaxiang Zhang, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对长程LLM-RL训练中梯度方差爆炸问题,从第一性原理推导最优Token基线,提出仅用前向概率近似梯度范数的Logit-Gradient Proxy,以N=4分组达到N=32性能,减少65%以上Token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00510 2026-06-19 cs.AI cs.LG cs.SE 版本更新 91%

PCBSchemaGen: Reward-Guided LLM Code Synthesis for Printed Circuit Boards (PCB) Schematic Design with Structured Verification

PCBSchemaGen: 奖励引导的LLM代码合成用于印刷电路板(PCB)原理图设计及结构化验证

Huanghaohe Zou, Peng Han, Emad Nazerian, Mafu Zhang, Zhicheng Guo, Alex Q. Huang

机构 * Semiconductor Power Electronics Center (SPEC)(半导体功率电子中心) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出PCBSchemaGen框架,通过结构化验证器引导冻结的LLM生成可修复的PCB原理图,在无单元测试的领域实现高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29025 2026-06-10 cs.CL cs.AI 版本更新 91%

The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoning

模型说走:表面启发式如何覆盖LLM推理中的隐式约束

Yubo Li, Lu Zhang, Tianchong Jiang, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM在表面线索与隐式约束冲突时的失败,提出启发式覆盖基准(HOB),通过因果行为分析揭示距离线索影响远大于目标,并验证目标分解提示可部分恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29027 2026-05-29 cs.AI cs.CL cs.HC 91%

Mind Your Tone: Does Tone Alter LLM Performance?

注意你的语气:语气会改变LLM的性能吗?

Om Dobariya, Akhil Kumar

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究提示语气变化如何影响大语言模型在客观选择题上的准确性,发现语气效应系统但高度依赖模型,并提出了解释语气如何调节内部推理模式的路由框架。

Comments 10 pages, 6 tables, 1 figure. Accepted as a full paper at the Thirty-second Americas Conference on Information Systems (AMCIS 2026), Reno. Follow-up to arXiv:2510.04950

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22263 2026-05-22 cs.LG cs.AI 91%

Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

按能力定制教学:方向自适应自蒸馏用于LLM推理

Hongbin Zhang, Chaozheng Wang, Kehai Chen, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算智能研究所,哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Keeta AI, Meituan(Keeta AI,美团)

专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出方向自适应自蒸馏(DASD),通过熵引导的定向监督改进LLM推理,通过分析发现统一的教师监督导致探索被压制,DASD在六个数学推理基准中取得最佳表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 91%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI 91%

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12227 2026-04-15 cs.AI cs.CL 91%

Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams

设计可靠的LLM辅助评分系统用于构造响应:来自物理考试的证据

Xiuxiu Tang, G. Alex Ambrose, Ying Cheng

机构 * Department of Psychology, University of Notre Dame(诺特大学心理学系) Notre Dame Learning, University of Notre Dame(诺特大学学习中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了GPT-4o在物理考试构造响应评分中的可靠性,发现细粒度检查清单式评分优于整体评分,提示清晰的评分标准对AI辅助评分至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05850 2026-02-24 cs.CL cs.AI 91%

Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models

跨语言崩溃:语言中心化基础模型如何塑造大语言模型的推理

Cheonbok Park, Jeonghoon Kim, Joosung Lee, Sanghwan Bae, Jaegul Choo, Kang Min Yoo

机构 * NAVER Cloud(NAVER云) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(title);分类 cs.CL、cs.AI

AI总结 该研究探讨了多语言模型在长链思考中因语言中心化先验导致的推理能力下降问题,并提出通过语言一致性奖励等方法缓解这一现象。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10080 2025-12-12 cs.CL cs.AI 91%

What Kind of Reasoning (if any) is an LLM actually doing? On the Stochastic Nature and Abductive Appearance of Large Language Models

LLM 实际上在进行何种推理(如果有的话)?关于大语言模型的随机性质及其类比于人类假设推理的性质

Luciano Floridi, Jessica Morley, Claudio Novelli, David Watson

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型的推理机制,指出其生成文本基于学习模式而非真实推理,且其看似假设推理的特性源于训练数据,而非实际推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21683 2025-04-02 cs.AI cs.CL 91%

LLM-Gomoku: A Large Language Model-Based System for Strategic Gomoku with Self-Play and Reinforcement Learning

Hui Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11207 2023-10-18 cs.CL cs.LG 91%

Can Large Language Models Explain Themselves? A Study of LLM-Generated Self-Explanations

Shiyuan Huang, Siddarth Mamidanna, Shreedhar Jangam, Yilun Zhou, Leilani H. Gilpin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07605 2026-07-09 cs.CY 新提交 91%

User identity conditions moral wrongness ratings in non-reasoning large language models

用户身份影响非推理大语言模型的道德错误评级

Willem Fourie, Isabel Ray, Gray Manicom

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究通过行为自下而上方法,评估两个非推理大语言模型,发现用户身份影响其道德错误评级,严重伤害行为有上限效应,有争议规则行为有角色条件性变化,为人工智能价值对齐讨论提出问题并助力重构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11500 2026-07-07 cs.CR 版本更新 91%

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

ARMOR:通过精细推理对齐安全的大语言模型

Zhengyue Zhao, Yingzi Ma, Somesh Jha, Marco Pavone, Patrick McDaniel, Chaowei Xiao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 研究大语言模型安全问题,针对现有方法不足,提出ARMOR,通过三步推理管道提取核心恶意意图并验证,开发ARMOR-Think提升性能,在防御越狱攻击上效果显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00225 2026-06-08 cs.LG cs.AI cs.CL 版本更新 91%

Should You Use Your Large Language Model to Explore or Exploit?

你应该使用你的大语言模型进行探索还是利用?

Keegan Harris, Aleksandrs Slivkins

机构 * UC Berkeley(伯克利大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25296 2026-05-26 cs.HC 91%

Subjective Code Preferences in Experts and Large Language Models

专家与大型语言模型中的主观代码偏好

Anna Mokhova, Subhabrata Dutta, Iryna Gurevych, Simone Balloccu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 通过收集约3000对Python代码片段并由73位专家评分,研究LLM在四个主观偏好轴(复杂度、注释、模块化、可读性)上的表现,发现模型在自然语言与代码评估中存在不一致,且表现出位置偏差和极化评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20369 2026-05-21 cs.CL cs.AI cs.LG 91%

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

DEL:用于大语言模型数值学习的数字熵损失

Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Digit Entropy Loss (DEL)用于大语言模型的自回归数值学习,通过重新设计传统无监督熵优化,引入数字条件概率和二元交叉熵,使熵优化转向监督方式,同时推广整数基于的数值学习到浮点数优化,从而提升数值预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03332 2026-04-20 cs.CL cs.AI cs.LG 91%

Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations

脆弱的思考:大型语言模型如何处理推理链扰动

Ashwath Vaithinathan Aravindan, Mayank Kejriwal

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大型语言模型在推理链扰动下的鲁棒性,通过五种扰动类型评估13种模型,发现不同扰动对模型的影响各异,模型规模在某些扰动中起到保护作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17995 2026-04-15 cs.CL cs.AI cs.LG 91%

Variation in Verification: Understanding Verification Dynamics in Large Language Models

验证的多样性:理解大型语言模型中的验证动态

Yefan Zhou, Austin Xu, Yilun Zhou, Janvijay Singh, Jiang Gui, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) Dartmouth College(达特茅斯学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大型语言模型中验证动态,分析问题难度、生成器能力及验证器生成能力三个维度,发现验证有效性与问题难度相关,优化TTS应用中的基本验证策略。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02842 2026-02-04 cs.AI cs.CL cs.LG 91%

Chain of Simulation: A Dual-Mode Reasoning Framework for Large Language Models with Dynamic Problem Routing

模拟链:一种用于大语言模型的双模式推理框架,具有动态问题路由

Saeid Sheikhi

机构 * Faculty of Information Technology(信息科技学院) Electrical Engineering University of Oulu, Oulu, Finland, 90014(奥卢大学电气工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 CoS是一种双模式推理框架,通过动态问题路由提升大语言模型的推理能力,实现更高效的准确性和效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12495 2025-11-13 cs.CL cs.AI cs.LG 91%

Mitigating Hallucinations in Large Language Models via Causal Reasoning

Yuangang Li, Yiqing Shen, Yi Nian, Jiechao Gao, Ziyi Wang, Chenxiao Yu, Shawn Li, Jie Wang, Xiyang Hu, Yue Zhao

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏