arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18810 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18810 篇

2606.26698 2026-06-26 cs.CL cs.AI 新提交 89%

Beyond Logical Forms: LLM-Extracted Patterns for Fallacy Classification

超越逻辑形式:LLM提取的谬误分类模式

Eleni Papadopulos, Firoj Alam, Giovanni Da San Martino

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13125 2026-06-12 cs.LG cs.AI 新提交 89%

Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

选择与改进:理解推理后训练的机制

Akshay Krishnamurthy, Audrey Huang, Nived Rajaraman

机构 * Microsoft Research NYC(微软研究院纽约) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07548 2026-06-09 cs.IR cs.AI cs.CL 新提交 89%

Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA

评估 Gemini Flash 上的高级提示工程用于多跳生物医学问答

Ahmed Bajaber, Mohammed Alliheedi

机构 * Saudi Med AI Lab (SMAIL)(沙特医学人工智能实验室(SMAIL)) Prince Sultan University(普森国王大学) Al-Baha University(阿勒巴哈大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本研究通过设计多组件提示(角色扮演、多步思维链示例和格式规则),在 Gemini 2.0 Flash 上实现概念级得分0.720,显著优于基线0.565,并接近下一代模型性能,证明高级提示设计对释放LLM推理能力至关重要。

Comments 8 pages, proceedings of the BioCreative IX Challenge and Workshop (BC9) at IJCAI 2025

Journal ref Proc. BioCreative IX Workshop (BC9), IJCAI 2025, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24171 2026-05-26 cs.LG cs.AI 89%

PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection

PromptAudit: 审计基于LLM的漏洞检测中的提示敏感性

Steffen J. Camarato, Yahya Hmaiti, Mandana Ghadamian, David Mohaisen

机构 * University of Central Florida(佛罗里达大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出PromptAudit框架,通过固定数据集、解码和解析仅变化提示策略,评估五种提示策略在五个开源模型上对1000个CVE(6074个代码样本,16种编程语言)的漏洞检测性能,发现标准思维链提示整体性能最佳,而提示敏感性是系统的一级属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08028 2026-05-21 cs.CL cs.AI 89%

Diverge to Induce Prompting: Multi-Rationale Induction for Zero-Shot Reasoning

偏离以诱导提示:多理性诱导用于零样本推理

Po-Chun Chen, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) Institute of Information Science, Academia Sinica, Taiwan(学术院信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出DIP框架,通过生成多个多样化的高层理由并诱导最终计划,以提升零样本推理的准确性,克服了传统链式思考提示中推理路径不稳定的问题。

Comments Accepted to Findings of IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20410 2026-05-21 cs.CL cs.AI 89%

Mechanics of Bias and Reasoning: Interpreting the Impact of Chain-of-Thought Prompting on Gender Bias in LLMs

偏见与推理的力学:分析链式推理提示对大语言模型中性别偏见的影响

Edie Pearman, Sophia Osborne, Mira Kandlikar-Bloch, Mina Arzaghi, Florian Carichon, Golnoosh Farnadi

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) HEC Montreal(蒙特利尔HEC)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了链式推理提示对大语言模型中性别偏见的影响,结合基准测试评估与机制可解释性技术,发现链式推理并未有效减少偏见,偏见仍存在于隐藏表示中。

Comments 24 pages, 6 figures, including appendix. Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04265 2026-05-15 cs.LG cs.AI 89%

Boosting LLM Reasoning via Human-Inspired Reward Shaping

通过人类启发的奖励塑造提升大语言模型推理能力

Wenze Lin, Zhen Yang, Xitai Jiang, Xiaoteng Ma, Gao Huang

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Mind Lab

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL 89%

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10377 2026-04-27 cs.LG cs.AI stat.ME 89%

Causal Concept Graphs in LLM Latent Space for Stepwise Reasoning

在LLM潜在空间中使用因果概念图进行分步推理

Md Muntaqim Meherab, Noor Islam S. Mohammad, Faiza Feroz

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果概念图(CCG),通过结合任务条件稀疏自编码器和可微结构学习方法,在LLM潜在空间中建模概念间的因果依赖关系,提升了多步推理的效果。

Comments We have recently encountered author conflicts related to this work and therefore respectfully request the withdrawal of this paper. We believe this step is necessary to address the situation appropriately and maintain academic integrity in the submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01925 2026-04-09 cs.CL cs.AI 89%

Rectifying LLM Thought from Lens of Optimization

从优化角度纠正大语言模型的思维

Junnan Liu, Hongwei Liu, Songyang Zhang, Kai Chen

机构 * Monash University(莫纳什大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过优化视角分析LLM推理过程,提出RePro方法改进推理性能,减少过度思考等亚优行为。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 89%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06717 2026-02-12 cs.LG cs.AI 89%

Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models

通过在大型语言模型上积累知识来精通图神经网络设计

Jialiang Wang, Hanmo Liu, Shimin Di, Zhili Wang, Jiachuan Wang, Lei Chen, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Southeast University(东南大学) HoHuawei Hong Kong Research Center (HKRC)(华为香港研究中心) University of Tsukuba(筑波大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 DesiGNN通过在大型语言模型上积累知识,提升图神经网络设计的自动化水平,实现高效精准的模型生成。

Comments Accepted at WSDM 2026. Title changed from "Computation-friendly graph neural network design by accumulating knowledge on large language models" to "Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models"

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07877 2026-01-14 cs.LG cs.AI 89%

E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis

E²-LLM:连接神经信号与可解释的情感分析

Fei Ma, Han Lin, Yifan Xie, Hongwei Ren, Xiaoyu Shen, Wenbo Ding, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所) Huawei(华为)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 E²-LLM通过整合预训练EEG编码器与Qwen-based LLM,实现了可解释的情绪分析,展示了模型扩展在情感识别和可解释性上的优势。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09897 2025-12-11 cs.AI cs.CL 89%

SCOPE: Language Models as One-Time Teacher for Hierarchical Planning in Text Environments

SCOPE:语言模型作为一次性教师用于文本环境中的分层规划

Haoye Lu, Pavan Seshadri, Kaheer Suleman

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 SCOPE通过一次性利用LLM生成的子目标预训练轻量级模型,实现高效文本环境分层规划,比ADaPT方法在成功率和推理效率上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08098 2025-11-12 cs.RO cs.AI cs.CL cs.HC 89%

PerspAct: Enhancing LLM Situated Collaboration Skills through Perspective Taking and Active Vision

Sabrina Patania, Luca Annese, Anita Pellegrini, Silvia Serino, Anna Lambiase, Luca Pallonetto, Silvia Rossi, Simone Colombani, Tom Foulsham, Azzurra Ruggeri, Dimitri Ognibene

机构 * University of Milan-Bicocca(米兰-比科卡大学) University of Naples Federico II(那不勒斯费德里科二世大学) Oversonic Robotics(Oversonic机器人公司) University of Essex(埃塞克斯大学) TUM School of Social Sciences and Technology(慕尼黑技术大学社会科学与技术学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at IAS19

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09211 2025-10-21 cs.CL cs.AI 89%

DICE: Structured Reasoning in LLMs through SLM-Guided Chain-of-Thought Correction

Yiqi Li, Yusheng Liao, Zhe Chen, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :SLM(title);LLM(abstract);large language model(abstract);language model(abstract)

Comments This paper was accepted to the EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17486 2025-10-08 cs.RO cs.AI cs.LG 89%

Distilling On-device Language Models for Robot Planning with Minimal Human Intervention

Zachary Ravichandran, Ignacio Hounie, Fernando Cladera, Alejandro Ribeiro, George J. Pappas, Vijay Kumar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

Comments Accepted to the Conference on Robot Learning (CoRL) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14363 2025-07-08 cs.LG cs.CL 89%

Improving RL Exploration for LLM Reasoning through Retrospective Replay

Shihan Dou, Muling Wu, Jingwen Xu, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University, Shanghai, China(复旦大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17219 2025-06-26 cs.LG cs.AI 89%

No Free Lunch: Rethinking Internal Feedback for LLM Reasoning

Yanzhi Zhang, Zhaoxi Zhang, Haoxiang Guan, Yilin Cheng, Yitong Duan, Chen Wang, Yue Wang, Shuxin Zheng, Jiyan He

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02302 2025-06-04 cs.CL cs.AI 89%

Explain-then-Process: Using Grammar Prompting to Enhance Grammatical Acceptability Judgments

Russell Scheinberg, Ameeta Agrawal, Amber Shore, So Young Lee

机构 * Portland State University(波特兰州立大学) Miami University(迈阿密大学)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17553 2025-03-25 physics.med-ph cs.AI cs.CL cs.ET cs.HC 89%

Autonomous Radiotherapy Treatment Planning Using DOLA: A Privacy-Preserving, LLM-Based Optimization Agent

Humza Nusrat, Bing Luo, Ryan Hall, Joshua Kim, Hassan Bagher-Ebadian, Anthony Doemer, Benjamin Movsas, Kundan Thind

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 19 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14002 2025-03-25 cs.CL cs.AI 89%

Advancing Mathematical Reasoning in Language Models: The Impact of Problem-Solving Data, Data Synthesis Methods, and Training Stages

Zui Chen, Tianqiao Liu, Mi Tian, Qing Tong, Weiqi Luo, Zitao Liu

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16061 2025-02-06 cs.LG cs.CL 89%

PORT: Preference Optimization on Reasoning Traces

Salem Lahlou, Abdalgader Abubaker, Hakim Hacid

专题命中 推理与问题求解 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16964 2024-12-25 cs.AI cs.CL 89%

System-2 Mathematical Reasoning via Enriched Instruction Tuning

Huanqia Cai, Yijun Yang, Zhifeng Li

专题命中 推理与问题求解 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06613 2024-07-23 cs.CL cs.AI 89%

GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents

Anthony Costarelli, Mat Allen, Roman Hauksson, Grace Sodunke, Suhas Hariharan, Carlson Cheng, Wenjie Li, Joshua Clymer, Arjun Yadav

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11804 2024-06-21 cs.AI cs.CL cs.SI 89%

LLM as Prompter: Low-resource Inductive Reasoning on Arbitrary Knowledge Graphs

Kai Wang, Yuwei Xu, Zhiyong Wu, Siqiang Luo

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted by Findings of ACL2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16118 2024-05-02 cs.CL cs.AI 89%

Response: Emergent analogical reasoning in large language models

Damian Hodel, Jevin West

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Response to publication in Nature Human Behaviour titled "Emergent analogical reasoning in large language models," (Webb, Holyoak, and Lu, 2023, arXiv:2212.09196). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17000 2024-04-29 cs.CL cs.AI 89%

Evaluating Class Membership Relations in Knowledge Graphs using Large Language Models

Bradley P. Allen, Paul T. Groth

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages, 1 figure, 2 tables, accepted at the European Semantic Web Conference Special Track on Large Language Models for Knowledge Engineering, Hersonissos, Crete, GR, May 2024, for associated code and data, see https://github.com/bradleypallen/evaluating-kg-class-memberships-using-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09676 2024-03-18 cs.CL cs.AI 89%

Unmasking the Shadows of AI: Investigating Deceptive Capabilities in Large Language Models

Linge Guo

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments AI deception, Large Language Models, ChatGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03227 2026-05-08 cs.AI 89%

Evaluating Prompting and Execution-Based Methods for Deterministic Computation in LLMs

评估基于提示和执行的方法在LLM中确定性计算中的表现

Hongkun Yu

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(title_cn,comments);large language model(abstract);language model(abstract)

AI总结 本文评估了多种提示策略在需要精确输出的任务中的表现,发现PoT通过生成可执行代码实现完美准确率,而其他方法存在误差积累或计算开销大等问题。

Comments 8 pages, 1 figure. Code and dataset available at https://github.com/bigbird231/llm-exact-computation-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏