arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 94 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2602.20722 2026-03-17 cs.AI 89%

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

缓冲区很重要:在大语言模型推理中释放离策略强化学习的潜力

Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出BAPO框架,通过动态选择训练批次和保证策略改进下限,提升大语言模型训练效率,实验显示在数学、规划和视觉推理任务中平均提升12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15375 2026-03-17 cs.SE 89%

Formalizing and validating properties in Asmeta with Large Language Models (Extended Abstract)

在Asmeta中形式化和验证属性的大型语言模型(扩展摘要)

Andrea Bombarda, Silvia Bonfanti, Angelo Gargantini, Nico Pellegrinelli

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文探讨将大型语言模型集成到Asmeta框架中,帮助用户定义、形式化、解释和验证时间属性,通过示例展示这种集成的可行性与潜在优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14676 2026-03-17 stat.ME stat.ML 89%

Scalable Text-Embedding-informed Cognitive Diagnosis of Large Language Models

可扩展的基于文本嵌入的认知诊断用于大语言模型

Jia Liu, Zhiyu Xu, Yuqi Gu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出将心理测量学中的认知诊断模型(CDM)适应于大语言模型评估,通过多维离散能力配置文件实现细粒度诊断,并利用文本嵌入信息构建先验,提高高维估计的稳定性。

Comments 34 pages of main text, 12 pages of appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00410 2026-03-17 cs.LG 88%

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

共奖励:用于大型语言模型中激发推理的稳定自监督强化学习

Zizhuo Zhang, Jianing Zhu, Xinmu Ge, Zihua Zhao, Zhanke Zhou, Xuan Li, Xiao Feng, Jiangchao Yao, Bo Han

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出Co-rewarding框架,通过引入互补监督提升训练稳定性,通过对比一致性和模型蒸馏方法,在多个数学推理基准上实现性能提升,尤其在Llama-3.2-3B-Instruct上表现突出。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13266 2026-03-17 cs.AI 88%

Multi-hop Reasoning and Retrieval in Embedding Space: Leveraging Large Language Models with Knowledge

嵌入空间中的多跳推理与检索:利用大型语言模型与知识

Lihui Liu

机构 * Wayne State University(韦恩州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出EMBRAG框架,通过生成基于知识图谱的逻辑规则并在嵌入空间中推理,提升知识图谱问答任务的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 88%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 87%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13230 2026-03-17 cs.CL 87%

Slang Context-based Inference Enhancement via Greedy Search-Guided Chain-of-Thought Prompting

基于贪心搜索的链式推理提示的俚语推理增强

Jinghan Cao, Qingyang Ren, Xiangyun Chen, Xinjin Li, Haoxiang Gao, Yu Zhao

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出一种基于贪心搜索的链式推理框架,通过改进小语言模型的推理能力,提升俚语解释的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI 86%

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15371 2026-03-17 cs.AI cs.NI 85%

Brain-Inspired Graph Multi-Agent Systems for LLM Reasoning

受脑启发的图多智能体系统用于LLM推理

Guangfu Hao, Yuming Dai, Xianzhe Qin, Shan Yu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出受人类认知全局工作理论启发的BIGMAS系统,通过动态图结构和共享工作区提升多步推理能力,实验表明其在多个LLM上均优于现有多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13950 2026-03-17 cs.CL 85%

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

ToolFlood: 超越选择 -- 通过语义覆盖隐藏有效工具于LLM代理

Hussein Jawad, Nicolas J-B Brunel

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对LLM代理的检索层攻击,通过语义覆盖注入恶意工具,使有效工具被排除在外,实验显示攻击成功率高达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09205 2026-03-17 cs.CL cs.AI cs.LG 85%

Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing

情感不只是一个标签:大型语言模型处理中的潜在情绪因素

Benjamin Reichman, Adar Avsian, Samuel Webster, Larry Heck

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究情绪作为潜在因素对LLM处理的影响,分析情绪如何改变transformer模型的注意力几何结构,并提出AURA-QA数据集和情绪正则化框架以提升阅读理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14018 2026-03-17 eess.SY cs.SY 85%

LLM-Guided Safe Reinforcement Learning for Energy System Topology Reconfiguration

基于大型语言模型的安全强化学习用于能源系统拓扑重构

Zongyan Zhang, Chao Shen, Xu Wan, Jie Song, Mingyang Sun

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出结合大型语言模型与安全软演员-评论家算法的拓扑控制框架,通过重构电压和热限为平滑安全成本信号,提升电网拓扑重构的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13775 2026-03-17 cs.NI 85%

LLM-Based Net Analyzer rApp for Explainable and Safe Automation in O-RAN Non-RT RIC

基于大语言模型的网络分析rApp用于O-RAN非实时RIC中的可解释和安全自动化

Tuan V. Ngo, Mao V. Ngo, Binbin Chen, Tony Q. S. Quek, Tejaswita Kumari, Maziar Nekovee

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的网络分析rApp,用于O-RAN非实时RIC中的可解释和安全自动化,通过事件驱动的批量触发推理框架,实现安全的人工干预自动化,确保操作安全性和可审计性。

Comments Accepted version for presentation at the IEEE ICC Workshop Open, Programmable and AI-Native Radio Access Network, Glasgow, Scotland, UK, May 2026. copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 84%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 84%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13243 2026-03-17 cs.AI 83%

Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning

先思后推:通过自回归计划条件改进扩散语言模型推理

Earl J St Sauver

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出计划条件方法,通过在扩散模型提示前添加自回归生成的计划,提升多步推理能力,实验表明在GSM8K和HumanEval上分别提升11.6和12.8个百分点,证明了协调问题假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06632 2026-03-17 cs.LG cs.AI cs.CL 82%

Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

从简单到困难的任务课程强化学习提升大语言模型推理能力

Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, Shuiwang Ji

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出E2H Reasoner方法,通过从易到难的任务调度提升LLM推理能力,理论证明其收敛性并展示更少样本需求,实验显示在多个领域显著提升小型LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01116 2026-03-17 cs.LG 81%

Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning

通过强化学习激发时间序列分析的链式推理

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出COUNTS框架,通过强化学习训练LLM进行时间序列任务的链式推理,提升复杂时间数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14251 2026-03-17 cs.CL cs.AI 81%

Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring

通过推理路径偏差监控缓解大型推理语言模型中的过度思考

Weixin Guan, Liang Li, Jiapeng Liu, Bing Li, Peng Fu, Chengyang Fang, Xiaoshuai Hao, Can Ma, Weiping Wang

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种与原生推理过程紧密耦合的早退方法,利用路径偏差指数监测高熵转移标记,动态检测并终止过度思考轨迹,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18933 2026-03-17 cs.CL cs.AI 81%

BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models

BabyReasoningBench: 生成发育启发式的推理任务以评估婴儿语言模型

Kaustubh D. Dhole

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BabyReasoningBench,基于发展心理学经典范式,设计19个推理任务,评估婴儿语言模型在因果推理、信念归因等任务上的表现,揭示不同任务对模型能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 80%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15051 2026-03-17 cs.CL cs.AI cs.LG 80%

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(马普尔大学斋普尔) TCS Research(塔塔咨询研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。

Comments Accepted at ICLR 2026, LIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09957 2026-03-17 cs.AI cs.CL cs.LG 80%

Think Before You Lie: How Reasoning Leads to Honesty

在谎言之前思考:推理如何导致诚实

Ann Yuan, Asma Ghandeharioun, Carter Blum, Alicia Machado, Jessica Hoffmann, Daphne Ippolito, Martin Wattenberg, Lucas Dixon, Katja Filippova

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过道德权衡数据集探讨推理对诚实的影响,发现推理能提升诚实度,而非单纯依赖推理内容,且代表空间的几何特性是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05065 2026-03-17 cs.CR 80%

Personalizing Agent Privacy Decisions via Logical Entailment

通过逻辑蕴含个性化代理隐私决策

James Flemings, Ren Yi, Octavian Suciu, Kassem Fawaz, Murali Annavaram, Marco Gruteser

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ARIEL框架,结合LLM与规则逻辑,实现结构化个性化隐私决策,实验显示其在适当判断的F1误差率上降低40.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-03-17 cs.CV cs.AI 79%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Project website: https://visioncoach.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 79%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13612 2026-03-17 cs.AI 79%

LLM Routing as Reasoning: A MaxSAT View

LLM路由作为推理:一种MaxSAT视角

Son Nguyen, Xinyuan Liu, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于约束的LLM路由方法,将其建模为加权MaxSAT问题,通过自然语言反馈生成硬约束和软约束,实验证明语言反馈能产生近可行推荐集,揭示了语言条件下的结构化约束优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13443 2026-03-17 cs.SE cs.AI cs.PL 79%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15402 2026-03-17 cs.CL cs.AI 79%

A Closer Look into LLMs for Table Understanding

深入探究用于表格理解的大型语言模型

Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏