arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2603.13950 2026-03-17 cs.CL 85%

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

ToolFlood: 超越选择 -- 通过语义覆盖隐藏有效工具于LLM代理

Hussein Jawad, Nicolas J-B Brunel

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对LLM代理的检索层攻击,通过语义覆盖注入恶意工具,使有效工具被排除在外,实验显示攻击成功率高达95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09205 2026-03-17 cs.CL cs.AI cs.LG 85%

Emotion is Not Just a Label: Latent Emotional Factors in LLM Processing

情感不只是一个标签:大型语言模型处理中的潜在情绪因素

Benjamin Reichman, Adar Avsian, Samuel Webster, Larry Heck

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究情绪作为潜在因素对LLM处理的影响,分析情绪如何改变transformer模型的注意力几何结构,并提出AURA-QA数据集和情绪正则化框架以提升阅读理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14018 2026-03-17 eess.SY cs.SY 85%

LLM-Guided Safe Reinforcement Learning for Energy System Topology Reconfiguration

基于大型语言模型的安全强化学习用于能源系统拓扑重构

Zongyan Zhang, Chao Shen, Xu Wan, Jie Song, Mingyang Sun

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出结合大型语言模型与安全软演员-评论家算法的拓扑控制框架,通过重构电压和热限为平滑安全成本信号,提升电网拓扑重构的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13775 2026-03-17 cs.NI 85%

LLM-Based Net Analyzer rApp for Explainable and Safe Automation in O-RAN Non-RT RIC

基于大语言模型的网络分析rApp用于O-RAN非实时RIC中的可解释和安全自动化

Tuan V. Ngo, Mao V. Ngo, Binbin Chen, Tony Q. S. Quek, Tejaswita Kumari, Maziar Nekovee

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的网络分析rApp,用于O-RAN非实时RIC中的可解释和安全自动化,通过事件驱动的批量触发推理框架,实现安全的人工干预自动化,确保操作安全性和可审计性。

Comments Accepted version for presentation at the IEEE ICC Workshop Open, Programmable and AI-Native Radio Access Network, Glasgow, Scotland, UK, May 2026. copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14636 2026-03-17 cs.SD cs.AI cs.CL eess.AS 84%

Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models

引导隐藏状态:用于大音频-语言模型链式推理的无训练模型引导

Lok-Lam Ieong, Chia-Chien Chen, Chih-Kai Yang, Yu-Han Huang, An-Yu Cheng, Hung-yi Lee

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过无训练的模型引导方法提升大音频-语言模型的推理能力,采用多种信息源策略在四个模型和四个基准上进行评估,结果显示推理准确率提升达4.4%,并发现跨模态迁移效应。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 84%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13243 2026-03-17 cs.AI 83%

Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning

先思后推:通过自回归计划条件改进扩散语言模型推理

Earl J St Sauver

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出计划条件方法,通过在扩散模型提示前添加自回归生成的计划,提升多步推理能力,实验表明在GSM8K和HumanEval上分别提升11.6和12.8个百分点,证明了协调问题假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06632 2026-03-17 cs.LG cs.AI cs.CL 82%

Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning

从简单到困难的任务课程强化学习提升大语言模型推理能力

Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, Shuiwang Ji

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出E2H Reasoner方法,通过从易到难的任务调度提升LLM推理能力,理论证明其收敛性并展示更少样本需求,实验显示在多个领域显著提升小型LLM的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01116 2026-03-17 cs.LG 81%

Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning

通过强化学习激发时间序列分析的链式推理

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出COUNTS框架,通过强化学习训练LLM进行时间序列任务的链式推理,提升复杂时间数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14251 2026-03-17 cs.CL cs.AI 81%

Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring

通过推理路径偏差监控缓解大型推理语言模型中的过度思考

Weixin Guan, Liang Li, Jiapeng Liu, Bing Li, Peng Fu, Chengyang Fang, Xiaoshuai Hao, Can Ma, Weiping Wang

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种与原生推理过程紧密耦合的早退方法,利用路径偏差指数监测高熵转移标记,动态检测并终止过度思考轨迹,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18933 2026-03-17 cs.CL cs.AI 81%

BabyReasoningBench: Generating Developmentally-Inspired Reasoning Tasks for Evaluating Baby Language Models

BabyReasoningBench: 生成发育启发式的推理任务以评估婴儿语言模型

Kaustubh D. Dhole

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BabyReasoningBench,基于发展心理学经典范式,设计19个推理任务,评估婴儿语言模型在因果推理、信念归因等任务上的表现,揭示不同任务对模型能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 80%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15051 2026-03-17 cs.CL cs.AI cs.LG 80%

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(马普尔大学斋普尔) TCS Research(塔塔咨询研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。

Comments Accepted at ICLR 2026, LIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09957 2026-03-17 cs.AI cs.CL cs.LG 80%

Think Before You Lie: How Reasoning Leads to Honesty

在谎言之前思考:推理如何导致诚实

Ann Yuan, Asma Ghandeharioun, Carter Blum, Alicia Machado, Jessica Hoffmann, Daphne Ippolito, Martin Wattenberg, Lucas Dixon, Katja Filippova

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过道德权衡数据集探讨推理对诚实的影响,发现推理能提升诚实度,而非单纯依赖推理内容,且代表空间的几何特性是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05065 2026-03-17 cs.CR 80%

Personalizing Agent Privacy Decisions via Logical Entailment

通过逻辑蕴含个性化代理隐私决策

James Flemings, Ren Yi, Octavian Suciu, Kassem Fawaz, Murali Annavaram, Marco Gruteser

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ARIEL框架,结合LLM与规则逻辑,实现结构化个性化隐私决策,实验显示其在适当判断的F1误差率上降低40.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14659 2026-03-17 cs.CV cs.AI 79%

VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting

VisionCoach: 通过视觉感知提示强化视频推理

Daeun Lee, Shoubin Yu, Yue Zhang, Mohit Bansal

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 VisionCoach通过视觉提示指导强化学习,提升视频推理的时空定位能力,实现无需外部工具的高效推理。

Comments Project website: https://visioncoach.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 79%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13612 2026-03-17 cs.AI 79%

LLM Routing as Reasoning: A MaxSAT View

LLM路由作为推理:一种MaxSAT视角

Son Nguyen, Xinyuan Liu, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于约束的LLM路由方法,将其建模为加权MaxSAT问题,通过自然语言反馈生成硬约束和软约束,实验证明语言反馈能产生近可行推荐集,揭示了语言条件下的结构化约束优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13443 2026-03-17 cs.SE cs.AI cs.PL 79%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15402 2026-03-17 cs.CL cs.AI 79%

A Closer Look into LLMs for Table Understanding

深入探究用于表格理解的大型语言模型

Jia Wang, Chuanyu Qin, Mingyu Zheng, Qingyi Si, Peize Li, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过研究16种LLM,探讨其理解表格数据和执行下游任务的机制,发现注意力动态、有效层数、专家激活及输入设计影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07685 2026-03-17 cs.CV cs.AI cs.LG 79%

Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought

增强推理的多模态链式推理

Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RED方法,通过KL约束奖励最大化提升多模态链式推理的准确性和忠实度,实验表明其在多个基准和模型上显著优于传统方法。

Comments Accepted to CVPR 2026 (Main); Code is available at https://github.com/yshinya6/red/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14087 2026-03-17 cs.LG cs.CL 79%

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

理解下一token预测器中看似无用特征的出现

Mark Rofin, Jalal Naghiyev, Michael Hahn

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20072 2026-03-17 cs.CL cs.AI 79%

Incentivizing Strong Reasoning from Weak Supervision

通过弱监督激励强推理

Yige Yuan, Teng Xiao, Shuchang Tao, Xue Wang, Jinyang Gao, Bolin Ding, Bingbing Xu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究如何在无需高成本示范和强化学习的情况下,通过弱监督模型激励大语言模型的推理能力,发现弱监督能有效提升推理性能,接近强化学习的效果,且成本更低。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06046 2026-03-17 cs.CL cs.AI 79%

EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation

EvolvR:自进化成对推理用于故事评估以增强生成

Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EvolvR通过自进化成对推理框架提升故事评估准确性,解决传统方法在开放任务中的局限性,实现生成质量的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14393 2026-03-17 cs.RO 78%

From Scanning Guidelines to Action: A Robotic Ultrasound Agent with LLM-Based Reasoning

从扫描指南到行动:基于LLM的机器人超声代理

Yuan Bi, Yiping Zhou, Pei Liu, Feng Li, Zhongliang Jiang, Nassir Navab

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出一种基于LLM的自主机器人超声扫描框架,通过动态调用软件工具实现自主扫描,提升适应性和透明度。

Comments Code: https://github.com/yuan-12138/RUSSAgent; Video: https://youtu.be/pfMOc4e2IGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13870 2026-03-17 math.OC 78%

When to Screen, When to Bypass: LLM-Judges in Resource-Scarce AI-Human Workflow

何时筛查,何时绕过:LLM-判断在资源稀缺的AI-人类工作流中

Ruihan Lin, Jiheng Zhang

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 研究探讨在资源有限的AI-人类工作流中,何时通过LLM-判断筛选输出,何时直接绕过判断直接提交人类审核,提出基于队列网络模型的优化策略,分析不同瓶颈资源下的最优分配方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 77%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23189 2026-03-17 cs.AI 77%

AutoEP: LLMs-Driven Automation of Hyperparameter Evolution for Metaheuristic Algorithms

AutoEP:基于LLM的元启发式算法超参数进化自动化

Zhenxing Xu, Yizhe Zhang, Weidong Bao, Hao Wang, Ming Chen, Haoran Ye, Wenzheng Jiang, Hui Yan, Ji Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoEP通过LLM实现元启发式算法超参数自动优化,利用探索性景观分析模块和多LLM推理链提供实时反馈和自适应策略,优于现有方法,使开源模型性能接近GPT-4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13725 2026-03-17 cs.CL 77%

Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality

我们能相信基于忆阻器的LLMs吗?在非理想条件下探究推理能力

Taiqiang Wu, Yuxin Cheng, Chenchen Ding, Runming Yang, Xincheng Feng, Wenyong Zhou, Zhengwu Liu, Ngai Wong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了基于忆阻器的类脑计算架构对LLM推理能力的影响,发现非理想性导致推理能力下降,提出三种无训练策略并总结提升鲁棒性的指导原则。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 77%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏