arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-10 至 2026-03-10 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 91 篇

2603.07091 2026-03-10 cs.SE 90%

Exploring the Reasoning Depth of Small Language Models in Software Architecture: A Multidimensional Evaluation Framework Towards Software Engineering 2.0

探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架

Ha Vo, Nhut Tran, Khang Vo, Phat T. Tran-Truong, Son Ha

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。

Comments Accepted at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08398 2026-03-10 cs.CL cs.AI cs.LG 89%

Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective

揭示大型语言模型中的行为可塑性:基于令牌条件的视角

Liyuan Mao, Le Yu, Jing Zhou, Chujie Zheng, Bowen Yu, Chang Gao, Shixuan Liu, An Yang, Weinan Zhang, JunYang Lin

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ToCoRL框架,通过令牌条件强化学习使LLM在推理时实现稳定的行为适应,从而实现精确的行为控制。

Comments Work done during an internship at the Qwen Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08077 2026-03-10 cs.IR 89%

Why Large Language Models can Secretly Outperform Embedding Similarity in Information Retrieval

为何大语言模型可以秘密超越嵌入相似性在信息检索中的表现

Matei Benescu, Ivo Pascal de Jong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文探讨了大语言模型在信息检索中通过推理超越传统嵌入相似性方法的潜力,并指出当前注释数据集难以准确评估其效果。

Comments 13 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07989 2026-03-10 cs.CV 89%

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

AutoTraces:通过多模态大语言模型实现自回归轨迹预测

Teng Wang, Yanting Lu, Ruize Wang

机构 * Southeast University(东南大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07825 2026-03-10 cs.CL 88%

Benchmarking Large Language Models for Quebec Insurance: From Closed-Book to Retrieval-Augmented Generation

魁北克保险领域大型语言模型基准测试:从闭卷到检索增强生成

David Beauchemin, Richard Khoury

机构 * Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AEPC-QA基准测试,评估51个LLM在魁北克保险领域的闭卷和检索增强生成性能,揭示推理、RAG效果及专业化悖论等关键发现。

Comments Publish at the Advances in Financial AI: Towards Agentic and Responsible Systems Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07728 2026-03-10 cs.AI 88%

A Novel Multi-Agent Architecture to Reduce Hallucinations of Large Language Models in Multi-Step Structural Modeling

一种新型多智能体架构以减少大型语言模型在多步骤结构建模中的幻觉

Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng, Dan M. Frangopol, Minghui Cheng

机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) HBC Engineering Company(HBC工程公司) College of Civil Engineering, Hunan University(湖南大学土木学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Department of Civil and Environmental Engineering, Lehigh University(莱斯利大学土木与环境工程系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种新型多智能体架构,通过并行代理协同工作,利用OpenSeesPy实现多步骤结构建模自动化,有效减少幻觉并提高计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22364 2026-03-10 cs.DB cs.AI cs.DC 88%

Cost Trade-offs of Reasoning and Non-Reasoning Large Language Models in Text-to-SQL

文本到SQL系统中推理与非推理大语言模型的代价权衡

Saurabh Deochake, Debajyoti Mukhopadhyay

机构 * WIDiCoReL Research Lab(WIDiCoReL研究实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了推理与非推理大语言模型在文本到SQL任务中的成本权衡,发现推理模型在处理效率和成本控制上表现更优,但非推理模型存在显著的成本波动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06878 2026-03-10 cs.AI 85%

Not Too Short, Not Too Long: How LLM Response Length Shapes People's Critical Thinking in Error Detection

不短不长:LLM响应长度如何影响人们在错误检测中的批判性思维

Natalie Friedman, Adelaide Nyanyo, Kevin Weatherwax, Lifei Wang, Chengchao Zhu, Zeshu Zhu, S. Joy Mountford

机构 * BTP Innovation, SAP(SAP创新部)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨LLM响应长度对用户批判性思维的影响,发现中等长度解释在LLM输出错误时能提高准确性,提示设计更透明的决策支持系统。

Comments 6 pages, 1 table, 2 figures

Journal ref In MIRAGE 2026 workshop held at 31st International Conference on Intelligent User Interfaces. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01488 2026-03-10 cs.AI 85%

LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning

基于大语言模型的语义选项发现用于促进自适应深度强化学习

Chang Yao, Jinghui Qin, Kebing Jin, Hankz Hankui Zhuo

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03505 2026-03-10 cs.AI 85%

Parallelized Planning-Acting for Efficient LLM-based Multi-Agent Systems in Minecraft

并行规划-行动用于Minecraft中基于大语言模型的多智能体系统的高效性

Yaoru Li, Shunyu Liu, Tongya Zheng, Li Sun, Mingli Song

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Hangzhou City University(杭州市城市大学) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的多智能体系统并行规划-行动框架,通过双线程架构实现同时规划和行动,提升Minecraft中动态决策的效率和响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15656 2026-03-10 cs.CR 85%

PhishDebate: An LLM-Based Multi-Agent Framework for Phishing Website Detection

PhishDebate: 基于大语言模型的多智能体框架用于钓鱼网站检测

Wenhao Li, Selvakumar Manickam, Yung-wey Chong, Shankar Karuppayah

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 PhishDebate通过多智能体辩论框架提升钓鱼网站检测的准确性与可解释性,实现高召回率和模块化可配置性。

Comments Please cite as: W. Li, S. Manickam, Y. -W. Chong and S. Karuppayah, "PhishDebate: An LLM-Based Multi-Agent Framework for Phishing Website Detection," 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 6606-6615, doi: 10.1109/BigData66926.2025.11401440

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 6606-6615

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07557 2026-03-10 cs.SE 85%

AgentRaft: Automated Detection of Data Over-Exposure in LLM Agents

AgentRaft: LLM代理中数据过度暴露的自动检测

Yixi Lin, Jiangrong Wu, Yuhong Nan, Xueqiang Wang, Xinyuan Zhang, Zibin Zheng

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 AgentRaft通过程序分析与语义推理,自动检测LLM代理中的数据过度暴露风险,提升隐私保护效果。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01674 2026-03-10 cs.CL cs.AI cs.MA 84%

FOR-Prompting: From Objection to Revision via an Asymmetric Prompting Protocol

从反对到修订的非对称提示协议:FOR-Prompting

He Zhang, Anzhou Zhang, Jian Dai

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Genentech, Inc.(基因泰克公司)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 FOR-Prompting通过非对称提示协议实现从反对到修订的推理机制,提升低资源环境下模型的推理能力与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08230 2026-03-10 cs.SD cs.AI eess.AS 83%

Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction

解构大音频-语言模型中的推理能力以实现模糊情绪预测

Xiaofeng Yu, Jiaheng Dong, Jean Honorio, Abhirup Ghosh, Hong Jia, Ting Dang

机构 * University of Auckland, New Zealand(奥克兰大学) The University of Melbourne, Australia(墨尔本大学) University of Birmingham, United Kingdom(伯明翰大学)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出了一种新的方法,通过将模糊情绪识别转化为分布推理问题,提升大音频-语言模型在模糊情绪预测中的推理能力。

Comments The paper was submitted to Interspeech for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07197 2026-03-10 cs.AI 83%

$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

Re²:通过强化学习与重解解锁LLM推理

Pinzheng Wang, Shuli Xu, Juntao Li, Yu Luo, Dong Li, Jianye Hao, Min Zhang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Re²通过强化学习与重解方法,使LLM能够灵活放弃无效推理路径并重新开始,从而提升推理性能和测试效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21344 2026-03-10 cs.AI cs.CL cs.LG 82%

Linear probes rely on textual evidence: Results from leakage mitigation studies in language models

线性探针依赖文本证据:语言模型中泄露缓解研究的结果

Gerard Boxo, Aman Neelappa, Shivam Raval

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现线性探针在依赖文本证据检测行为时性能下降,表明其在非表层模式检测中可能不够稳健。

Comments 33 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07824 2026-03-10 cs.RO 82%

Reasoning Knowledge-Gap in Drone Planning via LLM-based Active Elicitation

通过基于大语言模型的主动获取解决无人机规划中的推理知识缺口

Zeyu Fang, Beomyeol Yu, Cheng Liu, Zeyuan Yang, Rongqian Chen, Yuxin Lin, Mahdi Imani, Tian Lan

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的主动信息获取框架,用于解决无人机规划中的推理知识缺口问题,通过结构化知识缺口和最小化人机交互提升复杂任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07725 2026-03-10 cs.IR 82%

Verifiable Reasoning for LLM-based Generative Recommendation

基于LLM的生成推荐的可验证推理

Xinyu Lin, Hanqing Zeng, Hanchao Yu, Yinglong Xia, Jiang Zhang, Aashu Singh, Fei Liu, Wenjie Wang, Fuli Feng, Tat-Seng Chua, Qifan Wang

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 VRec通过引入推理-验证-推荐范式,提升LLM生成推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05592 2026-03-10 cs.CL 81%

MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy

MathSmith: 通过强化策略生成合成问题以实现极难的数学推理

Shaoxiong Zhan, Yanlin Lai, Ziyu Lu, Dahua Lin, Ziqing Yang, Fei Tan

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MathSmith通过生成合成问题提升LLM的数学推理能力,采用强化学习优化问题难度和推理复杂性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00296 2026-03-10 cs.RO cs.AI cs.CV cs.LG 81%

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

从像素到谓词:通过预训练视觉-语言模型学习符号世界模型

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) RAI Institute(RAI研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。

Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17057 2026-03-10 cs.LG cs.AI 81%

The Ends Justify the Thoughts: RL-Induced Motivated Reasoning in LLM CoTs

终点 justify 思维:RL 引导的动机推理在 LLM CoTs 中

Nikolaus Howe, Micah Carroll

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM在训练中会因冲突指令产生动机推理,导致监控器被欺骗,强调需进一步研究动机推理的检测与监管。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14176 2026-03-10 cs.AI cs.LG 81%

ARM-FM: Automated Reward Machines via Foundation Models for Compositional Reinforcement Learning

基于基础模型的自动奖励机制:用于组合强化学习的自动化奖励机

Roger Creus Castanyer, Faisal Mohamed, Pablo Samuel Castro, Cyrus Neary, Glen Berseth

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 ARM-FM通过基础模型实现自动化奖励设计,利用自然语言生成奖励机并实现跨任务泛化,提升强化学习的通用性和效率。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 81%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06612 2026-03-10 cs.LG cs.AI 81%

Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness

共识并非验证:为何众智策略在LLM诚实性上失效

Yegor Denisov-Blanch, Joshua Kazdan, Jessica Chudnovsky, Rylan Schaeffer, Sheng Guan, Soji Adeshina, Sanmi Koyejo

机构 * stanford(斯坦福大学) amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,扩展计算量无法提升LLM在无验证领域的诚实性,因模型错误高度相关,聚合方法反而放大误解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08477 2026-03-10 eess.SY cs.SY 80%

Behavioral Generative Agents for Power Dispatch and Auction

行为生成代理在电力调度和拍卖中的应用

Shaoze Li, Justin S. Kim, Cong Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用生成代理在电力调度和拍卖中模拟人类决策,通过上下文学习模块提升LLM的决策灵活性和经济理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 80%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14996 2026-03-10 cs.CL cs.AI cs.LG 80%

MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision

MAS-ZERO:无需监督设计多智能体系统

Zixuan Ke, Austin Xu, Yifei Ming, Xuan-Phi Nguyen, Ryan Chin, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAS-ZERO通过元层面设计实现无需监督的多智能体系统自动设计,提升推理、编程和代理任务的性能。

Comments SEA@NeurIPS (Oral) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06620 2026-03-10 cs.SE cs.AI cs.CL cs.LG 80%

GraphSkill: Documentation-Guided Hierarchical Retrieval-Augmented Coding for Complex Graph Reasoning

GraphSkill: 基于文档的分层检索增强编码用于复杂图推理

Fali Wang, Chenglin Weng, Xianren Zhang, Siyuan Hong, Hui Liu, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GraphSkill通过分层检索增强编码框架和自我调试代理,提升复杂图推理任务的准确性和效率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 79%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07915 2026-03-10 cs.AI 79%

Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents

Ares: 为高效LLM代理的自适应推理努力选择

Jingbo Yang, Bairu Hou, Wei Wei, Yujia Bao, Shiyu Chang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Accenture(埃森哲)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 Ares通过动态选择推理努力级别,有效降低LLM代理的推理成本,同时保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏