arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 63 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 63 篇

2604.22207 2026-08-05 cs.SE cs.AI cs.CL 版本更新 93%

Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations

评估基于大语言模型的目标提取在需求工程中的应用:提示策略及其局限性

Anna Arnaudo, Riccardo Coppola, Maurizio Morisio, Flavio Giobergia, Andrea Bioddo, Angelo Bongiorno, Luca Dadone

机构 * Department of Control and Computer Engineering(控制与计算机工程系)

专题命中 推理与问题求解 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了通过三个阶段自动提取功能目标以实现目标导向的需求工程,提出基于工程提示的LLM链,实验表明反馈循环机制在零样本学习中表现更优,但提示策略仍是性能限制因素。

Comments 11 pages, 1 figure. This contribution will be published in the conference proceedings of EASE 2026 Conference (https://conf.researchr.org/home/ease-2026/prompt-se-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03550 2026-08-05 cs.AI 新提交 92%

Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

随着大型语言模型(LLM)性能提升,软引导开始优于思维链(CoT)提示

Denys Pushkin, Albert Q. Jiang, Aryo Lotfi, Colin Sandon, Emmanuel Abbé

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究发现,随着LLM性能提升,标准CoT提示的干扰作用凸显,推理专用模型在零样本设置下的数学推理性能优于少样本CoT提示。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28942 2026-08-05 cs.AI 版本更新 92%

NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability

NeSyFS:部分可观测场景下LLM智能体的神经符号快慢思考框架

Duo Xu, Faramarz Fekri

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对部分可观测场景下LLM智能体的决策挑战,提出NeSyFS神经符号快慢思考框架,结合知识图谱、TSMC算法与反思模块,在三个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07850 2026-08-05 physics.comp-ph math-ph math.MP 版本更新 91%

PDE-Agents: An LLM-Orchestrated Multi-Agent Framework for Automated Finite Element Simulations with Knowledge Graph-Augmented Reasoning

PDE-Agents: 一种基于知识图谱增强推理的LLM编排多智能体框架,用于自动化有限元模拟

Sayan Adhikari, Gulshan Noorsumar, Øyvind Jensen

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PDE-Agents多智能体系统,通过LLM编排实现偏微分方程/有限元模拟全流程自动化,采用GraphRAG知识图谱增强,在50个任务消融实验中KG Smart模式达100%成功率,并验证了二阶空间收敛性。

Comments 19 pages, 9 figures, 10 tables, 1 algorithm. Code and evaluation artifacts: https://github.com/MatPro-IFE/pde-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02941 2026-08-05 cs.CL 新提交 91%

Aligned in Form, Not in Meaning: The Comprehension - Containment Decoupling of LLM Safety in Low-Resource Bangla Derogatory Speech

形式对齐而非意义对齐:低资源孟加拉语贬损言论中大型语言模型(LLM)安全的理解-遏制解耦

Shadab Bin Habib, A K M Ferdous Reza Habib, Subarno Neel, Adib Sakhawat

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对5个前沿LLM,在6种协议下对孟加拉语贬损言论审计,验证了LLM安全的理解-遏制解耦假设,发现高资源基准无法保障低资源安全,需基于意义的遏制。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-05 cs.AI cs.LG cs.MA 新提交 90%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02650 2026-08-05 cs.AI cs.SE 新提交 90%

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03068 2026-08-05 cs.CL cs.AI cs.LG 新提交 89%

CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

CVPO:通过值方差自适应与动态课程学习增强大语言模型的强化学习推理能力

Ziqi Jia, Yalu Ouyang, Bo Pang, Panpan Li, Hangfei Xu, Shengzhao Wen, Shiyong Li, Yanpeng Wang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM强化学习推理中反馈精度不足与问题难度漂移问题,提出CVPO方法,通过值方差自适应与动态课程学习优化,在数学任务上性能优于VAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12029 2026-08-05 cs.SE 版本更新 89%

Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks

通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究

Yong Jin Chun, Qihong Chen, Jiawei Li, Iftekhar Ahmed

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。

Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11482 2026-08-05 cs.AI cs.CL 88%

Meta Prompting for AI Systems

为AI系统引入元提示

Yifan Zhang, Yang Yuan, Andrew Chi-Chih Yao

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过元提示框架提升大语言模型的推理能力,实现高效的问题解决与自我优化。

Comments Project Page: https://github.com/meta-prompting/meta-prompting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03038 2026-08-05 cs.CL stat.AP 新提交 88%

Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

超越准确率:大型语言模型统计推理的多维度评估

Monnie McGee, Mateo Langston Smith, Julian Cabrera

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。

Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03291 2026-08-05 cs.LG cs.AI cs.CL 新提交 88%

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

可察觉的轨迹:利用思维链动态检测大语言模型中的推理失败

Shashwat Sourav, Aishwarya Balwani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究利用思维链动态特性,在不假设语言化CoT语义忠实性的情况下,检测大语言模型在布尔可满足性任务中的分布式推理失败,并通过针对性提示干预提升了Llama3-70B的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02974 2026-08-05 cs.SE 新提交 87%

ConFL: Explainable Concurrent Fault Localization via Hierarchy-Guided LLM Reasoning

ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架

Shuai Shao, Dingbang Wang, Yiming Zeng, Tingting Yu

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。

Comments Accepted at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02805 2026-08-05 cs.CV cs.AI 新提交 86%

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

用于DeepLesion检测、分割及简短报告生成的统一二维框架

Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发了一个整合LLM推理、病变检测、分割及报告生成的统一二维框架,在DeepLesion数据集上取得了各项指标提升,解决了其分割难题并开源了相关资源。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 86%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02582 2026-08-05 cs.SE 版本更新 86%

ACEM: A Cost Estimation Model for Agentic Software Engineering

ACEM:面向智能体软件工程的成本估算模型

Mohammad El-Ramly

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对智能体软件工程成本估算问题,本文提出ACEM模型,分解成本为LLM、HITL、基础设施三类,引入RF、CF、HIS构念并映射传统度量,为智能体开发成本估算提供早期方案。

Comments 27 pages, under journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15428 2026-08-05 cs.IR 版本更新 86%

Fault Cause Identification across Manufacturing Lines through Ontology-Guided and Process-Aware FMEA Graph Learning with LLMs

基于本体引导和流程感知FMEA图学习结合大语言模型的跨生产线故障原因识别

Sho Okazaki, Kohei Kaminishi, Takuma Fujiu, Yusheng Wang, Manu Sasidharan, Jun Ota

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对跨生产线故障原因识别难题,提出OGPAL框架,结合LLM与RGCN实现FMEA知识复用,在汽车压力传感器装配线案例中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02919 2026-08-05 cs.CL 新提交 84%

FLARE: Few-shot Learning-based Adaptive Reflective Engine

FLARE:基于小样本学习的自适应反思引擎

Dhanasekar Sundararaman, Bharat Gandhi, Aashna Garg, Minjie Li

机构 * Microsoft(微软)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出FLARE框架,利用小样本学习与反思机制优化指令,在多基准任务中优于GEPA,数据效率更高且稳定性更强,凸显小样本学习策略优化对提升LLM性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00076 2026-08-05 cs.CV cs.AI 版本更新 84%

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

哪种模态起决定作用?多模态大语言模型的反事实模态归因

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06374 2026-08-05 cs.CL cs.LG 版本更新 84%

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

叠加的幻觉?语言模型中潜在思维的原理性分析

Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了连续链式思维(Latent CoT)中叠加现象的出现条件,发现仅从头训练的模型表现出叠加特性,而其他训练方式下模型倾向于使用捷径解法。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03868 2026-08-05 cs.LG cs.AI 新提交 82%

GENESIS: Towards Explainable Causal Discovery

GENESIS:迈向可解释的因果发现

Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan Pedanekar

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。

Comments 13 pages, 2 figures, 13 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03972 2026-08-05 cs.AI 新提交 81%

ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

ReflectRL:通过反思到直接推理从优质负轨迹中学习

Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。

Comments Project page: https://github.com/bibisbar/ReflectRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03468 2026-08-05 cs.AI 新提交 81%

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划

Xiuhui You, Jiayi Luo, Zichao Shen, Qingyun Sun, Ziwei Zhang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02625 2026-08-05 cs.CL cs.AI 新提交 81%

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

推测校正:扩散语言模型的草稿后精炼解码

Brian K Chen, Chong Wu, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对扩散语言模型提出草稿后精炼解码方案,通过 Flash-Flash 和 Mini-Flash 配置在 GSM8K、MBPP、MATH 数据集上提升准确率并加快推理速度,为双向精炼及快速生成提供新路径。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02486 2026-08-05 cs.CV cs.CL 版本更新 80%

VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors

VLMs需要词语:视觉语言模型倾向于通过语义锚点而非视觉细节进行推理

Haz Sameen Shahgir, Xiaofu Chen, Yu Fu, Erfan Shayegani, Nael Abu-Ghazaleh, Yova Kementchedjhieva, Yue Dong

机构 * University of California, Riverside(加州大学河滨分校) MBZUAI(穆桑人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 研究发现视觉语言模型在需要细粒度视觉感知的任务中表现不佳,因其依赖语义锚点而非视觉细节。通过实验验证,模型在可命名实体上表现更佳,而Logit Lens分析显示其能恢复语义标签。任务特定微调可提升性能,无需语言先验。

Comments Accepted at the Conference on Language Modeling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03648 2026-08-05 cs.MA 新提交 80%

Group Perspective Matters: Regulating Debate Relationships Can Mitigate Blind Conformity in Multi-Agent Debate

群体视角至关重要:调控辩论关系可缓解多智能体辩论中的盲目从众

Hao Wu, Shoucheng Song, Chang Yao, Haoyu Wang, Huaiyu Wan, Youfang Lin, Kai Lv

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多智能体辩论中LLMs易盲目从众的问题,提出DEAR框架,通过动态调控辩论关系缓解该问题,实验显示其性能更优且token消耗显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 80%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17535 2026-08-05 cs.SE 版本更新 80%

AgentModernize: Preserving Business Logic in Legacy Modernization with Multi-Agent LLMs and Behavioral Specification Graphs

AgentModernize: 通过多智能体LLM和行为规范图在遗留系统现代化中保留业务逻辑

Sheikh Nazib Ahmed, Marnim Galib

专题命中 推理与问题求解 :LLM(title_cn,abstract)

AI总结 本文提出AgentModernize框架,通过多智能体系统和行为规范图来保留业务逻辑,解决传统方法在遗留系统现代化中丢失隐含规则和交叉模块约束的问题,实验表明该方法在多个场景中表现优异。

Comments 10 pages, 8 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13502 2026-08-05 cs.CL 版本更新 79%

BOW: Training Language Models to Reason Over Plausible Next Words

BOW:训练语言模型对合理的下一个单词进行推理

Ming Shen, Zhikun Xu, Jacob Dineen, Xiao Ye, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 BOW是一种RL框架,通过训练语言模型生成合理下一个单词空间的全面描述,在10个推理基准上表现优于部分基线,BOW-Reg还能提升SharedRef正确率并降低单义崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 79%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏