arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1562 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1562 篇

2607.25996 2026-07-29 cs.SE 新提交 87%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22554 2026-07-28 cs.AI cs.CL cs.LG 新提交 87%

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

相同问题,不同答案:超越准确率评估大语言模型的可靠性

Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12490 2026-07-15 cs.PL 新提交 87%

When is LLM-Based Program Reasoning Correct? A Completion Semantics for LLM-Based Code Inference

基于大语言模型的程序推理何时正确?基于大语言模型的代码推理的补全语义

Zhiyuan Liu, Yihe Li, Trevor E. Carlson, Huiyan Wang, Ruijie Meng, Gregory J. Duck

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的程序推理何时正确,引入补全语义,将不完整程序形式化,定义存在性推理正确性。以见证生成工作流程实例化方法,在真实任务上评估,能区分合理与不合理推理,为验证不完整程序推理提供实用机制。

Comments 28 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10340 2026-07-14 cs.AR 新提交 87%

When Fuzzing Meets Understanding: LLM-Driven Semantic Test Generation for RTL Verification

当模糊测试与理解相遇:用于RTL验证的大语言模型驱动的语义测试生成

Kun Wang, Cangyuan Li, Kaiyan Chang, Siyang Cai, Yinhe Han, Ying Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对硬件验证难题,提出ChipFuzzer框架,利用大语言模型语义推理能力。采用双阶段工作流程,覆盖引导阶段结合控制流分析提升覆盖率,错误引导阶段借助历史数据提高错误发现率,实验显示其显著提升验证效果。

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09101 2026-07-13 cs.SE 新提交 87%

Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows

通过受人工测试启发的工作流程进行多智能体大语言模型协作以生成单元测试

Quanjun Zhang, Ye Shang, Siqi Gu, Jianyi Zhou, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有基于大语言模型的单元测试生成方法的局限,提出TestAgent,通过多智能体协作机制模拟人工测试,设计专门智能体、配备工具API并构建知识图谱,在Java项目实验中取得优异结果,性能优于基线和搜索工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04293 2026-07-07 cs.CL cs.AI cs.LG stat.ML 新提交 87%

CausalGame: Benchmarking Causal Thinking of LLM Agents in Games

因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试

Zhenhao Chen, Yongqiang Chen, Chenxi Liu, Junchi Yu, Xiangchen Song, Zijian Li, Jialin Li, Philip Torr, Bo Han, Kun Zhang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong Baptist University(香港浸会大学) University of Oxford(牛津大学) New York University, Abu Dhabi(纽约大学阿布扎比分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在通过因果游戏基准测试大语言模型智能体的因果思维能力,让智能体设计实验、收集数据并给出解决方案。设计含多种挑战的场景,发现当前智能体因果思维能力欠佳,为评估提供了测试平台。

Comments Zhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01812 2026-07-03 cs.CE 新提交 87%

TO-Master: an LLM-agent framework for automated topology optimization

TO-Master:用于自动化拓扑优化的大语言模型智能体框架

Haoju Lin, Wenchang Zhang, Weipeng Xu, Xiang Li, Tian Xu, Tianju Xue

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出TO-Master框架,利用大语言模型智能体将有限元拓扑优化转化为对话式工作流,通过自然语言指令自动完成几何处理、网格生成、边界条件设置和优化求解,无需用户编写代码。

Comments 29 pages, 10 figures, 2 tables; submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01485 2026-07-03 cs.IR 新提交 87%

CoPersona: Collaborative Persona Graphs for Robust LLM Personalization

CoPersona: 面向鲁棒LLM个性化的协作人格图

Yangtian Zhang, Leyao Wang, Hiren Madhu, Ngoc Bui, Walter Roznyatovskiy, Rex Ying

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。

Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30649 2026-07-01 cs.CY 新提交 87%

Thinking Out Loud: Real-Time Deception Monitoring in Asymmetric LLM Negotiations

大声思考:非对称LLM谈判中的实时欺骗监控

Nolan Coffey, Faithful Odoi, Makenzie Johnson, Nasir U. Eisty

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出轻量级实时思维链监控器,在二手车销售场景中检测卖家隐藏缺陷的欺骗行为,实验表明监控能提高买家退出率但存在智能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20888 2026-06-23 cs.CV 新提交 87%

Fine-grained Human Motion Understanding with Language Models

基于语言模型的细粒度人体运动理解

Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang

机构 * Delft University of Technology(代尔夫特理工大学) Honda Research Institute Japan(日本本田研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title)

AI总结 提出LLM模型\methodname,通过显式时间戳编码和多样化姿态/运动级监督,在多个基准上实现SOTA性能,且仅用2D骨骼输入即可超越3D方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19776 2026-06-19 cs.CV 新提交 87%

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 87%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16886 2026-06-16 cs.SE 新提交 87%

Neuro-Symbolic Software Verification: Hyper-charging Local Language Models with Symbolic Reasoning at Scale

神经符号软件验证:通过符号推理在规模上增强本地语言模型

Muhammad A. A. Pirzada, Julian Parsert, Weiqi Wang, Konstantin Korovin, Lucas C. Cordeiro

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出VerIbmc管道,结合符号不变量生成与本地开源语言模型及ESBMC验证工具,通过结构化的验证器反馈迭代优化,实现隐私保护且高效的循环不变量合成,在520个问题上达到86.4%的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10838 2026-06-10 eess.AS 新提交 87%

Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains

面向语音-大语言模型的基于元数据驱动推理链的宽描述深度上下文推理

Jakob Poncelet, Hugo Van hamme

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 提出一种训练方法,使语音-LLM利用宽描述作为弱语义先验,通过链式推理进行上下文修正,降低罕见词和命名实体错误率。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07831 2026-06-09 cs.SE 新提交 87%

SLRMentor: An LLM-Based Tool Supporting Learning of SLR in Software Engineering

SLRMentor:一种基于LLM的软件工程系统文献综述学习支持工具

Rodolfo Gil-Pereira, Ronnie de Souza Santos, Cleyton Magalahes, Italo Santos

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出SLRMentor对话助手,利用LLM支持软件工程中系统文献综述的学习与规划,通过引导搜索字符串构建和纳入排除标准推理,降低新手入门门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 87%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13459 2026-08-14 cs.SE cs.AI cs.LO 新提交 86%

CAPRI: Contract-Aware Proof Repair for Isabelle

CAPRI:面向Isabelle的感知契约的证明修复

Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran Wei

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出CAPRI工具,用于解决Isabelle证明修复中LLM修改未授权内容的问题,通过契约检查机制保障安全,在12个失败证明的实验中验证了不同工作流的修复效果。

Comments 17 pages, 1 figure, 7 tables. Submitted to SBMF 2026. Reproducibility artefact available on Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11247 2026-08-13 cs.AI cs.MA 新提交 86%

Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier

大语言模型中的从众效应缓解措施存在于单一的抵抗-接受边界上

Zafar Hussain, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 该研究针对大语言模型的从众效应,提出抵抗-接受双维度评估,发现多数缓解措施存在此消彼长的边界,仅Reasoning可同时提升抵抗性与接受性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10714 2026-08-12 cs.NI cs.AI cs.DC cs.ET cs.MA 新提交 86%

Conversational Orchestration for Organic 6G

面向有机6G的对话式编排

Masoud Shokrnezhad, Tarik Taleb

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对有机6G跨域编排的开销与可部署性问题,提出基于LLM驱动域代理的轻量级去中心化对话式编排框架,仿真验证其控制开销可控且决策质量稳健。

Comments 7 pages, 6 figures. Accepted for publication in IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10186 2026-08-12 cs.MA cs.AI cs.CY 新提交 86%

The Deliberative Deficit: An Empirical Critique of LLMs in Democratic Discourse

审议缺陷:对大型语言模型在民主讨论中的实证批判

Maurice Flechtner

专题命中 推理与问题求解 :LLM(summary_cn,abstract);prompting(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过审议推理指数(DRI)评估1980次五智能体LLM运行,发现LLM群体讨论程序性质量与人类相当但主体间一致性提升小、视角多样性仅为人类的1/3,反转人类收敛模式,仅可作为人类推理的辅助工具而非自主审议智能体。

Comments 10 pages, archival publication at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09277 2026-08-11 cs.AI cs.PL 新提交 86%

P$^{3}$: Joint Program-and-Proof Planning for Verified Code Generation

P³:用于验证代码生成的程序与证明联合规划

Zenan Li, Ziran Yang, Peiyang Song, Zhaoyu Li, Kaiyu Yang

机构 * Apodex Princeton University(普林斯顿大学) Caltech(加州理工学院) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07838 2026-08-11 cs.AI 新提交 86%

Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge

针对异构知识下大语言模型事实一致性与顺序鲁棒接地推理的反事实基准测试与训练

Shibo Chu, Yuze Liu, Tiehua Zhang, Zhishu Shen, Lianghua He, Haofen Wang, Zhijun Ding

机构 * Tongji University(同济大学) Swinburne University of Technology(斯威本科技大学) Wuhan University of Technology(武汉理工大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建异构知识下LLM事实一致性基准TKFQA,提出训练框架ORLF,可提升LLM的推理与顺序鲁棒性,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06741 2026-08-10 cs.LG cs.GT 新提交 86%

Solver-Guided Reasoning for Mixed-Equilibrium Strategies

求解器引导的混合策略均衡推理

Han Wang, Philippe Beardsell, Boning Li, Aaron Sasmita, Shuai Li, Hongyuan Zha, Baoxiang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) GTO Wizard Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出混合策略决策树(MDT),用求解器输出引导LLM在博弈中的均衡推理,在无限制德州扑克8种LLM配置下,将与均衡的L1距离降低52.6%,且策略可移植性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交 86%

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02805 2026-08-05 cs.CV cs.AI 新提交 86%

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

用于DeepLesion检测、分割及简短报告生成的统一二维框架

Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发了一个整合LLM推理、病变检测、分割及报告生成的统一二维框架,在DeepLesion数据集上取得了各项指标提升,解决了其分割难题并开源了相关资源。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02422 2026-08-04 cs.CR cs.AI 新提交 86%

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

基于数字孪生增强多尺度规划的智能体事件响应

Yiran Gao, Tao Li, Kim Hammar

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有智能体事件响应方法的局限,提出结合决策论规划与LLM的多尺度方法,经实验验证可显著缩短恢复时间、提升恢复率。

Comments 31st European Symposium on Research in Computer Security (ESORICS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27130 2026-07-30 cs.AI 新提交 86%

AgentMap: Joint Equivalence and Subsumption Discovery for Ontology Matching

AgentMap:用于本体匹配的联合等价与包含关系发现

Yiping Song, Jiaoyan Chen, Renate Schmidt, Hui Yang, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26588 2026-07-30 cs.AI 新提交 86%

Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models

Eco3S:基于智能体模型的复杂社会经济系统仿真

Shaopeng Wei, Yufei Cheng, Wenxi Sun, Yepeng Ding, Yu Zhao, Gang Kou

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Eco3S是面向经济研究与政策分析的社会经济系统仿真框架,通过三种关键机制解决现有LLM-based ABM的挑战,经多场景实验验证其有效性、可扩展性与通用性。

Comments 18 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24492 2026-07-28 cs.CL 新提交 86%

SINT-Flow: Schema Integration using Large Language Model Workflows

SINT-Flow:使用大语言模型工作流进行模式集成

Keti Korini, Christian Bizer

机构 * University of Mannheim(曼海姆大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出SINT-Flow框架,由五个基于大语言模型的算子组成工作流,用于全自动端到端模式集成,能处理非规范化源表。通过SINT-Bench基准评估,在多种任务上取得高F1分数,消融研究证明了策略和审查循环的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22954 2026-07-28 cs.CL stat.AP 新提交 86%

Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

迈向电子健康记录中文档不一致性的自动检测

Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

机构 * Duke University(杜克大学) Columbia University Medical Center(哥伦比亚大学医学中心) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏