arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11496 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2608.09253 2026-08-11 cs.AI 新提交 87%

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07813 2026-08-11 cs.AI 新提交 87%

When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines

当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效

Yiyao Zhang, Diksha Goel, Hussain Ahmad, Shixun Huang, Jun Shen

机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06811 2026-08-10 cs.SE cs.AI 新提交 87%

Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

在软件问题解决的大语言模型智能体中耦合规划与情景记忆

Jiahao Zhang, Yifan Zhang, Yu Huang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PMCoder智能体,通过双向耦合分层阶段规划器与情景记忆解决软件问题,在SWE-bench Verified等数据集上显著提升问题解决能力,且性能可迁移至其他场景。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04265 2026-08-06 cs.MA cs.AI cs.SY eess.SY 新提交 87%

Strategic Evaluation of Planning Strategies for LLM Agents in Cyber-Physical Systems

网络物理系统中大语言模型智能体规划策略的战略评估

J. de Curtò, I. de Zarzà

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对网络物理系统,构建含40个异构产消者的智能电网基准,评估4种LLM规划架构,发现架构影响结果,应用截止可行性可显著降低遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02026 2026-08-04 cs.AI 新提交 87%

HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning

HPFA:基于超图的大语言模型推理配对失败归因

Runchuan Zhu, Hongbin Lai, Bowen Jiang, Junrui Zhang, Zhangheng LI, Ostap Kilbasovych, Junyuan Hong

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28890 2026-08-03 cs.HC cs.AI 新提交 87%

Agreement Is Not Quality: Blind Expert Verification of Human and LLM Qualitative Coding When Human Consensus Is Not Ground Truth

一致性并非质量:当人类共识并非真值时,对人类与大语言模型定性编码的盲专家验证

Alex Liu, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He, Min Sun

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究发现以人类共识为标准的一致性评估无法准确衡量LLM定性编码质量,盲专家验证显示部分LLM编码优于人类,提出了可迁移的验证协议与编码分工框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28636 2026-08-03 cs.CL cs.CY 新提交 87%

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Bingsheng He

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28460 2026-07-31 cs.LG cs.CR 新提交 87%

Cybersecurity Detection Classification with Reasoning-enabled Language Models

基于推理增强语言模型的网络安全检测分类

Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 该研究针对SOC警报疲劳问题,训练了思维链推理增强的分类器及校准器,在Windows终端检测任务上提升了良性与恶意召回率,且30B微调模型优于通用大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18915 2026-07-22 cs.CL 新提交 87%

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化

Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15957 2026-07-20 cs.CL 新提交 87%

From Plausible to Actionable: A Position on LLM Self-Explanations

从似是而非到可付诸行动:关于大语言模型自我解释的立场

Elize Herrewijnen, Benedetta Muscato, Gizem Gezici, Fosca Giannotti

机构 * Utrecht University(乌得勒支大学) Scuola Normale Superiore(高等师范学校) University of Pisa(比萨大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 探讨大语言模型自我解释,指出其虽看似合理但忠实性存疑。从传统可解释人工智能角度识别评估局限,提出评估合理性与忠实性的指南,并强调评估应拓展到可操作性及相关应用,以支持不同利益相关者的明智决策和适当行动。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12177 2026-07-15 cs.AI cs.CV 新提交 87%

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

地理空间基础模型的新兴范式:从预训练到智能推理

Shelley Cazares

机构 * Google Public Sector(谷歌公共部门)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究地理空间基础模型的新兴范式,通过职责分离实现预训练与特定任务微调,探讨不同类型模型能力及实现考虑因素,提出模型适应策略分类法和框架,展望智能地理空间推理推动领域从感知到认知的发展。

Comments 18 pages, 4 figures. To appear in Lecture Notes in Computer Science (LNCS)

Journal ref Lecture Notes in Computer Science, Vol. 16446 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05573 2026-07-08 cs.AI cs.CE 新提交 87%

Foundation Models for Automatic CAD Generation

用于自动CAD生成的基础模型

J de Curtò, Victoria Guillén, I. de Zarzà

机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) Universidad Pontificia Comillas(庞培法布拉大学) Chung-Ang University(中央大学) LUXEMBOURG Institute of Science and Technology(卢森堡科学技术研究所)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究利用统一评估管道和基准,对用于机械零件自动CAD生成的基础模型展开实证。介绍LLMForge框架,通过两种批判机制评估七个基础模型,展示了紧凑模型的效果,以及VLM批判的作用,还探讨了相关设计及影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32025 2026-07-01 cs.CL 新提交 87%

Generative Skill Composition for LLM Agents

面向LLM智能体的生成式技能组合

Xinyu Zhao, Zhen Tan, Vaishnav Tadiparthi, Nakul Agarwal, Kwonjoon Lee, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) Honda Research Institute USA(本田美国研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillComposer方法,将技能组合形式化为任务条件技能序列预测,通过约束自回归解码器联合决定技能子集、数量和顺序,在真实技能库上训练并验证其提升下游任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23387 2026-06-29 cs.CL 新提交 87%

Self-Stigma Is Not a Monolith, but Generic Empathy Is: Persona-Conditioned LLM Support for People Who Use Drugs

自我污名并非单一概念,但通用共情是:面向吸毒者的人物条件化LLM支持

Layla Bouzoubaa, Rezvaneh Rezapour

机构 * Department of Information Science(信息科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 针对吸毒者自我污名表达异质性问题,提出基于潜在剖面分析的四人物类型学,并用序列贝叶斯和循环神经网络从有限发帖历史中恢复人物类型,发现人物匹配响应虽能实现行为转变,但临床专家更偏好通用共情。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17524 2026-06-29 cs.LG 新提交 87%

Learning to Refine Hidden States for Reliable LLM Reasoning

学习精炼隐藏状态以实现可靠的LLM推理

Chia-Hsuan Hsu, Jui-Ming Yao

机构 * Tongyu0924

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。

Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26981 2026-06-26 cs.RO cs.AI 新提交 87%

In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics

上下文模型预测生成:从语言模型到物理的开放词汇运动合成

Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li, Liang Lin, Ziliang Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Department of Networked Intelligence, Peng Cheng Laboratory(鹏城实验室网络智能部) School of Computer Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与工程学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 提出ICMPG框架,结合语言模型规划与推理时物理反馈,通过上下文感知运动生成和模型预测生成模块实现语义忠实且物理合理的开放词汇运动合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24420 2026-06-24 cs.CL 新提交 87%

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎

Nitesh Kumar

机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。

Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22570 2026-06-23 cs.CL 新提交 87%

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15633 2026-06-18 cs.LG 新提交 87%

Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning

形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理

Donald Loveland, Puja Trivedi, Ari Weinstein, Edward W Huang, Danai Koutra

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17514 2026-06-17 cs.SE cs.AI 新提交 87%

Unlocking LLM Code Correction with Iterative Feedback Loops

解锁大语言模型代码修正的迭代反馈循环

Le Zhang, Suresh Kothari

机构 * Iowa State University(爱荷华州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。

Comments 22 pages, 14th Computing Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12935 2026-06-12 cs.AI 新提交 87%

MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling

MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略

Wenbo Chen, Puheng Li, Mengyang Liu, Weijie Su, Tianpei Xie

机构 * Amazon(亚马逊) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08543 2026-06-09 cs.AI 新提交 87%

PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR

PAEC:面向RLVR中LLM推理的位置感知熵校准

Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出位置感知熵校准(PAEC),通过局部top-p熵和top-2候选竞争构建软掩码,并施加基于锚点的下界惩罚,防止决策相关位置熵崩溃,提升数学推理性能。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08122 2026-06-09 cs.AI 新提交 87%

Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction

三思而后行:基于意图引导推理的LLM位置预测

Qingxiang Liu, Anqi Liang, Zhuoyang Jiang, Yutian Jiang, Sisuo Lyu, Yu Ji, Haomin Wen, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出IntentPOI框架,通过两阶段意图引导推理(先推断用户出行意图,再基于意图选择POI),将位置预测从直接轨迹匹配转化为意图推理,在三个真实数据集上超越11个基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07190 2026-06-08 cs.CL 新提交 87%

From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

从正确性到效用:基于增益的LLM推理前缀评估

Yuhang Zhou, Yixin Cao, Guangnan Ye

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出前缀增益概念,训练前缀效用模型(PUM)通过成对排序目标评估推理前缀对成功率的提升,在数学推理任务中优于传统正确性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06745 2026-06-08 cs.CL 新提交 87%

When to Think Deeply: Inhibitory Deliberation for LLM Reasoning

何时深度思考:用于LLM推理的抑制性深思

Zhixuan He, Yue Feng

机构 * University of Birmingham, United Kingdom(英国伯明翰大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出IDPR框架,通过抑制控制器根据快速答案决定是否启动慢速推理,在数学推理测试集上仅调用8.20%的慢速推理,准确率从47.90%提升至48.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-08-20 cs.CL cs.AI 新提交 87%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);pretraining(abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交 87%

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11027 2026-08-12 cs.LG cs.CL 新提交 87%

Mapping and Measuring the Behavioral Evolution of Large Language Models

大型语言模型行为演化的映射与测量

Dong Qiao, Chris Ding, Jicong Fan

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09779 2026-08-11 cs.CL cs.AI 新提交 87%

KGCaRe: Explainable Complex Conditional Question Answering using Automatic Knowledge Graph Construction and Context Retrieval with LLMs

KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法

Ghanshyam Verma, Simanta Sarkar, Devishree Pillai, Hotaka Shiokawa, Yourong Xu, Fiona Veazey, Peter Hubbert, Hui Su, Paul Buitelaar

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01598 2026-08-04 cs.CL cs.AI 新提交 87%

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge

PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力

Eojin Jeon, SangKeun Lee

机构 * Korea University(高丽大学)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%

详情

展开后加载摘要…

URL PDF HTML 收藏