Recursive Introspection: Teaching Language Model Agents How to Self-Improve
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);language agent(abstract)
Comments ACL 2024 main
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments ICLR 2024. The first two authors contributed equally. Code: https://github.com/Relento/hypothesis_search
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments 1 figure, 6 tables, 6 appendices
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments EMNLP 2023 (Main). 10 pages, 5 figures, 4 tables (26 pages, 9 figures and 13 tables including references and appendices)
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Findings of the Association for Computational Linguistics: ACL 2023. 10 pages, 2 tables, 4 figures (20 pages, 8 tables, 7 figures including references and appendices)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)
Comments NeurIPS 2022 Oral
POISE:面向LLM智能体的位置感知不可检测技能注入攻击
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; University of Queensland(昆士兰大学) ; Tulane University(路易斯安那州立大学) ; Rutgers University(罗格斯大学)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。
Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables
为AI系统引入元提示
专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过元提示框架提升大语言模型的推理能力,实现高效的问题解决与自我优化。
Comments Project Page: https://github.com/meta-prompting/meta-prompting
对人格引导对大语言模型能力影响的系统分析
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) ; School of Computing and Information Systems, Singapore Management University, Singapore 178902, Singapore(新加坡管理大学计算机与信息系统学院,新加坡 178902,新加坡) ; School of Computer and Communication Engineering, Northeastern University, Qinhuangdao 066004, China(东北大学计算机与通信工程学院,秦皇岛 066004,中国)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文通过NPTI框架诱导大模型五种人格特质,发现人格引导对认知任务性能有稳定影响,且不同特质对任务表现有不同影响,提出动态人格路由策略提升性能。
Journal ref Chen, J., Wang, M., Xie, T., Feng, S., & Liu, Y. (2026). A Systematic Analysis of the Impact of Persona Steering on LLM Capabilities. Proceedings of the Annual Meeting of the Cognitive Science Society, 48
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments ICLR 2024 Workshop on Reliable and Responsible Foundation Models
评估评估者:面向大语言模型推理的验证自主等级(L0-L5)
专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.CL
AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。
Comments Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own
大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择
专题命中 推理与问题求解 :LLM(title,summary_cn);post-training(title);分类 cs.LG
AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。
ALPS:通过数学构造衡量大语言模型的有效创造力
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。
Comments 14 pages, 3 figures
大型语言模型战略思维的脆弱性
机构 * IESE(IESE商学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。
Foam-Agent:迈向自动化智能CFD工作流程
机构 * Department of Computer Science, Rensselaer Polytechnic Institute(里士满理工学院计算机科学系) ; Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(里士满理工学院机械、航空航天与核工程系) ; Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) ; College of Education, Zhejiang Normal University(浙江师范大学教育学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 Foam-Agent通过多智能体框架和大型语言模型,实现自动化CFD工作流程,显著提升模拟效率和成功率。
Comments 34 pages, 9 figures, 9 tables
Journal ref Computer Methods in Applied Mechanics and Engineering, Vol. 461, 119271 (2026)
大语言模型无需规划即可说服理论之心理论
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。
机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) ; Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
利用大语言模型进行因果发现:一种基于约束和论证的方法
机构 * Department of Computing(计算系) ; Imperial College London(帝国理工学院伦敦分校)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出利用大语言模型作为不完美的专家,结合语义结构先验和条件独立性证据,实现因果发现的先进方法。
Comments Accepted at UAI 2026. 37 pages, including appendix
面向多模态大语言模型的多分支策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Sichuan University(四川大学) ; Shanghai University(上海大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。
Comments 10 pages,8 figures
RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。
Comments 100 pages 7 figures
从推理到代理:大型语言模型强化学习中的信用分配
机构 * Independent Researcher(独立研究员)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。
Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis
AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。
基于大语言模型的反事实分析
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文研究用GPT-3.5模型开展在线借贷反事实分析,经提示工程优化后其预测性能接近梯度提升回归,验证了LLMs用于反事实分析的潜力。
从暴力到语义洞察:基于LLM的性能引导数据转换设计
机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。
超越准确率:大型语言模型统计推理的多维度评估
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究结合多维度分析框架评估15款LLMs的统计推理,发现仅用准确率无法全面描述其统计推理能力,且存在厂商专属解释风格差异。
Comments 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication
大语言模型自适应元推理的认知需求引导
机构 * Thomson Reuters Foundational Research(汤森路透基础研究部) ; Imperial College London(帝国理工学院)
专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出无需训练的元推理框架CDS,通过认知量表刻画需求,在三类大模型和六个基准上较直接调用、标准CoT分别提升21.9%、9%准确率,难数学编码任务增益显著。
Comments 21 pages, 3 figures
大型语言模型能否执行父订单?
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。