ISR-LLM: Iterative Self-Refined Large Language Model for Long-Horizon Sequential Task Planning
专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL
Comments ACL 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL
Comments Preprint
LLM-as-a-Verifier:一种通用验证框架
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA Research(英伟达研究院)
专题命中 推理与问题求解 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。
Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com
基于大语言模型的生成式推荐的隐式推理
机构 * University of Virginia(弗吉尼亚大学) ; Snap Inc.(Snap公司)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 针对大语言模型用于生成式推荐时显式推理的三大局限(世界知识表达弱化、语义ID与自然语言嵌入空间不对齐、推理质量敏感),提出轻量级隐式推理范式PauseRec,在性能、训练成本和推理速度上均优于显式方法。
TInR:探索大语言模型中的工具内化推理
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Southeast University(东南大学) ; University of Edinburgh(爱丁堡大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出TInR-U框架,通过工具内化、监督微调和强化学习三阶段训练,使LLM无需外部文档即可进行工具集成推理,在域内和域外设置中均取得优越性能。
Comments Accepted to ACL 2026
边推理边提问:将推理型大语言模型从被动求解者转变为主动询问者
机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; Artificial Intelligence Research Institute(人工智能研究院) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of Texas, Dallas(德克萨斯大学达拉斯分校) ; University of Minnesota(明尼苏达大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);prompting(abstract)
AI总结 提出主动交互推理(PIR)范式,通过不确定性感知微调和用户模拟器策略优化,使LLM在推理中主动提问以澄清前提和意图不确定性,在数学推理、代码生成和文档编辑任务上显著提升准确率、通过率和BLEU值,同时减少近半推理计算和不必要交互。
Comments ACL Main Conference
共情提示:多模态大语言模型对话中的非语言上下文整合
机构 * University of Macerata(马切拉塔大学)
专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出共情提示框架,通过集成面部表情识别服务将非语言情感线索隐式融入大语言模型对话,实现无需用户显式控制的流畅多模态交互。
双重校准:通过校准知识和推理置信度实现可靠的LLM
机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院,广州,中国) ; Department of Computing, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学计算机系,香港特别行政区) ; School of Science and Technology, Hong Kong Metropolitan University, Hong Kong SAR(香港 Metropolitan 大学科技学院,香港特别行政区)
专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出双重校准框架,通过校准知识和推理置信度提升LLM的可靠性,实验表明其在保持低token成本的同时显著提高准确性和置信度校准。
Comments This work is to appear in the Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)
Agent-GWO: 为大型语言模型的动态提示优化设计的协作代理
机构 * Kyung Hee University(韩国庆熙大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nota Inc.(Nota公司) ; Tongji University(同济大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本文提出Agent-GWO框架,通过统一提示模板和解码超参数作为可继承的代理配置,利用灰狼优化器的领导者-追随者机制,自动选择领导者代理以指导协作更新,提升复杂推理的准确性和稳定性。
Comments Accepted to ACL 2026. 9 pages, 5 figures
TabularMath: 通过大规模语言模型理解表格上的数学推理
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出TabularMath基准,通过神经符号框架将数学问题转化为可扩展的表格推理任务,揭示表格复杂度、质量及表征对推理性能的影响,发现低质量表格对当前LLM的可靠性构成严重风险。
Comments Accepted by ACL 26
HintMR:在小型语言模型中激发更强的数学推理
机构 * University at Albany(阿尔巴尼大学) ; University at Buffalo(布法罗大学) ; Stony Brook University(石溪大学)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)
AI总结 本文提出HintMR框架,通过提示辅助引导小型语言模型进行多步数学问题解决,通过协作的双模型系统提升推理准确性,实验表明在多种数学基准上显著提升性能。
Comments 15 pages, 5 figures, Preprint
置信度校准的小-大语言模型协作用于成本有效的推理
机构 * Amazon Web Services(亚马逊网络服务) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
AI总结 COREA通过结合小型和大型语言模型,利用置信度校准提升推理效率,降低21.5%-16.8%成本,同时保持高准确率。
Comments Accepted to EACL 2026 Main Conference
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; People Public Security University of China(中国人民公安大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Laboratory(中关村实验室)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)
机构 * Microsoft(微软)
专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments TTODLer-FM Workshop@ICML'25 (Tiny Titans: The next wave of On-Device Learning for Foundational Models)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments 27 pages, project page at https://dllm-reasoning.github.io/
机构 * Silicon Austria Labs(硅 Austria 实验室) ; Jiangnan University(江南大学) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)
Comments 8 pages without references
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
Comments ICLR 2025 camera ready version
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)
基于视觉语言模型(VLM)与大语言模型(LLM)驱动的多智能体正电子发射断层扫描(PET)图像去噪系统
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对PET图像分辨率低、信噪比差及深度学习去噪部署需多模型与专家干预的问题,本文提出VLM与LLM驱动的多智能体闭环PET去噪框架,自主选最优模型参数,在低剂量数据上优于UNet等基线方法。
面向FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对FANET中现有GPSR协议难以适配动态环境的问题,提出基于LLM的PMKR-GPSR框架,通过参数特定多索引检索和知识引导约束图实现协议一致的路由参数适配,在高移动性场景下提升了数据包投递率并降低了端到端时延。
PDE-Agents: 一种基于知识图谱增强推理的LLM编排多智能体框架,用于自动化有限元模拟
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出PDE-Agents多智能体系统,通过LLM编排实现偏微分方程/有限元模拟全流程自动化,采用GraphRAG知识图谱增强,在50个任务消融实验中KG Smart模式达100%成功率,并验证了二阶空间收敛性。
Comments 19 pages, 9 figures, 10 tables, 1 algorithm. Code and evaluation artifacts: https://github.com/MatPro-IFE/pde-agents
结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。
Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736
在互联网上,没人知道你是一个LLM机器人:使用多层指纹识别揭露网络代理
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文部署蜜罐站点,结合网络、HTTP和浏览器层指纹识别技术,评估六种基于LLM的网络代理绕过反机器人机制的能力,发现多层指纹可区分代理与人类及代理之间,且隐身机制反而增加可检测性。
直觉引导的潜在推理用于基于LLM的推荐
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。
当LLM推理理由面向用户时:对信任感知、决策和注视行为的影响
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究通过两项实验(在线和眼动追踪)探讨LLM推理理由的呈现方式、正确性和确定性框架对用户信任、决策和注视行为的影响,发现不正确理由降低信任并增加认知负荷,挑战了“更多推理更好”的假设。
看见推理:LLM 推理如何影响用户在事实核查任务中的信任与决策
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 通过在线实验(N=68)操纵LLM推理的呈现格式、正确性和确定性框架,发现正确推理和确定性线索提升信任与决策采纳,不确定性线索降低,而呈现格式无显著影响。
Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划
机构 * Huawei Noah's Ark Lab(华为诺亚实验室) ; University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McGill University(麦吉尔大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。
Comments International Conference on Machine Learning (ICML) 2026