Large Language Models are Versatile Decomposers: Decompose Evidence and Questions for Table-based Reasoning
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments SIGIR 2023
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments SIGIR 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments Accepted as a long paper at NLDB 2023
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
从预测到干预:基于大语言模型智能体的个性化餐级血糖调节
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI、cs.LG
AI总结 针对精准营养中个性化血糖调节的挑战,提出融合生理学习与LLM智能体的系统,通过生理感知预测器和预测驱动优化智能体提升血糖预测准确率并降低血糖波动。
Comments Accepted in ACL 2026 Findings, 17 pages, 4 figures
Journal ref Findings of the Association for Computational Linguistics ACL 2026, pages 21629 to 21645
Proteo-R1:用于从头蛋白质设计的推理基础模型
专题命中 推理与问题求解 :foundation model(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026
检测到效应不等同于学习基于该效应行动:LLM获取智能体的奖励信噪比下限
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 该研究指出检测信号平均效应与学习基于该效应行动存在差异,提出奖励信噪比下限,引入SHE模型,在三个推荐数据集上发现学习获取策略失效,因数据集SNR低于下限。
从专有大语言模型API窃取推理轨迹
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。
ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。
校准大语言模型推理的置信度边际过程监督
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。
当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。
过重采样优化:大语言模型推理的测试时自校正
机构 * University of Oklahoma(俄克拉荷马大学) ; Stanford University(斯坦福大学) ; Universitat Pompeu Fabra(庞培法布拉大学) ; Air University(空军大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。
Comments Submitted to EMNLP 2026
使用大型语言模型进行创新中的创意生成
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究对比人类与GPT-4生成的大学生适用低价新产品创意,发现AI生成创意平均购买意向更高、跻身前10%的概率是人类的7倍,但新颖性较低,少样本提示效果略优于零样本。
认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架
机构 * Sichuan University(四川大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。
简洁思考:输出长度对LLM推理和成本的影响
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出CCoT方法,通过控制输出长度提升LLM推理的简洁性和效率,并验证了相关指标的有效性。
Comments Preprint version, under review
Journal ref Information Sciences 2026
人工智能旅游会议:基于大语言模型代理的团体旅行规划
机构 * NTT, Inc.(日本电报电话公司)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出基于大语言模型代理的团体旅行规划框架AI Tour Meeting,通过自然语言讨论找满足约束和偏好的行程,提供相关配置接口实现灵活编排,可作模拟工具,还展示了系统验证等结果以证明其效用。
Comments The code is available at https://github.com/ntt-dkiku/ai-tour-meeting
通过截断的思维链审计检测基于大语言模型的教育辅导中的答案驱动推理
机构 * Independent Researcher(独立研究员) ; Northeastern University(东北大学) ; Syracuse University(Syracuse大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究基于大语言模型的教育辅导中,模型能否利用答案信息生成答案驱动的解释,用截断推理AUC评估法在三种辅导情境下评估,发现答案信息能提升模型表现,支持截断思维链审计用于诊断。
当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性
机构 * AGILabs(AGILabs实验室)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。
Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models
OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架
机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) ; Intuit AI Research, Mountain View, United States(Intuit AI研究)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。
Comments Accepted as a Oral paper at ICML 2026
因果推理的可分离路径:建筑框架如何使LLM代理重构假设空间
机构 * Simon Fraser University(西蒙弗雷泽大学) ; International Computer Science Institute(国际计算机科学研究所) ; Amigo AI
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 本文提出通过建筑框架使LLM代理重构假设空间,通过实验发现上下文图和动态行为在因果推理中分别提升推理质量和有效性。
Comments 24 pages, 11 tables, 2 figures
ProgramTab:通过编程范式提升大语言模型的表格推理能力
机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) ; Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI
AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。
Comments Large Language Models, Table Reasoning, In-context Learning
iLENS:用于神经影像生存分析的可解释大语言模型引导的专家混合模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Yale University(耶鲁大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对阿尔茨海默病前驱期转化预测问题,提出iLENS框架,基于专家混合模型,利用大语言模型合成信息指导专家路由,具备竞争力的预测性能,能为决策提供透明且基于生物学的原理。
从投票到智能体协作:用于BioASQ 14b的答案类型感知大语言模型管道
机构 * Korea University(韩国大学) ; Myongji University(明知大学) ; AIGEN Sciences(爱根科学公司)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究针对BioASQ 14b任务B提出特定问题类型的大语言模型框架,依据不同问题类型选择不同推理程序,如为是/否问题用片段洗牌等,经初步实验和官方评估,框架性能具竞争力,在第4批次事实性子任务中夺冠,证明相关方法结合的有效性。
Comments 15 pages
利用离线强化学习学习控制大语言模型智能体的执行框架
机构 * University of Toronto(多伦多大学) ; Emory University(埃默里大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。
Comments 17 pages, 7 figures
谈判语言:大语言模型谈判中的语言效应
机构 * BITS Pilani(BITS 普利尼)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 研究通过多智能体模拟,在保持游戏规则等不变的情况下,系统分离英语和四种印度语言框架在不同游戏中的语言效应,发现语言选择对结果影响大,且因任务而异,强调仅用英语评估LLM谈判有局限。
Comments Under Review
用小代理模型预测LLM推理性能
机构 * Trillion Labs ; KAIST AI(韩国科学技术院人工智能系)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。
Comments ICLR 2026
在指令阶梯上推理以实现可控语言模型
机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) ; Microsoft Research(微软研究院) ; Allen Institute for AI(艾伦人工智能研究所)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI
AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354
面向LLM智能体规划的自我进化世界模型
机构 * National University of Singapore(国立新加坡大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院)
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出WorldEvolver框架,通过情景记忆、语义记忆和选择性预见三个模块在测试时修正世界模型,提升预测准确性和下游规划成功率。
PolicyGuard: 一种基于对话的子代理验证器,用于确保LLM代理遵循策略
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出PolicyGuard子代理验证器,通过共享对话上下文、策略推理和可操作反馈,在tau²-BENCH航空数据集上使PASS4提升12个百分点,同时误拦率降低约一半。
Comments 20 pages, 8 figures
去噪迭代自校正:用于可靠LLM推理的结构化验证循环
机构 * Thomson Reuters Labs(汤森路透实验室)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出DISC方法,通过将验证输出视为噪声测量,在多次验证-判断-校正循环中逐步减少推理错误,并引入二元判断门控机制防止破坏正确答案,在三个基准上优于现有方法。