Deal Me Maybe: The Role of Emotions in Multi-Agent Negotiation
或许与我成交:情绪在多智能体谈判中的作用
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
或许与我成交:情绪在多智能体谈判中的作用
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究探讨提示条件下的情绪对LLM多智能体价格谈判的影响,发现愤怒买方成交率极低,快乐买方成交率最高但价格较差,情绪效应具有角色依赖性,引发商业中情绪条件智能体的担忧。
用于聚合物自动化粗粒度分子动力学的多智能体框架
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。
开源权重大语言模型能否生成内核验证的Coq证明?一项试点研究
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究在CoqStoq的100个定理上评估6种开源权重LLMs,发现仅Gemma 4等3个模型能生成Coq内核验证的证明,总体成功率3.5%,未确立模型通用排名。
思维链可监控性中“看不见即想不到”吗?
机构 * University of Amsterdam(阿姆斯特丹大学) ; University of Edinburgh(爱丁堡大学)
专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL
AI总结 本研究对比显式与潜在CoT的可监控性,发现其更多取决于任务属性和模型内部访问程度,而非推理模式。
Comments 23 pages
STRIVE:探究分级合理性生成与评估中的推理极限
机构 * University of Pittsburgh(匹兹堡大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 STRIVE是基于LLM的框架,可联合生成评估跨越合理性类别与难度的受控事件集,实验中其优化后高质量事件集生成率达75.0%,为心理语言学研究减少手动工作量。
Comments Under Review
ExeCRE:基于执行一致性引导的自校正代码生成可靠性估计
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 ExeCRE是基于执行一致性的代码可靠性估计框架,可减少自校正代码生成中的误导性反馈,提升有效性与稳定性,在GPT-5.2搭配LiveCodeBench及数学推理场景均有显著收益。
Comments 13 pages, 5 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
ReflectRL:通过反思到直接推理从优质负轨迹中学习
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。
Comments Project page: https://github.com/bibisbar/ReflectRL
ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。
TCPO:回合级信用策略优化
机构 * Moore Threads AI(摩尔线程人工智能)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。
智能体图令牌推理
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究提出智能体图令牌推理,将图令牌化融入推理过程,通过三阶段训练实现,在七个图领域评估中大幅优于基线,可零样本迁移至未见领域,推动图分析向智能体范式发展。
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。
GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证
机构 * Tencent(腾讯) ; School of Integrated Circuits, Peking University(北京大学集成电路学院) ; Southwest Jiaotong University(西南交通大学) ; Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) ; Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。
Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship
用于自主量子传感实验中科学推理的智能体人工智能
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究围绕大语言模型智能体实现用于金刚石中NV中心自主实验的智能体人工智能工作流程,主要贡献为展示自主实验流程,引入离线基准评估智能体推理,结果表明自主实验中智能体与代码分工明确,智能体负责假设和数据评估,代码控制硬件与执行安全约束。
Comments 11 pages, 4 figures + Supplementary Information
评估可解释人工智能对人工智能辅助代码审查中信任的影响
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究可解释人工智能(XAI)对开发人员在人工智能辅助代码审查中信任的影响,通过对34名参与者的受试者内用户研究,比较不同XAI支持水平的系统,发现解释水平显著影响信任和认同,结果为可信代码审查系统设计等研究提供信息。
Comments 23 pages, 4 figures, 5 tables. To appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA093 (ISSTA 2026). Published under CC BY 4.0. Replication package: https://doi.org/10.5281/zenodo.21457282
HydroAgent:将预报员专业知识形式化为技能编排的洪水预报工作流程
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究针对业务洪水预报中隐性预报员专业知识难形式化等问题,提出HydroAgent框架,将大语言模型嵌入洪水预报工作流程,经实验验证其有效性,能转化隐性知识为可审核流程,辅助决策并展示规则引导语言模型推理补充物理模拟的作用。
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
ToolVerse:为智能强化学习解锁大规模环境和长时任务
机构 * LongCat Interaction Team, Meituan(美团长猫互动团队) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究针对LLM智能体在复杂环境中工具集成问题,提出ToolVerse框架。通过构建大规模训练环境、设计任务策略及提出新算法,经实验验证该框架能增强LLM长时工具使用能力,提升性能与推理能力。
GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架
机构 * Shandong University(山东大学) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; National Technological University(国立科技大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026
用于混合表格和文本的金融推理的黄金引导式程序蒸馏
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。
Comments 12 pages, 7 figures
HG-RAG:用于结构化知识图谱的层次引导检索增强生成
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对RAG系统在处理结构化知识推理时的不足,提出HG-RAG框架,通过在层次知识图谱上遍历为语言模型提供结构化上下文,经多规模多类型查询评估,该框架在相关推理任务中优于基线,减少幻觉并保持一致性。
Comments 8 pages, 3 figures
深度交互:一种用于大型推理模型的高效人机交互方法
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大语言模型推理出错时现有交互方法的问题,提出深度交互机制,可直接编辑原始响应并提炼精炼提示引导模型,在STEM任务推理中纠正成功率大幅提升,令牌使用量显著减少。
突破瓶颈:用于严格归纳的沙漏推理
机构 * Peking University(北京大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究针对大语言模型少样本归纳推理能力不足的问题,提出沙漏推理方法,通过在推理阶段强制实现严格上下文隔离,构建符号编码器 - 解码器。实验表明该方法在多基准测试中显著提升准确率,证实收益源于阶段隔离和初始归纳质量。
深度研究源归因的基准测试:评估用于验证引用的前沿模型
机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S.(普华永道商业技术与创新办公室)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 研究深度研究系统中引用质量校准问题,用现成LLM对1248个评分决策与黄金标准标签对比,发现较便宜模型有竞争力,校准模型是用引用评分作奖励信号的前提,校准不须最昂贵模型。
超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力
机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) ; Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) ; School of Computing, Queen’s University, Canada(皇后大学计算科学学院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。
超越下一个词预测:Atlassian工作流中工具使用代理的RLVR概念验证
机构 * Centific
专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对企业SaaS工作流中LLM因目标不匹配导致的静默失败,提出在目标环境中直接应用可验证奖励强化学习(RLVR),在五个合成Jira/Confluence环境中训练Qwen模型,将平均奖励从0.35-0.92提升至0.95-1.00。
ISM:面向持续数学推理的自我改进策略记忆
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 提出智能模式记忆(ISM),一种自我演进的记忆增强系统,通过从成功和失败案例中学习并维护策略模式库,在不更新模型参数的情况下提升冻结LLM在持续学习中的数学推理能力。
Comments 3rd AI for Math Workshop at ICML 2026 Forty-Third International Conference on Machine Learning
自然语言解释中的判断质量测量:来自预测锦标赛的证据
机构 * Forecasting Research Institute(预测研究所) ; Good Judgment Inc(Good Judgment公司) ; University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Stanford University(斯坦福大学) ; School of Arts and Sciences & Wharton, University of Pennsylvania(宾夕法尼亚大学文理学院与沃顿商学院) ; Federal Reserve Bank of Chicago(芝加哥联邦储备银行) ; Federal Reserve System(联邦储备系统)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出解释质量标记(EQMs),用大语言模型评分60种理论驱动的推理模式,在超过55,000个预测-理由对中预测准确性,优于传统方法。
SidConArena:一个在开放、正和博弈中评估智能体的环境
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。
Comments 15 pages
何时可能答案正确?关于LLM中的序列概率与正确性
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; AI Center Tübingen(图宾根人工智能中心) ; University of Tübingen(图宾根大学) ; IMPRS-IS(图宾根马克斯·普朗克研究所)
专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究大型语言模型中序列概率与正确性的关系,发现序列概率在固定数据集内预测正确性有效,但通过改变解码方法或超参数提高概率并不稳定提升准确率,且对同一提示的多次响应中概率不是正确性的良好指标。
Comments 38 pages, including 10 pages of main text and 28 pages of appendix, preprint
推理质量早期涌现:推理模型的数据策展
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出仅利用初始推理token即可识别多样且具挑战性的推理样本,通过扰动检查点评估前100个token的损失检测难题,并证明前1k token的损失模式可预测梯度相似性,在Qwen2.5-7B和Llama3.1-8B上验证,性能提升达1.7%,token效率提升91%。
Comments Accepted by ICML 2026 (Poster)