An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures
多语言多智能体规划失败的可操作诊断
专题命中 规划推理 :planning(title,abstract);分类 cs.CL
AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。
Comments 22 pages, 11 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
多语言多智能体规划失败的可操作诊断
专题命中 规划推理 :planning(title,abstract);分类 cs.CL
AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。
Comments 22 pages, 11 figures
ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。
评估药物安全推理中对患者信息的反事实敏感性
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。
飞越不确定性自然(FORTUNE):面向低空协同的智能且人文的三维路径规划
专题命中 规划推理 :planning(title,abstract)
AI总结 本文针对低空智能体的三维多无人机路径规划问题,提出FORTUNE分层离线-在线框架,其在真实与合成场景中性能优于现有最优方法。
语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究
专题命中 规划推理 :reasoning(title,abstract)
AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。
ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架
专题命中 规划推理 :reasoning(title,abstract)
AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。
Comments Accepted at ISSTA 2026
用于复杂序列决策任务的混合大语言模型增强强化学习智能体
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。
Comments 16 pages, 12 figures
通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。
Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)
GENESIS:迈向可解释的因果发现
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。
Comments 13 pages, 2 figures, 13 tables, 1 algorithm
激活是真实存在的,且存在于读出层:循环深度推理器中的潜在组成、难度驱动的激活以及由界面构成的提交
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究验证潜在推理模型的“组成激活”为真实计算,复现30M参数循环深度推理器,发现激活存在于读出层,决策时边际跃升,隐藏状态方向突变后冻结,撤回早期速度低谷声明。
Comments 9 pages, 2 figures, 3 tables
SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中
机构 * University of California San Diego(加州大学圣迭戈分校) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学)
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG
AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%
Comments Haozhou Xu and Dongxia Wu are co-first authors
基础模型的博弈论:通过相似性推理实现理性合作的新路径
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出针对基础模型智能体的嵌入贝叶斯智能体理论模型,通过嵌入均衡机制实现相似性推理,破解经典博弈论预测的社会困境中相互背叛问题,达成稳定合作。
Comments 75 pages, 11 figures
何时与何地查看:用于高效长视频理解的自适应视觉证据调度
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。
基于经验记忆提升大语言模型智能体的序列决策能力
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对LLM智能体序列决策性能不足的问题,提出带经验记忆的智能体框架,通过对局后反思与规则提取,在不修改模型权重的情况下提升了井字棋任务的表现。
Comments 8 pages, 6 figures, 14 tables, 5 appendices, accepted at Neuro-Symbolic Intelligence for LLMs and Autonomous Agents workshop at IJCAI 2026
能动人工智能:面向复杂系统的以决策为中心的架构
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。
TumorBoard:基于证据的多智能体纵向神经肿瘤学决策支持系统
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 TumorBoard是基于证据的多智能体纵向神经肿瘤学决策支持系统,经360例基准测试,其性能优于现有基线,安全管控模块可有效降低有害建议比例。
基于航班时刻的机场安检点每小时吞吐量时间融合预测
机构 * School of Aviation and Transportation Technology, Purdue University(普渡大学航空与运输技术学院) ; Department of Geography, The Ohio State University(俄亥俄州立大学地理系) ; College of Aeronautics and Engineering, Kent State University(肯特州立大学航空与工程学院)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 本研究开发了将航班时刻表转换为安检负荷信号的框架,结合时间融合Transformer模型,在机场每小时吞吐量预测中优于RNN和LSTM,可支撑安检点人员配置与规划。
当提示控制机器人时:多智能体机器人系统中的提示注入攻击
机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) ; Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。
哪种模态起决定作用?多模态大语言模型的反事实模态归因
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。
Comments 9 pages, 5 figures
迈向偏微分方程的目标无关联合嵌入预测控制
机构 * University of Waterloo(滑铁卢大学)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 该研究针对偏微分方程提出目标无关控制框架,基于联合嵌入预测架构,通过离线训练小型二维ViT编码器等,经模型预测路径积分控制器复用。在相关基准测试中,KE探测器规划提升奖励、降低误差,验证了潜在动力学与目标无关及校准可观测量用于状态控制的优势。
Comments Associated code will be open sourced alongside a later, updated submission
指令调优语言模型代理中类似人类的内群体偏见
机构 * Independent Researcher(独立研究者)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。
后缀约束的贪心搜索算法用于因果语言模型
机构 * Université Paris-Saclay, CNRS, LISN(巴黎萨克雷大学、法国国家科学研究中心、LISN) ; Université de Rennes, INSA Rennes, CNRS, IRISA(雷恩大学、里昂国立应用科学学院、法国国家科学研究中心、IRISA)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出后缀约束贪心搜索算法,用于在因果语言模型中确保最终答案的结构化提取,同时不损害性能甚至提升结果。
OR-Agent:连接进化搜索与结构化研究以实现自动化算法发现
机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education(教育部道路与交通工程重点实验室) ; College of Transportation, Tongji University(同济大学交通运输学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 OR-Agent通过结构化树形工作流和进化-系统化构想机制,实现自动化算法发现的高效探索与科学发现。
群体视角至关重要:调控辩论关系可缓解多智能体辩论中的盲目从众
专题命中 规划推理 :reasoning(abstract)
AI总结 针对多智能体辩论中LLMs易盲目从众的问题,提出DEAR框架,通过动态调控辩论关系缓解该问题,实验显示其性能更优且token消耗显著降低。
SEER:用于受控空间关系分类的自 grounding 证据接口
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出针对冻结VLM的无训练推理时证据接口SEER,通过构建查询特定证据缓解空间关系分类错误,在多数据集上取得显著性能提升,证明该干预措施的有效性。
Comments 23 pages total, 2 figures. Code: https://github.com/SouthWinter/SEER
VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力
专题命中 规划推理 :planning(abstract)
AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。
TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%
Comments 10 pages, 5 figures, 7 tables
MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。
通过场景图实现基于CAD的工业环境语义增强以用于模拟与推理
机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) ; Tough Cyberphysical AI Research Center, Tohoku University(东北大学 Tough 跨物理AI研究中心) ; RWTH Aachen University(亚琛工业大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出通过场景图增强CAD环境,利用大型视觉-语言模型生成语义信息,以提升工业环境的模拟与推理能力。
Comments Accepted to IEEE SSRR 2025
NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。