TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology
TumorBoard:基于证据的多智能体纵向神经肿瘤学决策支持系统
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 TumorBoard是基于证据的多智能体纵向神经肿瘤学决策支持系统,经360例基准测试,其性能优于现有基线,安全管控模块可有效降低有害建议比例。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
TumorBoard:基于证据的多智能体纵向神经肿瘤学决策支持系统
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 TumorBoard是基于证据的多智能体纵向神经肿瘤学决策支持系统,经360例基准测试,其性能优于现有基线,安全管控模块可有效降低有害建议比例。
基于航班时刻的机场安检点每小时吞吐量时间融合预测
机构 * School of Aviation and Transportation Technology, Purdue University(普渡大学航空与运输技术学院) ; Department of Geography, The Ohio State University(俄亥俄州立大学地理系) ; College of Aeronautics and Engineering, Kent State University(肯特州立大学航空与工程学院)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 本研究开发了将航班时刻表转换为安检负荷信号的框架,结合时间融合Transformer模型,在机场每小时吞吐量预测中优于RNN和LSTM,可支撑安检点人员配置与规划。
生成式与智能体式AI中认知能力差距的分类学
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文针对制约认知AI发展的认知能力差距开展分类学综述,梳理五大维度的进展与挑战,提出ACIA架构及认知导向评估框架,为构建可靠认知AI与AGI提供路线图。
Comments 15 pages, 4 figures
ScrambleToolBench:即使自身的“地图”指向下一步,智能体仍会进行穷尽式搜索
机构 * Nanyang Technological University(南洋理工大学) ; Agency for Science, Technology, and Research (A*STAR)(新加坡科学、技术与研究局)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 针对现有工具使用基准依赖先验知识的局限,推出ScrambleToolBench交互式终端基准,评估发现当前语言模型面对环境结构变化时难以实现稳健适应。
面向通用搜索智能体的跨域混合在线策略蒸馏
机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。
用于道德决策的契约论论证框架
机构 * Hospital del Mar Research Institute(德尔马医院研究所) ; Ghent University(根特大学) ; imec(imec研究院)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对自主智能体在共享环境中需处理冲突利益的道德决策问题,提出基于Scanlon契约论的、扩展了价值过滤的ASPIC+契约论论证框架,经实例验证其有效性并探讨了与现有方法的关联。
Comments 9 pages; to appear in the proceedings of the Fourth International Workshop on Value Engineering in AI (VALE 2026)
DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUDT(中国人民解放军国防科技大学) ; OUC(中国海洋大学) ; HITSZ(哈尔滨工业大学(深圳)) ; Huawei Cloud BU(华为云业务部)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。
能否用视觉-语言模型评估城市衰败:以底特律为例
机构 * School for Environment and Sustainability(环境与可持续发展学院) ; School of Information(信息学院) ; University of Michigan(密歇根大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。
Comments 19 pages, 11 figures
MNC:面向私有大语言模型智能体通信的范围受限语义解密
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究针对多智能体LLM系统的隐私泄露问题,提出范围受限语义解密协议MNC,通过绑定披露范围实现授权信息传递,阻止未授权操作,为私有LLM智能体系统提供实用通信边界。
SyncPlan:通过显式同步与自适应修正实现长视 Large Language Model(大语言模型,LLM)协调
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 SyncPlan 是用于长视 LLM 多智能体协调的“规划-执行-修正”框架,通过显式同步、自适应修正及轻量级计划过时检测器优化,在低耗时下实现了超越现有方法的任务成功率。
GraphIR:面向大语言模型引导的神经架构演化的架构级搜索状态
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 针对LLM引导NAS中代码级表示无法满足架构变异需求的问题,提出架构感知中间表示GraphIR,在六个下游基准中集成到OpenEvolve后实现最佳搜索性能。
面向仓库级代码问答的深度智能体搜索:一项实证研究
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究在SWE-QA基准上对比语义搜索与深度智能体搜索的代码问答效果,发现语义搜索正确率更高、成本更低,深度智能体搜索存在交接环节的新失败问题。
Comments 41 pages, 21 figures, 6 tables. Under review at a journal
G-ReAct:基于结构-状态协同演化的图引导深度搜索
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 提出图引导深度搜索框架G-ReAct,通过结构-状态协同演化解决现有LLM深度搜索的上下文遗忘等问题,仅用少量轨迹微调即提升模型在BrowseComp-ZH、XBench上的准确率,且推理时可增强现有LLM性能。
BiCAA:面向搜索增强智能体的双向信用分配
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 针对搜索增强智能体多步搜索任务中普通GRPO的稀疏监督问题,提出BiCAA双向信用分配框架,融合前向可解性增益与后见成功关键性构建密集过程奖励,实现稳定策略优化并取得有竞争力的QA性能。
RH-RAG:适用于隐私受限场景的可信长文本生成
机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。
Comments accepted in KDD 2026 SeT-LLM Workshop
从AI技术债务到智能体技术债务:智能体AI系统中根本原因与表现形式的系统映射
机构 * University of Birmingham(伯明翰大学) ; Bournemouth University(伯恩茅斯大学) ; Brunel University London(伦敦布鲁内尔大学) ; HBKU(哈迈德·本·哈利法大学) ; University of Hawaii(夏威夷大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文针对智能体AI系统引入智能体技术债务(AgTD)概念,通过转换方法建立AITD到智能体表现的系统映射,明确其影响并提出管理框架与研究议程。
Comments 32 pages, 7 figures, 7 tables, submitted to IEEE Transactions on Software Engineering
PROGRESS:基于覆盖引导的强化学习训练搜索增强型大语言模型智能体
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城人工智能中心)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对搜索增强型大语言模型智能体结果级奖励监督不足的问题,提出PROGRESS方法,通过教师引导的覆盖奖励结合R1框架训练,提升了智能体任务性能,凸显了搜索策略监督的重要性。
Comments Accepted in Interspeech 2026
超越组件测试:验证智能体AI系统
机构 * University of Messina(墨西拿大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。
Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review
SeekBrain:用于加速神经科学发现的自主多智能体系统
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。
通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。
为生成式AI(GenAI)搭建批判性参与支架:在提示工程任务中转变少数民族预科生的协作话语
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究针对中国78名少数民族预科生,通过整合人在回路工作流等的GenAI课程,帮助学生转变对GenAI的依赖,提升提示自我效能,培养其人机协作的批判性认知能动性。
Comments Accepted as a full paper by the 27th International Conference on Artificial Intelligence in Education (AIED 2026)
大型语言模型能否执行父订单?
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 该研究针对算法交易的父订单执行问题,提出分层框架PACE,基于深交所数据验证其性能优于现有方法,表明LLMs可辅助人类交易者执行决策。
MemHarness:记忆是被重构的,而非被重放的
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对现有记忆增强LLM智能体的逐字重放范式缺陷,提出MemHarness框架,通过GRPO训练实现记忆重构,在ALFWorld、WebShop等任务中性能优于基线,提升了智能体推理与分布外鲁棒性。
Comments 20 pages, 13 figures
超越改写:书籍级组织提升训练中合成教科书数据的质量
机构 * Peking University(北京大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。
Comments 31 pages, 3 figures, 11 tables
基于特权自蒸馏的对比强化策略优化
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。
规模化的记忆解码器:一种预训练的参数化长期记忆
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究将记忆解码器扩展至69亿参数并在3000亿token上预训练,通过分布式Faiss等技术解决索引瓶颈,发现独立扩展记忆可更高效提升语言模型性能,在多基准测试中验证了其优势。
SAFViT:用于基于视觉Transformer的细胞核分割与分类的空间注意力融合门控
机构 * School of Computer Science, University of Leeds(利兹大学计算机学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究针对数字病理学中细胞分割与分类的冗余信息问题,提出SAF门控模块替换CellViT的传统跳跃连接,在PanNuke和MoNuSeg数据集上使mPQ达0.471,死亡类F1分数提升14.5个百分点。
心理世界建模
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。
Comments project website: https://mental-world.github.io/
面向临时团队中任务无关适应的伙伴能力估计
机构 * King’s College London(伦敦国王学院)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究针对临时团队协作中伙伴能力隐藏与人类行为不可预测问题,提出CE-CM及CE-CM-Div方法,通过仿真采样与多样规划器rollout实现任务无关的能力估计,提升了团队协作的可行性与鲁棒性。
Comments 44 pages, 18 figures, submitted
AgentMap:用于本体匹配的联合等价与包含关系发现
机构 * The University of Manchester(曼彻斯特大学) ; Zhejiang University(浙江大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。
Comments 21 pages, 5 figures