Strategy-first synthesis planning for complex natural products
复杂天然产物的优先策略合成规划
专题命中 复杂问题求解 :planning(title);分类 cs.AI
AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
复杂天然产物的优先策略合成规划
专题命中 复杂问题求解 :planning(title);分类 cs.AI
AI总结 基于大语言模型的智能体框架SynthEx,可规划出传统算法无法实现的复杂天然产物合成路线,其关键步骤获化学家认可,相关路线数据库SynthAtlas已开放。
LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。
Comments 15 pages, 8 figures
使用边界框提高小语言模型在基于视觉的评分任务中的性能
机构 * Australian National University(澳大利亚国立大学)
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究在基于视觉的简答题评分任务中,用边界框裁剪学生答案对小语言模型性能的影响,通过实验表明此方法能显著提高评分准确性并降低计算成本,是大规模视觉教育评估中部署小语言模型的关键预处理步骤。
Comments Accepted for 1st Workshop on Small Language Models for Education (SLM4ED '26) at AIED 2026
用于聚合物自动化粗粒度分子动力学的多智能体框架
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。
MANTA:面向自演进多智能体系统的多智能体网络拓扑自适应框架
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 该研究提出MANTA框架,使多智能体系统通信拓扑可在推理阶段自演进,在五类基准测试中平均得分74.0,较最强基线高5.8个百分点,验证了推理阶段自改进可延伸至协作架构。
在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计
机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Springbrand Inc.(春品牌公司) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北京航空航天大学) ; Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) ; Microsoft(微软公司)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。
Comments 11 pages
人工智能从应用程序原型生成待办事项列表的效果如何?
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究人工智能从应用程序原型生成待办事项列表的效果,提出多模态方法,评估三种提示策略,发现结合架构上下文的混合提示有帮助,结果因项目类型而异,还提出新度量,强调开发人员监督必要。
Comments Accepted at the AIRE Workshop, IEEE 34th International Requirements Engineering Conference (RE) 2026
用于多事件长视频理解的模块化动态粒度视频语言模型
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。
Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)
MASTE:一种用于零样本方面情感三元组提取的多智能体管道
机构 * Tsinghua University(清华大学) ; Wuhan University(武汉大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 研究针对方面情感三元组提取问题,提出多智能体管道MASTE,将其分解为四个阶段,由专门智能体处理不同子任务,实现完全无训练的零样本提取,在多个基准测试中显著优于基线,缩小与全监督方法差距。
面向工业规模车辆路径问题的自适应先聚类后路由分解方法
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出一种自适应先聚类后路由分解系统,利用大语言模型作为高层决策者,迭代执行聚类、平衡和细化操作,实现容量感知的客户与车辆联合划分,在高达50万客户的实例上展现出竞争性性能和可扩展性。
Comments 29 pages, 6 figures, 5 tables
Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型
机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。
FAPO:多步骤LLM流水线的全自动提示优化
机构 * Foundation AI–Cisco Systems Inc.(基础AI–思科系统公司) ; Yale University(耶鲁大学)
专题命中 复杂问题求解 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 提出FAPO框架,通过自动诊断流水线瓶颈并迭代优化提示或链结构,在18个模型-基准比较中15次优于基线GEPA,平均提升14.1个百分点。
扩散语言模型中令牌编辑的自生成错误训练
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 针对LLaDA2.1中令牌编辑的训练-推理不匹配问题,提出自生成T2T方法,通过无梯度草稿传递和自生成错误监督,提升编辑准确率并减少编辑强度。
从论证组件到图:一种具有置信门控的多智能体辩论方法用于论证关系识别
机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(华沙理工大学电子与信息技术学院)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 提出一种多智能体辩论框架,通过置信门控机制仅在不确定时进行辩论,在UKP语料上达到训练无关方法最高Macro F1,并生成可读辩论记录。
Comments Accepted for publication in the proceedings of KES 2026
迈向自主加速器设计:基于SECDA的FPGA加速器生成
机构 * School of Computing Science, University of Glasgow, Scotland, UK(格拉斯哥大学计算机科学学院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出SECDA-DSE框架,集成大语言模型引导FPGA加速器设计空间探索,通过结构化探索器和LLM推理生成可综合的加速器设计,减少人工干预。
Comments Accepted to the Machine Learning for Architecture and Systems Workshop (MLArchSys), co-located with ISCA 2026
SSR: 模拟患者能否学会自我污名化?通过内心独白建模自我污名
机构 * Shanghai Jiao Tong University(上海交通大学) ; X-LANCE Lab, Dept. of Computer Science and Engineering(X-LANCE实验室,计算机科学与工程系) ; MoE Key Lab of Artificial Intelligence, AI Institute(教育部人工智能重点实验室,人工智能研究院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出基于心理3A1H模型的SSR框架,通过内心独白数据集和链式思维微调LLM,使模拟患者根据对话触发动态调整污名表达,生成更真实的情境适应性反应。
ZAS-SQL: 从失败中提炼规则用于零样本文本到SQL
机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心) ; College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) ; Behavioral and Spatial AI Lab, Peking University & Tongji University(北京大学与同济大学行为与空间人工智能实验室)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 提出ZAS-SQL零样本框架,通过Map-Reduce规则蒸馏从失败案例中提取核心生成规则,结合知识增强模式表示、规则驱动结构化推理和执行引导早停三个模块,在Spider上达到87.2%和88.6%执行准确率,超越多个少样本和微调方法。
智能体事务:面向ACID兼容的智能体系统
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
视听火烈鸟:用于长而复杂视频的开放视听智能
机构 * NVIDIA, USA(美国NVIDIA公司) ; University of Maryland, USA(美国马里兰大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。
Comments Project Page: https://avflamingo.pages.dev/
语言模型中的可言语化表征形成全局工作空间
机构 * Anthropic(A÷)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨语言模型中可言语化表征,用雅可比透镜识别出J空间,其具有全局工作空间功能特性与结构特征,能揭示模型未显思考,发现训练后助手观点在工作空间,引入反事实反思训练,解码表征助于了解认知过程。
关于测试前编码风险:基于大语言模型的测试生成工作流程的实证研究
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究大语言模型在软件工程工作流程中生成代码和测试套件时,生成的代码是否会使后续测试产生偏差,通过实证研究错误传播现象,评估其在多种编程任务和工作流程中的影响。
GMO-E$^2$DIT:面向电商图像的接地多操作编辑
机构 * Wuhan University(武汉大学) ; Xi’an Jiaotong University(西安交通大学) ; Sun Yat-sen University(中山大学)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)
AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。
用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。
更好的分解,自由聚合:面向多语言多跳问答的合成器折叠框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对多语言多跳问答中现有方法的翻译噪声与错误放大问题,提出Syfer框架,通过推迟翻译、格式受限分解与质量检查实现性能与成本的良好平衡。
Comments Accepted by NLPCC 2026
什么驱动了大语言模型(LLM)的自我反思?武装冲突预测中不确定性路由的受控消融研究
机构 * University of North Texas(北得克萨斯大学) ; College of Computer Science and Engineering(计算机科学与工程学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过受控消融实验发现,武装冲突预测中LLM自我反思的增益源于类型化行动路由,而非诊断支架或分类学术语,且该机制在GPT-4o上复现,增益集中于结构新颖的冲突。
LookBack:通过视觉参考使用情况对LVLM响应进行评分的位置与方法
机构 * Yonsei University(延世大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对LVLM响应存在的图像相关幻觉问题,提出无需训练的LookBack评分方法,结合视觉回溯评分增强token似然,在四个基准和三个模型上提升了Best-of-$N$选择性能且开销极小。
Comments 19 pages, 10 figures. Code: https://github.com/bscho333/LookBack
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
机构 * York University(约克大学) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce AI研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。