Learning to Plan with Natural Language
专题命中 复杂问题求解 :reasoning(abstract,comments);分类 cs.CL;planning(comments)
Comments Large Language Model, Learning from feedback, Planning and Reasoning
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 复杂问题求解 :reasoning(abstract,comments);分类 cs.CL;planning(comments)
Comments Large Language Model, Learning from feedback, Planning and Reasoning
奖励引导自回归图生成的高效多智能体通信拓扑设计
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。
Comments Full version of extended abstract accepted at ICONIP 2026 (poster)
涌现不变性:从符号化思维到结构控制
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。
面向医学问答的自适应记忆与反思多智能体系统
机构 * School of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学学院) ; Electrical and Computer Engineering, Technion – Israel Institute of Technology(以色列理工学院电气与计算机工程系) ; School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科学与科技学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有医学问答系统缺乏适应性等问题,提出自适应记忆与反思多智能体框架,经MedQA等数据集验证,结合专用记忆等模块可提升性能,助力开发可信医学智能体。
Comments Accepted by IEEE SMC 2026
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
Bactrainus:为多跳复杂问答任务优化大型语言模型
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对多跳问答的证据瓶颈,提出模块化选择器-阅读器框架Bactrainus,经实验验证其在HotpotQA任务中表现优异,为该领域提供了可审计的证据接口方案。
能源盲点:NVIDIA 旗舰边缘 AI 硬件无法支持进程级能源归因
机构 * Independent Researcher(独立研究者) ; Texas A&M University(德克萨斯农工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文审计了 ASUS Ascent GX10 (GB10 SoC) 平台的能源可观测性,发现其缺乏 CPU 能源计数器等关键接口,导致无法像 x86 的 RAPL 那样进行进程级能源归因,并提出通过外部直流计量和 GPU 减法进行校准的临时方案,呼吁将能源可观测性作为硬件的一等要求。
Comments 5 pages, 0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:2608.02072
LORA-CRAFT:通过冻结预训练注意力权重的跨层秩适应进行Tucker分解
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 LORA-CRAFT通过冻结预训练注意力权重的Tucker分解实现跨层秩适应,以轻量级可训练变换调整模型,在GLUE基准测试中达到与现有方法相当的性能,仅需41K参数。
用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。
更好的分解,自由聚合:面向多语言多跳问答的合成器折叠框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对多语言多跳问答中现有方法的翻译噪声与错误放大问题,提出Syfer框架,通过推迟翻译、格式受限分解与质量检查实现性能与成本的良好平衡。
Comments Accepted by NLPCC 2026
什么驱动了大语言模型(LLM)的自我反思?武装冲突预测中不确定性路由的受控消融研究
机构 * University of North Texas(北得克萨斯大学) ; College of Computer Science and Engineering(计算机科学与工程学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过受控消融实验发现,武装冲突预测中LLM自我反思的增益源于类型化行动路由,而非诊断支架或分类学术语,且该机制在GPT-4o上复现,增益集中于结构新颖的冲突。
学习面向延迟的并行多智能体系统编排
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LAMaS框架,通过显式优化关键路径降低多智能体系统并行执行的延迟,提升效率和性能。
Comments Preprint. Previously this version appeared as arXiv:2607.13359 which was submitted as a new work by accident
LookBack:通过视觉参考使用情况对LVLM响应进行评分的位置与方法
机构 * Yonsei University(延世大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对LVLM响应存在的图像相关幻觉问题,提出无需训练的LookBack评分方法,结合视觉回溯评分增强token似然,在四个基准和三个模型上提升了Best-of-$N$选择性能且开销极小。
Comments 19 pages, 10 figures. Code: https://github.com/bscho333/LookBack
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
WavePhaseNet:一种基于离散傅里叶变换(DFT)的构建语义概念层次结构(SCHS)方法
机构 * Pionira Solutions LLC(皮奥尼拉解决方案有限公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 WavePhaseNet通过DFT构建语义概念层次结构,利用频谱分析和上同调正则化实现语义一致性控制,减少维度以提升推理能力并抑制幻觉。
基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。
DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?
机构 * York University(约克大学) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce AI研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。
VDC-Agent:当视频详细描述器通过代理自我反思而自我进化
机构 * Xi’an Jiaotong University(西安交通大学) ; Kuaishou Technology(快手科技) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。
Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io
KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。
双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Stony Brook University(石溪大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。
工具增强型大语言模型系统中的持久语义实体
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8¬eId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521
DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练
机构 * Tsinghua University(清华大学) ; ENS Paris-Saclay(巴黎-萨克雷大学) ; Beike Language and Intelligence(贝克语言与智能)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。
LF²AR:考虑分层动态以改进语言模型的多模态适配
机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) ; Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) ; LIA, Avignon Université, France(法国阿维尼翁大学LIA) ; LIUM, Le Mans Université, France(法国勒芒大学LIUM) ; Zenidoc, Marseille, France(法国马赛Zenidoc)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。
Comments Published as a conference paper at COLM 2026
MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。
Comments Preprint
Kimi K3:开放前沿智能
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 介绍Kimi K3这一2.8T参数的专家混合模型,基于Kimi Delta Attention等构建,结合多种方法使缩放效率提升约2.5倍。经训练后在多领域强化学习表现出色,虽整体性能略逊最强专有模型,但在多项任务中达前沿水平且优于其他模型,还发布模型权重助力研究。
Comments K3 tech report
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
追踪核心:一种用于心力衰竭特征工程的证据关联管道
机构 * Nimblemind(宁敏德(音译)) ; Singapore University of Technology and Design(新加坡科技设计大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Florida International University(佛罗里达国际大学) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; Rutgers University Newark(罗格斯大学纽瓦克分校) ; Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) ; Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) ; Rutgers Health(罗格斯医疗)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。
对抗性快速变化的真实世界领域:用于基准测试AI科学家能力的测试床
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出以F1、MTG等对抗性快速变化的真实世界领域为测试床,发现AI科学家的核心能力差距是想法过滤、优先级排序而非生成。
Comments Accepted at the AI for Science workshop at ICML 2026. 14 pages, 11 figures
SphUnc:通过信息几何的超球面不确定性分解与因果识别
机构 * University of Macau(澳门大学) ; Fudan University(复旦大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Renmin University of China(中国人民大学) ; Hanyang University(翰阳大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Liverpool(利物浦大学) ; Southeast University(东南大学) ; Central South University(中南大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 SphUnc结合超球面表示学习与结构因果建模,通过信息几何融合分解不确定性为epistemic和aleatoric成分,并通过样本模拟实现因果识别,提升多智能体系统中的预测准确性和不确定性校准能力。
Comments 22 pages, 15 figures
用于延迟和模型大小优化的大语言模型多目标结构化剪枝
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在边缘计算环境部署的挑战,提出硬件感知多目标结构化剪枝框架,分两阶段优化,粗粒度移除模块,细粒度搜索最优剪枝率,实验证明能降低模型复杂度,在多方面实现良好权衡,适合边缘部署。
Comments Submitted to the ICTAI 2026 (under review)