Online Monitoring and Corrective Steering of Programming Agents
编程智能体的在线监控与纠正引导
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LivePlan,通过解耦判断与建议的设计,在SWE-agent基础上实现编程智能体的在线监控与纠正,在SWE-bench数据集上显著提升问题解决率,且成本增量极小。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
编程智能体的在线监控与纠正引导
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LivePlan,通过解耦判断与建议的设计,在SWE-agent基础上实现编程智能体的在线监控与纠正,在SWE-bench数据集上显著提升问题解决率,且成本增量极小。
CyberLLM:面向汽车网络安全的多智能体大语言模型框架,用于自主检测与受管控响应
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 CyberLLM是由大语言模型编排的多智能体框架,结合确定性检测层与大语言模型精化,在安全防护下实现汽车漏洞自主检测与修复,在基准测试中覆盖约70%漏洞且零误报,验证了LLM智能体自主防御的可行性。
利用大语言模型智能体与知识图谱的协同作用进行城市社会经济预测
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出LLM智能体与知识图谱的协同框架,结合二者优势完成城市社会经济预测,经实验验证该协同设计可提升预测效果,为跨任务信息共享提供思路。
用于小企业短历史多KPI预测的会计图变换器
机构 * Foresight-AI, Intuit(富睿特远见人工智能实验室,Intuit公司)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出Accounting Graph Transformer模型,针对小企业短历史数据完成13项财务KPI的12个月联合预测,在多组测试集上均优于LightGBM等基准模型,为企业财务分析提供集成预测层。
面向决策与智能体AI的因果数据管理生态系统
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。
Comments Accepted at ACM AI Leadership Summit 2026
用于视觉令牌剪枝的AI4AI框架
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。
MemWM:记忆增强的基于文本的世界模型
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Huawei Heisenberg Research Center(华为海森堡研究中心) ; Zhejiang University(浙江大学) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; TU Berlin(柏林工业大学) ; Kiel University(基尔大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 该研究提出记忆增强的基于文本的世界模型MemWM,通过引入世界记忆解决世界模型的系统性预测错误,在ALFWorld等基准上提升智能体规划成功率与效率。
奖励何时能引导对状态的理解?一种隐藏自动机工具与群语言边界
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 研究强化学习中高奖励与潜在状态理解的关系,通过将任务表示为隐藏自动机,利用三个可控轴(优化器强度、任务结构、观察信息量)来分别测量奖励成功和潜在状态学习,区分感知差距和规划差距,得出高奖励非任务理解证据且智能体恢复潜在状态可预测的结论。
Comments 17 pages, 3 figures, 6 tables (9-page main text). Ancillary file hidden-automata-rl-code.zip contains reproduction code and the complete per-run data behind every table and figure. v3: author name corrected, title revised, text rewritten for clarity, new robustness checks (nonlinear and off-policy probes) added; results and conclusions unchanged
DATAREEL:基于动画的自动化数据驱动视频故事生成
机构 * York University(约克大学) ; Bangladesh University of Business and Technology(孟加拉国商业与技术大学) ; RBC, Canada(加拿大RBC) ; Nanyang Technological University(南洋理工大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。
Comments Under Review
YOLO-PEFT:针对YOLO系列的参数高效微调
专题命中 规划推理 :planning(abstract)
AI总结 YOLO-PEFT是一种针对YOLO系列的结构感知参数高效微调框架,将适配器部署建模为约束规划问题,在VOC数据集上的实验显示其检测精度优于全微调,且能减少训练内存。
EvoRIC:面向自主O-RAN的、由强化学习微调大语言模型赋能的RAN智能控制器
专题命中 规划推理 :reasoning(abstract)
AI总结 针对传统RAN智能算法泛化差、通用LLM算力高且缺领域知识的问题,提出EvoRIC分层框架,结合RLFT与PPO优化LLM,在IAB网络中验证其泛化性与效能,为自主O-RAN提供新方案。
Comments Manuscript submitted 23 April 2026; revised 7 August 2026
规划与避让:多智能体环境下的实时飞行器轨迹协调
机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工学院暨州立大学) ; NASA Langley Research Center(NASA兰利研究中心)
专题命中 规划推理 :planning(abstract)
AI总结 该研究提出Plan-and-Avoid框架,针对多智能体空域环境,通过实时生成协作建议,在900余起强制着陆案例测试中,以5.7秒最坏响应时间实现优先级轨迹的低延迟安全间隔协调。
软商拓扑与软覆盖映射的精确处理
专题命中 规划推理 :planning(abstract)
AI总结 该研究建立软商拓扑基础理论,提出软覆盖映射精确定义,将其应用于多智能体运动规划以降低组合复杂性。
Comments 18 Pages. Comments are welcome
用于可复现人在环环境健康研究的智能体式人工智能
专题命中 规划推理 :planning(abstract)
AI总结 本文提出人在环智能体框架,结合领域知识与编码素养,利用智能体式大语言模型生成R代码,通过美国超级基金场地案例验证其可提升环境健康研究结果的严谨性与可复现性。
Comments 41 pages, 3 figures
基于物理学原理的材料人工智能用于可靠的材料发现
专题命中 规划推理 :reasoning(abstract)
AI总结 该研究提出PhysMat AI框架,整合物理知识用于材料发现,通过多领域示例说明其应用,还规划了从物理感知到自主AI的发展路线,助力可靠材料发现。
人工智能参与对专家咨询工作流中信任的影响
专题命中 规划推理 :planning(abstract)
AI总结 研究探讨人工智能在专家咨询工作流中对用户信任的影响,发现人类专家使用AI的方式会影响用户对专业知识的信任。
Comments Revised version. Accepted to AIES 2026. Includes technical appendices and additional analyses
文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移
机构 * Ant Group(蚂蚁集团)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。
将3D建模与空间推理解耦
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG
AI总结 该研究提出解耦空间推理器(DiSR)框架,将3D感知与LLM推理解耦,在空间推理基准上取得竞争力性能,兼具可解释性、模块化性与计算效率,为空间智能提供替代范式。
RemoteZero:零样本地理空间推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
多模态大模型模态迁移:自主地理信息系统智能体的先决条件
机构 * Graz University of Technology(格拉茨工业大学) ; University of Vienna(维也纳大学) ; University of Liverpool(利物浦大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。
图机:将边机制作为归纳偏置的探索
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究提出Graph Machine架构,含边增强注意力与以边为中心的引用两种边机制,在数独任务上优于Transformer基线,证明显式边机制是有前景的架构设计。
Capek 0.5:面向具身智能的以执行为中心的视觉语言模型
机构 * Xiaopeng(小鹏汽车)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出以执行为中心的具身视觉语言模型Capek 0.5,通过分类法整合四类具身能力,在多维度评估中表现优于初始化模型,可迁移至闭环具身任务执行。
破坏注意力:对检测 Transformer 中编码器注意力的基于规避的对抗攻击
机构 * Queensland University of Technology(昆士兰科技大学) ; Agency for Science, Technology and Research, Singapore(新加坡科技研究局) ; National University of Singapore(新加坡国立大学) ; Indraprastha Institute of Information Technology, Delhi(英迪拉普拉斯塔信息技术学院(德里))
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出首个针对检测 Transformer 编码器注意力的对抗攻击,在不可察觉扰动下破坏注意力结构,使 DETR-R50、DINO-Swin-L 等主流检测器 mAP 大幅下降,性能优于现有攻击。
Comments 8 pages, 6 figures, 6 tables
探测轻量视觉语言模型中视觉概念以用于自动驾驶
机构 * University of Limerick(利默里克大学) ; Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) ; Department of Electronic and Computer Engineering(电子与计算机工程系)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。
Journal ref Transactions on Machine Learning Research, 2026
AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。
Text2Villa:通过物理感知的合成分析进行3D室内环境的分层生成
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 研究旨在解决从自然语言生成3D室内场景的问题,提出Text2Villa框架。宏观构建数据集微调布局生成器,微观引入A-PSSG并结合碰撞检测与语义推理,有效解决相关问题,性能优于以往方法,为下游应用提供3D内容基础。
Comments 17 pages, 12 figures, Project page: https://xdlbw.github.io/Text2Villa/
MetaSICL: 通过元语音上下文学习适应听觉大语言模型
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。
面向长 horizon 智能体的可靠上下文压缩:执行不稳定性的实证研究
机构 * University of Virginia(弗吉尼亚大学) ; Nokia(诺基亚公司)
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 该研究针对长 horizon 智能体上下文压缩的执行不稳定性问题,提出了验证器引导框架 TRACE,在 AppWorld 上的实验显示其在任务性能等指标上优于现有基线,为可靠上下文压缩提供了新方向。
Comments 31 pages, 6 figures
TokTier:面向智能体大语言模型服务的精确有状态分词方案
机构 * Arizona State University(亚利桑那州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。
Comments 26 pages. Code: https://github.com/asu-idi/toktier
面向复杂动态系统反馈控制器设计的大语言模型基准测试与推理蒸馏
机构 * The University of Tokyo(东京大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Chiba University(千叶大学) ; Tongji University(同济大学) ; Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 该研究构建了CoDyControlBench基准,评估了6种LLMs的控制器设计性能,开发的15亿参数推理蒸馏模型可实现边缘部署,在机械臂试验中成功完成目标跟踪。