Beyond Compaction: Structured Context Eviction for Long-Horizon Agents
超越压缩:面向长周期智能体的结构化上下文驱逐
机构 * Kiz8
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 提出上下文窗口生命周期(CWL)方案,通过结构化、语义感知的驱逐策略,使长周期LLM智能体在有限上下文预算内实现无限工作视野,避免性能下降和幻觉。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
超越压缩:面向长周期智能体的结构化上下文驱逐
机构 * Kiz8
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 提出上下文窗口生命周期(CWL)方案,通过结构化、语义感知的驱逐策略,使长周期LLM智能体在有限上下文预算内实现无限工作视野,避免性能下降和幻觉。
IS-CoT: 通过交错结构思维打破长文本生成崩溃
机构 * Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Information Research Center of Military Science, PLA Academy of Military Science(军事科学院军事科学信息研究中心)
专题命中 规划决策 :planning(abstract);agentic(abstract);分类 cs.CL
AI总结 针对大语言模型在长文本生成中因静态层次规划导致长度崩溃的问题,提出交错结构思维链(IS-CoT)框架,通过动态规划-写作-反思循环实现持续策略调整,训练IS-Writer-8B模型在长文本基准上取得最优性能。
SecureClaw: 夺回对LLM智能体的控制
机构 * TU Berlin(柏林技术大学)
专题命中 规划决策 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 针对工具使用型LLM智能体的双重安全漏洞,提出双边界架构SecureClaw,在效果汇点实施授权、在读边界实施明文隔离,通过预览-提交协议和可信网关实现安全控制,在多个基准上保持可用性的同时将攻击成功率降至接近零。
面向工具增强型大语言模型的能力对齐分层学习
机构 * Jilin University(吉林大学)
专题命中 规划决策 :tool-use(abstract);planning(abstract);分类 cs.AI
AI总结 提出CAHL方法,利用RLVR联合优化高层规划器与低层执行器,解决分层工具学习中的规划-执行对齐问题,在多个基准上验证有效性。
Comments 14 pages, 5 figures, 6 tables. Preprint
将LLM推理蒸馏为可解释的策略树用于人机协作
机构 * Sun Yat-sen University(中山大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出Co-pi-tree方法,通过将大语言模型推理蒸馏为可执行策略树,在Overcooked-AI中平均奖励提升35.4%,同时减少77.7%的LLM查询和97.1%的测试延迟。
PRISM:世界模型中基于先验引导的想象采样
机构 * Northeastern University(东北大学) ; University of California, Berkeley(加州大学伯克利分校) ; Qiyuan Lab(启元实验室) ; University of Florida(佛罗里达大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 提出PRISM框架,通过从世界模型编码器提取状态条件高斯先验,并利用精度加权高斯乘积更新规划器的采样分布,在不增加架构复杂度的情况下显著提升基于模型的连续控制性能。
像飞行员一样思考:细粒度长时程无人机导航
机构 * Colab ; Beihang University(北航) ; Meituan(美团) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。
不确定性感知的LLM引导策略塑形用于稀疏奖励强化学习
机构 * USD AI Research Lab(USD人工智能研究实验室)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 提出ULPS框架,结合校准的大语言模型与不确定性估计,通过A*轨迹微调BERT模型提供动作建议,并用熵机制平衡LLM引导与PPO策略,在MiniGridUnlockPickup基准上显著提升成功率、奖励效率和样本复杂度。
Comments Accepted to the 2026 IEEE Conference on Artificial Intelligence (IEEE CAI). 6 pages, 3 figures. Code available at: https://github.com/USD-AI-ResearchLab/uncertainty-aware-llm-rl
TerraLogic:地球观测中分层地理空间推理的基准
机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) ; Technical University of Munich(慕尼黑工业大学)
专题命中 规划决策 :agent(abstract,comments);planning(abstract)
AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。
Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic
AccountAgent:AI会计助手系统
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 AccountAgent是一款AI会计助手系统,依托机器学习等技术实现会计全流程自动化,解决传统会计痛点,推动行业向管理导向转型。
RoboStriker:用于自主人形机器人拳击的隐空间策略博弈
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Huazhong University of Science and Technology(华中科技大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 本研究提出RoboStriker框架,将人形拳击任务形式化为隐空间零和马尔可夫博弈,通过分层结构解耦推理与执行,实现了优于原始动作空间方法的战术性能并成功部署到现实人形机器人。
MINT:用于平衡多目标对齐的最小选择偏好蒸馏
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Zillow Group(齐洛集团)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究针对多目标对齐的不平衡问题,提出MINT方法,通过按最弱目标排名候选替代加权和排名,在情感支持等任务中显著提升双目标表现并降低不平衡性。
OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器
机构 * Changhong Intelligent Robot(长虹智能机器人) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。
Comments Technical report. 11 pages, 6 figures, and 2 tables
用于鲁棒跨数据集图像分类的MLLM路由异质集成模型
机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) ; University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。
Comments 8 pages, 4 figures, 7 tables
ARIES-Mission2:用于快速大规模空中任务生成的零样本视觉-语言-动作框架
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 ARIES-Mission2是解耦视觉语义感知与路径优化的零样本VLA框架,在UAV基准上,其飞行距离更短、任务生成速度更快,且TSP模块可扩展性佳。
何时制度优于智能?
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 该研究通过构建受控人工生态,实验揭示制度在修复集体构建可用公共状态的失败时优于智能,反之则不然,为智能与制度的选择提供了诊断依据。
HarnessWAM:弥合世界动作模型中的预测与审议差距
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Yinwang Intelligent Technology Co., Ltd.(银湾智能科技有限公司) ; Beijing Institute of Technology(北京理工大学) ; Wuhan AI Research(武汉人工智能研究院)
专题命中 规划决策 :planning(abstract);agentic(abstract)
AI总结 针对世界动作模型的预测-审议差距,提出HarnessWAM框架,通过双时间尺度反馈环等机制,在两个基准数据集上取得最优任务成功率,扩展了WAMs的具身任务执行能力。
AI作为独立游戏开发中的民主化力量
专题命中 规划决策 :planning(abstract);agentic(abstract)
AI总结 该研究考察AI对2024-2026年游戏行业分化的影响,发现AI大幅降低独立游戏制作的协调成本,推动第三波民主化浪潮,披露AI的游戏接受度与传统游戏相当,但市场已呈现结构性过剩的前提条件。
HELENA:面向多智能体系统的互补拓扑联合上的分层稀疏协调框架
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 HELENA 是一种 MAS 框架,通过互补拓扑联合与分层稀疏协调抑制冗余噪声,在八个基准测试上实现最优结果,平均提升 3.47%,MMLU-Pro 最高提升 10.34%,难基准提升更显著且附加成本合理。
OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准
专题命中 规划决策 :planning(abstract);agentic(abstract)
AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。
LongHorizon-Harness:推进面向真实世界任务的长时程智能体
机构 * Alibaba Group(阿里巴巴集团)
专题命中 规划决策 :agent(abstract);tool use(abstract)
AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。
Comments 29 pages
SIPTraj:无高精地图的物理引导场景交互端到端轨迹预测
机构 * School of Data Science and Engineering, Xingzhi College, South China Normal University(华南师范大学行知学院数据科学与工程学院) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Macau(澳门大学) ; College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学学院) ; School of Electronic Science and Engineering, South China Normal University(华南师范大学电子科学与工程学院)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 SIPTraj是一种无高精地图的端到端轨迹预测框架,通过分层智能体-场景编码器和物理引导迭代解码器解决场景锚定与物理可行性问题,在两个数据集上性能优于现有方法,推理无需高精地图。
虚假的平均值:思维链监控在其作为唯一防御的地方失效
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究指出思维链监控在作为唯一防御时会失效,攻击者通过重写智能体推理可大幅降低监控捕获率,攻击可跨模型迁移,仅轨迹防御难恢复,需外部信息辅助。
低资源东南亚语言中的原生多语言思维链推理
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。
Comments 22 pages, 16 figures, 12 tables
深度强化学习:从第一性原理到推理模型
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 本书介绍深度强化学习从经典方法到各类算法及多领域应用的演进,融合基础与研究视角,面向具备相关基础的学生、研究者和工程师。
迭代调度修改的引导式探索:铁路牵引单元调度的设计研究
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 该研究针对铁路牵引单元调度中交汇序列空间指数增长的问题,提出结合可视化、仿真与三级引导的交互式探索方法,可大幅减少调度修改的识别与评估时间精力。
Comments Accepted for IEEE VIS 2026, will be published in IEEE TVCG
评估残差:长时序评估在匹配短任务性能之外的补充作用
机构 * Tencent(腾讯)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 该论文提出时序残差概念,指出长时序基准需将全任务成功与短阶段基线预测比较,以解释长任务失败的原因。
CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹
机构 * Technical University of Munich(慕尼黑工业大学) ; Huawei Dresden Research Center(华为德累斯顿研究中心)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。
Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/
超越缩放:学习用于超高分辨率遥感的多工具视觉推理
机构 * National University of Defense Technology(国防科技大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
专题命中 规划决策 :tool-use(abstract);planning(abstract)
AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。
CHILL-Harness:用于长期智能体高效推理的反事实控制学习
专题命中 规划决策 :agent(abstract);workflow(abstract)
AI总结 研究长期智能体控制中因依赖固定策略导致效率低的问题,提出CHILL-Harness方法,通过因果干预效应学习和优势实现因果编排,结合成功保留目标与约束,在多任务实验中减少消耗与时间,保持或提高任务成功率。