Inquisitive Action Logic
探究性行动逻辑
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 提出探究性行动逻辑InqAL,一种用于推理行动的多主体模态逻辑,通过问题模态分析主体对结果的确定作用,并证明其完备性和可判定性。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 222-241
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
探究性行动逻辑
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 提出探究性行动逻辑InqAL,一种用于推理行动的多主体模态逻辑,通过问题模态分析主体对结果的确定作用,并证明其完备性和可判定性。
Comments In Proceedings AiML 2026, arXiv:2606.29444
Journal ref EPTCS 447, 2026, pp. 222-241
先规划正确,再规划紧凑:面向高效具身推理的符号强化学习
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯) ; University of London(伦敦大学)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。
Comments 18 pages, 10 figures, 14 tables; includes appendix
大声思考:非对称LLM谈判中的实时欺骗监控
专题命中 规划决策 :agent(abstract);agentic(abstract)
AI总结 提出轻量级实时思维链监控器,在二手车销售场景中检测卖家隐藏缺陷的欺骗行为,实验表明监控能提高买家退出率但存在智能差距。
Vera C. Rubin 天文台调试和早期运行期间使用 Zephyr Scale 的测试管理与协调
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 采用 Jira 原生测试管理工具 Zephyr Scale 协调数百项集成和天空测试,通过测试用例和测试周期管理流程,并集成调度器实现部分自动化,总结了其在大规模天文台调试中的优缺点。
Comments 4 pages, 3 figures. To be published in Proc. SPIE 13381, Observatory Operations: Strategies, Processes, and Systems X, 2026
长程LLM推理的上下文回收
机构 * Independent Researcher(独立研究员)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。
BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化
机构 * University of Chicago(芝加哥大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。
NeuXtalViz:单晶中子衍射的交互式三维可视化与分析
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 开发了基于Python的NeuXtalViz软件,利用Mantid框架和PyVista/Matplotlib实现单晶中子衍射数据的交互式三维可视化与分析,支持UB矩阵确定、实验规划、倒易空间可视化和实空间结构计算。
基于光学扫描的表浅模具近距离治疗合成CT图像生成
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 提出利用光学3D扫描数据生成合成CT图像,结合3D建模和商业治疗计划系统,实现表浅近距离治疗模具的导管定位和剂量优化,无需内部解剖信息。
Comments 8 pages, 3 figures, accepted for publication in the IFMBE Proceedings on the World Congress on Medical Physics and Biomedical Engineering 2022
有毒剧本:揭秘知识投毒对AI安全代理的影响
专题命中 规划决策 :agent(abstract);AI agent(abstract)
AI总结 研究揭示通过RAG注入单条有毒安全知识可系统性改变AI安全代理行为,提出验证边界(VB)分类法,并评估验证提示与多源检索的防御效果。
RoBoSR:面向具身机器人推理的结构化场景表示
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 提出RoBoSR,一种基于语义对象中心场景图的中间结构表示,将操作建模为逐步状态转换,实现因果推理和长期任务规划,并在零样本泛化中优于提示方法和经典TAMP基线。
EmbodiedUS-FS:用于超声机器人的快速慢速智能
机构 * independent researcher(独立研究员) ; Shanghai World Foreign Language Academy(上海世界外国语中学) ; University of Wyoming(怀俄明大学) ; SUNY Binghamton(纽约州立大学宾汉姆顿分校)
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 提出一种分层快慢思考的具身超声系统,通过慢脑进行意图解析和任务规划,快脑融合多模态反馈优化局部动作,并集成安全防护机制,在动态临床环境中提高任务成功率并减少安全违规。
STARE: 基于惊讶度的令牌级优势重加权以实现策略熵稳定性
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent Hunyuan(腾讯 Hunyuan)
专题命中 规划决策 :tool use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对GRPO等RL算法中策略熵崩溃问题,提出STARE方法,通过惊讶度分位数识别熵关键令牌并重加权其优势,结合目标熵闭环门控稳定熵,在1.5B-32B模型和多种任务上实现稳定训练,AIME24/25准确率提升4%-8%。
Comments LLM, Reinforcement Learning
打破求解器瓶颈:在可学习前沿训练任务生成器
机构 * Vmax ; Goodfire AI
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出PROPEL框架,通过训练轻量级激活探针作为求解率代理,在无需重复求解器评估的情况下优化任务生成器,使生成任务集中在可学习前沿,提升数学、代码和软件工程任务的有效性。
Comments 30 pages, 9 figures, 12 tables
两个自私智能体在图上的间歇性战略合作
机构 * Bar-Ilan University(巴伊兰大学)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 研究两个自私智能体在时间与空间约束下的战略合作问题,通过IC2PP模型刻画纯纳什均衡结构,证明均衡存在性并提出多项式时间枚举算法。
机器人何时应重新规划?时变MDP中的遗憾引导更新调度
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 针对时变环境下机器人因预算限制无法持续重规划的问题,提出基于动态遗憾的在线更新调度规则,在仿真和实物实验中优于固定预算基线。
LabVLA:在科学实验室中落地视觉-语言-动作模型
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对科学实验室中机器人执行协议面临的数据和实体瓶颈,提出模拟数据引擎RoboGenesis和两阶段训练策略LabVLA,在LabUtopia基准上取得最高平均成功率。
Comments Work in progress. Project website at https://zjunlp.github.io/LabVLA/
零源大语言模型幻觉检测:类人类标准探测
机构 * South China University of Technology(华南理工大学) ; The University of Melbourne(墨尔本大学) ; Pazhou Laboratory(帕乔实验室) ; Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。
Comments Accepted at ICML 2026
Kwai Keye-VL-2.0 技术报告
机构 * Kuaishou Group(快手集团)
专题命中 规划决策 :agent(abstract);agentic(abstract)
AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。
Comments 31 pages, 11 figures
PreAct-Bench:大语言模型中的预测性监控基准
机构 * King’s College London(伦敦国王学院) ; National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学) ; Thomson Reuters Foundational Research(汤姆森路透基础研究) ; Imperial College London(伦敦帝国学院) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 规划决策 :autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。
RO-LiDAR GeoQuickView:探索罗马尼亚公共LiDAR衍生高程数据的Web平台
专题命中 规划决策 :planning(abstract);workflow(abstract)
AI总结 提出一个非商业Web-GIS平台RO-LiDAR GeoQuickView,整合公共LiDAR衍生数字地形模型等高程数据,提供标准化山体阴影可视化、参与式景观记录和空间索引,以解决数据碎片化和专业处理限制问题。
为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆
机构 * University of Cambridge(剑桥大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。
TRACE: 通过自适应跨步骤证据聚合的LLM智能体轨迹推理
机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) ; Adobe Research(Adobe研究) ; Dolby Labs(杜比实验室) ; University of Oregon(俄勒冈大学) ; Cisco(思科)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出TRACE框架,通过TIJ循环识别高信号区域、累积跨步骤证据并合成轨迹级判决,在SHADE-Arena的十个任务域上F1达0.713,召回率0.844,尤其擅长长距离证据链接。
大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力
机构 * University of Chicago(芝加哥大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL;planning(journal_ref)
AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。
Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025
临床试验策略学习:面向决策智能体的离线策略训练
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG;agentic(comments)
AI总结 本研究将肿瘤学临床开发建模为离线决策问题,构建时间数据集,对比4种离线目标与4种LLM智能体,发现奖励加权行为克隆表现最优,证明结构化离线学习可用于规划临床实验。
Comments Accepted for a spotlight at the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio) and as a poster at the ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning (DEMO). 15 pages, 3 figures, 11 tables
长视野智能体的跨基准泛化
专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.SE
AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。
Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables
结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt University Medical Center(范德堡大学医学中心)
专题命中 规划决策 :tool-use(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。
Comments PIHF method paper
步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) ; XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Data Science, Fudan University(复旦大学数据科学学院)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
基于环的空间Transformer:学习建筑分布与行人流量之间的非线性空间相互作用
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出基于环的SpatialTransformer模型,利用东京100个火车站的环缓冲区数据学习建筑分布与行人流量的非线性空间相互作用,其预测准确率优于GWR,挑战了紧凑城市假设,为城市规划提供了新视角。
FreeBalance:基于残差 workload 预测的预路由在线 MoE 负载均衡
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 FreeBalance 是一种 MoE 模型在线负载均衡框架,通过残差 workload 预测实现专家迁移与预路由计算重叠,降低负载失衡与推理延迟,提升分布式推理效率。
Comments 8 pages, 4 figures