Auditing Provenance Sensitivity in LLM Agent Action Selection
审计大语言模型智能体动作选择中的溯源敏感性
专题命中 规划决策 :agent(title);分类 cs.AI
AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
审计大语言模型智能体动作选择中的溯源敏感性
专题命中 规划决策 :agent(title);分类 cs.AI
AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。
PlanE:基于抽取式大语言模型的数据、调优和推理的元规划
机构 * Ant Group(蚂蚁集团) ; School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。
S3:通过约束分层强化学习中粗粒度动力学的不确定性进行稳定子目标选择
机构 * University of Massachusetts, Lowell(马萨诸塞大学洛厄尔分校)
专题命中 规划决策 :agent(abstract,comments);planning(abstract);分类 cs.LG;autonomous agent(comments)
AI总结 研究分层强化学习中高层智能体子目标选择问题,提出用粗粒度动力学提供动力学感知内在动机,通过最小化预测不确定性稳定高层策略,经实验验证该方法在非平稳长期环境中表现优于现有方法。
Comments Manuscript accepted to the Eighteenth Workshop on Adaptive and Learning Agents (ALA), at the 25th International Conference of Autonomous Agents and Multi Agent Systems 2026
TRACE:可审计的智能体承诺的操作推理模式
机构 * Stanford University(斯坦福大学) ; Quadrivium AI(四元数人工智能)
专题命中 规划决策 :agentic(title);分类 cs.AI
AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。
Comments 46 pages, 18 tables, 4 figures
FORGE:通过关键点轨迹推理实现功能工具使用的泛化
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 规划决策 :tool-use(title);分类 cs.AI
AI总结 研究针对机器人功能工具使用泛化问题,提出FORGE两阶段策略,通过关键点轨迹推理解耦功能推理与动作执行,在七工具击打基准测试中,对未见工具表现优于现有方法,平均成功率显著提升。
Comments 15 pages, 8 figures, 6 tables
先思考再检索:通过战略规划与自我批评实现鲁棒的零样本组合图像检索
机构 * Department of Artificial Intelligence, Korea University(高丽大学人工智能系)
专题命中 规划决策 :planning(title);分类 cs.AI
AI总结 提出PEC-CIR框架,通过规划器-执行器-批评家多阶段推理流水线构建查询,在零样本组合图像检索中减少生成错误,提升检索精度。
上下文感知强化学习用于智能体与多模态大语言模型
机构 * Princeton University(普林斯顿大学) ; UC Davis(加州大学戴维斯分校)
专题命中 规划决策 :agentic(title);分类 cs.CL
AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。
Comments 29 pages, 9 figures
AGORA: 审议与治理门能否吸收公交规划中的参与偏差?
机构 * Department of Civil and Environmental Engineering and Laboratory for Information & Decision Systems, Massachusetts Institute of Technology(土木与环境工程系和信息与决策系统实验室,麻省理工学院) ; Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院)
专题命中 规划决策 :planning(title);分类 cs.LG
AI总结 提出AGORA框架,通过固定网络、需求和求解器,系统变化会议组成、结构化审议和治理门,发现审议是参与影响结果的关键机制,治理门可压缩跨剖面方差,将参与偏差从不可控输入重构为过程设计问题。
基于混合CNN-元胞自动机火灾模型的空中野火抑制规划
机构 * Space Data Frontiers Research Center(空间数据前沿研究所以) ; Fujitsu Research of America(富士通美国研究院)
专题命中 规划决策 :planning(title);分类 cs.LG
AI总结 提出结合混合神经-元胞自动机野火模型与梯度优化空中投放的框架,通过蒙特卡洛采样和空间相关扰动量化不确定性,案例验证可生成有效抑制方案。
神经符号具身智能体
机构 * Imperial College London(帝国理工学院) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City, University of London(伦敦城市大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。
Second Thought:LLM智能体行动与观察时的并行推理
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。
训练AI科学家以实现研究的可复现性
机构 * Inherent(因赫伦特)
专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发了可扩展的论文复现任务空间Replica,后训练出270亿参数的AI科学家Faraday,其在复现任务上表现优于Claude Opus 4.8和GPT-5.5,为长期科学创新AI智能体奠定基础。
Comments 47 pages, 12 figures
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
了解你就是一切:LLM智能体在社交媒体模拟中实现近乎完美的个人资料一致反应预测
专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过基准测试12种LLM配置,发现其在社交媒体反应预测中表现优异,可用于推荐系统压力测试,同时也揭示了大规模合成智能体群对公众意见的潜在威胁。
Comments 28 pages, 6 figures
材料科学假说生成中从图到答案的机制恢复可视化
机构 * Washington University in St. Louis(圣路易斯华盛顿大学) ; Oak Ridge National Laboratory(橡树岭国家实验室) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) ; UniverseTBD ; Massachusetts Institute of Technology(麻省理工学院) ; Old Dominion University(奥多明尼昂大学)
专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对适配的 Qwen3-8B 模型 Graph-PRefLexOR-8B,构建可视化诊断工作流以追踪材料科学假说生成的图到答案机制,发现机制恢复集中于后期合成及答案起始层,可助力相关人员识别假说的机制支持变化。
MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准
专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。
通过结构感知策略学习内化学术写作工作流以生成引言
专题命中 规划决策 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对LLM生成论文引言的挑战,提出StructPO框架将多阶段写作工作流内化为单遍策略,实验显示其在语义对齐等指标上优于基线,泛化性好且与GPT-5.1性能相当。
从碎片化数据到可操作的设计:用于塑料升级再造的物理校准学习
专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 本研究开发PC-MG-MoE框架,将塑料升级再造的碎片化实验数据转化为可操作指导,在严格验证下误差最低,可支持跨实验室异质性下的工程筛选与实验规划。
HOBA:用于自适应在线广告的分层策略性投标代理
机构 * Kuaishou Technology(快手科技)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 针对在线广告投标系统问题,提出 HOBA 分层强化学习框架,在三个时间尺度解耦相关环节,通过实验验证其优于现有基线,大规模在线部署实现目标成本提升 3.6%,证明该范式有效。
Comments 10pages,accepted by KDD 2026 ads track
PoTRE:受认知异质性启发的测试时推理
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 研究针对大语言模型复杂推理难题,提出PoTRE异构框架,将推理解耦为四个智能体,经任务自适应聚合层协调,在三个前沿基准测试中评估,在HLE上达最优准确率,以相似或更少令牌提升推理性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR 2026)
Journal ref Transactions on Machine Learning Research, 2026
马赫思维-4-闪技术报告
机构 * Li Auto Inc(理想汽车公司)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 马赫思维-4-闪是含3B激活参数的35B参数专家混合智能体模型,通过训练后优化及可扩展交互环境提升性能。其流程含三个阶段,在多个基准测试中成绩优异,以低推理成本领先或匹配数倍激活规模模型。
风险感知通用效用马尔可夫决策过程
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 研究风险感知通用效用马尔可夫决策过程,聚焦熵风险度量,提出基于蒙特卡洛树搜索的方法,可解决该过程并达任意精度,实验表明此方法在多种任务的GUMDPs中优化风险感知行为时成功。
用于稳健奖励学习的多模态、多环境机器教学
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG
AI总结 研究自主智能体在多环境下奖励学习问题,提出分层机器教学算法,先选信息丰富环境,再查询低成本反馈,实验表明该方法比统一教学基线有更低遗憾值和更强泛化能力,凸显多环境多模态教学对稳健奖励学习的重要性。
Comments Accepted to RLC 2026. Conference paper
说服攻击会降低思维链监测的有效性
机构 * LASR Labs(LASR实验室) ; University College London(伦敦大学学院) ; Google DeepMind(谷歌DeepMind)
专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。
Comments 25 pages, 10 figures
Danus:利用事实图内存编排数学推理智能体
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) ; Research Institute for Mathematical Sciences, Kyoto University(京都大学数理解析研究所) ; School of Mathematics, Tianjin University(天津大学数学学院) ; Zhongguancun Academy(中关村科学院) ; Department of Mathematics, Stanford University(斯坦福大学数学系) ; Westlake Institute for Advanced Study, Westlake University(西湖大学西湖高等研究院) ; School of Mathematical Sciences, Key Laboratory of Intelligent Computing and Applications (Ministry of Education), Tongji University(同济大学数学科学学院(教育部智能计算与应用重点实验室)) ; Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学北京国际数学研究中心与新基石科学实验室) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾区大学高等研究院智能计算中心)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 本文针对基于大语言模型的数学推理智能体扩展和编排难题,提出以共享事实图为全局内存管理机制的Danus系统,由主智能体、工作智能体和验证器构成,通过案例研究评估,展示其构建长证明的能力,为长期研究问题提供有效编排途径。
用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Fuzhou University(福州大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。
Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents
AGL-1:作为可信企业智能控制平面的企业人工智能治理层
机构 * Independent Researcher(独立研究员)
专题命中 规划决策 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究企业人工智能从实验走向运营面临的治理挑战,介绍AGL-1企业人工智能治理层这一参考模型,基于相关原则将治理问题从检索控制扩展到全执行路径治理,定义七个治理领域。
Comments 16 pages, 1 figure; independent technical report
EvoPolicyGym:评估交互环境中的自主策略进化
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Macau(澳门大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Soochow University(苏州大学) ; Brown University(布朗大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 提出自主策略进化评估框架,通过EvoPolicyGym基准测试代理在固定交互预算下迭代改进策略的能力,GPT-5.5在16个环境中表现最优,并揭示预算分配与反馈转化机制。
Comments 24 pages
量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; Anyscale ; Snowflake
专题命中 规划决策 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。
上下文感知的生成式AI用于自动化电信测试脚本生成
机构 * Ericsson R&D Bangalore(爱立信印度班加罗尔研发中心)
专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 提出一种上下文感知的生成式AI框架,通过实时知识图谱和增量引擎检测变化,仅更新受影响的测试,减少人工并加速测试周期。