State transitions in land-vegetation systems emerge at Paris Agreement warming levels in CMIP6
CMIP6中陆地-植被系统的状态转变在巴黎协定规定的变暖水平下出现
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 本研究基于CMIP6集合识别陆地-植被系统的9类共47种状态转变,发现巴黎协定规定的2℃或更低变暖已足以触发多数转变,揭示了不同区域转变的驱动机制。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
CMIP6中陆地-植被系统的状态转变在巴黎协定规定的变暖水平下出现
专题命中 记忆与上下文管理 :workflow(abstract)
AI总结 本研究基于CMIP6集合识别陆地-植被系统的9类共47种状态转变,发现巴黎协定规定的2℃或更低变暖已足以触发多数转变,揭示了不同区域转变的驱动机制。
匿名动态网络中的通用有限状态与自稳定计算
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究匿名动态网络计算问题,提出通用自稳定算法在\(\max\{4\tau n - 2\mu, 2\mu\}\)轮稳定,通用有限状态算法在\(\tau(2n^2 + n)\)轮稳定,改进先前方法并开发历史树相关新技术。
Comments 30 pages, 5 figures
Journal ref Theoretical Computer Science, 2026
HarnessSafe:评估智能体框架中持久载体的安全性
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。
Comments 21 pages, 3 figures. Preprint
长时程智能体轨迹归因:统一基准与细粒度标注框架
机构 * Huawei Technologies Ltd.(华为技术有限公司)
专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI
AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。
Comments 17 pages, 4 figures, 7 tables
SkillProx:基于近端文本梯度下降的自进化智能体技能
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 SkillProx是结合闭环诊断进化与近端优化的自进化智能体技能框架,可提升LLM智能体在分布内外基准的平均准确率3.0个百分点,且两种核心组件具有互补效果。
Comments 23 pages, 4 figures
面向智能体强化学习的轨迹相对事后蒸馏
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tencent(腾讯)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 针对智能体强化学习中事后信号分配不清的问题,提出TRIAL框架,通过轨迹相对步分配优化监督信号,在WebShop、ALFWorld等任务上优于GRPO及多数基线方法,提升了任务性能。
StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。
SkillEval:将智能体技能质量分解为可解释信号
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本研究针对现有智能体技能评估仅反映任务适配性的不足,提出可解释框架SkillEval,其可区分技能质量、关联下游任务性能,还能指导技能修订以提升任务通过率。
PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预
机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) ; Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) ; Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。
基于LLM的智能体评估统一框架的必要性
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。
FinanceHarness:自主金融深度研究框架
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。
Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness
Ratchet:一种最小化卫生的自演化LLM代理技能库
机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) ; HSBC Holdings Plc.(汇丰控股有限公司) ; HSBC Technology Center, China(汇丰技术中心,中国)
专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract_cn);分类 cs.AI、cs.CL
AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。
Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet
评估自主编程代理中的计划合规性
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; IBM(IBM公司)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE
AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。
科学边缘评估:SEE——迈向真实科学发现的缺失环节
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; University of Alberta(阿尔伯塔大学) ; Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。
感知噪声下智能体的风险感知决策策略
机构 * University of Waterloo(滑铁卢大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对感知噪声下智能体决策问题,该研究构建人工生命捕食者-猎物觅食模型,发现不确定性感知策略可提升智能体存活率,揭示了行为随不确定性的状态转变,为含噪声标签的鲁棒学习提供类比。
Comments 8 pages, 6 figures. Submitted to the 2026 Conference on Artificial Life (ALIFE2026)
Fisher-R1:训练用于可靠假设检验的大语言模型智能体
机构 * Stanford University(斯坦福大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。
SkillAligner:在执行时将检索到的技能视为可调整的草稿
机构 * Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 SkillAligner是无训练的执行时技能适配框架,将检索技能视为可调整草稿,经联合适配整合为执行指南,在多基准实验中提升任务性能、降低退化与推理成本。
Comments 21 pages, 5 figures
基于DisCoCat的情感分析中,大语言模型辅助改写中等复杂度金融句子的探索性评估
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 本研究提出LLM辅助的预处理工作流,通过改写优化中等复杂度金融句子以适配DisCoCat情感分析,经对比实验验证其可降低电路资源消耗并提升准确率,为可扩展QNLP金融情感分析提供探索性依据。
VESTA: 一种全自动的LLM智能体场景生成与安全评估框架
机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) ; Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) ; Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Long-term AI(长期人工智能)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。
使用强化学习优化全局和局部交叉数
机构 * Technical University of Munich, Heilbronn, Germany(慕尼黑技术大学(海因斯贝格)) ; John Cabot University, Rome, Italy(约翰·卡博特大学) ; Technical University of Munich, Garching, Germany(慕尼黑技术大学(戈林根))
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 将图绘制视为单玩家优化游戏,利用强化学习通过移动顶点减少边交叉,提出一种优化全局或局部交叉数的策略,在局部交叉数最小化上具有竞争力。
Comments Appears in the Proceedings of the 34th International Symposium on Graph Drawing and Network Visualization (GD 2026)
MMAG:多控制混合音频生成基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 Agent评测 :agentic(abstract)
AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。
Comments 15 pages, 6 figures
设施布局问题中基于语言模式的经济与空间均匀性准则优化
专题命中 Agent评测 :agent(abstract)
AI总结 本文扩展LP Alinks框架,引入NCS空间均匀性准则,通过实验揭示结构与语言参数对布局的影响,推导参数选择矩阵,对比显示其在成本与均匀性权衡上表现更优。
Comments 28 pages, 14 figures
Journal ref Grobelny, J., Michalski, R. Linguistic pattern based optimization of economic and spatial uniformity criteria in facility layout problems. Cent Eur J Oper Res 2026
模拟并不总是意味着理解:当模型复杂性掩盖生物学本质时
专题命中 Agent评测 :agent(abstract)
AI总结 该研究指出细胞生物学模型的理解关键是自由参数与实验约束的比率而非复杂性,建议减少参数、开展与简单模型的系统比较以追踪细胞行为的涌现机制。
Comments 17 pages, 2 figures
SPEC CPU2026:特征、代表性及跨套件比较
专题命中 Agent评测 :agentic(abstract)
AI总结 本文研究SPEC CPU2026在九种平台上的性能特征,发现其相比2017版增加了指令量和内存占用,同时通过分析发现其在架构评估中可通过精简工作负载集保持高保真度,并通过与其他基准的比较展示其在通用计算中的优势。
对状态和特征的不注意
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一个理性不注意模型,通过施罗德桥问题和严格凹外问题,研究主体在获取成本信息时对状态和特征的不注意行为。
专题命中 Agent评测 :agent(abstract)
Comments To appear in WINE'23; preliminary version presented at COMSOC'23