arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-10 至 2026-08-10 共收录 176 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 14 篇

2608.07325 2026-08-10 physics.ao-ph 新提交 50%

State transitions in land-vegetation systems emerge at Paris Agreement warming levels in CMIP6

CMIP6中陆地-植被系统的状态转变在巴黎协定规定的变暖水平下出现

Pouriya Alinaghi, Sybren Drijfhout, Joran Angevaare, Chris Jones, Andy Wiltshire

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本研究基于CMIP6集合识别陆地-植被系统的9类共47种状态转变,发现巴黎协定规定的2℃或更低变暖已足以触发多数转变,揭示了不同区域转变的驱动机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00688 2026-08-10 cs.DC 版本更新 50%

Universal Finite-State and Self-Stabilizing Computation in Anonymous Dynamic Networks

匿名动态网络中的通用有限状态与自稳定计算

Giuseppe A. Di Luna, Giovanni Viglietta

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究匿名动态网络计算问题,提出通用自稳定算法在\(\max\{4\tau n - 2\mu, 2\mu\}\)轮稳定,通用有限状态算法在\(\tau(2n^2 + n)\)轮稳定,改进先前方法并开发历史树相关新技术。

Comments 30 pages, 5 figures

Journal ref Theoretical Computer Science, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 24 篇

2608.06984 2026-08-10 cs.CR cs.AI 新提交 83%

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

HarnessSafe:评估智能体框架中持久载体的安全性

Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。

Comments 21 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 83%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07449 2026-08-10 cs.AI cs.CL 新提交 81%

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

SkillProx:基于近端文本梯度下降的自进化智能体技能

Mingxuan Zheng, Yujin Zhou, Chuxue Cao, Boqin Yin, Yuyao Zhang, Jiapeng Sun, Shuaishuai Gong, Sirui Han, Yike Guo

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 SkillProx是结合闭环诊断进化与近端优化的自进化智能体技能框架,可提升LLM智能体在分布内外基准的平均准确率3.0个百分点,且两种核心组件具有互补效果。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07371 2026-08-10 cs.LG cs.CL 新提交 81%

Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning

面向智能体强化学习的轨迹相对事后蒸馏

Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 针对智能体强化学习中事后信号分配不清的问题,提出TRIAL框架,通过轨迹相对步分配优化监督信号,在WebShop、ALFWorld等任务上优于GRPO及多数基线方法,提升了任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06477 2026-08-10 cs.CR cs.AI cs.CL 新提交 81%

StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection

StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试

Zhuoxin Zhan, Akbar Rafiey, Avery Ma, Leila Pishdad, Layla El Asri

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06891 2026-08-10 cs.AI 新提交 79%

SkillEval: Decomposing Agent Skill Quality into Interpretable Signals

SkillEval:将智能体技能质量分解为可解释信号

Jiahui Han, Qinuo Li, Ziheng Peng, Haotian Wu, Haoze Liu, Danfeng Shan, Guanchu Wang, Huiqi Deng, Ninghao Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对现有智能体技能评估仅反映任务适配性的不足,提出可解释框架SkillEval,其可区分技能质量、关联下游任务性能,还能指导技能修订以提升任务通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17679 2026-08-10 cs.HC cs.AI 版本更新 79%

PULSE: Agentic Investigation with Passive Sensing for Proactive Affective Intervention in Cancer Survivorship

PULSE:基于被动感知的代理探究用于癌症幸存者的主动干预

Zhiyuan Wang, Subigya Nepal, Ariful Islam, Indrajeet Ghosh, Xinyu Chen, Katharine E. Daniel, Laura E. Barnes, Philip Chow

机构 * Department of Systems and Information Engineering, University of Virginia(系统与信息工程系,弗吉尼亚大学) Center for Behavioral Health and Technology, University of Virginia(行为健康与技术中心,弗吉尼亚大学) Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出PULSE系统,通过代理感知探究方法,利用智能手机被动感知数据和日记数据,提升对癌症幸存者情绪调节需求的预测准确率,验证了代理推理在主动干预中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03238 2026-08-10 cs.AI 版本更新 79%

"LLM Agent Performance" Is Not a Single Evaluation Target

基于LLM的智能体评估统一框架的必要性

Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对当前LLM智能体评估受系统提示、工具集和环境动态等混杂因素影响的问题,提出标准化统一评估框架以提升公平性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27853 2026-08-10 cs.CL cs.AI q-fin.CP 版本更新 79%

FinanceHarness: Autonomous Financial Deep Research Framework

FinanceHarness:自主金融深度研究框架

Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。

Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22148 2026-08-10 cs.AI cs.CL 版本更新 79%

Ratchet: How Reliable Must an LLM Judge Be to Retire a Skill?

Ratchet:一种最小化卫生的自演化LLM代理技能库

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) HSBC Holdings Plc.(汇丰控股有限公司) HSBC Technology Center, China(汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract_cn);分类 cs.AI、cs.CL

AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新 75%

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 70%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06420 2026-08-10 cs.LG cs.AI 新提交 62%

Risk-Aware Decision Policies for Agents Under Noisy Perception

感知噪声下智能体的风险感知决策策略

David Szczecina

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对感知噪声下智能体决策问题,该研究构建人工生命捕食者-猎物觅食模型,发现不确定性感知策略可提升智能体存活率,揭示了行为随不确定性的状态转变,为含噪声标签的鲁棒学习提供类比。

Comments 8 pages, 6 figures. Submitted to the 2026 Conference on Artificial Life (ALIFE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07437 2026-08-10 cs.AI 新提交 57%

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:训练用于可靠假设检验的大语言模型智能体

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06880 2026-08-10 cs.LG 新提交 57%

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

SkillAligner:在执行时将检索到的技能视为可调整的草稿

Qinfeng Li, Dalin He, Yuntai Bao, Ying Yang, Ruoxi Chen, Xinyan Yu, Lizhou Liang, Ge Su, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 SkillAligner是无训练的执行时技能适配框架,将检索技能视为可调整草稿,经联合适配整合为执行指南,在多基准实验中提升任务性能、降低退化与推理成本。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07439 2026-08-10 cs.CL quant-ph 新提交 57%

An Exploratory Evaluation of LLM-Assisted Rewriting of Moderate-Complexity Financial Sentences for DisCoCat-Based Sentiment Analysis

基于DisCoCat的情感分析中,大语言模型辅助改写中等复杂度金融句子的探索性评估

Brian Llinas, Nikos Chrisochoides

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本研究提出LLM辅助的预处理工作流,通过改写优化中等复杂度金融句子以适配DisCoCat情感分析,经对比实验验证其可降低电路资源消耗并提升准确率,为可扩展QNLP金融情感分析提供探索性依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 57%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06108 2026-08-10 cs.CG cs.LG 版本更新 57%

Using Reinforcement Learning to Optimize the Global and Local Crossing Number

使用强化学习优化全局和局部交叉数

Timo Brand, Henry Förster, Stephen Kobourov, Daniel Kohrt, Robin Schukrafft, Markus Wallinger, Johannes Zink

机构 * Technical University of Munich, Heilbronn, Germany(慕尼黑技术大学(海因斯贝格)) John Cabot University, Rome, Italy(约翰·卡博特大学) Technical University of Munich, Garching, Germany(慕尼黑技术大学(戈林根))

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 将图绘制视为单玩家优化游戏,利用强化学习通过移动顶点减少边交叉,提出一种优化全局或局部交叉数的策略,在局部交叉数最小化上具有竞争力。

Comments Appears in the Proceedings of the 34th International Symposium on Graph Drawing and Network Visualization (GD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06900 2026-08-10 cs.SD eess.AS 新提交 50%

MMAG: A Multi-Control Mixed Audio Generation Benchmark

MMAG:多控制混合音频生成基准

Zihao Zheng, Xuenan Xu, Jiahao Mei, Yixuan Li, Minghao Lv, Wen Wu, Chao Zhang, Mengyue Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 Agent评测 :agentic(abstract)

AI总结 本研究针对现有音频生成基准的不足,推出MMAG混合音频生成基准,构建含4000个标注音频的数据集,提出系统评估协议,测试发现各类模型在多控制能力间存在性能权衡,为该领域提供综合基准。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07011 2026-08-10 cs.CE econ.GN math.OC q-fin.EC 新提交 50%

Linguistic Pattern Based Optimization of Economic and Spatial Uniformity Criteria in Facility Layout Problems

设施布局问题中基于语言模式的经济与空间均匀性准则优化

Jerzy Grobelny, Rafał Michalski

专题命中 Agent评测 :agent(abstract)

AI总结 本文扩展LP Alinks框架,引入NCS空间均匀性准则,通过实验揭示结构与语言参数对布局的影响,推导参数选择矩阵,对比显示其在成本与均匀性权衡上表现更优。

Comments 28 pages, 14 figures

Journal ref Grobelny, J., Michalski, R. Linguistic pattern based optimization of economic and spatial uniformity criteria in facility layout problems. Cent Eur J Oper Res 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06998 2026-08-10 q-bio.MN physics.bio-ph 新提交 50%

Simulating is not always understanding: When model complexity obscures biology

模拟并不总是意味着理解:当模型复杂性掩盖生物学本质时

Lendert Gelens, Alejandro Fábregas-Tejeda, Grant Ramsey, Sylvia Wenmackers, Bart Smeets

专题命中 Agent评测 :agent(abstract)

AI总结 该研究指出细胞生物学模型的理解关键是自由参数与实验约束的比率而非复杂性,建议减少参数、开展与简单模型的系统比较以追踪细胞行为的涌现机制。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03713 2026-08-10 cs.AR cs.PF 版本更新 50%

SPEC CPU2026: Characterization, Representativeness, and Cross-Suite Comparison

SPEC CPU2026:特征、代表性及跨套件比较

Ruihao Li, Andrew Jacob, Neeraja J. Yadwadkar, Lizy K. John

专题命中 Agent评测 :agentic(abstract)

AI总结 本文研究SPEC CPU2026在九种平台上的性能特征,发现其相比2017版增加了指令量和内存占用,同时通过分析发现其在架构评估中可通过精简工作负载集保持高保真度,并通过与其他基准的比较展示其在通用计算中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05939 2026-08-10 econ.TH 版本更新 50%

Rational Inattention to States and Choice Characteristics

对状态和特征的不注意

Christopher W. Engh

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个理性不注意模型,通过施罗德桥问题和严格凹外问题,研究主体在获取成本信息时对状态和特征的不注意行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09549 2026-08-10 cs.GT cs.CC 50%

Stable Dinner Party Seating Arrangements

Damien Berriaud, Andrei Constantinescu, Roger Wattenhofer

专题命中 Agent评测 :agent(abstract)

Comments To appear in WINE'23; preliminary version presented at COMSOC'23

详情

展开后加载摘要…

URL PDF HTML 收藏