arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-08 至 2026-06-08 共收录 155 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 10 篇

2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 57%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05796 2026-06-08 cs.CR 版本更新 50%

GCD: Garbled, Corrected, Demonstrandum -- Fixing and Proving Go's Extended GCD Implementation

GCD: 乱码、修正、证明——修复并验证Go语言的扩展GCD实现

Linard Arquint

专题命中 软件智能体 :AI agent(abstract)

AI总结 本文修复了Go标准库中extendedGCD实现的两个偏差,并使用Gobra和Lean进行了形式化验证,证明了正确性和终止性,同时发现AI代理可辅助验证过程。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 5 篇

2606.06914 2026-06-08 cs.CR 新提交 82%

DPAgent-in-the-Middle: Agentic Defense and Repair Against AI-Groomed Deceptive Patterns

中间DPAgent:针对AI诱导欺骗模式的代理防御与修复

Zewei Shi, Ruoxi Sun, Haoyang Li, Seong Oun Hwang, Feng Liu, Minhui Xue, Xingliang Yuan

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract)

AI总结 针对网络界面中的隐私欺骗模式,提出DPAgent框架,通过四个专门代理结合潜在空间净化与防御性提示,主动检测并修复欺骗性界面,检测率达90.98%,修复率77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07244 2026-06-08 cs.RO cs.AI cs.CV 新提交 57%

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

超越航点:面向视觉语言导航的轨迹中心航点范式

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 提出轨迹航点范式,通过TSDF引导的扩散策略预测可执行轨迹,解决VLN-CE中航点不可达与规划控制不一致问题,在基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18670 2026-06-08 cs.NI 版本更新 50%

Masking Intent, Sustaining Equilibrium: Risk-Aware Potential-Game-Based Service Provision in Dynamic Mobile Crowdsensing

掩盖意图,维持平衡:基于风险的潜在游戏的动态移动 crowdsensing 服务提供

Houyi Qi, Minghui Liwang, Kaiwen Tan, Wenyong Wang, Sai Zou, Yiguang Hong, Xianbin Wang, Wei Ni

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出iParts框架,通过隐私保护和风险意识的两阶段方法,解决动态移动 crowdsensing 中任务完成、预算可行性和传感质量的不确定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22041 2026-06-08 cs.MA cs.CY 版本更新 50%

Using Feasible Action-Space Reduction by Groups to fill Causal Responsibility Gaps in Spatial Interactions

通过群体可行动作空间缩减来填补空间互动中的因果责任空缺

Ashwin George, Vassil Guenov, Arkady Zgonnikov, David A. Abbink, Luciano Cavalcante Siebert

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种群体因果责任度量方法,用于解决个体中心度量在因果过定性情况下失效的问题,通过定义积极影响类型和分层算法来识别因果责任主体,并通过场景模拟展示群体效应的动态变化。

Comments Presented at COINE workshop collocated with AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11740 2026-06-08 cs.RO 版本更新 50%

From Pixels to Shelf: An Integrated Robotic System for Autonomous Supermarket Stocking with a Mobile Manipulator

从像素到货架:基于移动操作臂的自主超市补货集成机器人系统

Davide Peron, Victor Nan Fernandez-Ayala, Lukas Segelmark

机构 * Department of Information Engineering, University of Padova(帕多瓦大学信息工程系) Division of Decision and Control Systems, School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(皇家理工学院电气工程与计算机科学学院决策与控制系统系) Animum AB(Animum公司)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出一种集成商用硬件与ROS2的模块化机器人系统,利用行为树规划、视觉检测和两步MPC控制,在700多次补货实验中实现98%以上的抓取成功率,但性能仍逊于人类工人。

Comments Preprint for CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 9 篇

2601.13508 2026-06-08 cond-mat.mtrl-sci cs.AI 版本更新 85%

Autonomous computational catalysis through an agentic research system

自主计算催化:通过智能体研究系统

Honghao Chen, Jiangjie Qiu, Yi Shen Tew, Xiaonan Wang

机构 * Beijing Key Laboratory of Artificial Intelligence for Advanced Chemical Engineering Materials, State Key Laboratory of Chemical Engineering and Low- Carbon Technology, Department of Chemical Engineering, Tsinghua University(北京先进化工材料人工智能重点实验室、化学工程与低碳技术国家重点实验室、清华大学化学工程系)

专题命中 记忆与上下文管理 :agentic(title,abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出CatMaster催化原生智能体研究系统,将自然语言请求转化为计算研究,实现从建模到闭环催化剂设计的自主执行,在CO2-to-CO催化剂设计中识别出竞争性活性位点。

Comments 25 pages for main manuscript; SI not available here

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07402 2026-06-08 cs.CL 新提交 79%

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian, Wei Chen, Junle Chen, Yuqian Wu, Fangyuan Zhang, Qintian Guo, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Chemical Technology(北京化工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) Tencent Hy(腾讯(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06787 2026-06-08 cs.AI 新提交 70%

AdMem: Advanced Memory for Task-solving Agents

AdMem: 面向任务求解智能体的高级记忆

Runzhe Wang, Huilin Lu, Shengjie Liu, Li Dong, Jason Zhu

机构 * Princeton University(普林斯顿大学) Amazon(亚马逊) Arm

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出一种统一自动记忆框架,集成语义、情节和程序记忆,通过双层级设计和多智能体架构实现自动生成、奖励标注与自适应检索,提升长程多轮任务的鲁棒性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15125 2026-06-08 cs.CR 版本更新 67%

From Storage to Steering: Memory Control Flow Attacks on LLM Agents

从存储到操控:针对LLM代理的内存控制流攻击

Zhenlin Xu, Xiaogang Zhu, Yu Yao, Minhui Xue, Yiliao Song

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 本文研究了内存控制流攻击对LLM代理的影响,提出MEMFLOW框架以系统识别和量化此类攻击,发现超过90%的测试在严格安全约束下仍易受攻击,揭示了严重的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09092 2026-06-08 q-bio.PE cond-mat.stat-mech physics.bio-ph physics.comp-ph 67%

Anomalous Diffusion and Emergent Universality in Coupled Memory-Driven Systems

异常扩散与耦合记忆驱动系统中的涌现普遍性

Nick Dashti, M. N. Najafi, Debra J. Searles

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 研究探讨了简单局部相互作用如何产生涌现探索模式,提出耦合记忆驱动系统模型,揭示了异常扩散、非高斯分布及压缩指数相遇统计等新普遍性类别。

Comments 24 pages including 7 figures and 2 tables; and 7 additional pages of supplementary information. In this revision the content and discussion has been extended. The title and abstract have been changed to be more aligned to the new content

Journal ref J. Stat. Mech. (2026) 023215

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12375 2026-06-08 cs.NI cs.LG 版本更新 57%

LiQSS: Post-Transformer Linear Quantum-Inspired State-Space Tensor Networks for Real-Time 6G

LiQSS:后Transformer线性量子启发状态空间张量网络用于实时6G

Farhad Rezazadeh, Hatim Chergui, Amir Ashtari Gargari, Mehdi Bennis, Houbing Song, Lingjia Liu, Merouane Debbah

机构 * i2CAT Foundation(i2CAT基金会) University of Oulu(奥卢大学) University of Maryland, Baltimore County (UMBC)(马里兰大学巴尔的摩县分校) Virginia Tech(弗吉尼亚理工大学) Khalifa University of Science and Technology(谢赫扎耶德科学技术大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 提出一种后Transformer的量子启发状态空间张量网络LiQSS,用线性复杂度结构状态空间核替代自注意力,结合张量训练分解和轻量门控,在6G O-RAN近实时KPI预测中实现参数减少155倍、推理加速2.74倍且不损失精度。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07326 2026-06-08 cs.CV 新提交 50%

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization

AnchorWorld: 基于视图演化定制的具身自我中心世界模拟

Yu Li, Menghan Xia, Gongye Liu, Xintao Wang, Conglang Zhang, Lei Ke, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Kun Gai, Yujiu Yang

机构 * Tsinghua University(清华大学) HUST(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) HKUST(香港科技大学) WHU(武汉大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出AnchorWorld框架,利用3D人体运动和外源视角辅助训练增强交互完整性,并通过锚点视图和文本描述实现自我演化世界的灵活定制,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07158 2026-06-08 cs.CR 新提交 50%

Synthetic APTs: the Collapse of TTP-Based Attribution

合成APT:基于TTP的归因的崩溃

Francesco Balassone, Víctor Mayoral-Vilches, María Sanz-Gómez, Paul Zabalegui-Landa, Stefan Rass, Davide Quarta, Daniel Sanchez-Prieto, Marina Oteiza-Álvarez, Almerindo Graziano, Lauren Min Kim, MinSeok Choi

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 研究AI驱动的对手模拟是否挑战基于TTP的归因,通过CSI框架配置五个APT组进行实验,发现企业网络均被攻陷且攻击者独立武器化防御工具,表明AI时代TTP归因基础被削弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07195 2026-06-08 math.NA cs.NA 新提交 50%

Adjoint-based Perfusion Estimation from Dynamic Contrast-Enhanced Ultrasound: Advection-Diffusion and Two-Compartment Models

基于伴随的动态对比增强超声灌注估计:对流扩散与两室模型

Sophie Externbrink, Ahmed El Kaffas, Dimitre Hristov, Sebastian Götschel

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文通过伴随方法估计肿瘤血流速度和灌注参数,比较了对流扩散模型与生理上更合理的两室模型,并利用Tikhonov正则化和连续伴随方程进行高效梯度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 19 篇

2511.19961 2026-06-08 eess.SY cs.SY 版本更新 88%

Toward Trustworthy Digital Twins in AI Agent-based Wireless Network Optimization: Challenges, Solutions, and Opportunities

迈向可信的AI代理无线网络优化数字孪生:挑战、解决方案与机遇

Zhenyu Tao, Wei Xu, Xiaohu You

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文提出一种新的数字孪生评估框架,用于确保AI代理基于网络优化的数字孪生的可信度,通过任务导向的评估方法减少训练和测试成本,同时保持部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05761 2026-06-08 cs.AI cs.CL 版本更新 84%

SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准

Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Xiamen University(厦门大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SubtleMemory基准,通过构建关系控制的潜在语义伪影并嵌入用户-智能体交互历史,评估长时程AI智能体在后续查询中恢复分布式关系结构的能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 83%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06665 2026-06-08 cs.SI cs.MA 新提交 82%

Comparing Sentiment Contagion in AI-Agent and Human Social Networks: Evidence from MOLTBOOK

AI智能体与人类社交网络中情绪传染的比较:来自MOLTBOOK的证据

Elyes Ben chaabane, Savindu Herath, Yash Raj Shrestha

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 研究AI社交网络中的情绪传播,发现负面帖子吸引更多回复,但回复通常趋于中性,情绪不会持续扩散,表明AI网络可能抑制情绪极端化。

Comments 8 pages without appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23294 2026-06-08 eess.SY cs.SY 版本更新 82%

Agentic AI-Enhanced Semantic Communications: Foundations, Architecture, and Applications

基于代理AI的语义通信:基础、架构与应用

Haixiao Gao, Mengying Sun, Ruichen Zhang, Yanhan Wang, Xiaodong Xu, Nan Ma, Dusit Niyato, Ping Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文探讨代理AI如何赋能语义通信,提出统一框架并展示多场景应用,通过案例研究验证其有效性。

Comments This version is being withdrawn because we need to further reevaluate the attribution of contributions among the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06784 2026-06-08 cs.CR cs.AI cs.CY 新提交 79%

What Your Posts Reveal: A Benchmark and Agentic Framework for User-Level Privacy Leakage on Social Media

你的帖子揭示了什么:社交媒体用户级隐私泄露的基准与智能体框架

Zifan Peng, Yini Huang, Aiwen Lu, Qiming Ye, Peixian Zhang, Jingyi Zheng, Yule Liu, Xuechao Wang, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Wuhan University(武汉大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对社交媒体用户级多模态隐私泄露缺乏统一基准和评估指标的问题,提出SopriBench基准和隐私暴露分数(PES),并开发了无需训练的智能体框架Argus,通过跨帖子线索累积推理实现隐私推断,PES达0.55,较最强基线提升25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03889 2026-06-08 cs.CL 版本更新 79%

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench: 来自真实开发者-智能体会话的实时OpenClaw基准测试

Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 针对现有基准缺乏真实性的问题,提出RealClawBench框架,通过重构执行环境和确定性可验证评分器,将真实OpenClaw会话转化为可复现、自动评分的任务,评估14个模型后最佳仅解决65.8%任务,揭示了开发者-智能体工作负载上的巨大提升空间。

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07344 2026-06-08 physics.soc-ph 新提交 78%

From Boundary Crossings to Global Connectivity: A Minimal Mechanism in Structured Agent-Based Landscapes

从边界穿越到全局连通:结构化基于智能体景观中的最小机制

Fabio Nelli

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究局部移动性异质性如何在结构化智能体系统中通过边界介导产生全局重构,发现少量探索性智能体即可在随机游走下实现景观连通,无需优化或目标导向行为。

Comments 26 pages, 6 figures, 3 supplementary figures. Source code and replication package publicly available via CoMSES and Zenodo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 73%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06546 2026-06-08 cs.LG 新提交 70%

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

Elmes*:面向长尾教育场景的大语言模型细粒度评估量规自动构建

Tao Liu, Ye Lu, Ruohua Zhang, Siyu Song, Wentao Liu, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education, East China Normal University(上海人工智能教育研究院,东华师范大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,东华师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 提出Elmes*框架,自动构建细粒度场景特定量规,用于评估大语言模型在教育场景中的多维教学能力,构建Edu-330基准并揭示模型差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05342 2026-06-08 cs.AI 版本更新 70%

SentinelBench: A Benchmark for Long-Running Monitoring Agents

SentinelBench: 一个用于长时间运行监控代理的基准测试

Matheus Kunzler Maldaner, Adam Fourney, Amanda Swearngin, Hussein Mozannar, Gagan Bansal, Maya Murad, Rafah Hosn, Saleema Amershi

机构 * University of Florida(佛罗里达大学) Microsoft Research, AI Frontiers(微软研究院,人工智能前沿)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出SentinelBench,一个包含10个合成网络环境中100个任务的基准测试,用于评估AI代理在长时间监控任务中的表现,衡量任务完成度、反应时间和资源使用。

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06741 2026-06-08 cs.AI cs.CL cs.LG 新提交 67%

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill: 面向LLM智能体的开放世界自我进化

Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

机构 * Lehigh University(莱维大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Salesforce AI Research(Salesforce人工智能研究) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。

Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04123 2026-06-08 cs.CY cs.AI cs.LG cs.SE 版本更新 67%

Measuring Agents in Production

生产环境中的智能体测量

Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

机构 * University of California at Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 62%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏