arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-12 至 2026-06-12 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 7 篇

2606.04602 2026-06-12 cs.AI 版本更新 79%

Parthenon Law: A Self-Evolving Legal-Agent Framework

Parthenon Law: 一种自我进化的法律智能体框架

Hejia Geng, Leo Liu

机构 * tapntell.ai

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 本文提出Parthenon框架,通过分解模型、工具、知识等组件并引入反泄漏学习循环,使法律领域的大语言模型智能体能够从经验中自我进化,显著提升法律事务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13126 2026-06-12 cs.LG cs.AI cs.CL 新提交 67%

MiniPIC: Flexible Position-Independent Caching in <100LOC

MiniPIC: 少于100行代码的灵活位置无关缓存

Nathan Ordonez, Thomas Parnell

机构 * IBM Research(IBM研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MiniPIC,通过无位置编码KV缓存和用户控制缓存重用原语,在vLLM中实现多种位置无关缓存方法,显著提升预填充吞吐量并降低首个令牌延迟。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13174 2026-06-12 cs.LG cs.CL 新提交 62%

Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents

与你合作得更好:将用户修正编译为编码代理的运行时强制

Yujun Zhou, Kehan Guo, Haomin Zhuang, Xiangqi Wang, Yue Huang, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Nuno Moniz, Nitesh V. Chawla, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) IBM Research(IBM研究院) Tencent AI Lab(腾讯AI实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出TRACE方法,通过将用户修正编译为原子规则并在运行时强制执行,显著减少编码代理在后续任务中的偏好违反,优于纯记忆方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12752 2026-06-12 cs.CY cs.SY eess.SY physics.soc-ph 新提交 50%

Beyond Resilience -- A Conceptual Framework for Civic Ascent

超越韧性——公民提升的概念框架

Alexandros Washburn, Carlo Lipizzi

专题命中 软件智能体 :agent(abstract)

AI总结 提出“公民提升”概念,定义城市从冲击中恢复后功能容量提升的状态,并构建基于拓扑、制度和判断三个慢变量及一个快情感通道的概念框架。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 2 篇

2606.13494 2026-06-12 cs.RO cs.CV 新提交 50%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 50%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 7 篇

2606.12703 2026-06-12 cs.CR cs.AI cs.LG 新提交 81%

SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems

SMSR:针对持久化LLM代理系统中运行时内存投毒的认证防御

Tarun Sharma

机构 * Independent Researcher(独立研究者)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SMSR防御框架,通过写入时HMAC签名和查询时随机化内存消融与基于判决的多数投票,首次为多会话内存投毒攻击提供认证鲁棒性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13177 2026-06-12 cs.CL cs.AI cs.LG 新提交 78%

MemRefine: LLM-Guided Compression for Long-Term Agent Memory

MemRefine: 基于LLM引导的压缩用于长期智能体记忆

Minjae Kim, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * Korea University(韩国大学) KAIST(韩国科学技术院)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 提出MemRefine框架,利用LLM判断事实内容,通过删除、合并和保留操作将记忆库压缩到固定预算内,在多个基准上保持下游性能并优于基于规则的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22815 2026-06-12 cs.HC 版本更新 76%

Memory as a Service (MaaS): Purpose-Bound Memory Mediation for Cooperative Agents

记忆即服务 (MaaS):面向合作智能体的目的绑定记忆中介

Haichang Li

专题命中 记忆与上下文管理 :agentic(abstract,comments);agent(abstract);workflow(abstract)

AI总结 提出记忆即服务 (MaaS) 框架,通过目的绑定的记忆中介机制,在合作编程智能体间平衡记忆共享效用与隐私泄露风险,实验表明现有检索方法存在严重隐私泄露。

Comments Accepted to the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE @ KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05895 2026-06-12 math.PR 版本更新 67%

Diffusion approximations for interacting stochastic systems with reflection and control

具有反射和控制的交互随机系统的扩散近似

Thoa Thieu, Roderick Melnik

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract)

AI总结 研究一类具有反射和控制的交互随机系统的扩散近似,通过扩散缩放建立到Ornstein-Uhlenbeck型反射随机微分方程组的分布收敛,并用数值例子展示在人群动力学和神经群体动力学中的应用。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31514 2026-06-12 cs.CL cs.AI cs.CY 版本更新 62%

If LLMs Have Human-Like Attributes, Then So Does Age of Empires II

如果LLM具有类人属性,那么《帝国时代II》也具有

Adrian de Wynter

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 通过训练简单神经网络于《帝国时代II》,论证LLM的拟人属性在经验上非唯一,提出应假设LLM非独特性而非拟人属性来设计实验。

Comments Fixed corollary 1, added stat sig

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08060 2026-06-12 quant-ph 版本更新 50%

Information gain and measurement disturbance for quantum agents

量子代理的信息增益与测量扰动

Arthur O. T. Pang, Noah Lupu-Gladstein, Y. Batuhan Yilmaz, C. Pria Dobney, Rui Jie Tang, Aharon Brodutch, Aephraim M. Steinberg

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 将量子测量推广至量子代理,其记忆可存储经典或量子信息,发现量子代理能获取更多信息但代价是更大的测量扰动,并通过实验表征了这种权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.03956 2026-06-12 cond-mat.mtrl-sci 50%

The bright side of defects in MoS$_2$ and WS$_2$ and a generalizable chemical treatment protocol for defect passivation

二硫化钼和二硫化钨中缺陷的积极面及一种通用的化学处理协议用于缺陷钝化

Hope M. Bretscher, Zhaojun Li, James Xiao, Diana Y. Qiu, Sivan Refaely-Abramson, Jack Alexander-Webber, Arelo O. A. Tanoh, Ye Fan, Géraud Delport, Cyan Williams, Samuel D. Stranks, Stephan Hofmann, Jeffrey B. Neaton, Steven G. Louie, Akshay Rao

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究揭示硫空位作为激子陷阱,提出通过硫醇或硫化物与路易斯酸结合的通用处理协议,提升光致发光275倍并保持载流子迁移率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 27 篇

2605.07728 2026-06-12 cs.SE cs.CY 87%

SARC: A Governance-by-Architecture Framework for Agentic AI Systems

SARC:一种用于代理AI系统的架构治理框架

Gaston Besanson

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出SARC框架,通过将约束作为第一类规范对象,实现对代理AI系统运行时的治理,减少硬约束违规并提升可审计性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12774 2026-06-12 eess.SY cs.AI cs.CL cs.SY 新提交 84%

Agentic MPC for Semantic Control System Resynthesis

用于语义控制系统再综合的智能体MPC

Yuya Miyaoka, Masaki Inoue

机构 * University of Tokyo(东京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出智能体MPC框架,通过集成大语言模型智能体实现上下文感知的语义自适应控制综合,在自动驾驶场景中验证其根据个人偏好或社交情境(如避让应急车辆)调整控制的能力。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12736 2026-06-12 cs.AI cs.LG 新提交 84%

Benchmarking AI Agents for Addressing Scientific Challenges Across Scales

跨尺度科学挑战的AI智能体基准测试

Tianyu Liu, Allen Xin Wang, Antonia Panescu, Lisa Xinyi Chen, Wenxin Long, Xinyu Wei, Yueqian Jing, Ziyao Zeng, Jihang Chen, Sihan Jiang, Ziqing Wang, Siyi Gu, Siyu Chen, Xinyang Hu, Haoran Shao, Leqi Xu, Wangjie Zheng, Zhiyuan Cao, Ada Fang, Botao Yu, Kunyang Sun, Rex Ying, Arman Cohan, Qingyu Chen, Lingzhou Xue, Kaize Ding, Yuanqi Du, Wengong Jin, Zhuoran Yang, Marinka Zitnik, James Zou, Hua Xu, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(布罗德研究所) The Pennsylvania State University(宾夕法尼亚州立大学) Northeastern University(东北大学) Northwestern University(西北大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13602 2026-06-12 cs.AI 新提交 79%

EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis

EpiBench:人工智能代理在表观基因组学分析中的可验证评估

Harihara Muralidharan, Reema Baskar, Soo Hee Lee, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 Agent评测 :AI agent(title);workflow(abstract);分类 cs.AI

AI总结 提出EpiBench基准,通过106个评估任务测试AI代理在表观基因组学工作流中的决策能力,发现最佳系统GPT-5.5/Pi通过率仅45%,失败多因缺乏深度科学判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13349 2026-06-12 cs.CL 新提交 79%

From Passive Generation to Investigation: A Proactive Scientific Peer Review Agent

从被动生成到主动调查:一种主动的科学同行评审代理

Haishuo Fang, Yue Feng, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Technical University of Darmstadt(达姆施塔特工业大学通用知识处理实验室) National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心 ATHENE) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 提出ProReviewer,一种基于LLM的主动科学同行评审代理,将评审建模为马尔可夫决策过程,通过结构化评审日志引导主动调查,在五个质量维度上平均得分最高,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12805 2026-06-12 cs.HC cs.AI 新提交 79%

Exploring How Agent Voice Accents Shape Human-AI Collaboration in K-12 Group Learning

探索智能体口音如何影响K-12小组学习中的人机协作

Prerna Ravi, Carúmey Stevens, Ben Hurt, Brandon Hanks, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究通过33名教师的实验,发现GenAI语音智能体的不同口音(英式、印度式、非裔美式)影响其被感知为工具或同伴,进而影响信任、参与和依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13639 2026-06-12 cs.MA 新提交 78%

Tuning Agent-Based Predator-Prey Models Toward Lotka-Volterra Dynamics

将基于智能体的捕食者-猎物模型调谐至洛特卡-沃尔泰拉动力学

Corinna Mandl, Siddharth Chaturvedi, Marcel van Gerven

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究通过调整环境与种群参数,使基于智能体的捕食者-猎物模型产生类似洛特卡-沃尔泰拉方程的周期性振荡,并利用基于特征的损失函数优化参数。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 70%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 70%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13474 2026-06-12 cs.CY 新提交 67%

Exploring Systems-Thinking Approaches to Loss of Control Risk

探索系统思维方法应对失控风险

Aurelio Carlucci, Sean P. Fillingham, James Walpole, Jakub Kryś

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文运用STECA、STPA和FRAM三种系统安全方法分析前沿实验室编码智能体场景,发现模型级评估可能遗漏治理责任、反馈回路和操作变异等风险,主张将模型评估与系统级危害分析和操作保证相结合。

Comments Accepted to the Technical AI Governance Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05405 2026-06-12 cs.AI cs.CL cs.LG 版本更新 67%

Agents' Last Exam

Agents' Last Exam

Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-Gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, Yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Chenyu Zhu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-Ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, Andy Zeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lyu, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Shi Qiu, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Cheng Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, He Ren, Zhenyu He, Qiao Jin, Langlang Li, Yuetai Li, Sylvia Liu, Lu Lu, Luqing Zhou, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Yian Ma, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Yinglun Zhu, Dawn Song

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对AI系统在专业领域缺乏经济性部署的问题,提出Agents' Last Exam (ALE)基准,通过250+专家协作构建覆盖13个行业集群55个子领域的1000+长期真实经济任务,当前最难层级平均通过率仅2.6%。

Comments Project website: https://agents-last-exam.org Code: https://github.com/rdi-berkeley/agents-last-exam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11479 2026-06-12 cs.LG cs.AI cs.MA 版本更新 62%

Grammar of the Wave: Towards Explainable Multivariate Time Series Event Detection via Neuro-Symbolic VLM Agents

波的语法:通过神经符号VLM智能体实现可解释的多变量时间序列事件检测

Sky Chenwei Wan, Yifei Y. Wang, Tianjun Hou, Xiqing Chang, Aymeric Jan

机构 * AI Lab, SLB(SLB人工智能实验室) Télécom Paris, Institut Polytechnique de Paris, France(巴黎电信学院,巴黎高等理工学院,法国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出语言引导的时间序列事件检测(TSED)任务,通过事件逻辑树(ELT)将文本描述转化为结构化时序逻辑,并构建神经符号VLM智能体SELA,实现零/少样本事件检测与可解释推理。

Comments 8 pages (main text), 28 pages total including appendix. 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13591 2026-06-12 cs.AI cs.CL 版本更新 62%

DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体

Maojun Sun, Yifei Xie, Yue Wu, Ruijian Han, Binyan Jiang, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03699 2026-06-12 q-bio.NC cs.AI cs.LG cs.NE cs.SY eess.SY 62%

Dissecting Larval Zebrafish Hunting using Deep Reinforcement Learning Trained RNN Agents

解析斑马鱼幼体捕食行为的深度强化学习训练RNN代理

Raaghav Malik, Satpreet H. Singh, Sonja Johnson-Yu, Nathan Wu, Roy Harpaz, Florian Engert, Kanaka Rajan

机构 * California Institute of Technology(加州理工学院) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过深度强化学习训练RNN代理,研究斑马鱼幼体捕食行为,揭示生态和能量约束如何影响适应性行为,发现简单模型能复现真实捕食行为,并通过虚拟实验验证约束和环境对捕食动态的影响。

Journal ref Proceedings of the 9th Conference on Cognitive Computational Neuroscience (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13310 2026-06-12 cs.CL cs.HC 新提交 57%

RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

RogueAI: 一种用于检测对话中授权AI欺骗的逆向图灵测试

Sara Candussio, Emanuele Ballarin, Lorenzo Bonin, Sandro Junior Della Rovere, Luca Bortolussi

机构 * AILab, MIGe, University of Trieste(的里雅斯特大学) Computational Statistics and Machine Learning, Istituto Italiano di Tecnologia(意大利理工学院) DIA, University of Trieste(的里雅斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出RogueAI,一种通过玩家与两个LLM代理的对话游戏来检测授权欺骗的逆向图灵测试,并引入AutoRogueAI扩展。实验发现简单启发式方法准确率75.6%,而人类仅56.6%,表明人类忽略关键信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13079 2026-06-12 cs.CR cs.AI 新提交 57%

The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems

大型语言模型驱动的AI系统中自主渗透能力的涌现

Jiaqi Luo, Jiarun Dai, Zhile Chen, Jia Xu, Weibing Wang, Yawen Duan, Brian Tse, Geng Hong, Xudong Pan, Yuan Zhang, Min Yang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Concordia AI Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有评估方法不透明、场景简化等问题,构建包含两级目标服务器和通用代理框架的自主渗透评估体系,测试19个LLM发现成功率10.7%-69.3%,且能力随模型整体能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12871 2026-06-12 cs.AI 新提交 57%

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

DailyReport: 一个用于评估搜索代理在日常搜索任务上的开放式基准

Jingxuan Han, Wei Liu, Mingyang Zhu, Youpeng Wang, Ziwen Wang, Lin Qiu, Xuezhi Cao, Xunliang Cai, Zheren Fu, Licheng Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出DailyReport基准,包含150个开放式日常搜索任务和3546个级联评分标准,通过分解子任务和维度评估,揭示当前搜索代理系统仍未能满足用户期望。

详情

展开后加载摘要…

URL PDF HTML 收藏