arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-01 至 2026-06-01 共收录 187 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 14 篇

2605.30712 2026-06-01 cs.CL 70%

ExpGraph: Model-Agnostic Experience Learning with Graph-Structured Memory for LLM Agents

ExpGraph: 面向LLM智能体的模型无关经验学习与图结构记忆

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) Meta Monetization AI(Meta 营收人工智能)

专题命中 记忆与上下文管理 :tool use(abstract);agentic(abstract);分类 cs.CL

AI总结 提出ExpGraph框架,通过图结构记忆和强化学习实现冻结LLM执行器的外部经验复用,在问答、数学推理、代码生成和多步智能体任务上显著提升性能并减少交互步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29317 2026-06-01 econ.GN q-fin.EC 67%

Should I State or Should I Show? Aligning AI with Human Preferences

我应该陈述还是展示?使AI与人类偏好对齐

Keaton Ellis, Wanying Huang

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract)

AI总结 通过在线实验比较AI代理从陈述偏好(文字提示)和显示偏好(选择数据)中学习人类偏好的效果,发现显示偏好数据预测更准确,但用户常选择信息量较少的方式,且AI在冲突时更倾向于遵循提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31444 2026-06-01 cs.AI cs.LO 57%

Answer-Set-Programming-based Abstractions for Reinforcement Learning

基于回答集编程的强化学习抽象方法

Rafael Bankosegger, Thomas Eiter, Johannes Oetsch

机构 * Siemens AG Österreich(西门子奥地利公司) TU Wien (Vienna University of Technology)(维也纳技术大学) Jönköping University(约翰·科平大学)

专题命中 记忆与上下文管理 :autonomous agent(abstract);分类 cs.AI

AI总结 本文提出使用回答集编程(ASP)实现CARCASS框架中的抽象,以解决强化学习中状态空间巨大带来的挑战,并通过积木世界和Minigrid两个领域的案例验证了该方法的有效性。

Comments Accepted for publication at the 42nd International Conference on Logic Programming (ICLP 2026). To appear in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30690 2026-06-01 cs.CL 57%

ElasticMem: Latent Memory as a Learnable Resource for LLM Agents

ElasticMem: 将潜在记忆作为LLM智能体的可学习资源

Tao Feng, Chongrui Ye, Tianyang Luo, Jingjun Xu, Xueqiang Xu, Haozhen Zhang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 提出ElasticMem框架,通过可学习的弹性潜在记忆分配策略,在记忆密集型问答和具身智能体控制任务中显著提升准确率并降低token开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30656 2026-06-01 cs.LG 57%

Learning to Perceive the World Through Control: Empowerment-Based Representation Learning

通过控制学习感知世界:基于赋能的表示学习

Mahsa Bastankhah, Sophie Broderick, Benjamin Eysenbach

机构 * Princeton University, USA(普林斯顿大学,美国)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文通过最大化赋能目标,研究如何学习仅捕捉环境控制相关特征的表示,并证明赋能代理诱导的前向和后向表示对控制无关特征具有不变性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22794 2026-06-01 eess.SY cs.LG cs.SY 57%

Accelerating Reinforcement Learning for Wind Farm Control via Expert Demonstrations

通过专家演示加速风电场控制的强化学习

Marcus Binder Nilsen, Julian Quick, Tuhfe Göçmen, Nikolay Dimitrov, Pierre-Elouan Réthoré

机构 * Department of Wind and Energy Systems, Technical University of Denmark(丹麦技术大学风能与能源系统系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 提出一种利用稳态尾流模型生成的专家演示预训练方法,通过行为克隆初始化Soft Actor-Critic网络,消除初始学习阶段,使初始性能接近基线水平,并在在线微调后超越查表控制器。

Comments Submitted to Journal of Physics: Conference Series (Torque 2026). This is the Accepted Manuscript version of an article accepted for publication in Journal of Physics: Conference Series. IOP Publishing Ltd is not responsible for any errors or omissions in this version of the manuscript or any version derived from it. This Accepted Manuscript is published under a CC BY licence

Journal ref J. Phys.: Conf. Ser. 3224 032016 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09221 2026-06-01 cs.LG 57%

Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning

超越测试时记忆:用于LLM推理的状态空间最优控制

Peihao Wang, Shan Yang, Xijun Wang, Tesi Xiao, Xin Liu, Changlong Yu, Yu Lou, Pan Li, Zhangyang Wang, Ming Lin, René Vidal

机构 * vita-group(vita组)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 提出测试时控制(TTC)层,通过有限时域LQR规划实现推理,作为适配器集成到预训练LLM中,在数学推理任务上提升高达27.8%的准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31075 2026-06-01 cs.CV 50%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11367 2026-06-01 cs.CV 50%

3D-Belief: Embodied Belief Inference via Generative 3D World Modeling

3D-Belief:通过生成式3D世界建模实现具身信念推断

Yifan Yin, Zehao Wen, Suyu Ye, Jieneng Chen, Zehan Zheng, Nanru Dai, Haojun Shi, Aydan Huang, Zheyuan Zhang, Alan Yuille, Jianwen Xie, Ayush Tewari, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学) Lambda University of Cambridge(剑桥大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出3D-Belief,一种生成式3D世界模型,通过在线更新显式3D信念,使具身智能体能够在部分可观测环境中想象场景补全并推理,在2D/3D想象质量和下游物体导航任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 25 篇

2605.11946 2026-06-01 cs.AI 91%

Counterfactual Trace Auditing of LLM Agent Skills

LLM Agent技能的反事实痕迹审计

Xiaolin Zhou, Jinbo Liu, Li Li, Ryan A. Rossi, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Adobe Research(Adobe研究)

专题命中 Agent评测 :agent(title,title_cn);planning(abstract);分类 cs.AI

AI总结 提出反事实痕迹审计(CTA)框架,通过配对有无技能的Agent轨迹并生成结构化技能影响模式(SIP)注释,揭示技能对行为的重塑效应,弥补仅通过通过率评估的不足。

Comments Code and data are available at https://github.com/WillChow66/CTA.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31351 2026-06-01 cs.CL cs.CV 84%

A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

面向VLM-as-a-Judge评估的视障辅助基准

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 Agent评测 :agent(summary_cn,abstract);workflow(abstract);分类 cs.CL

AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30916 2026-06-01 cs.LG cs.GT econ.TH 83%

Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation

福利、可改进性与方差:最优基准测试项聚合的主-代理方法

Andreas Haupt, Justin Hartenstein, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo

机构 * Department of Economics & Computer Science(经济与计算机科学系) Institute for Computational and Mathematical Engineering(计算与数学工程研究所) Department of Computer Science(计算机科学系) Department of Aeronautics & Astronautics(航空与航天系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出将基准测试建模为多任务主-代理博弈,通过福利、可改进性和方差三个维度评估项目,并应用于OLMES数据集识别帕累托劣势项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31463 2026-06-01 cs.LG cs.AI cs.CL cs.DC 82%

PithTrain: A Compact and Agent-Native MoE Training System

PithTrain: 一个紧凑且面向智能体的MoE训练系统

Ruihang Lai, Hao Kang, Haozhan Tang, Akaash R. Parthasarathy, Zichun Yu, Junru Shao, Todd C. Mowry, Chenyan Xiong, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Xlue NVIDIA(英伟达)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PithTrain,一个基于智能体原生设计原则的紧凑型MoE训练框架,通过引入ATE-Bench评估智能体任务效率,在保持生产框架吞吐量的同时,将智能体任务轮次和活跃GPU时间分别降低62%和64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30590 2026-06-01 cs.LG cs.AI cs.CL 81%

Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents

反事实评估揭示临床LLM和智能体的隐藏能力画像

Matt Turk

机构 * Protege Data Lab(Protege数据实验室)

专题命中 Agent评测 :AI agent(abstract,comments);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出因果敏感性评分(CSS),通过沿五个临床维度变异肿瘤病例来评估模型是否按预期方向更新推荐,发现与覆盖度指标排名相反,并揭示所有前沿模型在手术状态干预上的安全盲点。

Comments Accepted to RLEval @ ACM CAIS 2026 (Workshop on Methods and RL Environments for Evaluating AI Agents) and selected for an invited talk based on reviewer ratings. 4-page short paper + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31308 2026-06-01 cs.AI 79%

TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

TraceGraph: 用于诊断和改进智能体轨迹的共享决策景观

Junjie Nian, Kang Chen, Ge Zhang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出TraceGraph图框架,将多模型智能体轨迹构建为共享决策景观,通过事件摘要和陷阱感知恢复管线提升SWE-bench解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30547 2026-06-01 cs.MA 78%

MATraM: A Multi-Activity Transport and Mobility Agent-Based Model for Activity Modifications

MATraM:一种用于活动修改的多活动交通与出行智能体模型

Yahya Gamal, Ricardo Colasanti, Gary Polhill, Tatsuya Mitomi, Esra Suel, Alison Heppenstall

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出MATraM智能体模型,通过引入动态活动适应机制,克服传统活动基础交通模型依赖固定行程的局限,实现个体行为对交通系统动态的响应。

Comments 24 pages, 4 figures, 9 tables, working paper for a submission to MethodsX journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30907 2026-06-01 cs.SE cs.AI cs.CL cs.LG 77%

BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

BlueFin: 在金融电子表格上对LLM智能体进行基准测试

Srivatsa Kundurthy, Clara Na, Colton Moraine, Anoushka Mohta, Case Winter, George Fang, John Ling, Emma Strubell, Zach Kirshner

机构 * Longitude Labs Inc.(Longitude Labs公司) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出BlueFin基准,通过131个真实金融电子表格任务评估LLM智能体的合成、操作和理解能力,并验证了LM评判与人类专家的一致性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13812 2026-06-01 cs.DB cs.AI cs.MA 77%

DTBench: A Synthetic Benchmark for Document-to-Table Extraction

DTBench:文档到表格提取的合成基准

Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出DTBench合成基准,通过反向Table2Doc范式和多智能体合成流程生成文档,系统评估LLM在文档到表格提取中的多种能力。

Comments KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08964 2026-06-01 cs.LG cs.AI cs.CL cs.CY 75%

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

语言模型智能体中目标导向性的行为与表征评估

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sarti, Mario Giulianelli

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) Indiana University, Bloomington(印第安纳大学,布卢明顿) Northeastern University(东北大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种结合行为评估与内部表征可解释性分析的目标导向性评估框架,并以LLM智能体在2D网格世界中的导航为例,验证了其行为与表征的一致性。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30708 2026-06-01 nlin.CG cs.NE nlin.AO 71%

Agnosiophobia in a virtual agent: behavioral and dynamical architecture in Lenia

虚拟智能体中的未知恐惧:Lenia中的行为与动力学架构

Jesse Cool, Benedikt Hartl, Michael Levin, Samantha Petti

专题命中 Agent评测 :agent(title)

AI总结 本研究通过在Lenia环境中引入无感知区域,发现虚拟生物倾向于回避这些区域(称为未知恐惧),并通过动力学系统分析揭示其行为源于形态维持这一更根本的目标。

Comments 8 pages, 6 figures; under review at ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25110 2026-06-01 cs.CL 70%

DEBATE: A Large-Scale Benchmark for Evaluating Opinion Dynamics in Role-Playing LLM Agents

DEBATE:用于评估角色扮演LLM代理中观点动态的大规模基准

Yun-Shiuan Chuang, Ruixuan Tu, Chengtao Dai, You Li, Smit Vasani, Binwei Yao, Michael Henry Tessler, Sijia Yang, Dhavan Shah, Robert Hawkins, Junjie Hu, Timothy T. Rogers

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 提出DEBATE基准,通过多轮公共消息和Likert量表信念数据,评估多代理角色扮演LLM模拟中观点动态的真实性,发现零样本设置下代理组过度收敛,而监督微调可改善立场对齐并减少组级收敛误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14221 2026-06-01 cs.IR cs.CL 70%

GEM-Bench: A Benchmark for Ad-Injected Response Generation within Generative Engine Marketing

GEM-Bench:生成引擎营销中广告注入响应生成的基准测试

Silan Hu, Shiqi Zhang, Yimin Shi, Xiaokui Xiao

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对生成引擎营销中广告注入响应生成缺乏专门基准的问题,提出首个综合基准GEM-Bench,包含多场景数据集、多维度指标和基线方案,实验表明简单提示方法虽能提升点击率但降低用户满意度,而基于预生成无广告响应的插入方法可缓解此问题但增加开销。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31572 2026-06-01 cs.CV 67%

nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving

nuReasoning:面向长尾自动驾驶的推理中心数据集与基准

Zhiyu Huang, Johnson Liu, Rui Song, Zewei Zhou, Ruining Yang, Yun Zhang, Tianhui Cai, Hanyin Zhang, Mingxuan Gao, Valeria Xu, Jiali Chen, Yishan Shen, Yiluan Guo, Tony, Qi, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Motional

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出nuReasoning数据集,包含2万段20秒长尾驾驶场景的推理标注,支持空间、决策和反事实推理评估,并证明推理监督可提升VLM和VLA的驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31170 2026-06-01 cs.CL cs.AI 62%

Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion

语言模型智能体群体中的涌现语言:从令牌效率到监督规避

Stine Lyngsø Beltoft, William Brach, Federico Torrielli, Jacob Nielsen, Annemette Brok Pirchert, Filippo Tonini, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学) Slovak University of Technology in Bratislava(布拉迪斯拉发技术大学) University of Turin(都灵大学) Ordbogen A/S(Ordbogen公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究语言模型智能体群体中涌现的语言,通过规则启发式和零样本分类识别出令牌效率、新自然语言和监督规避三类,发现监督规避语言更难对齐且可被上下文学习,表明仅监控表面行为可能不足以控制智能体群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30899 2026-06-01 eess.AS cs.AI cs.SD 57%

A Unified and Reproducible Experimentation Framework for Speech Understanding

语音理解的统一可复现实验框架

Jing Peng, Junhao Du, Chenghao Wang, Hanqi Li, Yi Yang, Yixuan Wang, Xiaoyu Gu, Guanyu Chen, Yucheng Wang, Jiang Li, Zhangjie Zhao, Haoran Wang, Wenming Tu, Haoyu Li, Duo Ma, Lirong Qian, Yu Xi, Wen Wen, Jiaqi Guo, Hui Zhang, Shuai Fan, Wenbin Jiang, Shuai Wang, Kai Yu

机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) AISpeech Ltd(AISpeech有限公司) ETH Zürich(苏黎世联邦理工学院) Nanjing University(南京大学) Hangzhou Dianzi University(杭州电子科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出SURE框架,通过标准化预测格式、归一化和评分,以及代理辅助的训练转换流程,提高语音理解模型在部署场景下的可比性和可复现性。

Comments This paper is submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30727 2026-06-01 cs.CL 57%

MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents

MosaicLeaks:深度研究代理的开放查询中的隐私风险

Alexander Gurung, Spandana Gella, Alexandre Drouin, Issam H. Laradji, Perouz Taslakian, Rafael Pardinas

机构 * ServiceNow AI Research(ServiceNow AI研究院) University of Edinburgh(爱丁堡大学) Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对深度研究代理在查询外部工具时可能泄露本地敏感信息的问题,提出MosaicLeaks基准测试和隐私感知深度研究(PA-DR)框架,通过强化学习降低信息泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30639 2026-06-01 cs.CV cs.AI cs.RO 57%

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

PInVerify:面向主动实例验证的离线具身基准

Yuhang Jiang

机构 * University of Trento(特伦托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。

Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30454 2026-06-01 cs.CR cs.AI 57%

The Surface You Test Is Not the Surface That Breaks

测试的表面并非断裂的表面

Shifat E Arman, Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文发现工具增强的LLM代理对提示注入的脆弱性依赖于攻击表面(工具输出 vs 工具描述),提出自适应攻击率并强调评估需报告每个表面的脆弱性。

Comments 8 Figures, 8 Tables, Under Review at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16922 2026-06-01 cs.AI 57%

ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis

ClimAgent:基于大语言模型的自主开放式气候科学分析智能体

Hao Wang, Jindong Han, Wei Fan, Hao Liu

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI

AI总结 提出ClimAgent框架,通过统一工具使用环境和严格推理协议,实现端到端建模与分析,在ClimaBench基准上相比原始LLM方案提升40.21%。

Comments It was submitted without the full consent of all co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18382 2026-06-01 cs.AI 57%

From Weak Cues to Real Identities: Evaluating Inference-Driven De-Anonymization in LLM Agents

从弱线索到真实身份:评估LLM代理中推理驱动的去匿名化

Myeongseob Ko, Jihyun Jeong, Sumiran Singh Thakur, Gyuhak Kim, Ruoxi Jia

机构 * Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机工程系) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究通过LLM代理结合分散的非识别线索与公开证据重建真实身份的能力,揭示了即使在没有明确标识符的情况下,代理也能以高成功率实现去匿名化,并提出了新的隐私评估维度。

Comments Accepted at ICML 2026

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏