arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-30 至 2026-03-30 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2603.26221 2026-03-30 cs.CR cs.AI cs.ET cs.SE 86%

Clawed and Dangerous: Can We Trust Open Agentic Systems?

带刺且危险:我们能信任开放代理系统吗?

Shiping Chen, Qin Wang, Guangsheng Yu, Xu Wang, Liming Zhu

机构 * CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) University of Technology Sydney(悉尼科技大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨开放代理系统在安全治理中的挑战,提出六维分析框架和安全建设参考原则,指出当前在部署控制、运营治理等方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25780 2026-03-30 cs.SE cs.LG 81%

A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation

裁判代理缩小了人工智能生成的科学模拟的可靠性差距

Chengshuai Yang

机构 * NextGen PlatformAI C Corp(NextGen PlatformAI C公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 本文提出裁判代理自动验证生成的科学模拟代码,将失败率从42%降至1.5%,并在12个领域中实现89%的成功率,同时引入spec.md规范格式。

Comments 36 pages, 5 figures, 22 tables, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26034 2026-03-30 cs.CL 70%

AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents

AgentCollab: 一种以自我评估驱动的高效大语言模型代理协作范式

Wenbo Gao, Renxi Liu, Xian Wang, Fang Guo, Shuai Yang, Xi Chen, Hui-Ling Zhen, Hanting Chen, Weizhe Lin, Xiaosong Li, Yaoyuan Wang

机构 * Huawei(华为) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 本文提出AgentCollab框架,通过自我反思信号动态协调不同推理能力的模型,提升LLM代理在复杂任务中的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24989 2026-03-30 cs.RO cs.AI 70%

Learning Rollout from Sampling:An R1-Style Tokenized Traffic Simulation Model

从采样中学习:一种R1风格的分词交通仿真模型

Ziyan Wang, Peng Chen, Ding Li, Chiwei Li, Qichao Zhang, Zhongpu Xia, Guizhen Yu

机构 * State Key Laboratory of Intelligent Transportation System, Key Laboratory of Autonomous Transportation Technology for Special Vehicles, Ministry of Industry and Information Technology, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院,智能交通系统国家重点实验室,特种车辆自主运输技术重点实验室(工业和信息化部)) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所,多模态人工智能系统国家重点实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出R1Sim模型,通过分词交通仿真结合熵引导采样和GRPO优化,实现探索与利用的平衡,生成真实安全的多智能体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25747 2026-03-30 cs.AI 70%

BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments

BeSafe-Bench:揭示功能环境中情境代理的行为安全风险

Yuxuan Li, Yi Lin, Peng Wang, Shiming Liu, Xuetao Wei

机构 * Southern University of Science and Technology(南方科技大学) Huawei RAMS Lab(华为RAMS实验室)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15106 2026-03-30 eess.SY cs.SY 67%

Local Differential Privacy for Distributed Stochastic Aggregative Optimization with Guaranteed Optimality

分布式随机聚合优化的局部差分隐私

Ziqin Chen, Yongqiang Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出一种算法,在保证精确收敛的同时实现严格差分隐私,解决了分布式聚合优化中梯度噪声和隐私泄露的问题,并通过实验验证其有效性。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26137 2026-03-30 cs.SE cs.AI 62%

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

面向仓库级别的软件工程评估的时间一致性基准

Xianpeng, Sun, Haonan Sun, Tian Yu, Sheng Ma, Qincheng Zhang, Lifei Rao, Chen Tian

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25197 2026-03-30 cs.AI cs.ET cs.HC cs.RO cs.SE 62%

The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering

能力阴影:物理AI系统安全工程中AI辅助的理论与界限

Umair Siddique

机构 * Independent Research(独立研究)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨AI在安全工程中的辅助作用,提出能力阴影理论,揭示AI辅助可能带来的系统性盲区,并强调协作设计的重要性。

Comments 8 Pages, 3 Figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06882 2026-03-30 cs.DC cs.AI cs.LG cs.PF 62%

Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices

边缘设备上流处理服务的多维自动扩展

Boris Sedlak, Philipp Raith, Andrea Morichetta, Víctor Casamayor Pujol, Schahram Dustdar

机构 * TU Wien(维也纳工业大学) Universitat Pompeu Fabra(庞培法布拉大学) ICREA(加泰罗尼亚高等研究机构)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MUDAP平台,通过服务与资源维度的细粒度垂直扩展,结合RASK代理优化执行,实现边缘设备上流处理服务的多维自动扩展,减少SLO违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25946 2026-03-30 cs.CV cs.AI cs.LG 62%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26177 2026-03-30 cs.LG 57%

Can AI Scientist Agents Learn from Lab-in-the-Loop Feedback? Evidence from Iterative Perturbation Discovery

AI科学家代理能否从循环实验室反馈中学习?来自迭代扰动发现的证据

Gilles Wainrib, Barbara Bodinier, Haitem Dakhli, Josep Monserrat, Almudena Espin Perez, Sabrina Carpentier, Roberta Codato, John Klein

机构 * Owkin Inc(Owkin公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过800次独立重复实验,比较了基于LLM的代理在循环扰动发现中利用反馈与零样本基线的性能差异,发现反馈能显著提升发现效率,且模型能力提升后效果更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26031 2026-03-30 cs.HC cs.AI 57%

Designing Fatigue-Aware VR Interfaces via Biomechanical Models

通过生物力学模型设计疲劳感知的VR界面

Harshitha Voleti, Charalambos Poullis

机构 * Immersive \& Creative Technologies Lab, Concordia University Canada Immersive \& Creative Technologies Lab, Concordia University

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种分层强化学习框架,利用生物力学用户模型评估和优化VR界面,以减少空中交互的疲劳。通过模拟疲劳反馈优化UI布局,实验表明该方法能有效降低用户感知疲劳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26589 2026-03-30 cs.CV 50%

The Limits of Learning from Pictures and Text: Vision-Language Models and Embodied Scene Understanding

图像与文本学习的极限:视觉语言模型与具身场景理解

Gillian Rosenberg, Skylar Stadhard, Bruce C. Hansen, Michelle R. Greene

机构 * Barnard College, Columbia University(哥伦比亚大学巴纳德学院) Colgate University(科尔盖特大学)

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨图像与文本学习在人类场景理解中的局限性,通过对比18个视觉语言模型与2000名人类观察者在15项任务中的表现,发现模型在具身认知任务中存在显著缺陷,表明分布学习不足以实现基于 affordance 的场景理解。

Comments 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏