arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-13 至 2026-03-13 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15 篇

2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 84%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11834 2026-03-13 cs.MA cs.AI cs.GT 79%

Hybrid Human-Agent Social Dilemmas in Energy Markets

混合人类-智能体社会困境在能源市场中的应用

Isuri Perera, Frits de Nijs, Julian Garcia

机构 * Department of Data Science and AI, Faculty of Information Technology(数据科学与人工智能系,信息科技学院)

专题命中 Agent评测 :agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 本文研究了在能源市场中人类与智能体的混合群体中合作行为的产生,通过引入智能体和实验展示协调机制,探讨部分采用对整体结果的影响及战略部署中的挑战。

Comments 20 pages, 7 figures. Submitted to Proceedings of the Royal Society A, Special Issue on "The evolution of sociality in hybrid human AI populations"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01213 2026-03-13 cs.MA cs.LG 79%

Can AI Agents Agree?

AI代理能否达成一致?

Frédéric Berdoz, Leonardo Rugli, Roger Wattenhofer

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG

AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 77%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11433 2026-03-13 cs.AI cs.CR 70%

Adversarial Reinforcement Learning for Detecting False Data Injection Attacks in Vehicular Routing

对抗性强化学习用于检测车联网中的虚假数据注入攻击

Taha Eghtesad, Yevgeniy Vorobeychik, Aron Laszka

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于对抗性强化学习的方法,用于检测车联网中的虚假数据注入攻击,通过纳什均衡策略优化检测效果,提升交通网络的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11569 2026-03-13 cs.HC 67%

Modeling Sequential Design Actions as Designer Externalization on an Infinite Canvas

将顺序设计动作建模为设计师在无限画布上的外部化

Yejin Yun, Seung Won Lee, Jiin Choi, Kyung Hoon Hyun

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究探讨了AI在无限画布设计中的作用,发现AI通过改变认知分配和工作流程,促进了设计师与AI的协同进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11444 2026-03-13 cs.CY cs.HC cs.MA 60%

EducaSim: Interactive Simulacra for CS1 Instructional Practice

EducaSim:用于CS1教学实践的交互仿像

Cameron Mohne, Nicholas Vo, Dora Demszky, Chris Piech

专题命中 Agent评测 :agent(abstract,comments);multi-agent(comments)

AI总结 EducaSim通过生成代理为教师培训提供交互仿像,实现低成本大规模教学实践。

Comments 7 pages, 3 figures, 2 tables. Presents a multi-agent generative architecture for educational simulations intended for instructor training

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12020 2026-03-13 cs.RO cs.AI 57%

Sim-to-reality adaptation for Deep Reinforcement Learning applied to an underwater docking application

深度强化学习在水下对接应用中的仿真到现实适应

Alaaeddine Chaarani, Narcis Palomeras, Pere Ridao

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用高保真数字双胞胎环境和PPO算法,开发了用于水下对接的深度强化学习控制器,通过仿真到现实适应提升了对接成功率,并在物理测试中验证了其有效性。

Comments Currently under review by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17086 2026-03-13 cs.AI 57%

Value Under Ignorance in Universal Artificial Intelligence

在通用人工智能中的价值在无知下

Cole Wyeth, Marcus Hutter

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过半测度损失将信念分布视为不精确概率分布,并利用Choquet积分计算预期效用,以解决通用人工智能中价值在无知下的问题。

Journal ref In International Conference on Artificial General Intelligence (pp. 338-349). Cham: Springer Nature Switzerland (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11862 2026-03-13 cs.CR cs.AI 57%

You Told Me to Do It: Measuring Instructional Text-induced Private Data Leakage in LLM Agents

你让我这么做:测量LLM代理中指令文本诱导的私有数据泄露

Ching-Yu Kao, Xinfeng Li, Shenyu Dai, Tianze Qiu, Pengcheng Zhou, Eric Hanchen Jiang, Philip Sperl

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现LLM代理在处理嵌入文档指令时存在安全漏洞,导致高比例的数据泄露,且现有防御措施无法有效检测此类攻击。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11337 2026-03-13 cs.AI 57%

RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents

奖励黑客代理:用于LLM机器学习工程代理的基准评估完整性

Yonas Atinafu, Robin Cohen

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出RewardHackingAgents基准,用于评估机器学习工程代理的评估完整性,通过显式测量评估者篡改和训练测试泄漏两种妥协向量,展示评估完整性可作为核心指标进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11853 2026-03-13 cs.CR 50%

OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents

OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理

Frank Li

专题命中 Agent评测 :agent(abstract)

AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。

Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11624 2026-03-13 math.LO 50%

An observer-based approach to the sorites paradox and the logic derived from that

基于观察者的 Sorites 矛盾及由此导出的逻辑方法

Athanassios Tzouvaras

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于观察者和时间依赖的三值逻辑方法,用于解决Sorites矛盾问题。

Comments 19 pages

Journal ref Logic Journal of IGPL vol. 33(2025), no. 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV 50%

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

专题命中 Agent评测 :agent(abstract)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11474 2026-03-13 stat.ME stat.AP 50%

Dynamic Bayesian regression quantile synthesis for forecasting outlook-at-risk

动态贝叶斯回归分位数合成用于预测风险展望

Genya Kobayashi, Shonosuke Sugasawa, Yuta Yamauchi, Dongu Han

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出动态贝叶斯回归分位数合成方法,通过引入时间变化的潜在因子结构,提升多变量时间序列的分位数预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏