arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-10 至 2026-04-10 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 25 篇

2604.07385 2026-04-10 cs.LG cs.AI 62%

Playing DOOM with 1.3M Parameters: Specialized Small Models vs Large Language Models for Real-Time Game Control

用130万参数进行DOOM游戏:专用小型模型与大型语言模型在实时游戏控制中的对比

David Golchinfar, Daryoush Vaziri, Alexander Marquardt

机构 * VAGO Solutions University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用技术大学) Cybernetics and Reality Engineering (CARE) Laboratory, Nara Institute of Science and Technology(奈良先端科学技术大学院大学控制论与真实工程实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SauerkrautLM-Doom-MultiVec模型,通过31ms/决策的ASCII帧表示选择游戏动作,在实时DOOM游戏中超越了包括Nemotron-120B在内的大型语言模型,展示了专用小型模型在实时控制任务中的优势。

Comments 17 pages, 3 figures, 3 tables. Code and model weights available at https://github.com/VAGOsolutions/SauerkrautLM-Doom-MultiVec

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07360 2026-04-10 cs.AR cs.AI cs.LG 62%

Position Paper: From Edge AI to Adaptive Edge AI

观点论文:从边缘AI到自适应边缘AI

Fabrizio Pittorino, Manuel Roveri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出边缘AI必须适应变化的环境,探讨了自适应边缘AI的理论保证、动态架构和系统分解等研究挑战。

Comments 8 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07355 2026-04-10 cs.LG cs.AI econ.GN q-fin.EC 62%

Prediction Arena: Benchmarking AI Models on Real-World Prediction Markets

预测竞技场:在真实世界预测市场中评估AI模型

Jaden Zhang, Gardenia Liu, Oliver Johansson, Hileamlak Yitayew, Kamryn Ohly, Grace Li

机构 * Arcada Labs Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出预测竞技场,通过让AI模型在真实预测市场上自主交易来评估其预测准确性和决策能力。研究分析了不同模型在真实市场中的表现,揭示了预测准确性及正确预测的利用能力是关键因素,同时展示了平台设计对模型成功的影响。

Comments 18 pages, 10 figures, 3 tables. Evaluation period: January 12 - March 9, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07551 2026-04-10 cs.CR cs.AI 57%

MCP-DPT: A Defense-Placement Taxonomy and Coverage Analysis for Model Context Protocol Security

MCP-DPT:模型上下文协议安全的防御放置分类与覆盖分析

Mehrdad Rostamzadeh, Sidhant Narula, Nahom Birhan, Mohammad Ghasemigol, Daniel Takabi

机构 * Old Dominion University(老道明大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出MCP-DPT框架,分析模型上下文协议的安全性,识别防御点并揭示架构不匹配导致的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07423 2026-04-10 cs.RO cs.LG 57%

OpenPRC: A Unified Open-Source Framework for Physics-to-Task Evaluation in Physical Reservoir Computing

OpenPRC: 一个用于物理共振计算中任务评估的统一开源框架

Yogesh Phalak, Wen Sin Lor, Apoorva Khairnar, Benjamin Jantzen, Noel Naughton, Suyi Li

机构 * Virginia Tech(弗吉尼亚理工大学) Department of Mechanical Engineering, Virginia Tech(弗吉尼亚理工大学机械工程系) Department of Philosophy, Virginia Tech(弗吉尼亚理工大学哲学系) Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 OpenPRC通过统一的数据接口整合高保真模拟轨迹和实验测量,提供可重复的评估、分析和物理感知优化,支持多种物理子系统和数据源。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 57%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15512 2026-04-10 cs.LG 57%

SALSA-RL: Stability Analysis in the Latent Space of Actions for Reinforcement Learning

SALSA-RL:强化学习中动作潜空间的稳定性分析

Xuyang Li, Romit Maulik

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 SALSA-RL通过动作潜空间的局部稳定性分析,为强化学习提供可解释性,使在不损害性能的前提下评估预训练智能体的动作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08517 2026-04-10 cs.GT 50%

Learning vs. Optimizing Bidders in Budgeted Auctions

学习与优化投标人在预算拍卖中的博弈

Giannis Fikioris, Balasubramanian Sivan, Éva Tardos

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究预算拍卖中学习者与优化者在贝叶斯设定下的重复交互,提出预算Stackelberg均衡概念,证明在预算约束下优化策略需时间分层,并证明比例控制器在预算下具有战略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08443 2026-04-10 cs.RO cs.HC 50%

A Soft Robotic Interface for Chick-Robot Affective Interactions

一种柔软的机器人接口用于鸡-机器人情感互动

Jue Chen, Alexander Mielke, Kaspar Althoefer, Elisabetta Versace

机构 * Queen Mary University of London(伦敦玛丽女王大学) School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦玛丽女王大学生物与行为科学学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种以动物为中心的柔软机器人情感接口,用于新生鸡的机器人情感互动研究,通过温度、呼吸样变形和面孔状视觉刺激等安全可控的提示,评估鸡对接口的接受度及与机器人互动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08211 2026-04-10 cs.CV 50%

SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection

SciFigDetect:一种用于AI生成科学图表检测的基准测试

You Hu, Chenzhuo Zhao, Changfa Mo, Haotian Liu, Xiaobai Li

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究员) University of Oulu(奥卢大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出首个AI生成科学图表检测基准,通过多模态数据管道构建,涵盖多种图表类别和生成源,揭示现有方法在零样本迁移和对抗性攻击下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2601.18772 2026-04-10 cs.HC 78%

Are Conversational AI Agents the Way Out? Co-Designing Reader-Oriented News Experiences with Immigrants and Journalists

对话式AI代理是出路吗?与移民和记者共同设计以读者为导向的新闻体验

Yongle Zhang, Ge Gao

专题命中 其他Agent :AI agent(title,abstract)

AI总结 本文通过与移民读者和记者共同设计,探索如何利用对话式AI代理改善移民读者的新闻体验,揭示了移民读者与记者之间价值对齐的悖论及AI代理的设计方法。

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07695 2026-04-10 cs.CR cs.AI 57%

AITH: A Post-Quantum Continuous Delegation Protocol for Human-AI Trust Establishment

AITH:一种面向人类-人工智能信任建立的后量子连续委托协议

Zhaoliang Chen

机构 * Faculty of Business Administration, University of Macau(澳门大学工商管理学院)

专题命中 其他Agent :AI agent(abstract);分类 cs.AI

AI总结 本文提出AITH协议,通过后量子加密技术解决人类-人工智能信任关系的持续委托问题,引入连续委托证书、边界引擎和撤销协议,提升安全性与效率。

Comments 11 pages, 8 tables, 5 theorems (machine-verified via Tamarin Prover). Supplementary materials including formal verification model and reference implementation available from the author

详情

展开后加载摘要…

URL PDF HTML 收藏