arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-01 至 2026-05-01 共收录 137 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 10 篇

2604.17460 2026-05-01 cs.CY cs.AI cs.HC cs.SE 84%

Agentic Education: Using Claude Code to Teach Claude Code

代理教育:使用Claude Code进行教学

Zain Naboulsi

机构 * Sparq

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出cc-self-train模块化交互课程,通过实际项目构建教授Claude Code,引入五项贡献:角色进阶模型、自适应学习系统、跨领域统一课程、分步机制和自动更新课程设计,提升AI教学效果。

Comments 27 pages, 5 figures, 7 tables. v2: added discussion of the GenAI adoption gap (MIT NANDA 2025) and a future-work direction on affect-aware adaptation; no changes to the system, evaluation, or core contributions. Code: https://github.com/zainnab-sparq/cc-self-train

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28138 2026-05-01 cs.OS cs.AI 83%

Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

Crab:一种语义感知的检查点/恢复运行时用于智能体沙盒

Tianyuan Wu, Chaokun Chang, Lunxi Cao, Wei Gao, Wei Wang

机构 * HKUST(香港科技大学)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 Crab通过桥接智能体与操作系统间的语义鸿沟,提升检查点恢复的准确性,减少检查点流量,提高执行效率。

Comments 15 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA 83%

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27555 2026-05-01 cs.AI 81%

SpatialGrammar: A Domain-Specific Language for LLM-Based 3D Indoor Scene Generation

SpatialGrammar: 一种面向领域的语言用于基于LLM的3D室内场景生成

Song Tang, Kaiyong Zhao, Yuliang Li, Qingsong Yan, Penglei Sun, Junyi Zou, Qiang Wang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 软件智能体 :agent(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SpatialGrammar,一种领域特定语言,通过BEV网格放置确定性编译生成有效3D几何,提升空间准确性和物理合理性。SG-Agent通过编译器反馈迭代优化场景,SG-Mini在单次生成场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27419 2026-05-01 cs.AI cs.CL 81%

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?

Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang

机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(悉尼大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。

Comments 21 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10140 2026-05-01 cs.SE cs.AI cs.MA 81%

Can Large Language Models Implement Agent-Based Models? An ODD-based Replication Study

大型语言模型能否实现基于主体的模型?基于ODD的复制研究

Nuno Fachada, Daniel Fernandes, Carlos M. Fernandes, João P. Matos-Carvalho

机构 * Lusófona University(卢塞佛纳大学) INESC INOV-Lab(INESC INOV实验室)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文评估17种LLM在ODD到代码转换任务中的表现,探讨LLM能否可靠实现基于主体的模型并支持复制、验证与验证。

Comments The peer-reviewed version of this paper is published in Ecological Modelling at https://doi.org/10.1016/j.ecolmodel.2026.111624. This version is typeset by the author and differs only in pagination and typographical detail

Journal ref Ecological Modelling, 517, 111624, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27264 2026-05-01 cs.SE cs.AI 79%

Self-Evolving Software Agents

自演化软件代理

Marco Robol, Paolo Giorgini

机构 * University of Trento(特伦托大学)

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出自演化软件代理,结合BDI推理与大语言模型,使代理能自主进化目标、推理和可执行代码。实验显示代理可自主发现新目标并生成行为,验证了LLM驱动进化的可行性与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 67%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07179 2026-05-01 cs.LG cs.AI 62%

Efficient Traffic Forecasting on Large-Scale Road Network by Regularized Adaptive Graph Convolution

通过正则化自适应图卷积实现大规模道路网络高效交通预测

Kaiqi Wu, Weiyang Kong, Sen Zhang, Zitong Chen, Yubao Liu

机构 * School of Computer Science and Engineering, Sun Yat-Sen University, China(中山大学计算机科学与工程学院) School of Artificial Intelligence, Sun Yat-Sen University, China(中山大学人工智能学院) Guangdong Key Laboratory of Big Data Analysis and Processing, China(广东大数据分析与处理重点实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出正则化自适应图卷积模型,通过高效余弦操作和残差差分机制提升大规模交通网络预测效率与精度,实验表明其在多个真实数据集上均优于现有方法。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27148 2026-05-01 cs.SE 57%

CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows

CI-Repair-Bench:基于CI工作流的自动化补丁验证仓库意识基准

Rabeya Khatun Muna, Md Nakhla Rafi, Tse-Hsun, Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 CI-Repair-Bench通过真实GitHub Actions执行构建,提供仓库级程序修复基准,包含567个CI失败实例,细粒度评估12种CI错误类型,揭示自动化修复在局部和工具强制失败上效果最佳,但环境依赖等问题仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 6 篇

2602.13559 2026-05-01 cs.AI 85%

OpAgent: Operator Agent for Web Navigation

OpAgent:网页导航的运算代理

Yuyu Guo, Wenjie Yang, Siyuan Yang, Ziyang Liu, Cheng Chen, Yuan Wei, Yun Hu, Yang Huang, Guoliang Hao, Dongsheng Yuan, Jianming Wang, Xin Chen, Hang Yu, Lei Lei, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出OpAgent,通过在线强化学习优化网页导航策略,结合层级多任务微调和混合奖励机制,实现71.6%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27776 2026-05-01 cs.AI cs.CL 73%

WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments

WindowsWorld: 一个以进程为中心的自主GUI代理跨应用专业环境基准测试

Jinchao Li, Yunxin Li, Chenrui Zhao, Zhenran Xu, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出WindowsWorld基准测试,用于评估自主GUI代理在跨应用复杂任务中的能力,发现代理在多应用任务中表现不佳,执行效率低,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV 57%

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27253 2026-05-01 cs.AI 57%

AutoSurfer -- Teaching Web Agents through Comprehensive Surfing, Learning, and Modeling

AutoSurfer -- 通过全面浏览、学习和建模教学网络代理

Fazle Elahi Faisal, Qianhui Wu, Baolin Peng, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 AutoSurfer通过系统性广度优先探索策略、任务合成引导和轨迹优化,实现全面覆盖网站操作空间,提升网络代理轨迹生成的准确性和多样性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27974 2026-05-01 cs.CV cs.DB 50%

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

FineState-Bench:面向细粒度GUI状态设置的状态条件化基准测试

Fengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen

机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI研究院) Northeastern University, China(中国东北大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 FineState-Bench通过精确目标状态评估,检验智能体能否正确映射指令至UI控件,提出FineState-Metrics与VDA诊断工具,实验显示视觉接地仍有提升空间,但整体准确率不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27620 2026-05-01 cs.CV 50%

SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation

SpaAct:基于课程适应的空间激活转换学习用于视觉语言导航

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Hanbing Li, Lin Zhao, Kailin Lyu, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室) Centre for Artificial Intelligence and Robotics(人工智能与机器人中心) University of Macau(澳门大学) Xiaomi EV(小i EV) School of Automation(自动化学院) Beijing Institute of Technology(北京理工大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 SpaAct通过引入空间激活任务和课程适应方法,提升视觉语言导航中动态空间感知能力,实现更高效的导航性能。

Comments Submmited to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 9 篇

2601.10702 2026-05-01 cs.CL cs.AI cs.IR 81%

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 记忆与上下文管理 :agent(title);agentic(abstract);分类 cs.AI、cs.CL

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27737 2026-05-01 physics.soc-ph 78%

Crowd Dynamics in Historical Perspective: Reframing the Amritsar Massacre through Agent-Based Modelling and Social Psychology

从历史视角看人群动态:通过基于代理建模和社会心理学重新审视阿姆利则大屠杀

Mohcine Chraibi, Krisztina Konya, Ezel Üsten

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 本文通过基于代理建模和社会心理学重新审视阿姆利则大屠杀,揭示人群作为现象的物理与社会心理动态,指出即使在保守的物理假设下,模拟结果仍高于官方死亡人数,强调跨学科建模对历史责任和当前人群安全的重要性。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27045 2026-05-01 cs.LG cs.AI cs.CL 67%

Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture

在健康教练代理中检测临床差异:一种双流记忆与协调架构

Samuel L Pugh, Eric Yang, Alexander Muir Sutherland, Alessandra Breschi

机构 * Verily Health Inc(Verily健康公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出双流记忆与协调架构,用于检测健康教练代理中的临床差异,通过验证患者报告与临床记录以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27981 2026-05-01 cs.LG cs.AI 62%

ITS-Mina: A Harris Hawks Optimization-Based All-MLP Framework with Iterative Refinement and External Attention for Multivariate Time Series Forecasting

ITS-Mina:一种基于Harris Hawks优化的全MLP框架,结合迭代细化和外部注意力机制用于多变量时间序列预测

Pourya Zamanvaziri, Amirhossein Sadr, Aida Pakniyat, Dara Rahmati

机构 * Department of Computer Science and Engineering, Shahid Beheshti University, Iran(伊朗谢赫·贝赫什提大学计算机科学与工程系) School of Computer Science, Institute for Research in Fundamental Sciences (IPM), Iran(伊朗基础科学研究院(IPM)计算机科学学院)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ITS-Mina,一种全MLP框架,通过迭代细化机制、外部注意力模块和Harris Hawks优化算法,实现多变量时间序列预测的高精度与低计算成本。

Comments 19 pages, 2 figures, 3 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26103 2026-05-01 cs.AR cs.AI cs.DC cs.LG 62%

AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving

AMMA: 一种面向低延迟1M上下文注意力服务的多芯片片内存架构

Zhongkai Yu, Haotian Ye, Chenyang Zhou, Ohm Rishabh Venkatachalam, Zaifeng Pan, Zhengding Hu, Junsung Kim, Won Woo Ro, Po-An Tsai, Shuyi Pei, Yangwook Kang, Yufei Ding

机构 * University of California, San Diego(加州大学圣迭戈分校) Columbia University(哥伦比亚大学) Yonsei University(延世大学) NVIDIA(NVIDIA公司) Samsung Semiconductor, Inc.(三星半导体公司)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 AMMA是一种面向低延迟1M上下文注意力服务的多芯片片内存架构,通过提高内存带宽和优化并行计算方案,显著降低注意力延迟和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27872 2026-05-01 cs.AI 57%

Modeling Clinical Concern Trajectories in Language Model Agents

语言模型代理中临床关注轨迹建模

Sukesh Subaharan, Venkatesan VS, Murugadasan P, Sivakumar D, Gautham N, Ganeshkumar M

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文研究通过显式状态动态揭示临床关注轨迹,提出轻量级架构以生成连续升级压力信号,使LLM代理更符合临床实际需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28161 2026-05-01 cs.RO 50%

RopeDreamer: A Kinematic Recurrent State Space Model for Dynamics of Flexible Deformable Linear Objects

RopeDreamer:一种用于柔性可变形线性物体动态的运动学递归状态空间模型

Tim Missal, Lucas Domingues, Berk Guler, Simon Manschitz, Jan Peters, Paula Dornhofer Paro Costa

机构 * Technical University of Darmstadt(德意志技术大学) School of Electrical and Computer Engineering, Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学电气与计算机工程学院) Instituto de Pesquisas Eldorado(Eldorado研究所) Honda Research Institute Europe GmbH(本田欧洲研究院) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Robotics Institute Germany (RIG)(德国机器人研究所) Centre for Cognitive Science(认知科学研究中心) Artificial Ingelligence Lab, Recod.ai(Recod.ai人工智能实验室)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 本文提出结合递归状态空间模型与四元数运动链表示的潜变量框架,用于预测柔性可变形线性物体的状态,通过约束物理有效流形减少自交和非物理变形,提升长周期预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28157 2026-05-01 cs.CR 50%

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

FlashRT: 向计算和内存高效方向发展用于提示注入和知识腐败的红队测试

Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

专题命中 记忆与上下文管理 :autonomous agent(abstract)

AI总结 本文提出FlashRT框架,通过提升计算和内存效率,优化长上下文LLM的提示注入和知识腐败攻击,实现2-7倍的加速和2-4倍的内存节省,为系统评估长上下文LLM的安全性提供工具。

Comments The code is available at https://github.com/Wang-Yanting/FlashRT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27961 2026-05-01 physics.soc-ph math.DS math.PR 50%

Clustering in co-evolving opinion dynamics: reduced SPDE models

共演意见动力学中的聚类:简化SPDE模型

Sebastian Zimper, Nataša Djurdjevac Conrad, Federico Cornalba, Ana Djurdjevac

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出简化SPDE模型研究共演社会与意见变量中的聚类现象,通过减少状态空间提升计算效率,应用于大规模GSS数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 21 篇

2604.27464 2026-05-01 cs.CR cs.AI 88%

Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study

自主代理框架的安全攻击与防御策略:以OpenClaw为案例的分层综述

Luyao Xu, Xiang Chen

机构 * School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文通过分层分析探讨自主代理框架的安全风险与防御策略,以OpenClaw为案例,揭示威胁跨层传播的可能性及未来研究方向。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27309 2026-05-01 cs.AI 86%

End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians

面向临床医生的嵌入式电子健康记录(EHR)AI代理的端到端评估与治理

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级医疗)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada(内华达大学儿科系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出一个端到端治理框架,通过rubric验证、实时部署反馈、技术性能监控和成本追踪,持续优化临床AI系统性能,实验显示系统性能显著提升。

Comments 19 pages, 6 figures, 6 tables, submitted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05192 2026-05-01 cs.CR cs.AI 85%

From surveillance to signalling: escalation channels as environmental controls for agentic AI

从监控到信号:冲突通道作为代理AI的环境控制

Francesca Gomez

机构 * Wiser Human

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27894 2026-05-01 q-bio.NC 82%

On Agentic Behavioral Modeling

关于代理行为建模

Dirk Ostwald, Rasmus Bruckner, Franziska Usée, Belinda Fleischmann, Joram Soch, Sean Mulready

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文提出代理行为建模框架,通过两个实验任务展示其在认知机制建模中的应用,并证明Rescorla-Wagner学习与贝叶斯推断的等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28093 2026-05-01 cs.AI 79%

What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design

什么样的终端-智能体基准任务是好的:为对抗性、困难和可理解的评估设计提供指南

Ivan Bercovich

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文探讨了如何设计有效的终端-智能体基准任务,指出任务应具备对抗性、难度和可理解性,以避免常见的失败模式,并通过实证证据表明超过15%的基准任务存在奖励可 hack 的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏