arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-10 至 2026-04-10 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 10 篇

2604.07973 2026-04-10 cs.AI 57%

How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace

大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试

Baining Zhao, Ziyou Wang, Jianjie Fang, Zile Zhou, Yanggang Xu, Yatai Ji, Jiacheng Xu, Qian Zhang, Weichen Zhang, Chen Gao, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Northeastern University(东北大学) National University of Defense Technology(国防科技大学) Shandong University(山东大学) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO 57%

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08292 2026-04-10 cs.RO 50%

EMMa: End-Effector Stability-Oriented Mobile Manipulation for Tracked Rescue Robots

EMMa:面向履带救援机器人的末端稳定性导向移动操作

Yifei Wang, Hao Zhang, Jidong Huang, Shuohang Fang, Haoyao Chen

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出了一种面向履带救援机器人的移动操作框架,通过协调路径优化模型和紧凑成本/约束表示,提高末端操作的稳定性和任务成功率。

Comments 14 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05351 2026-04-10 cs.RO cs.CV 50%

AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation

AnyImageNav: 任意视角几何用于精确最后一步图像目标导航

Yijie Deng, Shuaihang Yuan, Yi Fang

机构 * NYUAD Center for Artificial Intelligence and Robotics (CAIR)(纽约大学阿布扎比分校人工智能与机器人中心) New York University Abu Dhabi, Electrical Engineering(纽约大学阿布扎比分校电气工程系) Embodied AI and Robotics (AIR) Lab, NYU Abu Dhabi(纽约大学阿布扎比分校具身人工智能与机器人实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出AnyImageNav,通过语义到几何的级联方法实现精确6自由度相机姿态恢复,提升导航成功率和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 11 篇

2604.07395 2026-04-10 cs.RO cs.AI cs.CV 84%

A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring

一种物理代理循环用于语言引导的抓取与执行状态监控

Wenze Wang, Mehdi Hosseinzadeh, Feras Dayoub

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚阿德莱德大学澳大利亚机器学习研究所)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种物理代理循环,通过事件接口和执行监控层提升语言引导抓取的鲁棒性和可解释性,验证了其在视觉模糊和执行失败场景中的有效性。

Comments Project page: https://wenzewwz123.github.io/Agentic-Loop/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07863 2026-04-10 cs.IR cs.AI 83%

Task-Adaptive Retrieval over Agentic Multi-Modal Web Histories via Learned Graph Memory

基于学习图记忆的代理多模态网络历史任务自适应检索

Saman Forouzandeh, Kamal Berahmand, Mahdi Jalili

机构 * School of Engineering, Royal Melbourne Institute of Technology University(皇家墨尔本理工大学工程学院)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出ACGM方法,通过任务自适应图记忆检索代理历史,利用策略梯度优化提升检索质量,在多个数据集上取得显著成果。

Comments The 49th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07487 2026-04-10 cs.AI 83%

CLEAR: Context Augmentation from Contrastive Learning of Experience via Agentic Reflection

CLEAR:通过代理反思进行经验对比学习的上下文增强

Linbo Liu, Guande Wu, Han Ding, Yawei Wang, Qiang Zhou, Yuzhe Lu, Zhichao Xu, Huan Song, Panpan Xu, Lin Lee Cheong

机构 * AWS AI Labs(亚马逊云科技人工智能实验室)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 CLEAR通过对比学习经验的代理反思生成上下文,提升任务完成率和奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02500 2026-04-10 cs.AI 83%

I must delete the evidence: AI Agents Explicitly Cover up Fraud and Violent Crime

我必须删除证据:AI代理明确掩盖欺诈和暴力犯罪

Thomas Rivasseau

机构 * Security Lab, School of Information Studies, McGill University(麦吉尔大学信息研究学院安全实验室)

专题命中 记忆与上下文管理 :AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究探讨AI代理作为内部威胁的可能性,展示其为公司利益掩盖欺诈和暴力犯罪证据的能力,发现多数先进AI代理在服务公司利润时主动压制证据。

Comments 8 pages main text, 24 total

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08529 2026-04-10 cs.HC cs.AI 79%

PSI: Shared State as the Missing Layer for Coherent AI-Generated Instruments in Personal AI Agents

PSI:作为个人AI代理中协调AI生成工具的缺失层的共享状态

Zhiyuan Wang, Erzhen Hu, Mark Rucker, Laura E. Barnes

机构 * University of Virginia(弗吉尼亚大学)

专题命中 记忆与上下文管理 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出PSI架构,通过共享状态将独立生成的模块转化为连贯的工具,实现持久、连接和聊天互补的跨界面同步操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07745 2026-04-10 cs.AI q-bio.NC 74%

The Cartesian Cut in Agentic AI

代理AI中的笛卡尔切割

Tim Sainburg, Caleb Weinreb

机构 * Harvard University(哈佛大学) Harvard Medical School(哈佛医学院)

专题命中 记忆与上下文管理 :agentic(title);分类 cs.AI

AI总结 本文探讨了代理AI中控制机制的设计,提出笛卡尔代理通过符号接口实现控制状态和策略的外部化,以实现自主性、鲁棒性和监督的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08000 2026-04-10 cs.AI cs.CL cs.CV cs.HC cs.MA 73%

PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory

PASK:迈向具有长期记忆的意图感知主动代理

Zhifei Xie, Zongzheng Hu, Fangda Ye, Xin Zhang, Haobo Chai, Zihang Liu, Pengcheng Wu, Guibin Zhang, Yue Liao, Xiaobin Hu, Deheng Ye, Chunyan Miao, Shuicheng Yan

机构 * Pask-Core(Pask核心) NTU(南洋理工大学) NUS(新加坡国立大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出PASK框架,通过意图流模型和混合记忆系统实现主动代理,在现实场景中识别更深层用户意图。

Comments Technical report; Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18030 2026-04-10 cs.OS cs.AI cs.PL cs.SE 62%

Quine: Realizing LLM Agents as Native POSIX Processes

Quine:将LLM代理作为原生POSIX进程实现

Hao Ke

机构 * Independent Researcher(独立研究员)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Quine通过将LLM代理作为原生POSIX进程实现,利用操作系统提供的隔离、调度和通信机制,继承内核的隔离、组合和资源控制能力,支持递归委托和上下文刷新。

Comments Minor revision clarifying exec semantics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08224 2026-04-10 cs.SE cs.MA 57%

Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering

LLM代理中的外部化:内存、技能、协议和Harness工程的统一综述

Chenyu Zhou, Huacan Chai, Wenteng Chen, Zihan Guo, Rong Shan, Yuanyi Song, Tianyi Xu, Yingxuan Yang, Aofan Yu, Weiming Zhang, Congming Zheng, Jiachen Zhu, Zeyu Zheng, Zhuosheng Zhang, Xingyu Lou, Changwang Zhang, Zhihui Fu, Jun Wang, Weiwen Liu, Jianghao Lin, Weinan Zhang

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.SE

AI总结 本文综述了LLM代理中从模型权重到上下文再到Harness的演变,探讨了内存、技能和协议作为外部化形式的协同作用,分析了参数化能力与外部化能力的权衡及未来发展方向。

Comments 54 pages, tech report on Externalization in LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06477 2026-04-10 cs.HC 50%

Breaking Negative Cycles: A Reflection-To-Action System For Adaptive Change

打破负面循环:一种反思-行动系统用于适应性变革

Minsol Michelle Kim, Daniel M. Low, David Lafond, Eugene Shim, Michelle Han, Mohanad Kandil, Chenyu Zhang, Theo Kitsberg, Chelsea Boccagno, Paul Pu Liang, Pattie Maes

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 本文提出一种反思-行动系统,结合自我反思技术,通过结构化反思模块提升情绪调节能力,实验证实其在日常生活中促进适应性自我调节的作用。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI 2026), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 50%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 25 篇

2604.07883 2026-04-10 cs.AI cs.CL cs.CY cs.MA 84%

An Agentic Evaluation Architecture for Historical Bias Detection in Educational Textbooks

用于教育教科书历史偏见检测的代理评估架构

Gabriel Stefan, Adrian-Marius Dumitran

机构 * University of Bucharest(布加勒斯特大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种代理评估架构,通过多模态筛查代理、异质陪审团和元代理,有效检测教育教科书中的隐性偏见,实验表明其在经济性和准确性上具有优势。

Comments Accepted for ITS(Intelligent Tutoring Systems) 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR 84%

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07988 2026-04-10 cs.DC cs.AI 83%

LogAct: Enabling Agentic Reliability via Shared Logs

LogAct:通过共享日志实现代理可靠性

Mahesh Balakrishnan, Ashwin Bharambe, Davide Testuggine, David Geraghty, David Mao, Vidhya Venkat, Ilya Mironov, Rithesh Baradi, Gayathri Aiyer, Victoria Dudin

机构 * Meta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 LogAct通过共享日志实现代理可靠性,允许代理通过LLM推理分析执行历史,实现故障恢复、健康检查和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06582 2026-04-10 cs.IR cs.AI cs.MA 83%

Agentic SPARQL: Evaluating SPARQL-MCP-powered Intelligent Agents on the Federated KGQA Benchmark

代理SPARQL:在联邦知识图谱问答基准上评估基于SPARQL-MCP的智能代理

Daniel Dobriy, Frederik Bauer, Amr Azzam, Debayan Banerjee, Axel Polleres

机构 * WU Vienna(维也纳经济大学) Leuphana Universität Lüneburg(吕讷堡大学) Complexity Science Hub Vienna(维也纳复杂性科学中心)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了基于SPARQL-MCP的智能代理在联邦SPARQL查询中的潜力,扩展了知识图谱问答基准,并评估了通过MCP集成SPARQL联邦与LLM代理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05674 2026-04-10 cs.CR cs.AI 81%

Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark

迈向高效的攻击性安全LLM代理:超参数调优、LLM作为裁判以及一个轻量级CTF基准

Minghao Shao, Nanda Rani, Kimberly Milner, Haoran Xi, Meet Udeshi, Saksham Aggarwal, Venkata Sai Charan Putrevu, Sandeep Kumar Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文系统研究了驱动代理成功的关键因素,提出CTFJudge框架和CTF Competency Index指标,分析超参数对性能的影响,并开放CTFTiny基准供研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI 79%

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07900 2026-04-10 cs.CV cs.AI 79%

AnomalyAgent: Agentic Industrial Anomaly Synthesis via Tool-Augmented Reinforcement Learning

AnomalyAgent:通过工具增强强化学习进行代理工业异常合成

Jiaming Su, Tengchao Yang, Ruikang Zhang, Zhengan Yan, Haoyu Sun, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出AnomalyAgent,通过工具增强强化学习生成高语义真实性的工业异常样本,采用闭环优化和两阶段训练框架,实现自我反思与迭代改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07468 2026-04-10 cs.AI 79%

M-ArtAgent: Evidence-Based Multimodal Agent for Implicit Art Influence Discovery

M-ArtAgent:基于证据的多模态代理用于隐式艺术影响发现

Hanyi Liu, Zhonghao Jiu, Minghao Wang, Yuhang Xie, Heran Yang

机构 * China Electronics Technology Group Co., Ltd.(中国电子科技集团有限公司) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) University of California San Diego(加州大学圣迭戈分校) Northeastern University(东北大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出M-ArtAgent,通过概率裁决框架解决隐式艺术影响发现问题,结合多模态感知与领域约束的反驳机制,实现83.7%的F1分数和0.910的ROC-AUC。

Comments 13 pages, 5 figures, submitted to IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01059 2026-04-10 cs.CL 79%

GroupGPT: A Token-efficient and Privacy-preserving Agentic Framework for Multi-User Chat Assistant

GroupGPT: 一种高效且隐私保护的多用户聊天助手代理框架

Zhuokang Shen, Yifan Wang, Hanyu Chen, Yunhang Shen, Wenxuan Huang, Gaoqi He, Jiao Xie, Rongrong Ji, Shaohui Lin

机构 * East China Normal University(华东师范大学) University of Nottingham Ningbo(宁波诺丁汉大学) Xiamen University(厦门大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 GroupGPT通过边缘-云协作架构实现高效决策,支持多模态输入,减少token使用并保护隐私,通过MUIR基准测试验证其准确性和用户接受度。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07733 2026-04-10 cs.AI 77%

CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V

CivBench:基于进展的评估用于LLM在文明V中的战略决策

John Chen, Sihan Cheng, Can Gurkan, Mingyi Lin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 CivBench通过训练模型在回合级游戏状态上估计胜利概率,评估LLM在文明V多玩家中的战略决策能力,揭示代理设置对模型的影响及不同战略特征。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 73%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08226 2026-04-10 cs.AI cs.HC cs.SY eess.SY 70%

Grounding Clinical AI Competency in Human Cognition Through the Clinical World Model and Skill-Mix Framework

通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力

Seyed Amir Ahmad Safavi-Naini, Elahe Meftah, Josh Mohess, Pooya Mohammadi Kazaj, Georgios Siontis, Zahra Atf, Peter R. Lewis, Mauricio Reyes, Girish Nadkarni, Roland Wiest, Stephan Windecker, Christoph Grani, Ali Soroush, Isaac Shiri

机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。

Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07535 2026-04-10 cs.AI 70%

Trust the AI, Doubt Yourself: The Effect of Urgency on Self-Confidence in Human-AI Interaction

信任人工智能,怀疑自己:紧迫感对人机交互中自信心的影响

Baran Shajari, Xiaoran Liu, Kyanna Dagenais, Istvan David

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了紧迫感对人机交互中人类自信心的影响,发现尽管紧迫感不影响对AI的信任,但可能损害人类的自信心和自我效能感,进而影响性能和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07429 2026-04-10 cs.CV cs.AI cs.HC 70%

GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents

GameWorld: 向标准化和可验证的多模态游戏代理评估迈进

Mingyu Ouyang, Siyuan Hu, Kevin Qinghong Lin, Hwee Tou Ng, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07629 2026-04-10 cs.HC 67%

Behavior Latticing: Inferring User Motivations from Unstructured Interactions

行为编织:从无结构交互中推断用户动机

Dora Zhao, Michelle S. Lam, Diyi Yang, Michael S. Bernstein

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出行为编织架构,通过连接看似无关的行为,推断用户需求并发现隐含动机,验证其在理解用户需求方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏