arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-11 至 2026-05-11 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 30 篇

2603.19254 2026-05-11 cs.CL 70%

FinReasoning: A Hierarchical Benchmark for Reliable Financial Research Reporting

FinReasoning:一种用于可靠金融研究报告的分层基准

Yiyun Zhu, Yidong Jiang, Ziwen Xu, Yinsheng Yao, Dawei Cheng, Jinru Ding, Jie Xu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出FinReasoning分层基准,用于评估金融研究中的核心能力,区分模型在基础阶段如审计和修正中的表现,揭示模型能力分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG 67%

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07447 2026-05-11 cs.CV cs.AI cs.CL cs.LG 67%

Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs

稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙

Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara

机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) Waseda University(早稻田大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18991 2026-05-11 q-fin.TR cs.GT econ.GN q-fin.EC 67%

Who Restores the Peg? A Mean-Field Game Approach to Model Stablecoin Market Dynamics

谁恢复了锚定物?一种用于稳定币市场动态的均场博弈方法

Hardhik Mohanty, Bhaskar Krishnamachari

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 本文通过均场博弈框架研究稳定币脱锚事件中市场参与者行为,揭示了 arbitrage 和 retail traders 在恢复锚定物中的作用,并通过历史案例验证了主市场 arbitrage 对系统性压力的缓解作用。

Comments 9 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07840 2026-05-11 cs.LG 57%

RelAgent: LLM Agents as Data Scientists for Relational Learning

RelAgent:基于LLM的数据科学家用于关系学习

Xingyue Huang, Louis Tichelman, Jinwoo Kim, Krzysztof Olejniczak, İsmail İlkan Ceylan

机构 * University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA(AITHYRA研究所) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 RelAgent是一种基于LLM的关系学习自主数据科学家,通过两阶段流程构建SQL特征程序并选择预测模型,最终通过SQL查询和经典模型实现快速、确定性和可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07823 2026-05-11 cs.CL 57%

SCENE: Recognizing Social Norms and Sanctioning in Group Chats

SCENE:识别社交规范并实施制裁在群聊中

Mateusz Jacniacki, Maksymilian Bilski

机构 * HumaLike

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SCENE旨在通过多角色聊天场景识别隐性社交规范并实施制裁,评估LLM在动态社交互动中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04712 2026-05-11 cs.LG 57%

SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

SPHERE: 缓解混合专家在深度强化学习中的频谱可塑性损失

Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SPHERE,通过引入Parseval惩罚来缓解混合专家策略在持续学习中的频谱可塑性损失,提升了MetaWorld和HumanoidBench的持续强化学习性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05777 2026-05-11 cs.AI 57%

Emergent social transmission of model-based representations without inference

涌现的社会传递模型基于表示而无需推理

Silja Keßler, Miriam Bautista-Salinero, Claudio Tennie, Charley M. Wu

机构 * University of Tübingen(图宾根大学) Technical University Darmstadt(达姆施塔特技术大学) Hessian AI(黑森人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了在有限认知能力下,人们如何通过他人获取丰富灵活的知识,发现通过简单社会线索而非推理可实现高级表示的间接传递。

Comments Code available at https://github.com/skessler01/social-transmission-rl.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 57%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 57%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02382 2026-05-11 eess.IV cs.AI cs.CV 57%

Benchmark of Segmentation Techniques for Pelvic Fracture in CT and X-ray: Summary of the PENGWIN 2024 Challenge

CT和X射线中骨盆骨折分割技术的基准测试:PENGWIN 2024挑战总结

Yudi Sang, Yanzhen Liu, Sutuke Yibulayimu, Yunning Wang, Benjamin D. Killeen, Mingxu Liu, Ping-Cheng Ku, Ole Johannsen, Karol Gotkowski, Maximilian Zenk, Klaus Maier-Hein, Fabian Isensee, Peiyan Yue, Yi Wang, Haidong Yu, Zhaohong Pan, Yutong He, Xiaokun Liang, Daiqi Liu, Fuxin Fan, Artur Jurgas, Andrzej Skalski, Yuxi Ma, Jing Yang, Szymon Płotka, Rafał Litka, Gang Zhu, Yingchun Song, Mathias Unberath, Mehran Armand, Dan Ruan, S. Kevin Zhou, Qiyong Cao, Chunpeng Zhao, Xinbao Wu, Yu Wang

机构 * Beijing Rossum Robot Technology Co., Ltd.(北京罗素机器人科技有限公司) Key Laboratory of Biomechanics and Mechanobiology, Ministry of Education, Beijing Advanced Innovation Center for Biomedical Engineering, School of Biological Science and Medical Engineering, Beihang University(生物力学与机械生物学重点实验室,教育部,北京生物医学创新中心,生物科学与医学工程学院,北航) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Division of Medical Image Computing, German Cancer Research Center (DKFZ)(医学影像计算部,德国癌症研究中心(DKFZ)) Helmholtz Imaging, Heidelberg(海德堡大学医院影像中心) Smart Medical Imaging, Learning and Engineering (SMILE) Lab, Medical UltraSound Image Computing(智能医学影像、学习与工程(SMILE)实验室,医学超声影像计算)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文通过PENGWIN 2024挑战评估了CT和X射线中骨盆骨折分割技术,发现CT分割准确率较高,但X射线分割仍需进一步改进,揭示了分割方法的多样性及片段定义的不确定性。

Comments PENGWIN 2024 Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07851 2026-05-11 cs.HC 50%

A Roadmap of Mixed Reality Body Doubling for Adults with ADHD

混合现实身体双人技术在ADHD成人中的应用路线图

Valerie Tan, Kimberly Hegemann, Jens Gerken

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出混合现实身体双人技术的十二维度框架,旨在揭示ADHD成人自我管理中的研究空白与未来发展方向。

Comments 9 pages, 2 figures, accepted short paper submission to a CHI 2026 conference workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26509 2026-05-11 cs.RO cs.CV 50%

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

专题命中 Agent评测 :agentic(abstract)

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06746 2026-05-11 cs.NE 50%

The Causally Emergent Alignment Hypothesis: Causal Emergence Aligns with and Predicts Final Reward in Reinforcement Learning Agents

因果涌现对齐假说:因果涌现与强化学习代理最终奖励对齐并预测

Federico Pigozzi, Michael Levin

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨因果涌现与强化学习代理奖励之间的关系,发现因果涌现能预测最终奖励并促进表示动态与奖励提升对齐。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08194 2026-05-11 cs.HC 50%

From Fixed to Flexible: Shaping AI Personality in Context-Sensitive Interaction

从固定到灵活:在情境敏感交互中塑造AI个性

Shakyani Jayasiriwardene, Hongyu Zhou, Weiwei Jiang, Benjamin Tag, Nicholas Koemel, Matthew Ahmadi, Jorge Goncalves, Emmanuel Stamatakis, Anusha Withana, Zhanna Sarsenbayeva

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨用户期望如何在动态调整AI个性时形成和演变,通过混合方法研究发现,情境敏感性影响个性配置轨迹,提升用户信任和拟人化感知。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08989 2026-05-11 math.OC math.PR 50%

Agency Problems and Adversarial Bilevel Optimization under Uncertainty and Cyber Threats

代理问题与不确定性和网络威胁下的对抗双层优化

Thibaut Mastrolia, Haoze Yan

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在不确定性和网络威胁下,领导者设计最优激励方案以提高高风险项目的价值,通过双层随机优化问题,结合跳跃第二类BSDE和积分-偏Hamilton-Jacobi-Bellman-Isaacs方程,提出鲁棒随机控制方法以应对网络攻击带来的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12221 2026-05-11 math.OC 50%

Multiple Approximate-Response Agents (MARA): Fast Near-Optimal Primal Recovery for Distributed Optimization

多重近似响应代理(MARA):分布式优化中的快速近优对偶恢复

Tetiana Parshakova, Yicheng Bai, Garrett van Ryzin, Stephen Boyd

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出MARA方法,通过并行生成多个近优 primal 响应,快速减少对偶不可行性,提升分布式优化的收敛速度与解的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2603.19791 2026-05-11 cs.CR 50%

Text-Based Personas for Simulating User Privacy Decisions

基于文本的隐私人物模拟

Kassem Fawaz, Ren Yi, Octavian Suciu, Rishabh Khandelwal, Hamza Harkous, Nina Taft, Marco Gruteser

专题命中 其他Agent :autonomous agent(abstract)

AI总结 本文提出Narriva方法,通过生成基于历史隐私决策的文本隐私人物,提升隐私研究的准确性与效率,实现87%的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏