arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-15 至 2026-06-15 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 20 篇

2511.08819 2026-06-15 cond-mat.mtrl-sci 89%

TEM Agent: enhancing transmission electron microscopy (TEM) with modern AI tools

TEM Agent:利用现代AI工具增强透射电子显微镜(TEM)

Morgan K. Wall, Alexander J. Pattison, Edward S. Barnard, Stephanie M. Ribet, Peter Ercius

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出TEM Agent框架,通过模型上下文协议(MCP)方法结合商业LLM,实现对TEM多个子系统的访问与控制,简化复杂显微镜生态系统,提升用户完成各类难度实验的能力。

Comments 22 pages, 4 figures

Journal ref Npj Computational Materials (2026) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 86%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交 86%

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13731 2026-06-15 cs.AI cs.MA 新提交 85%

TwinBI: An Agentic Digital Twin for Efficient Augmented Interactions with Business Intelligence Dashboards

TwinBI:一种用于与商业智能仪表盘高效增强交互的智能数字孪生

Jisoo Jang Wen-Syan Li

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出TwinBI框架,通过LLM代理与可执行仪表盘状态耦合,统一对话、操作、语义和溯源,提升多步分析中状态一致性,将精确匹配准确率从43.3%提升至63.3%,超时率从40%降至10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14219 2026-06-15 cs.RO cs.AI 新提交 83%

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

面向无人机自主性的选择性代理恢复与持久任务运行时

Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo, Hwangnam Kim

机构 * Department of Electrical and Electronic Engineering, Korea University(高丽大学电气与电子工程系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出持久任务运行时(PMR)框架,通过选择性调用外部代理推理器实现无人机恢复,引入学习型调用认知价值(learned-CVI)门控机制,在Gazebo/PX4基准测试中将硬/模糊场景成功率从5.0%提升至95.0%,同时减少16.7%的远程调用和29.2%的令牌消耗。

Comments 17 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11378 2026-06-15 cs.CL 版本更新 83%

An Empirical Study of Automating Agent Evaluation

自动化代理评估的实证研究

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.CL

AI总结 本文研究了自动化代理评估的可行性,提出EvalAgent系统,通过编码技能和领域知识提升评估效率,实验显示其在评估准确性和人类偏好上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14603 2026-06-15 cs.CE q-bio.MN q-bio.QM 新提交 82%

Towards In Silico Cancer Therapy Design: An Agent-Based Approach for GPU-Accelerated Molecular Pathway Simulation

迈向计算机辅助癌症治疗设计:基于智能体的GPU加速分子通路模拟方法

Stefano Maestri

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 提出GPU加速的智能体模拟器,用于癌症信号通路建模与治疗评估,通过MAPK/ERK级联和cFos表达案例验证,准确复现临床剂量反应和基因表达动态。

Comments 16 pages, 7 figures, 2 tables. A preliminary version of this work appeared in the Collections of Short Papers of CIBB 2025 (20th International Conference on Computational Intelligence Methods for Bioinformatics and Biostatistics, Milan, 10-12 September 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14200 2026-06-15 cs.AI cs.LG 新提交 81%

When Should Agent Trust Be Conditional? Characterizing and Attacking Skill-Conditional Reputation in Agent Swarms

何时应条件化智能体信任?表征与攻击智能体群中的技能条件声誉

Yihan Xia, Taotao Wang

机构 * Shenzhen University(深圳大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究异构LLM智能体群中技能条件信任的适用条件,通过相图分析揭示其在高异质性、稀疏证据和技能相关场景下有效,但存在跨技能证据被攻击者利用的风险,提出条件信息值测试(CIVT)量化攻击影响。

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14571 2026-06-15 cs.AI 新提交 79%

StreamMemBench: Streaming Evaluation of Agent Memory for Future-Oriented Assistance

StreamMemBench: 面向未来辅助的智能体记忆流式评估

Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Amazon Stream(亚马逊流)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出StreamMemBench基准,通过两步任务序列测试智能体记忆从流式观察到后续任务中证据回忆、反馈整合与重用能力,实验发现现有系统在证据使用和反馈转化上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10813 2026-06-15 cs.CR cs.CL 版本更新 79%

RedAct: Redacting Agent Capability Traces for Procedural Skill Protection

RedAct: 为程序技能保护而编辑智能体能力痕迹

Shuwen Xu, Zhitao He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 提出RedAct框架,通过定位保护关键信息、重写痕迹并嵌入行为水印,将技能转移率降至无技能基线以下,同时保留审计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13749 2026-06-15 cs.MA 新提交 78%

Large Language Models as Supervised Extraction Assistants: Lowering the Barrier to Documentation Standard Adoption in Agent-Based Modelling

大型语言模型作为监督式提取助手:降低基于智能体建模中文档标准采纳的门槛

Peer-Olaf Siebers, Christopher Frantz

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究探索利用大型语言模型(LLMs)辅助自动化ABM文档标准(如RAT-RS)的采纳,通过四个LLMs从已发表论文中提取报告,发现LLMs在描述性任务上表现可靠,但在解释性和评估性任务上存在局限,并提出了何时依赖LLM、何时需要人工监督的实用启发式方法。

Comments 17 pages, accepted for publication at the Social Simulation Conference 2026, see https://www.durham.ac.uk/research/institutes-and-centres/research-methods/social-simulation-conference-2026/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14331 2026-06-15 physics.soc-ph cond-mat.stat-mech econ.GN q-fin.EC 新提交 78%

Wealth Inequality and Planetary Boundaries in a Stylized Agent-Based Model

一个基于主体的风格化模型中的财富不平等与行星边界

Thomas Valade, Michael Benzaquen, Matthieu Cristelli, Stanislao Gualdi, Pierre Lenders

专题命中 Agent评测 :agent(title,abstract)

AI总结 通过构建异质主体模型,研究财富不平等如何阻碍绿色转型,发现超过一定阈值后经济锁定在棕色状态,并评估了不同财政政策的效果。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 78%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13995 2026-06-15 cs.CL 新提交 57%

Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

Dialogue SWE-Bench: 对话驱动的编码智能体基准

Brendan King, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Dialogue SWE-Bench基准,通过用户模拟器评估编码智能体在对话中解决软件工程问题的能力,并引入模式引导智能体提升对话性能3-14%。

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14601 2026-06-15 cs.LG cs.SY eess.SY math.OC stat.CO 新提交 57%

A Statistical and Machine Learning Framework for Operational Threshold Detection and Deployable Dispatch Controller Development in Hydrogen Multi-Energy Systems

氢多能系统中运行阈值检测与可部署调度控制器开发的统计与机器学习框架

Shadi Heenatigala, Hasanika Samarasinghe

机构 * Antioch College(安提阿学院) The Open University of Sri Lanka(斯里兰卡开放大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出统计与机器学习框架,利用一年高分辨率运行数据表征氢多能系统,通过统计分析和随机森林揭示非线性动态,并利用强化学习优化调度。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07040 2026-06-15 cs.CL 新提交 57%

Beyond Rubrics: Exploration-Guided Evaluation Skills for Reward Modeling

超越评分标准:面向奖励建模的探索引导评估技能

Xing Yue, Linjuan Wu, Daoxin Zhang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 提出Eval-Skill方法,通过探索引导合成可复用的领域级评估技能,以替代每查询生成评分标准,在RewardBench 2上使Qwen3-8B和DeepSeek-V4-Flash分别提升13.44%和18.51%。

Comments 24 pages, 6 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14091 2026-06-15 eess.AS 新提交 50%

Who Spoke When in Multi-Conversation: Target Speaker Tagging Task and Benchmark

多对话中谁在何时发言:目标说话人标记任务与基准

Minjae Lee, Hee-Soo Heo, Youngki Kwon, Han-Gyu Kim, You Jin Kim, Bong-Jin Lee

专题命中 Agent评测 :workflow(abstract)

AI总结 提出目标说话人标记任务,整合说话人日志、验证和识别,构建大规模合成基准TST-Bench,实验表明该任务具有独特挑战,专用系统设计优于现有方案。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14201 2026-06-15 cs.DB 新提交 50%

TACO: A Benchmark for Open-Domain Text-to-SQL with Ambiguous and Cross-Database Queries

TACO:面向开放域、含歧义和跨数据库查询的文本到SQL基准

Chao Deng, Ju Fan, Yuyu Luo, Qinliang Xue, Meihao Fan, Yuxin Zhang, Min Zhang, Xiaofeng Jia, Jing Zhang, Xiaoyong Du

专题命中 Agent评测 :planning(abstract)

AI总结 提出TACO基准,包含1500个真实和13000个合成示例,覆盖开放域、歧义和跨数据库查询,通过基线TACO-SQL揭示现有方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13980 2026-06-15 cs.GT cs.CC 新提交 50%

On Cutting Cakes and Crossing Curves

论切蛋糕与穿越曲线

Alexandros Hollender, Gilbert Maystre, Kilian Risse

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过揭示蛋糕切割与Jordan曲线问题的新联系,证明了三名代理人情况下无嫉妒蛋糕切割问题的计算复杂性,并首次给出了Jordan曲线问题的查询下界和UEOPL难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24177 2026-06-15 cond-mat.mes-hall cond-mat.dis-nn cond-mat.stat-mech 版本更新 50%

Optimized control protocols for stable skyrmion creation using deep reinforcement learning

基于深度强化学习的稳定斯格明子生成优化控制协议

Ji Seok Song, Se Kwon Kim, Kyoung-Min Kim

专题命中 Agent评测 :agent(abstract)

AI总结 提出深度强化学习方法,优化动态磁场-温度路径以生成热稳定性增强的斯格明子,在Fe3GeTe2单层中实现更高成功率和更长寿命,归因于最小化耗散功使状态接近平衡分布。

Comments Supplemental Material and Supplemental Vidoes will be provided with the published manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏