arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-24 至 2026-06-24 共收录 163 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 23 篇

2605.24050 2026-06-24 cs.SE cs.AI stat.AP 版本更新 62%

More Skills, Worse Agents? Skill Shadowing Degrades Performance When Expanding Skill Libraries

更多技能,更差智能体?扩展技能库时技能遮蔽降低性能

Hongwen Song, Song Wei

机构 * Databricks Inc.(Databricks公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM智能体技能库扩展导致性能下降的现象,提出将性能下降分解为技能遮蔽和上下文开销两种效应,并通过实验证明技能遮蔽是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24340 2026-06-24 cs.LG 新提交 57%

Managing Task Execution for Unknown Workloads in Batteryless IoT: A Hardware-Agnostic Evaluation

无电池物联网中未知工作负载的任务执行管理:一种硬件无关的评估

Samer Nasser, Henrique Duarte Moura, Ritesh Kumar Singh, Maarten Weyn, Jeroen Famaey

机构 * University of Antwerp - imec, IDLab Research Group(安特卫普大学-imec, IDLab研究组)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对无电池物联网中未知工作负载,提出两种硬件无关的动态调度策略(强化学习和近似预测),通过物理仿真框架评估,揭示了不同策略在任务吞吐量、生存-执行平衡和能量缺口执行节奏上的权衡。

Comments Submitted to IEEE Transactions on Sustainable Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24176 2026-06-24 cs.CL stat.CO 新提交 57%

A Synthetic Reliability-Aware PINN Benchmark for Offshore Wind Turbine Support-Structure Monitoring with Bayesian Inverse Identification

一种用于海上风力发电机支撑结构监测的合成可靠性感知PINN基准测试,结合贝叶斯逆识别

Puneet Kant, Monika Tanwar

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院) School of Management and Entrepreneurship, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校管理与创业学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 提出Digi Turbine基准,结合物理信息神经网络、贝叶斯逆识别和FORM筛选,用于海上风机单桩支撑结构监测,验证基于NREL 5MW参考风机。

Comments 18 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24081 2026-06-24 cs.CR cs.AI 新提交 57%

PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

PixJail:面向文本到图像越狱评估的自演化论文到流水线复现

Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州)) East China Normal University(华东师范大学) Shanghai Qi Zhi Institute(上海启智研究院) Wuhan University(武汉大学) Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI) CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI)) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PixJail框架,通过自演化论文到流水线代理,自动构建攻击模块和可运行评估流水线,忠实复现原始实验结果,平均误差仅2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-06-24 cs.LG 新提交 57%

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06177 2026-06-24 cs.AI 版本更新 57%

BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents

BioMedArena:构建和评估生物医学深度研究代理的开源工具包

Jinge Wu, Hongjian Zhou, Mingde Zeng, Jiayuan Zhu, Junde Wu, Jiazhen Pan, Ayush Noori, Sean Wu, Honghan Wu, Fenglin Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) Technical University of Munich(慕尼黑技术大学) Oxford-Suzhou Centre for Advanced Research, China(牛津-苏州先进研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 BioMedArena通过解耦六个评估层,提供公平比较不同基础模型的平台,显著提升生物医学基准的性能,实现8个代表性基准的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11957 2026-06-24 cs.CL 版本更新 57%

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

PEARL: 基于强化学习的自我进化时间管理助手

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Viven

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对日历冲突解决任务,提出PEARL框架,通过外部偏好记忆和逐轮奖励优化,显著降低LLM代理的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03509 2026-06-24 cs.AI cs.NE 版本更新 57%

Evolving Programmatic Skill Networks

演化式程序化技能网络

Haochen Shi, Xingdi Yuan, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(DIRO与Courtois研究所,蒙特利尔大学) Mila – Québec AI Institute(魁北克人工智能研究所) Microsoft Research(微软研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出程序化技能网络(PSN),通过大语言模型驱动的故障定位、渐进优化和结构重构,实现开放环境中技能库的持续构建与复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24552 2026-06-24 cs.RO 新提交 50%

Enabling Robust Cloth Manipulation via Inference-Time Simulator-in-the-Loop Refinement

通过推理时仿真器在环优化实现鲁棒的布料操作

Xin Liu, Yulin Li, Ziming Li, Pengyu Jing, Zhenhao Huang, Bingyang Zhou, Ziqiu Zeng, Siyuan Luo, Chenkun Qi, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :planning(abstract)

AI总结 提出基于仿真器在环优化的布料操作框架,通过合成数据训练的真实到仿真模块和稀疏网格滚动结合先验引导MPPI,从单RGB输入实现鲁棒操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23892 2026-06-24 cs.CV 新提交 50%

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

REALM: 面向物理世界视觉语言模型的统一红队基准

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中佛罗里达大学)

专题命中 Agent评测 :agentic(abstract)

AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。

Comments 20 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14804 2026-06-24 math.GM 新提交 50%

Mapping Mathematical Hardness: Machine-Assisted Conjecture Discovery and the Quantification of Non-Triviality

映射数学难度:机器辅助猜想发现与非平凡性的量化

Madhuparna Das

专题命中 Agent评测 :agent(abstract)

AI总结 提出使用马氏距离在已知数学猜想嵌入簇中量化机器生成猜想非平凡性的基准,并应用于孪生素数分布猜想以验证Birch测试条件。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22249 2026-06-24 cs.CV 版本更新 50%

D3Seg: Dependency-Aware Diffusion for Brain Tumor Segmentation with Missing Modalities

D3Seg: 依赖感知的扩散模型用于缺失模态的脑肿瘤分割

Danish Ali, Ajmal Mian, Naveed Akhtar, Ghulam Mubashar Hassan

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出D3Seg模型,通过多跳模态图融合、轻量扩散插补机制和概率空间决策细化,解决缺失MRI模态下的脑肿瘤分割问题,提升分割性能并保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2605.21401 2026-06-24 cs.CY cs.AI 版本更新 70%

Open-source LLMs administer maximum electric shocks in a Milgram-like obedience experiment

开源大语言模型在类似米尔格拉姆的服从实验中施加最大电击

Roland Pihlakas, Jan Llenzl Dagohoy

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作)

专题命中 其他Agent :autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究探讨了开源大语言模型在持续权威压力下的行为,发现它们在类似米尔格拉姆实验的条件下表现出服从倾向,尽管明确表达 distress,且存在逐步边界/价值违规的脆弱性,以及拒绝时可能忽略响应格式要求导致重试从而再次服从的机制。

Comments 37 pages, 18 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏