arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-23 至 2026-06-23 共收录 428 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 78 篇

2606.22613 2026-06-23 cs.AI 新提交 57%

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21926 2026-06-23 cs.SE 新提交 57%

A11YRepair: Bridging Web Accessibility Barriers via Knowledge-Enhanced Divide-and-Conquer Repair

A11YRepair: 通过知识增强的分治修复弥合网络无障碍障碍

Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 针对网络无障碍违规修复问题,提出基于LLM的分治框架A11YRepair,通过聚类关联违规并引入WCAG领域知识,实现多文件协调修复,在60个真实项目中优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21732 2026-06-23 cs.CR cs.AI 新提交 57%

Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

安全检查,不安全使用:LLM代理压缩边界处的重链接

Zesen Liu, Zihan Zhang, Dongdong She

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21409 2026-06-23 cs.AI 新提交 57%

Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

不要盲目信任:不可靠反馈如何破坏使用工具的LLM智能体

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Pengfei Zhou, Wangbo Zhao, Jingxuan Wu, Yaxin Zhou, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(新加坡科技研究局计算与推理中心) IHPC Agency for Science Technology and Research(新加坡科技研究局高性能计算研究所) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究不可靠反馈对工具增强型LLM智能体的影响,通过匹配循环对比实验发现,误导性反馈会导致价值反转,使智能体表现低于无反馈基线,并强调无反馈回退控制对评估的必要性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21020 2026-06-23 cs.CV cs.AI 新提交 57%

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

CheXpercept: 评估胸部X光片中专家级病变感知的基准

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心) Konkuk University Medical Center(建国大学医疗中心)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20960 2026-06-23 cs.GT cs.LG econ.TH 新提交 57%

Equilibrium with Internal Transfers

具有内部转移的均衡

Mingyang Liu, Gabriele Farina, Asuman Ozdaglar

机构 * LIDS, EECS, Massachusetts Institute of Technology(信息与电子科学系,麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究通过预算平衡的内部转移改善激励的博弈模型,提出自我执行转移均衡和中介自我执行转移均衡,证明社会最优策略可被支持为均衡,并给出多项式算法和分散学习动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20909 2026-06-23 cs.CV cs.AI eess.IV 新提交 57%

BELDE: Building a Large-scale Earth-observation Land-cover Dataset for Europe

BELDE:构建欧洲大规模对地观测土地覆盖数据集

Ümit Mert Çağlar, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(中东技术大学信息学研究生院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 针对现有土地覆盖数据集在规模、地理覆盖和公开性上的不足,提出基于Sentinel-2真彩色影像和ESA WorldCover标注的欧洲大规模RGB土地覆盖分割数据集BELDE,含108万+图像-分割图对,覆盖7类地物,并建立跨域泛化基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18774 2026-06-23 cs.LG 新提交 57%

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

RouteJudge: 一个可复现且偏好感知的LLM路由开放平台

Guannan Lai, Haoran Hu, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) SinapisAI

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出RouteJudge平台,通过匿名成对比较评估LLM路由策略的决策质量,并发布ORBIT工具箱标准化路由工作流,支持可复现和偏好感知的路由评估。

Comments Accepted by Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新 57%

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08690 2026-06-23 cs.LG cs.CR 版本更新 57%

SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity

SoK: 深度强化学习在网络安全中的陷阱

Shae McFadden, Myles Foley, Elizabeth Bates, Ilias Tsingenopoulos, Sanyam Vyas, Vasilios Mavroudis, Chris Hicks, Fabio Pierazzi

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cardiff University(卡迪夫大学) KU Leuven(鲁汶大学) Devotion AI Labs(Devotion AI 实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文系统梳理了深度强化学习应用于网络安全时的11个方法学陷阱,通过分析66篇论文量化其普遍性,并在三个典型场景中实验验证其影响,最后提出改进建议。

Comments Accepted at USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17178 2026-06-23 cs.CR cs.AI cs.AR 版本更新 57%

TrojanGYM: A Detector-in-the-Loop LLM for Adaptive RTL Hardware Trojan Insertion

TrojanGYM:一种检测器在环的大语言模型用于自适应RTL硬件木马插入

Saideep Sreekumar, Zeng Wang, Akashdeep Saha, Weihua Xiao, Minghao Shao, Muhammad Shafique, Ozgur Sinanoglu, Ramesh Karri, Johann Knechtel

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出TrojanGYM框架,利用大语言模型智能体自动生成多样化的硬件木马,暴露基于GNN的检测器盲点,并设计鲁棒检测器Robust-GNN4TJ,在生成的基准上将检测率从0%提升至60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01241 2026-06-23 cs.CR cs.SE 57%

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析

Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22963 2026-06-23 cs.CR cs.AI 版本更新 57%

When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents

当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击

Zesen Liu, Zhixiang Zhang, Yuchong Xie, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22720 2026-06-23 econ.TH 新提交 50%

Screening Under Competition

竞争下的筛选

Yu-Ting Ho

专题命中 Agent评测 :agent(abstract)

AI总结 研究多个差异化产品企业竞争时,密度正则性条件确保企业最优反应是仅提供标价合同,否则标价可能非最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21987 2026-06-23 q-bio.TO 新提交 50%

Fabrication Of Bilayer Nanofibers From Poly Xylitol Dodecanedioic Acid, Poly Caprolactone, Gelatin Biological Macromolecules And Surface Modification Via Spin Coating Of Capsules For Skin Wound Treatment

聚木糖醇十二烷二酸、聚己内酯、明胶生物大分子双层纳米纤维的制备及通过旋涂胶囊进行表面修饰用于皮肤伤口治疗

Mohaddeseh Sharifi, S. Hajir Bahrami

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过缩聚法合成聚木糖醇十二烷二酸,并利用静电纺丝制备双层纳米纤维,结合遗传算法优化纤维直径,通过旋涂载药胶囊实现表面修饰,显著提升细胞附着和活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 50%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 Agent评测 :workflow(abstract)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22756 2026-06-23 cs.RO cs.CV cs.MA cs.SY eess.SY 新提交 50%

HERCULES: An Open-Source Simulation Framework for Heterogeneous Multi-Robot SLAM, Collaborative Perception, and Exploration

HERCULES:面向异构多机器人SLAM、协同感知与探索的开源仿真框架

Sandilya Sai Garimella, Daniel Chase Butterfield, Sean Wilson, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工学院研究所)

专题命中 Agent评测 :planning(abstract)

AI总结 提出基于UE5的开源仿真框架HERCULES,支持异构无人机-无人车协同,解决架构限制,提供共享导航栈、红外相机和动态环境,验证了多机器人SLAM与探索的有效性。

Comments 19 pages, 14 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22520 2026-06-23 cs.DS 新提交 50%

Submodular Welfare Maximization with Budget Constraints in the Random-Order Model

随机顺序模型下带预算约束的子模福利最大化

Max Klimm, Martin Knaack

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线物品分配问题,其中代理有预算约束,目标最大化单调子模函数。提出多项式时间α竞争算法(α≈1/14.85),改进单代理结果;并改进在线子模匹配问题至1/6.86竞争比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交 50%

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

专题命中 Agent评测 :agent(abstract)

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21346 2026-06-23 cs.GT cs.MA 新提交 50%

Simultaneously Efficient Allocation of Indivisible Items Across Multiple Dimensions

不可分物品跨维度的同时高效分配

Yasushi Kawase, Bodhayan Roy, Mohammad Azharuddin Sanpui

专题命中 Agent评测 :agent(abstract)

AI总结 提出多维高效分配(MDEA)模型,研究不可分物品在多维度下同时实现功利社会福利(USW)和平均社会福利(ESW)的效率边界,揭示了尖锐的最坏情况边界和紧阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21011 2026-06-23 cs.RO 新提交 50%

R2HandoverSim: A Simulation Framework and Benchmark for Robot-to-Human Object Handovers

R2HandoverSim:机器人到人类物体交接的仿真框架与基准

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 Agent评测 :planning(abstract)

AI总结 提出R2HandoverSim仿真基准,通过用户研究和五个互补指标评估四种基线方法,证明仿真结果与真实世界评价相关。

Comments Accepted by the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20746 2026-06-23 cs.CR cs.LO 新提交 50%

Amplify, Don't Create: Temporal Accumulation for Slow-Burn Prompt Injection

放大而非创造:针对慢燃提示注入的时间累积

J Alex Corll

专题命中 Agent评测 :agent(abstract)

AI总结 针对工具使用智能体的控制平面攻击通过轨迹分布弱指令,代理端时间累积器通过峰值和CUSUM持久性统计恢复慢燃信号,在集中攻击下优于逐事件检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20720 2026-06-23 cs.MA cs.CY 新提交 50%

Empowering Economic Simulation Through Situation-Aware Llm-Driven Generative System

通过情境感知的LLM驱动生成系统赋能经济模拟

Zhimei Chen, Mu Chen

专题命中 Agent评测 :agent(abstract)

AI总结 提出SAMAS系统,利用大语言模型嵌入宏观经济理解和模拟轨迹,联合建模宏观结构与微观动态,提升波动真实性和拐点预测能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21382 2026-06-23 math.OC math.AP 新提交 50%

Finite-Horizon Portfolio Choice, Labor Supply, and Early Retirement under Borrowing Constraints

借贷约束下的有限期限投资组合选择、劳动供给与提前退休

Gugyum Ha, Junkee Jeon, Jihoon Ok

专题命中 Agent评测 :agent(abstract)

AI总结 研究借贷约束下具有劳动供给灵活性和不可逆提前退休选择的有限期限最优消费与投资组合问题,通过对偶鞅方法转化为零和停时-奇异控制博弈,并数值分析劳动供给灵活性对消费、投资组合和退休时机的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21794 2026-06-23 quant-ph 新提交 50%

First-Quantized Relativistic Quantum Simulation with Periodic and Dirichlet Boundary Conditions

具有周期和狄利克雷边界条件的第一量子化相对论量子模拟

Jeongho Bang, Timothy P. Spiller, Kyunghyun Baek, Kyoungho Cho, Jaewoo Joo

专题命中 Agent评测 :workflow(abstract)

AI总结 提出在周期和狄利克雷边界条件下,基于第一量子化框架构建弱相对论晶格哈密顿量,通过边界一致的离散动量矩重建实现相对论量子模拟,并在多种势阱中验证了方法的有效性。

Comments This manuscript is a significantly revised and extended version of preprint arXiv:2509.22579, with an updated author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20988 2026-06-23 physics.soc-ph 新提交 50%

Mechanism underlying the scaling law of home-return probability in human mobility

人类移动中回家概率标度律的潜在机制

Haoying Niu, Xiao-Yong Yan

专题命中 Agent评测 :agent(abstract)

AI总结 基于最小努力原则和Luce选择规则,揭示了回家概率标度律的指数γ由个体活动优先级的Zipf指数ν决定,即γ=1-ν,并通过智能体模拟验证。

Comments 3 pages,1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19641 2026-06-23 cs.RO cs.CV 新提交 50%

Scaling Self-Play for End-to-End Driving

扩展端到端驾驶的自我对弈

Luke Rowe, Roger Girgis, Rodrigue de Schaetzen, Daphne Cornelisse, Alaap Grandhi, Felix Heide, Eugene Vinitsky, Christopher Pal, Liam Paull

机构 * Mila(米拉研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) Torc Robotics NYU Tandon School of Engineering(纽约大学坦登工程学院) McMaster University(麦克马斯特大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出大规模自我对弈训练策略,通过高效模拟器Gigapixel实现像素级自我对弈,结合DAgger蒸馏和感知适应,提升端到端驾驶模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 50%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 Agent评测 :planning(abstract)

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18556 2026-06-23 eess.SY cs.SY eess.SP 新提交 50%

Wind-Resilient Trajectory Optimization for UAV-BS Networks: TD3 for Continuous Service Availability

抗风无人机基站网络轨迹优化:基于TD3的连续服务可用性

Azim Akhtarshenas, German Svistunov, Kuangyu Zheng, David Lopez-Perez

专题命中 Agent评测 :agent(abstract)

AI总结 针对风扰导致无人机基站位置漂移和通信质量下降问题,提出基于TD3算法的抗风轨迹调整框架,通过随机运动学建模学习自适应控制策略,在湍流条件下维持最优覆盖,仿真验证其优于PPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17385 2026-06-23 cs.RO 新提交 50%

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinity: 一个面向任意视角机器人重定向与视频到动作机器人学习的网络规模4D手物交互数据引擎

Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

机构 * Rice University(莱斯大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 Agent评测 :agent(abstract)

AI总结 提出EgoInfinity引擎,从互联网视频自动生成4D手物交互数据,实现跨机器人形态的动作重定向与技能学习,无需人工标注。

Comments 24 pages. Project page: https://huggingface.co/spaces/Rice-RobotPI-Lab/EgoInfinity

详情

展开后加载摘要…

URL PDF HTML 收藏