arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-10 至 2026-07-10 共收录 27 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 1 篇

2512.21414 2026-07-10 cs.CV cs.LG 版本更新 57%

A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding

用于临床信息丰富且可解释的医学图像理解的工具瓶颈框架

Christina Liu, Alan Q. Wang, Joy Hsu, Jiajun Wu, Ehsan Adeli

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG

AI总结 针对医学图像理解中工具组合难的问题,提出工具瓶颈框架(TBF),利用工具瓶颈模型(TBM)组合VLM选择的工具,通过神经网络计算融合工具输出,在组织病理学和皮肤病学任务中表现出色,提升医学图像理解且使预测更具可解释性。

Journal ref Proceedings of the 9th International Conference on Medical Imaging with Deep Learning, Proceedings of Machine Learning Research 315 (2026) 2958-2986

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 7 篇

2605.21917 2026-07-10 cs.CV cs.AI 版本更新 85%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05622 2026-07-10 cs.CL 版本更新 83%

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench: 在世界约束和用户约束下评估大语言模型智能体的自适应规划能力

Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu, Qing Zong, Heng Wang, Jeonghwan Kim, Yumeng Wang, Bingxiang He, Xiusi Chen, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划决策 :planning(title,abstract);agent(abstract);分类 cs.CL

AI总结 针对现有基准未充分探索渐进揭示的双重约束下的自适应规划问题,提出动态交互基准AdaPlanBench,通过307个家务任务和可扩展的约束构建流程,评估LLM智能体在交互中根据反馈迭代调整计划的能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00969 2026-07-10 cs.RO cs.AI 版本更新 79%

V-VLAPS: Value-Guided Planning for Vision-Language-Action Models

V-VLAPS:面向视觉-语言-动作模型的价值引导规划

Ke Ren, Ali Salamatian, Kieran Pattison, Cyrus Neary

机构 * The University of British Columbia(不列颠哥伦比亚大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 提出V-VLAPS方法,通过在VLA模型上增加轻量级价值头预测蒙特卡洛回报,引导蒙特卡洛树搜索选择高价值分支,从而提升长时域任务下的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28746 2026-07-10 cs.RO 版本更新 78%

He3-Seeker: Robotic Information Planning for Lunar Helium-3 Distribution Mapping

He3-Seeker:用于月球氦-3分布测绘的机器人信息规划

Dong Li, Yujie Zheng, Chengdeng Cao, Siyu Teng, Yuchen Li, Yang Gao, Long Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Macau University of Science and Technology(澳门科学技术大学) China University of Petroleum-Beijing(中国石油大学(北京)) Wuhan University(武汉大学) Shenzhen University(深圳大学) Technical University of Munich(慕尼黑技术大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出He3-Seeker框架,利用机器人信息规划引导自主导航与主动感知,实现基于多点钻探采样和原位分析的月球氦-3分布快速高保真测绘。

Comments Submitted to the International Conference on Space Robotics (iSpaRo) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16453 2026-07-10 cs.AI 版本更新 57%

RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments

RetailBench: 评估LLM代理在真实零售环境中的长周期自主决策与策略稳定性

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 提出RetailBench基准,用于评估LLM代理在千天级超市运营模拟中的长周期决策能力,发现当前最强模型仍远落后于最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21855 2026-07-10 cs.DC cs.DB cs.NI 版本更新 50%

Self-Adaptive Probabilistic Skyline Analytics in Cloud-Edge IoE: A Multi-Objective DRL Approach

云边万物互联中的自适应概率天际线分析:一种多目标深度强化学习方法

Chuan-Chi Lai

专题命中 规划决策 :agent(abstract)

AI总结 针对云边万物互联中概率天际线查询分析难题,提出SA-PSKY框架,集成深度强化学习与分布式查询优化,通过马尔可夫决策过程和自适应加权机制,结合优先经验回放,有效降低延迟,提升可扩展性,优于基线方法。

Comments 15 pages, 2 tables, 5 figures. Manuscript currently under review at IEEE Transactions on Cloud Computing (TCC). This version includes extended scalability analysis and refined theoretical proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03075 2026-07-10 cs.RO 版本更新 50%

A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics

水下机器人异常诊断的协作推理框架

Markus Buchholz, Niamh Ellis, Rahaf Abu Hara, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 规划决策 :agent(abstract)

AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。

Comments Paper was submitted for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 3 篇

2605.17361 2026-07-10 cs.LG cs.AI 版本更新 88%

MasFACT: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer

MasFACT:基于几何感知后验转移的连续多智能体拓扑学习

Xuefei Wang, Jialu Wang, Fengbo Zhang, Yihan Hu, Di Zhang, Yutong Ye, Yikun Ban, Jun Han, Ruijie Wang

机构 * Beihang University(北京航空航天大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MasFACT框架,通过几何感知后验转移方法,解决多智能体系统中因新任务适应导致的拓扑遗忘问题,提升连续学习任务的准确性和拓扑稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26883 2026-07-10 cs.LO 版本更新 67%

A Dynamic Deontic Simplicial Logic for Joint Commitments

联合承诺的动态道义单纯逻辑

Giorgio Cignarale, Hugo Rincon Galeana

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 提出基于单纯复形的道义逻辑DSL及其动态扩展DDSL,用于建模群体义务和联合承诺,并证明了可靠性和完全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21074 2026-07-10 cs.NI 版本更新 67%

RepLLM: Toward Automatically Reproducing Network Research Results

RepLLM:迈向自动重现网络研究结果

Yining Jiang, Yunxin Xu, Wenyun Xu, Yufan Zhu, Rui Liu, Tangtang He, Haiying Huang, Letian Zhu, Qingyu Song, Qiang Su, Lizhao You, Lu Tang, Wanjian Feng, Yuchao Zhang, Linghe Kong, Qiao Xiang, Jiwu Shu

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。

Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 工作流自动化 6 篇

2605.05969 2026-07-10 cs.CR cs.SE 版本更新 57%

Heimdallr: Characterizing and Detecting LLM-Induced Security Risks in GitHub CI Workflows

Heimdallr:在GitHub CI工作流中识别和检测LLM引发的安全风险

Bonan Ruan, Yeqi Fu, Chuqi Zhang, Jiahao Liu, Jun Zeng, Zhenkai Liang

专题命中 工作流自动化 :workflow(abstract);分类 cs.SE

AI总结 本文研究GitHub CI工作流中LLM引发的安全风险,提出Heimdallr框架,通过流程图规范化和威胁向量检测,实现高精度识别LLM节点和威胁向量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04920 2026-07-10 cs.AI 版本更新 57%

Conversational AI for Rapid Scientific Prototyping: A Case Study on ESA's ELOPE Competition

用于快速科学原型设计的对话式人工智能:以欧空局的ELOPE竞赛为例

Nils Einecke

机构 * Honda Research Institute Europe GmbH(本田欧洲研究机构)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 以欧空局ELOPE竞赛为例,探讨用ChatGPT进行快速科学原型设计。介绍其在竞赛中的表现,包括提供代码、推理等,虽有局限但凸显人机协作潜力,分析优缺点,提出将大语言模型集成到科学工作流程可增强快速原型设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15612 2026-07-10 cs.CE cs.CR q-fin.TR 版本更新 50%

SoK: Market Microstructure for Decentralized Prediction Markets (DePMs)

SoK:去中心化预测市场(DePMs)的市场微观结构

Nahid Rahman, Joseph Al-Chami, Jeremy Clark

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文通过回顾去中心化预测市场(DePMs)的历史和设计,分析了其模块化工作流程及各模块的设计变体,探讨了去中心化、表达性和抗操纵之间的权衡,并指出了研究中的开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10746 2026-07-10 cs.LO 版本更新 50%

Weakest Precondition Rules for Programs with Linear Temporal Specifications

具有线性时态规范的程序的最弱前置条件规则

Gidon Ernst

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究如何将软件模块集成中时态逻辑需求考虑进去,针对现有工具不足,提出一种简单通用能集成到现有验证条件生成器的解决方案来处理结构化程序与时态逻辑集成问题。

Comments Accepted at ISoLA 2026 - SpecifyThis

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22109 2026-07-10 q-fin.CP math.OC q-fin.PM stat.AP stat.CO 版本更新 50%

Low-Turnover Rebalancing for Sparse Index Tracking

用于稀疏指数跟踪的低换手率再平衡

Dimitrios Roxanas

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究针对稀疏指数跟踪中滚动重建存在的高换手率问题,提出将构建与维护分开的新工作流程,采用混合框架及自融资变量$\Delta w$,在标准普尔500风格案例中实现低换手率跟踪,且维护层可用于外部跟踪器改进。

Comments Rewritten in the language of generalised Bayesian inference and with the main focus on rebalancing and turnover. New case study and protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12497 2026-07-10 cs.CR 版本更新 50%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与网页智能体 1 篇

2602.13723 2026-07-10 cs.SE 版本更新 89%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 GUI与网页智能体 :agentic(title,summary_cn);workflow(abstract);分类 cs.SE

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 记忆与上下文管理 2 篇

2604.27630 2026-07-10 physics.bio-ph 版本更新 82%

A stochastic agent-based extension of the GSM2 model for particle therapy: cell-cycle dynamics, dose-rate dependence, and fractionation effects

一种用于粒子治疗的GSM2模型的随机基于代理的扩展:细胞周期动力学、剂量率依赖性和分次照射效应

Francesco G. Cordoni, Marco Battestini, Marta Missiaggia

专题命中 记忆与上下文管理 :agent(title,abstract);autonomous agent(abstract)

AI总结 本文提出一种随机基于代理的建模框架,用于模拟粒子照射的生物响应,通过显式耦合粒子到达、损伤积累和修复动力学,揭示剂量率对细胞存活的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18999 2026-07-10 cs.RO cs.AI cs.CV 版本更新 57%

OREN: Octree Residual Network for Real-Time Euclidean Signed Distance Mapping

OREN:八叉树残差网络用于实时欧几里得符号距离映射

Zhirui Dai, Qihao Qian, Tianxing Fan, Nikolay Atanasov

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 OREN结合八叉树插值的显式先验和神经网络回归的隐式残差,实现高效且可微的非截断SDF重建,优于现有方法的准确性和效率。

Comments Accepted to IEEE/RSJ International Conference Intelligent Robots & Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. Agent评测 7 篇

2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 81%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 70%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26076 2026-07-10 cs.CL 版本更新 61%

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

IMProofBench:在研究级数学证明生成上对人工智能进行基准测试

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学)

专题命中 Agent评测 :agentic(abstract,comments);分类 cs.CL

AI总结 针对大语言模型数学能力评估,引入IMProofBench基准测试,由专家开发77个经同行评审问题,涵盖详细证明及子问题,模拟现实研究环境,结果显示当前LLMs能解决不少研究级问题,该基准测试将持续发展。

Comments v2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02871 2026-07-10 cs.AI 版本更新 57%

SimRPD: Optimizing Recruitment Proactive Dialogue Agents through Simulator-Based Data Evaluation and Selection

SimRPD:通过基于模拟器的数据评估和选择优化招聘主动对话代理

Zhiyong Cao, Dunqiang Liu, Qi Dai, Haojun Xu, Huai Yuen Khor, Hao Wang, Huan He, Yafei Liu, Ke Ma, Ruqian Shi, Sicheng Zhou, Sijia Yao

机构 * Zhaopin Limited(智聘有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation,Beijing Institute of Technology(北京理工大学自动化学院) Central University of Finance and Economics(中央财经大学) Beihang University(北航) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对招聘主动对话代理训练数据稀缺问题,提出SimRPD框架。通过高保真用户模拟器合成数据,基于意图链的评估框架选数据,在所选数据集上训练代理。实验证明该框架优于现有策略,有工业部署价值和其他场景适用性。

Comments Published in the ACL 2026 Industry Track. Oral presentation

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track), 2026, pp. 1359-1377

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04203 2026-07-10 cs.LG cs.CV 版本更新 57%

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

计算、凝聚及其之间的不完备性:智能的耦合基础

Xin Li

机构 * Department of Computer Science, University at Albany, SUNY(计算机科学系,阿尔巴尼大学,SUNY)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究探讨计算理论与智能所回答问题的差异,指出智能需计算与记忆两个算子耦合,证明单独算子不完备,确定耦合代价是关键操作不可判定且有误差下限,认为耦合是普遍法则并给出其可证伪核心与范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02704 2026-07-10 cs.GT cs.LG 版本更新 57%

Calibrated Stackelberg Games: Learning Optimal Commitments Against Calibrated Agents

校准的斯塔克尔伯格博弈:学习针对校准代理的最优承诺

Nika Haghtalab, Chara Podimata, Kunhe Yang

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究校准斯塔克尔伯格博弈,将标准框架推广,其中代理依校准预测行动。虽信息减少,但委托人最优效用有界。针对校准挑战,开发新校准概念及算法,包括基于最佳响应区域的松弛,及代理自适应校准算法,助委托人更快收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21858 2026-07-10 math.OC 版本更新 50%

When to Match: A Cost-Balancing Principle for Dynamic Markets

何时匹配:动态市场的成本平衡原则

Jie Liu, Hailun Zhang, Jiheng Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 研究动态市场中平台何时匹配的问题,提出成本平衡(CB)规则,在无需预测的情况下,能根据等待成本与当前匹配成本比例决定匹配时机,相比行业标准有成本和延迟优势,是简单高效且最坏情况最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏