arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-29 至 2026-06-29 共收录 27 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 3 篇

2605.26872 2026-06-29 cs.LG cs.AI cs.CL 版本更新 67%

The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection

最强的教师并不总是最好的教师:以学生为中心的答案选择

Zhengyu Hu, Zheyuan Xiao, Linxin Song, Fengqing Jiang, Yuetai Li, Zhihan Xiong, Yue Liu, Junhao Lin, Yao Su, Lijie Hu, Kaize Ding, Teng Xiao, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Southern California(南加州大学) Independent Researcher(独立研究者) National University of Singapore(新加坡国立大学) Microsoft(微软) Google(谷歌) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Northwestern University(西北大学) Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03217 2026-06-29 cs.CL cs.AI cs.CY cs.IR 版本更新 62%

Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification

混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证

Shaghayegh Kolli, Richard Rosenbaum, Timo Cavelius, Lasse Strothe, Andrii Lata, Jana Diesner

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。

Comments Paper has been accepted at 9th wiNLP workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15136 2026-06-29 quant-ph 版本更新 50%

Optimization of path-integral tensor-multiplication schemes in open quantum systems

开放量子系统中路径积分张量乘法方案的优化

L. M. J. Hall, A. Gisdakis, E. A. Muljarov

专题命中 工具调用 :tool use(abstract)

AI总结 针对开放量子系统中路径积分张量乘法方案因张量大小随量子记忆长度指数增长而受限的问题,提出基于矩阵表示和奇异值分解的优化方法,显著降低计算时间和内存使用,并实现精确值的快速外推。

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 5 篇

2508.07743 2026-06-29 cs.AI cs.LG 版本更新 81%

Symmetry-Aware Transformer Training for Automated Planning

面向自动规划的对称感知Transformer训练

Markus Fritzsche, Elliot Gestrin, Jendrik Seipp

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出对比学习目标使Transformer感知对称性,结合架构改进,解决其在自动规划中因问题对称性导致的泛化困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07844 2026-06-29 cs.RO 版本更新 78%

Relating Reinforcement Learning to Dynamic Programming-Based Planning

将强化学习与基于动态规划的规划联系起来

Filip V. Georgiev, Kalle G. Timperi, Başak Sakçak, Steven M. LaValle

机构 * Center for Applied Computing, Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(奥卢大学信息科技与电气工程学院应用计算中心,芬兰) Dept. of Advanced Computing Sciences, Maastricht University, the Netherlands(马斯特里赫特大学高级计算科学系,荷兰)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文通过去随机化RL、数学分析等价条件及定义真实成本,桥接了最优规划与强化学习在模型、目标和参数上的差异。

Comments 43 pages, 8 figures, World Symposium on the Algorithmic Foundations of Robotics (WAFR 2026); added requested reviewer changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18558 2026-06-29 cs.CV cs.AI 版本更新 70%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29072 2026-06-29 cs.LG cs.NA math.NA 版本更新 57%

Diffusion Model-Based Data Assimilation for Real-World Energy Consumption Forecasting

集成得分滤波用于真实数据能耗预测修正

Ruoyu Hu, Dahai Yu, Feng Bao, Guang Wang, Guannan Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 针对真实能耗数据的高维数据同化问题,采用集成得分滤波器(EnSF)结合预训练黑箱时空预测模型,通过基于得分的扩散模型和闭式得分表示修正预测轨迹,实验表明EnSF优于开环传播和集成卡尔曼滤波。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 5 篇

2606.03735 2026-06-29 nlin.CD cs.MA cs.RO 版本更新 89%

On dynamic multi-agent pathfinding methods: review, simulations and modifications

动态多智能体路径规划方法:综述、仿真与改进

Gabriel Fejziaj, Salama Hassona, Wieslaw Marszalek

机构 * Department of Computer Science, Opole University of Technology(计算机科学系,奥波尔技术大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)

AI总结 本文系统研究动态多智能体路径规划(D-MAPF)中的六种代表性算法,并提出一种基于模板的A**算法,通过离线几何路径生成与在线时间适应解耦,在频繁变化和有限感知环境中提高解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01693 2026-06-29 cs.DB cond-mat.mtrl-sci 版本更新 88%

LitMOF: An LLM Multi-Agent for Literature-Validated Metal-Organic Frameworks Database Correction and Expansion

LitMOF:用于文献验证的金属有机框架数据库校正与扩展的LLM多智能体系统

Honghui Kim, Dohoon Kim, Jihan Kim

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 提出LitMOF框架,利用大语言模型多智能体从原始文献验证并修复MOF数据库中的结构错误,成功修复9227个无效条目并发现8771个新MOF,通过直接空气捕获案例证明结构错误严重影响材料筛选可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03704 2026-06-29 cs.CV 版本更新 88%

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04390 2026-06-29 cs.AI 版本更新 81%

SciFig: Towards Automating Editable Figure Generation for Scientific Papers

SciFig:面向科学论文的可编辑图形自动生成

Siyuan Huang, Yifan Zhou, Yutong Gao, Zi Yin, Juyang Bai, Xinxin Liu, Rama Chellappa, Chun Pong Lau, Cheng Peng, Sayan Nag, Shraman Pramanick

机构 * Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Independant Researcher(独立研究者) Tsinghua University(清华大学) University of Central Florida(佛罗里达中央大学) City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究)

专题命中 多智能体 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出SciFig多智能体框架,从科学文本自动生成可编辑的高质量方法图,通过分解规划、布局、渲染和迭代优化,在435个基准上优于基线,平均10分钟生成可编辑图形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02827 2026-06-29 cs.RO 版本更新 50%

Orientation Matters: Learning Radiation Patterns of Multi-Rotor UAVs In-Flight to Enhance Communication Availability Modeling

方向至关重要:学习多旋翼无人机飞行中的辐射模式以增强通信可用性建模

Martin Zoula, Daniel Bonilla Licea, Jan Faigl, Václav Navrátil, Martin Saska

机构 * Faculty of Electrical Engineering, Czech Technical University in Prague(捷克技术大学布拉格分校电子工程系) Mohammed VI Polytechnic University(穆莱·伊沙克·博格达特大学)

专题命中 多智能体 :planning(abstract)

AI总结 提出一种通过校准飞行数据学习异构四旋翼无人机天线辐射模式的方法,利用球谐级数或加权平均建模,并通过线性回归解耦独立无人机的辐射模式,在真实数据集上实现4.56 dB RMS外推误差。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 工作流自动化 2 篇

2604.28167 2026-06-29 cond-mat.soft cond-mat.stat-mech cs.LG 版本更新 57%

Active-learning mapping of the Vicsek model phase diagram

用机器学习映射Vicsek模型的相图

Grace T. Bai, Brandon B. Le

机构 * Thomas Jefferson High School for Science and Technology(泰勒斯杰斐逊科学与技术高中) Department of Physics, University of Virginia, Charlottesville, Virginia 22904, USA(弗吉尼亚大学物理系,夏洛茨维尔,弗吉尼亚州,22904,美国)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文利用机器学习对Vicsek群体运动模型在三维参数空间(η,ρ,v_0)中的相结构进行分类和插值,通过聚类分析构建相图并提升分类精度。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12001 2026-06-29 cs.DC cs.LG 版本更新 57%

Decentralized Orchestration Architecture for Fluid Computing: A Secure Distributed AI Use Case

去中心化编排架构用于流计算:一个安全的分布式AI应用案例

Diego Cajaraville-Aboy, Ana Fernández-Vilas, Rebeca P. Díaz-Redondo, Manuel Fernández-Veiga, Pablo Picallo-López

机构 * atlanTTic Research Center – ICLAB – Universidade de Vigo(atlanTTic研究所以及ICLAB – 维戈大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出一种去中心化多域编排架构,用于流计算环境,支持多域协同部署,确保端到端放置和执行。通过引入FU-HST机制提升对抗鲁棒性,验证了多域联邦学习在拜占庭威胁下的性能。

Comments 19 pages, 9 figures and 1 table

Journal ref Computer Networks, Volume 284 (2026) 112369

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 软件智能体 4 篇

2603.17381 2026-06-29 econ.EM stat.ML 版本更新 88%

An Auditable AI Agent Loop for Empirical Economics: A Case Study in Forecast Combination

一个可审计的AI代理循环用于实证经济学:以预测组合为例

Minchul Shin

专题命中 软件智能体 :agent(title,abstract);AI agent(title);workflow(abstract)

AI总结 提出一个开源代理循环架构,结合搜索后留出评估,使实证规范搜索透明化,在预测组合案例中独立代理搜索找到优于原始研究基准的方法。

Comments 36 pages, no figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12232 2026-06-29 cs.SE cs.AI 版本更新 81%

LinkAnchor: An Autonomous LLM-Based Agent for Issue-to-Commit Link Recovery

LinkAnchor:一个基于自主LLM的代理用于问题到提交链接恢复

Arshia Akhavan, Alireza Hoseinpour, Abbas Heydarnoori, Hamid Bagheri, Mehdi Keshani

机构 * Bowling Green State University(伯灵顿州立大学) University of Nebraska-Lincoln(内布拉斯加大学林肯分校) University of Zurich(苏黎世大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 针对软件仓库中问题到提交链接恢复的挑战,本文提出LinkAnchor,通过懒惰访问架构动态检索相关数据,提升链接恢复的准确性和效率。

Comments Proceedings of the ACM International Conference on the Foundations of Software Engineering (FSE), Montreal, Canada, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04873 2026-06-29 cs.AI 版本更新 79%

SEA-TS: Self-Evolving Agent for Autonomous Code Generation of Time Series Forecasting Algorithms

SEA-TS:面向时间序列预测算法自主代码生成的自我进化智能体

Longkun Xu, Xiaochun Zhang, Qiantu Tuo, Rui Li

机构 * Ecoflow Inc.(Ecoflow公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出SEA-TS框架,通过度量优势MCTS、代码审查与运行提示优化、全局可引导推理三大机制,自主迭代生成、验证和优化时间序列预测算法代码,在四个数据集上优于TimeMixer等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 77%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. GUI与网页智能体 2 篇

2601.18197 2026-06-29 cs.AI 版本更新 57%

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统

Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09241 2026-06-29 cs.CV cs.RO 版本更新 50%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 记忆与上下文管理 1 篇

2506.01442 2026-06-29 cs.AI 版本更新 79%

Agentic Episodic Control

智能体情节控制

Xidong Yang, Wenhao Li, Junjie Sheng, Yun Hua, Haosheng Chen, Chuyun Shen, Xiangfeng Wang

机构 * East China Normal University(华东师范大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 提出智能体情节控制(AEC),利用大语言模型增强情节强化学习,通过语义增强器和关键状态识别器提升数据效率和泛化能力,在BabyAI-Text环境中实现2-6倍数据效率提升。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. Agent评测 5 篇

2510.16492 2026-06-29 cs.CL 版本更新 85%

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04160 2026-06-29 cs.GT 版本更新 78%

Representation theorems for actual and alpha powers over two-agent general concurrent game frames

关于双智能体一般并发博弈框架中实际权力和α权力的表示定理

Zixuan Chen, Fengkui Ju, Thomas Agotnes

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文针对双智能体一般并发博弈框架,证明了实际权力和α权力的八种类型分别可由八类邻域框架表示,推广了已有结果,并指出双智能体实际权力刻画无法推广到任意有限智能体集合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13072 2026-06-29 cs.CL cs.AI cs.LG 版本更新 75%

LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试

Xiang Long, Li Du, Yilong Xu, RongJian Xu, Qiyanhui Lu, Ying Gao, Qinhua Xie, Fangcheng Liu, Ning Ding, Haoqing Wang, Ziheng Li, Changjiang Zhou, Jianyuan Guo, Yehui Tang

机构 * Samsung Research(三星研究院) HKUST (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) City University of Hong Kong(香港城市大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10238 2026-06-29 cs.CL cs.LG 版本更新 62%

Learning to Evict from Key-Value Cache

学习从键值缓存中驱逐

Luca Moschella, Laura Manduchi, Ozan Sener

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出基于强化学习的KV缓存驱逐策略KVP,通过轻量级逐头代理学习预测令牌未来效用,显著提升长上下文和多轮对话性能。

Comments Accepted to ICML 2026. Code available at: https://github.com/apple/ml-learning-to-evict

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18879 2026-06-29 econ.TH 版本更新 50%

Motivating Innovation with a Misspecified Roadmap

用错误指定的路线图激励创新

Florian Mudekereza

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托人用路线图指导代理人创新时,路线图错误指定导致代理人陷入突破陷阱,无法持续创新,并得到创新频率上界随错误程度增加而收紧的结论。

Comments Cleaner results and the static framework is now removed

详情

展开后加载摘要…

URL PDF HTML 收藏