arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-13 至 2026-07-13 共收录 28 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 2 篇

2511.20297 2026-07-13 cs.AI 版本更新 70%

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

通过BREW改进语言智能体:引导式经验学习环境知识

Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

机构 * University of Michigan(密歇根大学) Independent(独立研究者) Microsoft(微软) Apple(苹果公司)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究基于LLM的智能体无法从经验学习的问题,提出BREW框架,通过提炼交互轨迹成知识库、引入EG-MCTS算法及适应事后重标记等方法,在多基准测试中提升任务成功率并减少执行步骤,且知识库具有良好特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22294 2026-07-13 cs.CL cs.AI 版本更新 62%

SLIDERS: Systematic Reviews via Automated Evidence Synthesis and Reconciliation

上下文从不够长:用于长文档集可扩展问答的结构化推理

Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SLIDERS框架,通过结构化推理解决长文档集问答问题,利用关系数据库和SQL实现可扩展推理,优于现有基准。

Comments 53 pages (10 main), preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 9 篇

2601.09097 2026-07-13 cs.AI 版本更新 79%

Programming over Thinking: Efficient and Robust Multi-Constraint Planning

编程而非思考:高效且稳健的多约束规划

Derrick Goh Xin Deik, Quanyu Long, Zhengyuan Liu, Nancy F. Chen, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(科技研究局)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 多约束规划面临挑战,现有大语言模型方法有局限。本文提出SCOPE框架,将特定查询推理与通用代码执行分离,产生一致、可重用的求解器函数,降低成本和延迟,性能达最优。

Comments Accepted at ACL 2026 : Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03411 2026-07-13 cs.RO 版本更新 78%

Greedy Heuristics for Sampling-Based Motion Planning in High-Dimensional State Spaces

高维状态空间中基于采样的运动规划的贪心启发式算法

Phone Thiha Kyaw, Anh Vu Le, Rajesh Elara Mohan, Jonathan Kelly

专题命中 规划决策 :planning(title,abstract)

AI总结 研究高维状态空间中基于采样的运动规划问题,提出贪心有信息集,刻画其在类似RRT*规划器中的行为。基于此提出G-RRT*,实验表明它能快速找初始解并渐近收敛到最优路径,性能优于现有采样规划器。

Comments Submitted to the Autonomous Robots journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11434 2026-07-13 cs.RO 版本更新 78%

An Incremental Sampling and Segmentation-Based Approach for Motion Planning Infeasibility

一种基于增量采样和分割的运动规划不可行性方法

Antony Thomas, Fulvio Mastrogiovanni, Marco Baglietto

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Informatics, Bioengineering, Robotics, and Systems Engineering, University of Genoa(热那亚大学信息学院、生物工程、机器人与系统工程系)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出一种检测运动规划不可行性的算法,通过近似机器人配置空间为离散空间,从障碍区域采样分隔起始和目标来判定规划不可行,逐步构建配置空间并划分连通分量,在多场景演示,讨论优化及高维扩展性。

Comments Accepted for publication in Robotics and Autonomous Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 73%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16861 2026-07-13 cs.RO cs.AI cs.LG 版本更新 62%

ReinforceGen: Hybrid Skill Policies with Automated Data Generation and Reinforcement Learning

ReinforceGen:具有自动数据生成和强化学习的混合技能策略

Zihan Zhou, Animesh Garg, Ajay Mandlekar, Caelan Garrett

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Georgia Institute of Technology(佐治亚理工学院) NVIDIA Research(NVIDIA研究)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对机器人长期操纵挑战,ReinforceGen系统结合任务分解、数据生成、模仿学习与运动规划形成初始方案,经强化学习微调,在Robosuite数据集基准测试中成功率达80%,消融研究显示微调使性能平均提升89%,实际评估也有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01692 2026-07-13 cs.AI cs.LG 版本更新 62%

A Descriptive and Normative Theory of Human Beliefs in RLHF

基于人类反馈强化学习中的人类信念描述性与规范性理论

Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16238 2026-07-13 cs.LG physics.ao-ph stat.ML 版本更新 57%

Enhancing AI and Dynamical Subseasonal Forecasts with Probabilistic Bias Correction

通过概率性偏误校正增强人工智能和动力学亚季预测

Hannah Guan, Soukayna Mouatadid, Paulo Orenstein, Judah Cohen, Haiyu Dong, Zekun Ni, Jeremy Berman, Genevieve Flaspohler, Alex Lu, Jakob Schloer, Joshua Talib, Jonathan A. Weyn, Lester Mackey

机构 * Harvard College(哈佛学院) University of Toronto(多伦多大学) Instituto de Matemática Pura e Aplicada(数学与应用数学研究所) Massachusetts Institute of Technology(麻省理工学院) Atmospheric and Environmental Research(大气与环境研究) Microsoft Corporation(微软公司) Rhiza Research(Rhiza研究) Microsoft Research New England(微软新英格兰研究院) European Centre for Medium-Range Weather Forecasts(欧洲中期天气预报中心)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出概率性偏误校正方法,通过学习历史概率预测来减少系统性误差,显著提升亚季预测能力,应用于ECMWF模型后,AI预测系统技能翻倍,操作性去偏模型在91%压力、92%温度和98%降水目标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00130 2026-07-13 cs.CL 版本更新 57%

Hierarchical Chain-of-Thought: Enhancing LLM Reasoning Performance and Efficiency

层次化思维链提示:提升大语言模型推理性能与效率

Xingshuai Huang, Derek Li, Bahareh Nikpour, Parsa Omidi

机构 * Huawei Technologies Canada, Canada(华为技术加拿大公司,加拿大)

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 本文提出层次化思维链提示方法,通过分层步骤规划与执行提升复杂多步推理的准确率和效率,实验显示在多种模型和任务中平均准确率提升6.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31271 2026-07-13 cs.CV 版本更新 50%

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

专题命中 规划决策 :planning(abstract)

AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。

Comments arXiv admin note: text overlap with arXiv:2605.21273

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 6 篇

2511.00651 2026-07-13 cs.AI cs.CL cs.IT cs.MA cs.NI math.IT 版本更新 91%

Leveraging Multi-Agent System (MAS) and Fine-Tuned Small Language Models (SLMs) for Automated Telecom Network Troubleshooting

利用多智能体系统(MAS)和微调后的小语言模型(SLM)实现电信网络自动化故障排除

Chenhua Shi, Bhavika Jalli, Gregor Macdonald, John Zou, Wanlu Lei, Mridul Jain, Joji Philip

机构 * Ericsson(爱立信)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);agentic(abstract)

AI总结 针对电信网络故障排除难题,提出基于多智能体系统(MAS)的方法,利用大语言模型协调专业工具,通过微调小语言模型生成修复计划,实现全自动故障排除,加速了无线接入网和核心网领域的故障排除自动化。

Comments 6 pages, 7 figures, 1 table, 2026 IEEE ICC Workshop on Wireless Foundation Models for AI-native 6G and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20134 2026-07-13 cs.AI cs.ET quant-ph 版本更新 90%

QAgent: An LLM-based Multi-Agent System for Autonomous OpenQASM programming

QAgent:一种基于大语言模型的用于自主OpenQASM编程的多智能体系统

Zhenxiao Fu, Lei Jiang, Yilun Xu, Gang Huang, Fan Chen

机构 * Zhenxiao Fu1, Lei Jiang1, Yilun Xu2, Gang Huang2, Fan Chen1(作者1、作者2、作者3、作者4、作者5)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);workflow(abstract)

AI总结 研究针对OpenQASM编程挑战提出QAgent,它是基于大语言模型的多智能体系统,集成规划、合成和校准工作流程,利用检索增强生成及多智能体推理确保正确性,在多模型评估中表现出色,证明集成对可靠量子程序生成很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17393 2026-07-13 cs.AI cs.LG cs.MA 版本更新 88%

Heterogeneous Information-Bottleneck Coordination Graphs for Multi-Agent Reinforcement Learning

异质信息瓶颈协调图用于多智能体强化学习

Wei Duan, Junyu Xuan, En Yu, Xiaoyu Yang, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出异质信息瓶颈协调图(HIBCG),通过理论指导机制解决多智能体强化学习中协调图的边存在性和信息传递容量分配问题,通过信息瓶颈方法构建组对齐的块对角先验,实现边存在性和信息容量的理论验证。

Comments Updated organization; corrected theoretical statements and proofs. Main paper + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00138 2026-07-13 cs.LO cs.DC cs.MA cs.PL 版本更新 88%

JustAct: A Framework for Auditable Multi-Agent Systems Regulated by Inter-Organisational Policies

JustAct:一个由组织间政策监管的可审计多智能体系统框架

Christopher A. Esterhuyse, Tim Müller, L. Thomas van Binsbergen

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)

AI总结 研究跨越组织边界的开放多智能体系统中行动受复杂政策监管的问题,提出JustAct框架,智能体可凭动态政策信息证明行动合理,通过特定语言和系统的实例及案例研究展示评估该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12920 2026-07-13 cs.MA cs.AI cs.CL 版本更新 87%

Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue

通过对话对齐世界模型实现具身多智能体协调

Vardhan Dongre, Dilek Hakkani-Tür

机构 * Siebel School of Computing & Data Science(计算机与数据科学学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL

AI总结 研究通过对话机制探索具身智能体的世界模型对齐,发现对话能减少冲突但降低任务成功率,提出评估世界模型对齐的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03051 2026-07-13 econ.TH 版本更新 67%

On the sufficiency of unidirectional incentive compatibility in auctions

关于拍卖中单向激励相容的充分性

Kiho Yoon

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 研究在竞拍者只能低报真实估值时,单向激励相容对于收益最大化是否足以替代完全激励相容,并通过线性规划对偶性证明两者等价。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 工作流自动化 3 篇

2504.07459 2026-07-13 cs.CL 版本更新 57%

Beyond LLMs: A Linguistic Approach to Causal Graph Generation from Narrative Texts

超越大语言模型:一种从叙事文本生成因果图的语言学方法

Zehan Li, Ruhua Pan, Xinyu Pi

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工作流自动化 :agent(abstract);分类 cs.CL

AI总结 该研究提出从叙事文本生成因果图的框架,先以LLM提取顶点,引入含七个语言特征的“专家索引”并集成到分类模型,结合RoBERTa嵌入提升因果关系识别精度,经五次迭代提示构建因果图,实验证明其优于GPT-4o和Claude 3.5,还提供开源工具。

Comments published at the 7th Workshop on Narrative Understanding, NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13171 2026-07-13 eess.SP 版本更新 50%

Multi-UE Identification and Localization in LAWN via an Autonomous Non-Serving UAV

自主感知无人机用于LAWN中多用户识别与定位

Niccolò Paglierani, Francesco Linsalata, Vineeth Teeda, Davide Scazzoli, Maurizio Magarini

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种自主感知无人机,用于在5G协作网络中实现多用户识别与定位,通过模拟和实验验证其在低空经济中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06497 2026-07-13 quant-ph 版本更新 50%

Time-frequency-correlated Native CCZ Gate in Superconducting Circuits

时间频率纠缠光子介导的CCZ门

Chenhui Wang, Weilong Wang, Yangyang Fei, Zhiqiang Fan, Hanshi Zhao, Yuyan Mage, Zheng Shan

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究提出了一种基于双光子吸收的高效CCZ门实现方案,通过优化参数达到高保真度,适用于超导量子计算平台,并能扩展至任意角度的CCPhase门和多量子比特操作。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 软件智能体 5 篇

2605.14563 2026-07-13 cs.SE cs.CL 版本更新 84%

Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation

记住你的踪迹:一种基于记忆的长周期代理框架,用于一致且分层的仓库级代码文档

Suyoung Bae, Jaehoon Lee, Changkyu Choi, YunSeok Choi, Jee-Hyong Lee

机构 * Sungkyunkwan University(成均馆大学) University of Oslo(奥斯陆大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL、cs.SE

AI总结 MemDocAgent通过依赖感知遍历引导和记忆引导代理交互,生成统一上下文的仓库级代码文档,实现高效且一致的文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01480 2026-07-13 cs.AI physics.comp-ph 版本更新 83%

A Self-Evolving Agentic Framework for Metasurface Inverse Design

一种自演化代理框架用于超材料逆向设计

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Hualiang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种自演化代理框架,通过上下文级技能进化解决超材料逆向设计中工作流构建的难题,提升任务成功率并减少尝试次数,实现可重用的求解器专业知识积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 83%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 软件智能体 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23449 2026-07-13 cs.AI cs.CR cs.SE 版本更新 62%

Beyond Embeddings: Interpretable Feature Extraction for Binary Code Similarity

超越嵌入:用于二进制代码相似性的可解释特征提取

Charles E. Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * Defence Research and Development Canada(加拿大国防研究与发展署) McGill University(麦吉尔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究二进制代码相似性检测问题,利用基于语言模型的智能体对汇编代码结构化推理分析生成可解释特征,无需匹配训练,在跨架构和跨优化任务中召回率表现良好,结合嵌入优于现有技术,实现准确性、可扩展性和可解释性共存。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15855 2026-07-13 cs.PL 版本更新 50%

Mixing visual and textual code

混合视觉与文本代码

Leif Andersen, Michael Ballantyne, Cameron Moy, Matthias Felleisen, Stephen Chang

专题命中 软件智能体 :workflow(abstract)

AI总结 本文提出Hybrid ClojureScript,一种混合编程语言,允许开发者结合视觉和文本语法表达领域特定概念,同时保持静态推理和工作流程流畅。

Comments to be published in JFP

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 记忆与上下文管理 1 篇

2603.22786 2026-07-13 cs.CV 版本更新 50%

Predictive Photometric Uncertainty in Gaussian Splatting for Novel View Synthesis

预测性光度不确定性在新型视角合成中的高斯点散射应用

Chamuditha Jayanga Galappaththige, Thomas Gottwald, Peter Stehr, Edgar Heinert, Niko Suenderhauf, Dimity Miller, Matthias Rottmann

机构 * QUT Centre for Robotics, Australia(昆士兰大学机器人中心,澳大利亚) ARIAM Hub, Australia(ARIAM中心,澳大利亚) University of Wuppertal, Germany(乌尔姆大学,德国) University of Osnabrück, Germany(奥斯纳布吕克大学,德国)

专题命中 记忆与上下文管理 :autonomous agent(abstract)

AI总结 本文提出轻量级框架,通过贝叶斯正则化线性最小二乘优化重建残差,实现像素级视图依赖性预测不确定性,提升3D高斯点散射在自主代理和安全关键应用中的可靠性。

Comments Accepted at ECCV26. Project Page: https://chumsy0725.github.io/3DGS-Uncertainty/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. Agent评测 2 篇

2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新 75%

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29762 2026-07-13 cs.IR 版本更新 67%

Do Recommendation Algorithms Work When Users Are LLM Agents? A Case Study on Moltbook

当用户是LLM智能体时推荐算法是否有效?基于Moltbook的案例研究

Daming Li, Simeng Han, Jialu Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究LLM智能体作为用户时推荐算法的有效性,在Moltbook平台上评估八种方法,发现基于流行度和物品协同过滤的方法优于用户表示学习,表明推荐从个性化退化为结构模式匹配。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏