arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-16 至 2026-03-16 共收录 85 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 2 篇

2603.05344 2026-03-16 cs.AI 70%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 软件智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2508.11360 2026-03-16 cs.AI cs.HC 83%

CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks

CRAFT-GUI:基于群体相对策略优化的课程强化代理用于GUI任务

Songqin Nong, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Jianfeng Chen, Tao Jiang, Wenhao Xu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出CRAFT-GUI,通过课程学习框架和群体相对策略优化,解决GUI任务中难度差异和奖励信号单一的问题,实验表明在Android Control和内部基准上分别提升5.6%和10.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12823 2026-03-16 cs.CL cs.CV 57%

Adaptive Vision-Language Model Routing for Computer Use Agents

自适应视觉-语言模型路由用于计算机使用代理

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由项目) MBZUAI McGill University(麦吉尔大学) AMD Red Hat(红帽公司)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12868 2026-03-16 cs.RO 50%

Beyond Imitation: Reinforcement Learning Fine-Tuning for Adaptive Diffusion Navigation Policies

超越模仿:用于自适应扩散导航策略的强化学习微调

Junhe Sheng, Ruofei Bai, Kuan Xu, Ruimeng Liu, Jie Chen, Shenghai Yuan, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) A*STAR, Singapore(A*STAR,新加坡) National University of Singapore, Singapore(新加坡国立大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 5 篇

2509.21553 2026-03-16 cs.AI cs.CE cs.HC cs.LG cs.MA 86%

AutoClimDS: Climate Data Science Agentic AI -- A Knowledge Graph is All You Need

AutoClimDS:气候数据科学代理AI——一个知识图谱足矣

Ahmed Jaber, Wangshu Zhu, Ayon Roy, Karthick Jayavelu, Justin Downes, Sameer Mohamed, Candace Agonafir, Linnia Hawkins, Tian Zheng

机构 * NSF STC Learning the Earth with AI and Physics (LEAP), Columbia University(NSF STC 学习地球与人工智能和物理(LEAP),哥伦比亚大学) AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) Department of Statistics, Columbia University(哥伦比亚大学统计系)

专题命中 记忆与上下文管理 :agentic(title,abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 AutoClimDS通过整合 curated 的气候知识图谱与代理AI工作流,解决数据碎片化、格式异质性和技术门槛高的问题,实现端到端的气候分析,展示知识图谱作为自主气候数据科学的基础结构。

Comments Accepted to IEEE CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13017 2026-03-16 cs.AI cs.CL cs.IR 84%

Structured Distillation for Personalized Agent Memory: 11x Token Reduction with Retrieval Preservation

结构化蒸馏用于个性化代理记忆:11倍token减少并保持检索能力

Sydney Lewis

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种结构化蒸馏方法,将用户与代理的对话历史压缩至38个token,实现11倍压缩,同时保持检索性能,通过实验验证了压缩后检索质量的可靠性。

Comments 6 figures. Code: https://github.com/Process-Point-Technologies-Corporation/searchat

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12608 2026-03-16 cs.IR cs.HC 82%

InterDeepResearch: Enabling Human-Agent Collaborative Information Seeking through Interactive Deep Research

InterDeepResearch:通过交互式深度研究实现人机协作的信息检索

Bo Pan, Lunke Pan, Yitao Zhou, Qi Jiang, Zhen Wen, Minfeng Zhu, Wei Chen

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract)

AI总结 本文提出InterDeepResearch系统,通过交互式深度研究框架提升人机协作信息检索效率,实验证明其在性能和用户研究支持方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16891 2026-03-16 cs.AI cs.CR cs.SE 81%

OpenSage: Self-programming Agent Generation Engine

OpenSage:自主编程代理生成引擎

Hongwei Li, Zhun Wang, Qinrun Dai, Yuzhou Nie, Jinjun Peng, Ruitong Liu, Jingyang Zhang, Kaijie Zhu, Jingxuan He, Lun Wang, Yangruibo Ding, Yueqi Chen, Wenbo Guo, Dawn Song

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 OpenSage是首个允许大语言模型自动创建代理的ADK,提供结构化内存支持和自动生成拓扑与工具集,通过实验验证其在代理开发中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06688 2026-03-16 cs.CV cs.AI 57%

Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning

叙事编织者:迈向多模态可控的长程视觉一致性

Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 Narrative Weaver通过整合精细控制、自动叙事规划和长程一致性,解决生成AI中多模态可控、长程且一致的视觉内容生成问题,提出首个综合解决方案并构建首个电商广告视频脚本数据集。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 13 篇

2603.12274 2026-03-16 cs.MA cs.CE cs.CL 88%

DIALECTIC: A Multi-Agent System for Startup Evaluation

DIALECTIC:一种用于初创企业评估的多智能体系统

Jae Yoon Bae, Simon Malberg, Joyce Galang, Andre Retterath, Georg Groh

机构 * Technical University of Munich(慕尼黑技术大学) Earlybird Venture Capital(Earlybird风投) UVC Partners(UVC伙伴)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 DIALECTIC通过多智能体系统提升初创企业评估效率,利用LLM生成事实论证并模拟辩论,生成决策分数以帮助投资者优先排序。

Comments Accepted at EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 87%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 84%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13110 2026-03-16 cs.OS 78%

AgentRM: An OS-Inspired Resource Manager for LLM Agent Systems

AgentRM: 一种受操作系统启发的LLM代理系统资源管理器

Jianshu She

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出AgentRM,通过多级反馈队列调度和三级上下文生命周期管理,解决LLM代理系统中的资源调度失败和上下文退化问题,显著提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10450 2026-03-16 cs.CY 67%

Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research

机器中的幽灵:在AI教学与研究中模拟识别与内在对话

Liam Magee

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出基于黑格尔识别和弗洛伊德心理动力学的AI辅导系统,通过增强识别提示和多智能体架构提升辅导效果,并探讨AI对师生及研究者关系动态的影响。

Comments 16 pages, 1 figure; plus 135-page automated companion paper (authored by Claude Code) included as appendix with 18 figures and 30+ tables reporting factorial evaluation across three LLM families

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 62%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12744 2026-03-16 cs.LG cs.AI cs.LO 62%

TaoBench: Do Automated Theorem Prover LLMs Generalize Beyond MathLib?

TaoBench: 自动定理证明器LLM是否能超越MathLib?

Alexander K Taylor, Junyi Zhang, Ethan Ji, Vigyan Sahai, Haikang Deng, Yuanzhou Chen, Yifan Yuan, Di Wu, Jia-Chen Gu, Kai-Wei Chang, Nanyun Peng, Amit Sahai, Wei Wang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 TaoBench评估了当前ATP系统在非标准定义框架下的鲁棒性,发现其在定义等价的Tao公式上性能下降26%,表明定义框架的泛化能力是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12483 2026-03-16 cs.AI cs.LG 62%

Generating Expressive and Customizable Evals for Timeseries Data Analysis Agents with AgentFuel

通过AgentFuel生成具有表现力和可定制性的时序数据分析代理评估

Aadyaa Maddi, Prakhar Naval, Deepti Mande, Shane Duan, Muckai Girish, Vyas Sekar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了6种流行的数据分析代理,发现其在状态性和事件特定查询上表现不足,并提出AgentFuel工具,帮助领域专家生成定制化的评估方案,提升代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 57%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13220 2026-03-16 cs.MA 50%

A Generative Model of Conspicuous Consumption and Status Signaling

conspicuous 消费与地位信号的生成模型

Logan Cross, Jordi Grau-Moya, William A. Cunningham, Alexander Sasha Vezhnevets, Joel Z. Leibo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于适当性理论的生成模型,通过模拟LLM代理群体的社会互动,揭示了社会观察与预测模式完成的反馈循环如何驱动地位符号的内生生成,展示了消费行为与地位信号的动态关系。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13151 2026-03-16 cs.CR 50%

Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents

为OpenClaw设计的可辩护性设计:保障自主工具调用代理的安全性

Zongwei Li, Wenkai Li, Xiaoqi Li

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种可辩护性设计框架,旨在通过风险分类、安全工程原则和研究议程,提升自主代理的安全性,推动系统化防御工程和稳健部署实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05872 2026-03-16 cs.CR 50%

Evolving Deception: When Agents Evolve, Deception Wins

进化欺骗:当代理进化时,欺骗获胜

Zonghao Ying, Haowen Dai, Tianyuan Zhang, Yisong Xiao, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 50%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他Agent 2 篇

2603.11455 2026-03-16 cs.AI 57%

Examining Users' Behavioural Intention to Use OpenClaw Through the Cognition--Affect--Conation Framework

通过认知-情感-意志框架考察用户使用OpenClaw的行为意向

Yiran Du

专题命中 其他Agent :AI agent(abstract);分类 cs.AI

AI总结 研究通过CAC框架探讨认知对情感和行为意向的影响,揭示用户对OpenClaw的积极与消极感知对使用意愿的作用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02631 2026-03-16 cs.CL 57%

Cross-Family Speculative Prefill: Training-Free Long-Context Compression with Small Draft Models

跨家族推测预填:无训练长上下文压缩与小型草稿模型

Shubhangi Upasani, Ravi Shanker Raju, Bo Li, Mengmeng Ji, John Long, Chen Wu, Urmish Thakker, Guangtao Wang

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 本文研究跨家族推测预填技术,利用不同模型家族的轻量草稿模型实现无训练提示压缩,保留90-100%的完整提示性能并显著降低TTFT,表明推测预填依赖任务先验和语义结构。

Journal ref ICLR 2026 (WS)

详情

展开后加载摘要…

URL PDF HTML 收藏