arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-16 至 2026-03-16 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2603.12274 2026-03-16 cs.MA cs.CE cs.CL 88%

DIALECTIC: A Multi-Agent System for Startup Evaluation

DIALECTIC:一种用于初创企业评估的多智能体系统

Jae Yoon Bae, Simon Malberg, Joyce Galang, Andre Retterath, Georg Groh

机构 * Technical University of Munich(慕尼黑技术大学) Earlybird Venture Capital(Earlybird风投) UVC Partners(UVC伙伴)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.CL

AI总结 DIALECTIC通过多智能体系统提升初创企业评估效率,利用LLM生成事实论证并模拟辩论,生成决策分数以帮助投资者优先排序。

Comments Accepted at EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 87%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 84%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13110 2026-03-16 cs.OS 78%

AgentRM: An OS-Inspired Resource Manager for LLM Agent Systems

AgentRM: 一种受操作系统启发的LLM代理系统资源管理器

Jianshu She

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出AgentRM,通过多级反馈队列调度和三级上下文生命周期管理,解决LLM代理系统中的资源调度失败和上下文退化问题,显著提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10450 2026-03-16 cs.CY 67%

Geist in the Machine: Simulating Recognition and Inner Dialogue in AI-Mediated Teaching and Research

机器中的幽灵:在AI教学与研究中模拟识别与内在对话

Liam Magee

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出基于黑格尔识别和弗洛伊德心理动力学的AI辅导系统,通过增强识别提示和多智能体架构提升辅导效果,并探讨AI对师生及研究者关系动态的影响。

Comments 16 pages, 1 figure; plus 135-page automated companion paper (authored by Claude Code) included as appendix with 18 figures and 30+ tables reporting factorial evaluation across three LLM families

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 62%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12744 2026-03-16 cs.LG cs.AI cs.LO 62%

TaoBench: Do Automated Theorem Prover LLMs Generalize Beyond MathLib?

TaoBench: 自动定理证明器LLM是否能超越MathLib?

Alexander K Taylor, Junyi Zhang, Ethan Ji, Vigyan Sahai, Haikang Deng, Yuanzhou Chen, Yifan Yuan, Di Wu, Jia-Chen Gu, Kai-Wei Chang, Nanyun Peng, Amit Sahai, Wei Wang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 TaoBench评估了当前ATP系统在非标准定义框架下的鲁棒性,发现其在定义等价的Tao公式上性能下降26%,表明定义框架的泛化能力是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12483 2026-03-16 cs.AI cs.LG 62%

Generating Expressive and Customizable Evals for Timeseries Data Analysis Agents with AgentFuel

通过AgentFuel生成具有表现力和可定制性的时序数据分析代理评估

Aadyaa Maddi, Prakhar Naval, Deepti Mande, Shane Duan, Muckai Girish, Vyas Sekar

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了6种流行的数据分析代理,发现其在状态性和事件特定查询上表现不足,并提出AgentFuel工具,帮助领域专家生成定制化的评估方案,提升代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26495 2026-03-16 cs.AI 57%

OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!

OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!

Jingdi Lei, Varun Gumma, Rishabh Bhardwaj, Seok Min Lim, Chuan Li, Amir Zadeh, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Walled AI Labs(Walled AI实验室) Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) Lambda Labs(Lambda实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13220 2026-03-16 cs.MA 50%

A Generative Model of Conspicuous Consumption and Status Signaling

conspicuous 消费与地位信号的生成模型

Logan Cross, Jordi Grau-Moya, William A. Cunningham, Alexander Sasha Vezhnevets, Joel Z. Leibo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于适当性理论的生成模型,通过模拟LLM代理群体的社会互动,揭示了社会观察与预测模式完成的反馈循环如何驱动地位符号的内生生成,展示了消费行为与地位信号的动态关系。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13151 2026-03-16 cs.CR 50%

Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents

为OpenClaw设计的可辩护性设计:保障自主工具调用代理的安全性

Zongwei Li, Wenkai Li, Xiaoqi Li

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种可辩护性设计框架,旨在通过风险分类、安全工程原则和研究议程,提升自主代理的安全性,推动系统化防御工程和稳健部署实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05872 2026-03-16 cs.CR 50%

Evolving Deception: When Agents Evolve, Deception Wins

进化欺骗:当代理进化时,欺骗获胜

Zonghao Ying, Haowen Dai, Tianyuan Zhang, Yisong Xiao, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21251 2026-03-16 cs.CV 50%

AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs

AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准

Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。

Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted

详情

展开后加载摘要…

URL PDF HTML 收藏