arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-27 至 2026-03-27 共收录 104 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2603.25195 2026-03-27 cs.HC 78%

On-Demand Instructional Material Providing Agent Based on MLLM for Tutoring Support

基于MLLM的按需教学材料提供代理用于辅导支持

Takumi Kato, Masato Kikuchi, Tadachika Ozono

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。

Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25056 2026-03-27 cs.CR cs.AI 74%

The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities

系统提示是攻击面:LLM代理配置如何影响安全并创造可利用的漏洞

Ron Litvak

机构 * Independent Researcher(独立研究员) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 研究探讨了LLM邮件代理中系统提示配置对安全性和漏洞的影响,发现提示模型交互是关键安全变量,通过不同配置可使钓鱼检测率从低于1%到97%波动,同时提出Safetility指标以平衡检测、可用性和对抗鲁棒性。

Comments 32 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI 70%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25226 2026-03-27 cs.SE cs.AI cs.CL cs.MA 67%

WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing

WebTestBench: 评估面向端到端自动化网页测试的计算机使用代理

Fanheng Kong, Jingyuan Zhang, Yang Yue, Chenxi Sun, Yang Tian, Shi Feng, Xiaocui Yang, Daling Wang, Yu Tian, Jun Du, Wenchong Zeng, Han Li, Kun Gai

机构 * Northeastern University(东北大学) Kuaishou Technology(快手科技)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出WebTestBench基准,用于评估端到端自动化网页测试能力,揭示现有方法在测试完整性、检测瓶颈和长周期交互可靠性方面的不足。

Comments 24 pages, code: https://github.com/friedrichor/WebTestBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25727 2026-03-27 cs.AI cs.MM 57%

Back to Basics: Revisiting ASR in the Age of Voice Agents

回归基础:在语音助手时代重新审视ASR

Geeyang Tay, Wentao Ma, Jaewon Lee, Yuzhi Tang, Daniel Lee, Weisu Yin, Dongming Shen, Silin Meng, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 57%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24369 2026-03-27 math.OC cs.LG 57%

Adaptive decision-making for stochastic service network design

适应性决策在随机服务网络设计中的应用

Javier Durán-Micco, Bilge Atasoy

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出一种两阶段优化方法,结合元启发式算法、仿真和机器学习,解决物流服务提供商在多模式货运网络中的服务网络设计问题,通过模拟退火算法和自适应替代模型提升解决方案质量和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19516 2026-03-27 cs.CV cs.AI 57%

Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

Gastric-X:一种多模态多阶段基准数据集,用于推进胃癌分析中的视觉-语言模型

Sheng Lu, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Yuanzhe Li

机构 * Ruijin Hospital(瑞金医院) University of Cambridge(剑桥大学) Nanjing First Hospital(南京市第一医院) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 Gastric-X通过1700例胃癌病例数据,评估视觉-语言模型在胃癌诊断中的多阶段任务能力,推动医疗领域VLM发展。

Comments Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02606 2026-03-27 cs.SI cs.AI cs.CY 57%

Gender Dynamics and Homophily in a Social Network of LLM Agents

社交网络中LLM代理的性别动态与同性倾向

Faezeh Fadaei, Jenny Carla Moran, Taha Yasseri

机构 * School of Mathematics and Statistics, University College Dublin(都柏林大学数学与统计学院) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin and Technological University Dublin(人类与机器社会学中心(SOHAM),都柏林圣三一学院与都柏林理工大学) Trinity Long Room Hub, Trinity College Dublin(都柏林圣三一学院长厅中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究LLM代理在社交网络中的性别表现动态及同性倾向,发现尽管个体性别表现随时间变化,网络仍表现出强性别同质性,揭示文化影响下的性别排序机制。

Comments Under Review

Journal ref Philosophical Transactions A. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24703 2026-03-27 cs.SE cs.RO cs.SY eess.SY 57%

IndustriConnect: MCP Adapters and Mock-First Evaluation for AI-Assisted Industrial Operations

IndustriConnect:MCP适配器与先假测试用于AI辅助工业操作

Melwin Xavier, Melveena Jolly, Vaisakh M A, Midhun Xavier

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文提出IndustriConnect,通过MCP适配器将工业操作暴露为可发现的AI工具,支持协议特定连接和安全控制,并通过先假测试和确定性基准验证适配器的正确性、并发行为和结构化错误处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11118 2026-03-27 cs.LG cs.CV 57%

Revealing Human Attention Patterns from Gameplay Analysis for Reinforcement Learning

从游戏分析中揭示强化学习中的人类注意力模式

Henrik Krauss, Takehisa Yairi

机构 * Department of Advanced Interdisciplinary Studies(先进跨学科研究系) Research Center for Advanced Science and Technology(先进科学与技术研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种从游戏数据中揭示人类内部注意力模式的新方法,通过对比人类和强化学习代理的注意力图,验证了人类注意力模式的稀疏性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25303 2026-03-27 cs.GT cs.MA cs.NI 50%

Learning in Proportional Allocation Auctions Games

在比例分配拍卖博弈中的学习

Younes Ben Mazziane, Cleque-Marlain Mboulou Moutoubi, Eitan Altman, Francesco De Pellegrini

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了重复的凯利博弈,探讨了在无线网络切片中基于公平性与吞吐量权衡得到的对数型效用函数,并证明了在三种行为模型下重复游戏收敛到纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25280 2026-03-27 cs.IT math.IT math.ST stat.TH 50%

List Estimation

列表估计

Nikola Zlatanov, Amin Gohari, Farzad Shahrivari, Mikhail Rudakov

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究k列表估计,通过单个观测生成k个候选估计,其性能由与真向量的最小距离衡量。对比集中与去中心化MMSE基准,证明集中式k列表估计等价于向量量化,并在标准条件下具有高率渐进行为,而去中心化基准无法超越集中式k^{-2/d}的衰减率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18628 2026-03-27 math.OC math.PR 50%

Robust mean-field games under entropy-based uncertainty

在熵基不确定性下的鲁棒均场博弈

François Delarue, Pierre Lavigne

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一类熵惩罚的鲁棒均场博弈问题,其中代表性代理人与自然对抗。代理人目标为min-max随机控制问题,自然以熵成本扭曲参考概率测度。通过Schauder不动点论证建立均场博弈均衡存在性,并引入联合平坦反单调性和位移单调性条件确保唯一性。

详情

展开后加载摘要…

URL PDF HTML 收藏