arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-08 至 2026-04-08 共收录 27 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 27 篇

2603.23448 2026-04-08 cs.SE cs.AI 84%

Code Review Agent Benchmark

代码审查代理基准

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出c-CRAB基准,用于评估代码审查代理的能力,发现现有代理仅能解决40%的任务,揭示了未来研究的潜力及人机协作的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO 82%

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05681 2026-04-08 cs.AI cs.CL cs.GT cs.LG cs.MA 80%

LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo

LUDOBENCH:通过基于点的棋盘游戏场景评估LLM的行为决策

Ojas Jain, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 LudoBench通过12种不同决策类别中的480个手工设计点场景,评估LLM在Ludo棋盘游戏中的战略推理能力,发现模型在行为上呈现不同特征,揭示了提示敏感性作为关键漏洞。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05345 2026-04-08 cs.AI 79%

Dynamic Agentic AI Expert Profiler System Architecture for Multidomain Intelligence Modeling

多领域智能建模的动态代理AI专家Profiler系统架构

Aisvarya Adeseye, Jouni Isoaho, Seppo Virtanen, Mohammad Tahir

机构 * Department of Computing, University of Turku(图尔库大学计算系)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种动态代理AI专家Profiler系统,通过多层模块化架构对自然语言响应进行四个级别分类,实验显示在多领域中83%-97%的评估与自我评估一致。

Comments Accepted to be Published in IEEE Conference on Artificial Intelligence (CAI) 2026 - May 8-10, 2026, Granada, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05848 2026-04-08 cs.CL cs.AI 73%

Evaluating Learner Representations for Differentiation Prior to Instructional Outcomes

评估学习者表示以区分优先于教学结果

Junsoo Park, Youssef Medhat, Htet Phyo Wai, Ploy Thajchayapong, Ashok K. Goel

机构 * Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院,亚特兰大,佐治亚州,美国)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过比较学习者与交互层面的表示,探讨如何在无教学结果情况下评估学习者表示的区分能力,发现学习者层面的表示在分离度、聚类结构和判别可靠性上更优。

Comments Accepted to AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05398 2026-04-08 math.OC cs.LG 70%

An Actor-Critic Framework for Continuous-Time Jump-Diffusion Controls with Normalizing Flows

一个用于连续时间跳跃扩散控制的Actor-Critic框架

Liya Guo, Ruimeng Hu, Xu Yang, Yi Zhu

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Department of Mathematics, Tsinghua University(清华大学数学系) Department of Mathematics, University of California, Santa Barbara(加州大学圣塔芭芭拉分校数学系) Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣塔芭芭拉分校统计与应用概率系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京雁栖湖应用数学研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出一个无网格求解器,用于解决熵正则化控制问题和具有跳跃的随机博弈,通过时间非齐性小q函数和适当的职业测度,结合条件归一化流参数化Actor,实现灵活的非高斯策略,并在多个金融和博弈场景中验证了方法的有效性。

Comments 29 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05364 2026-04-08 cs.AI 70%

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

TFRBench:用于评估预测系统推理能力的基准测试

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Yiwen Song, Long T. Le, Qiang Cheng, Chun-Liang Li, Hamid Palangi, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05116 2026-04-08 cs.AI 70%

Uncertainty-Guided Latent Diagnostic Trajectory Learning for Sequential Clinical Diagnosis

不确定性的引导潜在诊断轨迹学习用于顺序临床诊断

Xuyang Shen, Haoran Liu, Dongjin Song, Martin Renqiang Min

机构 * University of Connecticut(康涅狄格大学) Texas A&M University(德克萨斯农工大学) NEC Laboratories America(NEC美国实验室)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于规划LLM和诊断LLM的潜在诊断轨迹学习框架,通过后验分布优先选择高诊断信息轨迹,提升顺序临床诊断的准确率并减少检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00185 2026-04-08 cond-mat.mtrl-sci cs.AI 70%

QUASAR: A Universal Autonomous System for Atomistic Simulation and a Benchmark of Its Capabilities

QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试

Fengxu Yang, Jack D. Evans

机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA 67%

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05719 2026-04-08 cs.CR cs.AI cs.SE 62%

Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing

黑客还是幻觉?对基于LLM的自动化渗透测试的全面分析

Jiaren Peng, Zeqin Li, Chang You, Yan Wang, Hanlin Sun, Xuan Tian, Shuqiao Zhang, Junyi Liu, Jianguo Zhao, Renyang Liu, Haoran Ou, Yuqiang Sun, Jiancheng Zhang, Yutong Jiao, Kunshu Song, Chao Zhang, Fan Shi, Hongda Sun, Rui Yan, Cheng Huang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) National University of Singapore(新加坡国立大学) College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文对基于LLM的自动化渗透测试框架进行系统分析和大规模评估,揭示其架构设计和性能差异,为未来研究提供结构化分类和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05112 2026-04-08 cs.LG cs.AI cs.RO 62%

Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner

Vintix II:决策预训练变压器是一种可扩展的上下文强化学习者

Andrei Polubarov, Lyubaykin Nikita, Alexander Derevyagin, Artyom Grishin, Igor Saprygin, Aleksandr Serkov, Mark Averchenko, Daniil Tikhonov, Maksim Zhdanov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Alexey Zemtsov, Vladislav Kurenkov

机构 * Applied AI Institute(应用人工智能研究所) Innopolis University(因诺波利斯大学) HSE(高等经济学院) ITMO University(ITMO大学) NUST MISIS(国立科技大学MISIS) MSU(莫斯科国立大学) Humanoid(Humanoid公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Vintix II,通过Flow Matching扩展DPT,实现跨多领域任务的强化学习,提升泛化能力。

Comments ICLR 2026, Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04328 2026-04-08 cs.AI cs.LG cs.MA 62%

Soft Tournament Equilibrium

软锦标赛均衡

Saad Alqithami

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软锦标赛均衡(STE),通过可微框架直接从配对比较数据学习和计算多值锦标赛解,解决非传递性交互中的评估问题,提供更稳健的多值均衡评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 62%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05875 2026-04-08 cs.AI 57%

Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models

通过结合大语言模型和小语言模型实现知识库补全与问答的联合处理

Yinan Liu, Dongying Lin, Sigang Luo, Xiaochun Yang, Bin Wang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems optimization, Northeastern University, Shenyang, China(东北大学工业智能与系统优化国家级前沿科学中心,沈阳,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出JCQL框架,结合大语言模型与小语言模型,通过迭代增强知识库补全与问答任务,提升两者性能。

Comments 20 pages, 11 figures

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05775 2026-04-08 cs.CL q-bio.GN 57%

PhageBench: Can LLMs Understand Raw Bacteriophage Genomes?

PhageBench: LLMs能否理解原始噬菌体基因组?

Yusen Hou, Weicai Long, Haitao Hu, Houcheng Su, Junning Feng, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 PhageBench通过模拟生物信息学专家流程,评估LLM对噬菌体基因组的理解能力,发现通用模型在噬菌体contig识别和宿主预测上表现优异,但在复杂推理任务中存在明显局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05753 2026-04-08 cs.SE 57%

An End-to-End Approach for Fixing Concurrency Bugs via SHB-Based Context Extractor

一种基于SHB上下文提取器的端到端并发bug修复方法

Zhuang Li, Qiuping Yi, Keyang Xiao, Zongcheng Ji, Hongliang Liang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出ConFixAgent,一种基于LLM的端到端并发bug修复工具,通过静态发生前图识别相关代码段,提升修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04938 2026-04-08 cs.AI 57%

Operational Noncommutativity in Sequential Metacognitive Judgments

顺序元认知判断中的操作非交换性

Enso O. Torres Alegre, Diana E. Mora Jimenez

机构 * Pontifical Catholic University of Chile(智利天主教大学) University of Notre Dame(圣母大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一个操作框架,区分元认知评估中的顺序依赖性与经典状态变化,通过引入反事实确定性和评估非侵入性假设,证明非交换性存在并提供三维旋转模型和实验范式。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06565 2026-04-08 cs.CL 57%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04246 2026-04-08 cs.AI 57%

Toward Virtuous Reinforcement Learning: A Critique and Roadmap

迈向道德强化学习:一种批评与路线图

Majid Ghasemi, Mark Crowley

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文批评了强化学习中常见的伦理模式,提出以美德为中心的替代方法,强调规则导向方法和单一目标强化学习的局限性,并提出通过社会学习、多目标优化、正则化和伦理传统操作化来构建道德强化学习的框架。

Comments Accepted as a workshop paper at Machine Ethics: From Formal Methods to Emergent Machine Ethics workshop at the AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06387 2026-04-08 cs.LG cs.GT econ.TH 57%

How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators

人类如何帮助大语言模型:评估和激励人类偏好标注者

Shang Liu, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School, Imperial College London(帝国理工学院商学院,帝国理工学院) University of Sydney Business School, University of Sydney(悉尼大学商学院,悉尼大学) Meta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究如何监控人类偏好标注者质量及激励机制,提出自一致性监控方案并分析样本复杂度,揭示标注样本数量与合同性能的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09701 2026-04-08 math.PR math.OC 50%

Optimal control of Volterra integral diffusions and application to contract theory

Volterra积分扩散的最优控制及其在合同理论中的应用

Dylan Possamaï, Mehdi Talbi

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了一类随机Volterra积分方程的最优控制问题,通过动态规划方法和粘性解理论,在Sobolev空间中建立价值函数的抛物型方程,并应用于时间不一致的委托代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05788 2026-04-08 cs.CV 50%

Sparse Gain Radio Map Reconstruction With Geometry Priors and Uncertainty-Guided Measurement Selection

稀疏增益无线电地图重建:结合几何先验与不确定性引导的测量选择

Zhihan Zeng, Ning Wei, Muhammad Baqer Mollah, Kaihe Wang, Phee Lep Yeoh, Fei Xu, Yue Xiu, Zhongpei Zhang

机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China (UESTC)(电子科技大学通信抗干扰全国重点实验室) University of Electronic Science and Technology of China (UESTC)(电子科技大学) Department of Information Science Technology, University of Houston(休斯顿大学信息科学与技术系) School of Science, Technology and Engineering, University of the Sunshine Coast(阳光海岸大学科学、技术与工程学院) ZGC Institute of Ubiquitous-X Innovation and Applications(中关村泛在融合创新研究院)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出GeoUQ-GFNet,结合几何先验和不确定性估计,从主动传感视角实现复杂城市环境下的稀疏增益无线电地图重建,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05298 2026-04-08 cs.GT cs.MA cs.SY eess.SY 50%

Strategic Delay and Coordination Efficiency in Global Games

全局博弈中的战略延迟与协调效率

Shinkyu Park, Behrouz Touri, Marcos M. Vasconcelos

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在全局博弈框架下,延迟决策如何提升集体决策的协调效率和整体效率。

Comments Extended Version. Submitted to the IEEE Conference on Decision and Control 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24155 2026-04-08 cs.RO 50%

Goal-Oriented Reactive Simulation for Closed-Loop Trajectory Prediction

面向目标的反应式仿真用于闭环轨迹预测

Harsh Yadav, Tobias Meisen

机构 * University of Wuppertal(伍珀塔尔大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种闭环训练范式,通过引入基于Transformer的场景解码器,提升高频率重规划下的碰撞避免能力,实验显示在nuScenes和密集DeepScenario交叉口的碰撞率降低显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15305 2026-04-08 math.NA cs.NA 50%

From flocking to jamming in collective cell dynamics: a Vicsek-like model including contact forces

从群体细胞动力学中的聚群到阻塞:一种包含接触力的Vicsek-like模型

Laurent Navoret, Roxana Sublet, Marcela Szopos

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种结合经典Vicsek-like极性对齐和接触力的agent-based模型,通过数值实验研究了模型的相变和阻塞效应,为理解复杂集体细胞动力学提供了理论工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03686 2026-04-08 eess.SP 50%

Multi-Sensor Fusion for Extended Object Tracking Exploiting Active and Passive Radio Signals

多传感器融合用于扩展目标跟踪:利用主动和被动无线电信号

Hong Zhu, Alexander Venus, Erik Leitinger, Klaus Witrisal

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于贝叶斯方法的多传感器融合算法,用于在部分遮挡线状视图的情况下实现精确定位,通过融合主动和被动雷达型测量来提高鲁棒性。

Comments Added experimental validation

详情

展开后加载摘要…

URL PDF HTML 收藏