arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-02 至 2026-03-02 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2505.19764 2026-03-02 cs.LG cs.AI 87%

Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows

多视角编码器在基于大语言模型的代理工作流性能预测中的应用

Patara Trirat, Wonyong Jeong, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。

Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23373 2026-03-02 cs.AI cs.CL cs.IR 84%

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

面向反面媒体筛查的代理LLM框架用于反洗钱合规

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank

机构 * Interdisciplinary Centre for Security, Reliability and Trust(安全、可靠与信任跨学科中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于LLM与RAG的代理框架,用于自动化反面媒体筛查,通过多步骤流程实现高风险个体的准确识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD 79%

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04026 2026-03-02 cs.HC 78%

VeriWeb: Verifiable Long-Chain Web Benchmark for Agentic Information-Seeking

VeriWeb: 可验证的长链网络基准测试用于代理信息检索

Shunyu Liu, Minghao Liu, Huichi Zhou, Zhenyu Cui, Yang Zhou, Yuhao Zhou, Jialiang Gao, Heng Zhou, Yunhao Yang, Wendong Fan, puzhen zhang, Ge Zhang, Jiajun Shi, Weihao Xuan, Jiaxing Huang, Shuang Luo, Fang Wu, Heli Qi, Qingcheng Zeng, Junjie Wang, Aosong Feng, Jindi Lv, Sicong Jiang, Ziqi Ren, Wangchunshu Zhou, Zhenfei Yin, Wenlong Zhang, Guohao Li, Wenhao Yu, Lei Ma, Lei Bai, Qunshu Lin, Mingli Song, Dacheng Tao

专题命中 Agent评测 :agentic(title,abstract)

AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 74%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 Agent评测 :agentic(title);分类 cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20640 2026-03-02 cs.AI cs.LG 73%

CoMind: Towards Community-Driven Agents for Machine Learning Engineering

CoMind:面向机器学习工程的社区驱动代理

Sijie Li, Weiwei Sun, Shanda Li, Ameet Talwalkar, Yiming Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 CoMind通过多代理系统和迭代并行探索机制,在Kaggle竞赛中实现了优于人类竞争者的性能,展示了社区驱动代理在机器学习工程中的潜力。

Comments ICLR 2026. Code available at https://github.com/comind-ml/CoMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18471 2026-03-02 cs.IR cs.AI cs.CL cs.LG q-fin.ST 67%

FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Data

FinBloom:基于实时金融数据的知识引导大型语言模型

Ankur Sinha, Chaitanya Agarwal, Pekka Malo

机构 * Indian Institute of Management Ahmedabad(印度管理学院阿赫迈德亚德分校) Aalto University School of Business(阿尔托大学商学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 FinBloom通过实时金融数据增强LLMs能力,实现高效金融任务处理。

Comments 39 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03472 2026-03-02 cs.RO cs.AI cs.MA 65%

Destination-to-Chutes Task Mapping Optimization for Multi-Robot Coordination in Robotic Sorting Systems

多机器人协同中的目的地到传送口任务映射优化

Yulun Zhang, Alexandre O. G. Barbosa, Federico Pecora, Jiaoyang Li

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 Agent评测 :planning(abstract);分类 cs.AI;agent(comments);multi-agent(comments)

AI总结 本文提出基于进化算法和混合整数线性规划的任务映射优化方法,用于提升多机器人分拣系统的吞吐量。

Comments Accepted to IEEE International Symposium on Multi-Robot and Multi-Agent Systems (MRS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24288 2026-03-02 cs.AI cs.CL 62%

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

DARE-bench: 评估LLMs在数据科学中的建模和指令忠实度

Fan Shu, Yite Wang, Ruofan Wu, Boyi Liu, Zhewei Yao, Yuxiong He, Feng Yan

机构 * University of Houston(德克萨斯大学休斯顿分校) Snowflake AI Research(Snowflake人工智能研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 DARE-bench通过提供可验证的真实值任务和大规模训练数据,有效评估和提升LLMs在数据科学中的建模和指令忠实度。

Comments Published as a conference paper at ICLR 2026. 10 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17582 2026-03-02 q-bio.QM cs.AI cs.LG cs.SY eess.SY q-bio.MN 62%

GenAI-Net: A Generative AI Framework for Automated Biomolecular Network Design

GenAI-Net: 一种用于自动化生物分子网络设计的生成AI框架

Maurice Filo, Nicolò Rossi, Zhou Fang, Mustafa Khammash

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 GenAI-Net是一种生成AI框架,用于自动化设计生物分子网络,通过结合代理和基于模拟的评估,实现从行为规范到可实现机制的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24191 2026-03-02 cs.GT cs.AI cs.LO 61%

Resilient Strategies for Stochastic Systems: How Much Does It Take to Break a Winning Strategy?

随机系统中的稳健策略:打破获胜策略需要多大的代价?

Kush Grover, Markel Zubia, Debraj Chakraborty, Muqsit Azeem, Nils Jansen, Jan Kretinsky

机构 * Ruhr University Bochum Germany Nanyang Technological University, Singapore Technical University of Munich \& University of Konstanz Germany Ruhr University Bochum \& Radboud University Nijmegen Germany Masaryk University Czech Republic Ruhr University Bochum Technical University of Munich \& University of Konstanz Ruhr University Bochum \& Radboud University Nijmegen Masaryk University

专题命中 Agent评测 :agent(abstract);分类 cs.AI;autonomous agent(comments)

AI总结 本文研究了随机系统中稳健策略的定义与问题,探讨了马尔可夫决策过程和随机游戏中的可达性和安全目标,提出了一种基于干扰频率的稳健性度量方法。

Comments To appear in Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24146 2026-03-02 cs.LG 57%

Learning with a Budget: Identifying the Best Arm with Resource Constraints

在预算下学习:在资源约束下识别最佳臂

Zitian Li, Wang Chi Cheung

机构 * Department of Industrial Systems Engineering & Management(工业系统工程与管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SH-RR算法,在资源约束下有效识别最佳臂,统一了随机和确定性消耗设置的理论分析。

Comments A preliminary version of this work, titled 'Best Arm Identification with Resource Constraints,' was presented at the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024). This manuscript extends the original conference paper by providing improved theoretical results and more generalized conclusions, aiming for future journal submission. arXiv admin note: substantial text overlap with arXiv:2402.19090

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24037 2026-03-02 cs.AI 57%

Portfolio Reinforcement Learning with Scenario-Context Rollout

情景-上下文回放的组合投资强化学习

Vanya Priscillia Bendatu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于情景-上下文回放的组合投资强化学习方法,通过构建反事实状态和增强目标来稳定学习,提升夏普比率和降低回撤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14135 2026-03-02 cs.AI cs.CR cs.CY 57%

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

ForesightSafety Bench: 面向安全人工智能的前沿风险评估与治理框架

Haibo Tong, Feifei Zhao, Linghao Feng, Ruoyu Wu, Ruolin Chen, Lu Jia, Zhou Zhao, Jindong Li, Tenglong Li, Erliang Lin, Shuai Yang, Enmeng Lu, Yinqian Sun, Qian Zhang, Zizhe Ruan, Jinyu Fan, Zeyang Yue, Ping Wu, Huangrui Li, Chengyi Sun, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出ForesightSafety Bench框架,通过94个细化风险维度系统评估前沿AI安全风险,揭示多领域安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21961 2026-03-02 cs.AI cs.HC 57%

How do Visual Attributes Influence Web Agents? A Comprehensive Evaluation of User Interface Design Factors

视觉属性如何影响网络代理?对用户界面设计因素的全面评估

Kuai Yu, Naicheng Yu, Han Wang, Rui Yang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VAF框架,通过系统评估视觉属性对网络代理决策的影响,发现背景颜色对比、项目大小等属性对代理行为有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24258 2026-03-02 q-bio.QM 50%

A model of tuberculosis progression using CompuCell3D

利用CompuCell3D模拟肺结核进展的模型

James W. G. Doran, Christopher F. Rowlatt, Gibin G. Powathil, Ruth Bowness, Christian A. Yates

专题命中 Agent评测 :agent(abstract)

AI总结 本文利用CompuCell3D构建了肺结核进展的多细胞多尺度模型,通过对比分析揭示了空间组织对TB进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23848 2026-03-02 quant-ph 50%

MAFFT-inspired Quantum Shift-based Sequence Alignment and its Efficient Simulation on Decision Diagrams

受MAFFT启发的量子位移序列比对及其在决策图上的高效模拟

Yusuke Kimura, Yutaka Takita

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出基于量子位移的序列比对方法,利用Grover算法和决策图模拟器提升效率,用于优化多重序列比对中的筛选步骤。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23607 2026-03-02 cs.RO cs.SY eess.SY 50%

MicroPush: A Simulator and Benchmark for Contact-Rich Cell Pushing and Assembly with a Magnetic Rolling Microrobot

MicroPush:一种用于接触密集细胞推动和组装的模拟器和基准测试平台,配备磁性滚动微机器人

Yanda Yang, Sambeeta Das

机构 * Department of Mechanical Engineering, University of Delaware(机械工程系,德雷克塞尔大学)

专题命中 Agent评测 :planning(abstract)

AI总结 MicroPush提供了一个开源的模拟器和基准测试平台,用于评估磁性滚动微机器人在接触密集任务中的自主操作能力,包括细胞推动和多目标组装。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00784 2026-03-02 cs.RO 50%

Agile legged locomotion in reconfigurable modular robots

可重构模块化机器人中的敏捷腿部运动

Chen Yu, David Matthews, Jingxian Wang, Jing Gu, Douglas Blackiston, Michael Rubenstein, Sam Kriegman

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种可重构模块化机器人系统,通过自主模块化腿部实现快速修复和重组,以适应动态环境并提高机器人灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23449 2026-03-02 math.NA cs.NA 50%

A Novel Aggregated SIR Model for Spatial Epidemic Propagation

一种用于空间传染病传播的新型聚合SIR模型

M. Soledad Aronna, Mariana Bergonzi, Ernesto Kofman

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种聚合SIR模型,用于研究空间结构传染病动态,通过聚合变量简化了空间传播建模,适用于聚合数据和模型简化需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23437 2026-03-02 cs.SI math.DS nlin.AO physics.soc-ph 50%

Learning dynamics from online-offline systems of LLM agents

从LLM代理的在线-离线系统学习动态

Moyi Tian, George Mohler, P. Jeffrey Brantingham, Nancy Rodríguez

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了LLM代理在在线-离线系统中信息传播的动态,通过两种数学模型分析不同事件类型和性格对传播的影响,并发现SI模型能有效描述系统动态。

Comments 16 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏