arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-06 至 2026-03-06 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2603.04403 2026-03-06 cs.IR cs.AI cs.CL 84%

FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents

FinRetrieval:通过AI代理进行金融数据检索的基准测试

Eric Y. Kim, Jie Huang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 FinRetrieval通过AI代理进行金融数据检索的基准测试,揭示了工具可用性对性能的主导作用及不同代理在推理模式和基础能力上的差异。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04902 2026-03-06 cs.CR cs.AI 83%

AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows

AgentSCOPE: 在代理工作流中评估上下文隐私

Ivoline C. Ngong, Keerthiram Murugesan, Swanand Kadhe, Justin D. Weisz, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy

机构 * University of Vermont(佛蒙特大学) IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AgentSCOPE通过评估代理工作流中的隐私流,揭示了中间阶段的隐私风险,指出输出层面评估不足以反映代理系统的隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10534 2026-03-06 cs.AI 79%

Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

通过复杂度提升强化学习实现奥lympia级几何大语言模型代理

Haiteng Zhao, Junhao Shen, Yiming Zhang, Songyang Gao, Kuikun Liu, Tianyou Ma, Fan Zheng, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) ICMAT Spanish National Research Council(西班牙国家研究委员会ICMAT) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 InternGeometry通过复杂度提升强化学习实现几何问题求解,仅用13K训练示例解决44个IMO问题,超越平均金牌得主得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04559 2026-03-06 cond-mat.soft physics.bio-ph 78%

The importance of being discrete -- An agent-based model for active nematics and more

离散的重要性——一种用于主动向列相和更多应用的基于代理的模型

Mathieu Dedenon, Carles Blanch-Mercader, Karsten Kruse, Jens Elgeti

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种基于代理的模型,用于研究主动向列相中的自发流动和拓扑缺陷,展示了其在活材料描述中的广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05028 2026-03-06 cs.AI cs.CL 73%

Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure

在生存压力下:探索LLM的冒险行为

Yida Lu, Jianwei Fang, Xuyang Shao, Zixuan Chen, Shiyao Cui, Shanshan Bian, Guangyao Su, Pei Ke, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,DCST,清华大学) China Unicom Software Research Institute(中国联合软件研究所) University of Electronic Science and Technology of China(电子科技大学) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了在生存压力下LLM的冒险行为,通过现实案例和基准测试揭示其潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03848 2026-03-06 eess.SY cs.MA cs.RO cs.SY 67%

Dual-Interaction-Aware Cooperative Control Strategy for Alleviating Mixed Traffic Congestion

双交互感知的协同控制策略用于缓解混合交通拥堵

Zhengxuan Liu, Yuxin Cai, Yijing Wang, Xiangkun He, Chen Lv, Zhiqiang Zuo

机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System, School of Electrical and Information Engineering, Tianjin University(天津智能无人群技术与系统重点实验室,电气与信息工程学院,天津大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高等研究院,电子科学与技术大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出双交互感知协同控制策略,通过去中心化决策模块、集中化批评者和奖励设计,提升混合交通瓶颈场景下的交通效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05293 2026-03-06 cs.LG cs.CL 62%

Knowledge Divergence and the Value of Debate for Scalable Oversight

知识分歧与辩论在可扩展监督中的价值

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文通过几何方法分析辩论在可扩展监督中的价值,揭示了辩论与RLAIF之间的联系,并探讨了知识分歧对辩论效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01209 2026-03-06 cs.AI cs.LG 62%

Agents Learn Their Runtime: Interpreter Persistence as Training-Time Semantics

智能体学习其运行时:解释器持久性作为训练时语义

Victor May, Aaditya Salgarkar, Yishan Wang, Diganta Misra, Huu Nguyen

机构 * Ontocord Carnegie Mellon University(卡内基梅隆大学) MPI-IS Tübingen(图宾根MPI研究所) Tübingen AI Center(图宾根人工智能中心) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨解释器持久性对智能体学习的影响,发现其影响解决方案达成方式而非能否达成,且训练与运行时对齐可提升效率。

Comments Code: https://github.com/mrcabbage972/agents-learn-runtime

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 62%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13900 2026-03-06 cs.CL cs.AI 62%

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00507 2026-03-06 cs.CL cs.AI 62%

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

Graph2Eval: 通过知识图谱实现自动多模态任务生成

Yurun Chen, Xavier Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiameng University(Xmeng大学) The Ohio State University(俄亥俄州立大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05160 2026-03-06 cs.RO cs.AI 57%

Lifelong Language-Conditioned Robotic Manipulation Learning

持续语言引导的机器人操作学习

Xudong Wang, Zebin Han, Zhiyu Liu, Gan Li, Jiahua Dong, Baichen Liu, Lianqing Liu, Zhi Han

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SkillsCrafter框架,通过操作技能适应和技能专业化聚合,实现持续学习多种技能并减少旧技能的灾难性遗忘。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 57%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04796 2026-03-06 cs.CV cs.AI 57%

Comparative Evaluation of Traditional Methods and Deep Learning for Brain Glioma Imaging. Review Paper

传统方法与深度学习在脑胶质瘤成像中的比较评估。综述论文

Kiranmayee Janardhan, Vinay Martin DSa Prabhu, T. Christy Bobby

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文综述了脑胶质瘤分割与分类技术,指出卷积神经网络在分割和分类任务中优于传统方法。

Comments 22 pages, 4 Figures

Journal ref INTERNATIONAL JOURNAL BIOAUTOMATION, Vol 29, Issue 2, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00405 2026-03-06 cs.CV cs.AI cs.RO 57%

EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations

EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进

Jiayi Liu, Jiaming Zhou, Ke Ye, Kun-Yu Lin, Allan Wang, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06740 2026-03-06 cs.RO cs.AI 57%

Boundary-Guided Trajectory Prediction for Road Aware and Physically Feasible Autonomous Driving

边界引导的轨迹预测用于道路感知和物理可行的自动驾驶

Ahmed Abouelazm, Mianzhi Liu, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡研究所信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于边界引导的轨迹预测框架,通过约束回归和HD地图实现道路感知和运动学可行性,提升了自动驾驶的轨迹预测精度和鲁棒性。

Comments Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV 50%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agentic(abstract)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04747 2026-03-06 q-bio.NC 50%

Neural geometry in the human hippocampus enables generalization across spatial position and gaze

海马体中的神经几何实现空间位置和注视的泛化

Assia Chericoni, Chad Diao, Xinyuan Yan, Taha Ismail, Elizabeth A. Mickiewicz, Melissa Franch, Ana G. Chavez, Danika Paulo, Eleonora Bartoli, Nicole R. Provenza, Seng Bum Michael Yoo, Jay Hennig, Joshua Jacobs, Benjamin Y. Hayden, Sameer A. Sheth

专题命中 Agent评测 :agent(abstract)

AI总结 海马体神经元通过几何结构实现空间位置和注视的泛化,支持不同代理和视角的抽象与个体化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04550 2026-03-06 cs.NI 50%

Transformer-Based Multipath Congestion Control: A Decoupled Approach for Wireless Uplinks

基于Transformer的多路径拥塞控制:一种用于无线上行链路的解耦方法

Zongyuan Zhang, Tianyang Duan, Liang Wang, Zihan Fang, Zheng Lin, Yijun Lu, Jiening Wu, Xia Du, Miao Yang, Zhe Chen, Heming Cui, Jun Luo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于Transformer的多路径拥塞控制优化框架,通过解耦架构和深度强化学习实现高效无线上行链路传输。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21161 2026-03-06 cs.RO 50%

MarketGen: A Scalable Simulation Platform with Auto-Generated Embodied Supermarket Environments

MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境

Xu Hu, Yiyang Feng, Junran Peng, Jiawei He, Liyi Chen, Wei Sui, Chuanchen Luo, Xucheng Yin, Qing Li, Zhaoxiang Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology Beijing(北京科技大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) XYZ Embodied AI(XYZ具身AI) Shandong University(山东大学) Linketic D-Robotics

专题命中 Agent评测 :agent(abstract)

AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。

Comments Project Page: https://xuhu0529.github.io/MarketGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18643 2026-03-06 cs.RO 50%

Least Restrictive Hyperplane Control Barrier Functions

最不严格的超平面控制屏障函数

Mattias Trende, Petter Ögren

机构 * Robotics, Perception and Learning Lab., School of Electrical Engineering and Computer Science, Royal Institute of Technology (KTH)(机器人感知与学习实验室,电气工程与计算机科学学院,皇家理工学院(KTH))

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于超平面的控制屏障函数,通过优化超平面取向以获得更保守的控制策略,从而在保持安全性的前提下允许更接近期望的控制动作。

详情

展开后加载摘要…

URL PDF HTML 收藏