arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-10 至 2026-03-10 共收录 258 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 35 篇

2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS 62%

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06671 2026-03-10 cs.LG cs.AI 62%

ERP-RiskBench: Leakage-Safe Ensemble Learning for Financial Risk

ERP-RiskBench: 用于金融风险的泄漏安全集成学习

Sanjay Mishra

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ERP-RiskBench通过泄漏安全的集成学习方法,提升ERP系统中金融风险检测的准确性和可解释性。

Comments 12 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 57%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07978 2026-03-10 cs.AI 57%

OSExpert: Computer-Use Agents Learning Professional Skills via Exploration

OSExpert: 通过探索学习专业技能的计算机使用智能体

Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OSExpert通过引入GUI-DFS探索算法和技能集,提升智能体在复杂任务中的表现和效率,实现专家级计算机使用。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10467 2026-03-10 cs.AI 57%

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

MERIT反馈促进LLM谈判者更好的协商

Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Amazon AGI(亚马逊人工智能实验室) LG AI Research(LG人工智能研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。

Comments Preprint. Typo corrected, New results added

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06585 2026-03-10 cs.HC cs.AI 57%

Right Move, Right Time: Multi-Sport Space Evaluation Platform for Ultimate Frisbee, Basketball, and Soccer

正确移动,正确时机:多运动空间评估平台用于极限飞盘、篮球和足球

Shunsuke Iwashita, Titouan Jeannot, Braden Eberhard, Jacob Miller, Rikako Kono, Calvin Yeung, Keisuke Fujii

机构 * Nagoya University(名古屋大学) Aix-Marseille Université(阿维尼翁-马赛大学) University of Pennsylvania(宾夕法尼亚大学) Shown Space Australian National University(澳大利亚国立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一个多运动空间评估平台,通过标准化输入和时间感知评估,实现极限飞盘、篮球和足球之间的空间度量比较,为不同运动的评估一致性提供实用解决方案。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08680 2026-03-10 quant-ph 50%

Metriq: A Collaborative Platform for Benchmarking Quantum Computers

Metriq: 一个用于量子计算机基准测试的协作平台

Alessandro Cosentino, Changhao Li, Vincent Russo, Bradley A. Chase, Tom Lubinski, Siyuan Niu, Neer Patel, Nathan Shammah, William J. Zeng

专题命中 Agent评测 :workflow(abstract)

AI总结 Metriq是一个开源协作平台,用于可重复的跨平台量子计算机基准测试,通过统一的工作流程整合基准定义、执行、数据收集和公开展示,提供系统级和应用级的性能评估,并引入Metriq分数作为综合性能指标。

Comments 41 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08603 2026-03-10 econ.GN q-fin.EC 50%

A Dynamic Equilibrium Model for Automated Market Makers

自动市场 maker 的动态均衡模型

Chengqi Zang, Zhenghui Wang, Weitong Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个动态均衡模型,研究自动市场 maker 中套利者、噪音交易者和流动性提供者之间的互动,揭示流动性提供与波动性的非单调关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08364 2026-03-10 cs.CV 50%

Diffusion-Based Data Augmentation for Image Recognition: A Systematic Analysis and Evaluation

基于扩散的数据增强用于图像识别:系统分析与评估

Zekun Li, Yinghuan Shi, Yang Gao, Dong Xu

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出UniDiffDA框架,系统分析DiffDA方法的三个核心组件,通过全面评估揭示不同策略的优劣,提供可复现的代码和配置以促进研究。

Journal ref Int J Comput Vis 134, 126 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08050 2026-03-10 math.OC math.AP 50%

Finite-Horizon Optimal Consumption and Investment with Time-Varying Job-Switching Costs

有限时间 horizon 最优消费与投资及时间变化就业转换成本问题

Gugyum Ha, Junkee Jeon, Jihoon Ok

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在时间变化就业转换成本下,经济代理人在有限时间 horizon 内的最优消费、投资及就业转换策略问题,通过PDE理论分析了双障碍问题的解及其自由边界性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 50%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18064 2026-03-10 cs.CV 50%

3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis

3DMedAgent:面向3D医学分析的统一感知-理解框架

Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院) TUD Dresden University of Technology(德累斯顿技术大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract)

AI总结 3DMedAgent通过统一框架实现2D MLLMs在3D医学分析中的高效处理,无需3D特定微调,提升3D医学图像的感知与理解能力。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06746 2026-03-10 cs.RO cs.CV 50%

M3CAD: Towards Generic Cooperative Autonomous Driving Benchmark

M3CAD:迈向通用协作自动驾驶基准

Morui Zhu, Yongqi Zhu, Yihao Zhu, Qi Chen, Deyuan Qu, Song Fu, Qing Yang

机构 * University of North Texas(北卡罗来纳州立大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 Agent评测 :planning(abstract)

AI总结 M3CAD是一个全面的协作自动驾驶基准,提供多模态数据支持多种自动驾驶任务,并提出多级融合方法以平衡通信效率与感知精度。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08650 2026-03-10 cs.CY 50%

Who is Responsible? The Data, Models, Users or Regulations? A Comprehensive Survey on Responsible Generative AI for a Sustainable Future

谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能

Shaina Raza, Rizwan Qureshi, Anam Zahid, Amgad Muneer, Anas Zafar, Safiullah Kamawal, Ferhat Sadak, Joseph Fioresi, Muhammaed Saeed, Ranjan Sapkota, Aditya Jain, Muneeb Ul Hassan, Aizan Zafar, Hasan Maqbool, Ashmal Vayani, Jia Wu, Maged Shoman

专题命中 Agent评测 :agentic(abstract)

AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06681 2026-03-10 cs.CV 50%

RADAR: A Multimodal Benchmark for 3D Image-Based Radiology Report Review

RADAR:用于基于3D图像的放射学报告审查的多模态基准

Zhaoyi Sun, Minal Jagtiani, Wen-wai Yim, Fei Xia, Martin Gunn, Meliha Yetisgen, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) Microsoft Health AI(微软健康AI)

专题命中 Agent评测 :workflow(abstract)

AI总结 RADAR是一个用于放射学报告审查的多模态基准,通过3D医学图像与初步报告及候选编辑的配对,评估模型在细粒度临床推理和图像-文本对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08766 2026-03-10 eess.SY cs.SY math.DS 50%

Discovering and exploiting active sensing motifs for estimation

发现并利用主动感知动机以进行估计

Benjamin Cellini, Burak Boyacioglu, Austin Lopez, Floris van Breugel

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出BOUNDS方法和AI-KF滤波器,用于发现主动感知运动动机并提升估计精度。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2603.08484 2026-03-10 cs.CR 75%

Towards Modeling Cybersecurity Behavior of Humans in Organizations

面向组织中人类网络安全行为建模

Klaas Ole Kürtz

专题命中 其他Agent :AI agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 本文提出了一种面向组织中人类网络安全行为的建模方法,整合意识、安全文化等关键概念,为开发对抗AI代理操纵攻击的安全策略提供理论框架。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08575 2026-03-10 cs.AI cs.LG 62%

Trust via Reputation of Conviction

通过可信度声誉建立信任

Aravind R. Iyengar

专题命中 其他Agent :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于可信度的声誉框架,用于人工智能代理的信任建立,强调可信度而非正确性作为信任的基础。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏