arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2503.09780 2025-10-03 cs.AI 72%

AgentDAM: Privacy Leakage Evaluation for Autonomous Web Agents

Arman Zharmagambetov, Chuan Guo, Ivan Evtimov, Maya Pavlova, Ruslan Salakhutdinov, Kamalika Chaudhuri

机构 * FAIR at Meta(Meta 的公平性研究部门)

专题命中 Agent评测 :agent(abstract,comments);AI agent(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025 (D&B track), project page: https://github.com/facebookresearch/ai-agent-privacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17918 2025-02-17 cs.AI 72%

AgentStudio: A Toolkit for Building General Virtual Agents

Longtao Zheng, Zhiyuan Huang, Zhenghai Xue, Xinrun Wang, Bo An, Shuicheng Yan

专题命中 Agent评测 :agent(abstract,comments);function calling(abstract);分类 cs.AI

Comments ICLR 2025. Project page: https://ltzheng.github.io/agent-studio

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06399 2023-12-20 cs.AI 72%

Designing Behavior Trees from Goal-Oriented LTLf Formulas

Aadesh Neupane, Eric G Mercer, Michael A. Goodrich

专题命中 Agent评测 :autonomous agent(abstract,comments);agent(abstract);分类 cs.AI

Comments Accepted as "Most Visionary Paper" in Autonomous Robots and Multirobot Systems (ARMS) 2023 workshop affiliated with the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.03450 2023-05-26 cs.LG cs.MA 72%

DeepFreight: Integrating Deep Reinforcement Learning and Mixed Integer Programming for Multi-transfer Truck Freight Delivery

Jiayu Chen, Abhishek K. Umrawal, Tian Lan, Vaneet Aggarwal

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG;planning(comments)

Comments Citing the ICAPS version is preferred: Chen, Jiayu, Abhishek K. Umrawal, Tian Lan, and Vaneet Aggarwal. "DeepFreight: A Model-free Deep-reinforcement-learning-based Algorithm for Multi-transfer Freight Delivery." In Proceedings of the International Conference on Automated Planning and Scheduling, vol. 31, pp. 510-518. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.02918 2020-11-06 cs.AI 72%

Domain-independent generation and classification of behavior traces

Daniel Borrajo, Manuela Veloso

专题命中 Agent评测 :planning(abstract,comments);agent(abstract);分类 cs.AI

Comments A version of this paper appears in the Pre-prints of the Workshop in Planning for Financial Services (FinPlan) at ICAPS'20. arXiv admin note: text overlap with arXiv:2011.01826

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17142 2026-08-19 eess.SY cs.SY 新提交 71%

A Hybrid Discrete-Event and Agent-Based Simulation Approach to Model Circular Supply Chains in Healthcare: A Case Study of Laparoscopic Scissors

用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例

Mohd Shoaib, Antuela Tako, Shahin Rahimifard

专题命中 Agent评测 :agent(title)

AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00867 2026-08-19 cs.HC cs.MA 版本更新 71%

Interactionalism: Re-Designing Higher Learning for the Large Language Agent Era

互动主义:为大语言智能体时代重新设计高等学习

Mihnea C. Moldoveanu, George Siemens

专题命中 Agent评测 :agent(title)

AI总结 该研究提出互动主义作为与生成式AI协同的高等学习实践蓝图,定义互动智能为核心认知任务可由大语言模型智能体自动化时的关键技能,拆解为元认知与元情感组件,用于培养学习者。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08277 2026-08-11 cs.NI 新提交 71%

WirelessOpsAgent: A Benchmark and Agent Design for Action Assurance in Wireless Networks

WirelessOpsAgent:无线网络行动保障的基准测试与智能体设计

Zijian Lu, Yiping Zuo, Hao Xu, Weicong Chen, Xin He, Jiajia Guo, Shi Jin

专题命中 Agent评测 :agent(title)

AI总结 针对现有无线网络运维LLM智能体基准未测试执行阶段支持检查的问题,本文提出WirelessOptBench基准与WirelessOpsAgent智能体,使后者在600片段评估中精确行动准确率达0.983,不安全执行率大幅下降。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 71%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 Agent评测 :agentic(title)

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15696 2026-07-20 cs.IR 新提交 71%

PCTD: Preference-Guided Counterfactual Task Decomposition for Agent Tool Retrieval

PCTD:用于智能体工具检索的偏好引导反事实任务分解

Chu Zhao, Lei Tang, Minghang Li, Jianzhe Zhao, Guibing Guo, Zhengzong Chen, Yuanyuan Zhao, Fei Huang

专题命中 Agent评测 :agent(title)

AI总结 研究针对任务分解中因直接用检索指标作奖励易致奖励作弊及削弱域外泛化能力的问题,提出偏好引导反事实任务分解框架PCTD,通过反事实和偏好奖励改进,构建基准MTDTool,实验证明其在多方面超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00889 2026-07-07 econ.TH 版本更新 71%

Mr.Keynes and the... Complexity! A suggested model for the General Theory

凯恩斯先生与……复杂性!《通论》的一个建议模型

Alessio Emanuele Biondo

专题命中 Agent评测 :agent(title)

AI总结 提出凯恩斯《就业、利息和货币通论》的数学模型,核心方法是依据原文,主要贡献是表明流动性偏好、资本边际效率和边际消费倾向决定既定利率下的总收益与就业水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18038 2026-06-19 cs.CY 版本更新 71%

Acceleration AI Ethics and the Telus GenAI Conversational Agent

加速AI伦理与Telus生成式AI对话代理

James Brusseau

专题命中 Agent评测 :agent(title)

AI总结 本文阐述加速伦理学的理论框架,并通过Telus公司的生成式AI语言工具案例,展示加速AI伦理如何在创新与安全之间平衡,以最大化社会责任。

Journal ref Law Ethics Technol. 2026(2):0006

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08636 2026-06-09 eess.SY cs.SY 新提交 71%

Cooperative Guidance and Control for Active Asset Protection with Time-Varying Agent Speeds

时变速度下主动资产保护的协同制导与控制

Ram Milan Kumar Verma, Shashi Ranjan Kumar, Hemendra Arya

专题命中 Agent评测 :agent(title)

AI总结 提出一种资产与防御者协同的制导控制策略,通过时变速度与航向协调,结合视线率归零、防御者保持在视线线上以及基于剩余时间引导的三种几何与时间目标,实现对机动威胁的拦截。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26065 2026-06-09 econ.TH math.OC 版本更新 71%

Stationary Heterogeneous-Agent Models in Continuous Time

连续时间下的平稳异质性主体模型

Felix Höfer

专题命中 Agent评测 :agent(title)

AI总结 研究连续时间下Bewley-Huggett-Aiyagari模型的平稳均衡存在性与多重性,基于财政价格水平理论,发现政府小规模赤字可导致任意偶数个均衡及价格水平多重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.04264 2026-06-04 econ.GN cs.MA physics.soc-ph q-fin.EC 71%

Agent based simulations visualize Adam Smith's invisible hand by solving Friedrich Hayek's Economic Calculus

基于代理的模拟通过解决弗里德里克·哈耶克的经济计算来可视化亚当·斯密的看不见的手

Klaus Jaffe

专题命中 Agent评测 :agent(title)

AI总结 本文通过代理模拟展示经济中看不见的手如何在异质环境中通过劳动分工产生协同效应,揭示了经济协同的来源和性质。

Comments Econophysics, Complexity, Synergy

详情

展开后加载摘要…

URL PDF HTML 收藏
1202.4707 2026-06-03 math.OC cs.SY eess.SY 71%

A para-model agent for dynamical systems

动力系统的参数模型智能体

Loïc Michel

专题命中 Agent评测 :agent(title)

AI总结 提出一种广义的无模型控制方法,通过参数模型智能体实现非线性动力系统的控制与无导数优化,并验证其鲁棒性。

Comments 41 pages, 38 figures, partially presented at the French Symposium of Electrical Engineering in Grenoble, Jun. 2016 and at the Sparse days in St Girons III, Jul. 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30708 2026-06-01 nlin.CG cs.NE nlin.AO 71%

Agnosiophobia in a virtual agent: behavioral and dynamical architecture in Lenia

虚拟智能体中的未知恐惧:Lenia中的行为与动力学架构

Jesse Cool, Benedikt Hartl, Michael Levin, Samantha Petti

专题命中 Agent评测 :agent(title)

AI总结 本研究通过在Lenia环境中引入无感知区域,发现虚拟生物倾向于回避这些区域(称为未知恐惧),并通过动力学系统分析揭示其行为源于形态维持这一更根本的目标。

Comments 8 pages, 6 figures; under review at ALIFE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27452 2026-05-28 cs.CV 71%

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent

微调视觉语言模型以理解当前损伤并使用质量卫士代理进行优先级评分

Takato Yasuno

专题命中 Agent评测 :agent(title)

AI总结 本文通过微调LLaVA-1.5-7B视觉语言模型,结合规则引擎和质量卫士代理,实现了桥梁损伤自动理解与修复优先级评分,有效降低了评分变异并提升了效率。

Comments 23 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17871 2026-04-21 cs.HC 71%

Design and Evaluation of a Culturally Adapted Multimodal Virtual Agent for PTSD Screening

面向PTSD筛查的跨文化多模态虚拟代理设计与评估

Cengiz Ozel, Waleed Nadeem, Samuel Potter, Yahya Bokhari, Bdour Alwuqaysi, Wejdan Alotaibi, Rahaf Fahad Alnufaie, Sabri Boughorbel, Abdulrhman Aljouie, Rakan Altasan, Ehsan Hoque

专题命中 Agent评测 :agent(title)

AI总结 本文设计并评估了适用于军事医疗场景的跨文化多模态虚拟代理Molhim,通过可配置的对话流程实现特定目的的交互,支持结构化多轮对话和自动会后分析,集成PCL-5量表进行PTSD筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 71%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 Agent评测 :agent(title)

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18985 2026-04-06 cs.SI 71%

Simulating Online Social Media Conversations on Controversial Topics Using AI Agents Calibrated on Real-World Data

利用真实数据校准的AI代理模拟争议性话题的在线社交媒体对话

Elisa Composta, Nicolo' Fontana, Francesco Corso, Francesco Pierri

专题命中 Agent评测 :AI agent(title)

AI总结 本文研究了基于LLM的代理在模拟微博客社交网络中的行为,探讨了其在不同场景下生成内容、互动及意见演变的机制,发现其生成内容在语气和毒性方面不如真实数据多样,需更精细的认知建模以模拟人类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 71%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 Agent评测 :agent(title)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06314 2026-03-09 physics.med-ph 71%

Sparse probabilistic evaluation for treatment planning: a feasibility study in IMPT head & neck patients

稀疏概率评估用于治疗计划:一项在IMPT头颈患者中的可行性研究

Jenneke I. de Jong, Steven J. M. Habraken, Albin Fredriksson, Johan Sundström, Erik Engwall, Sebastiaan Breedveld, Mischa S. Hoogeman

专题命中 Agent评测 :planning(title)

AI总结 本研究提出稀疏概率评估方法,用于提高IMPT治疗计划中目标覆盖与器官保护的平衡,通过优化网格设置实现高效计算,验证了其在头颈癌患者中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07346 2026-02-16 hep-th 71%

Higgs Field as Architect of a Geodesically Complete Universe and Agent for New Physics in Interiors of Black Holes

希格斯场作为几何完备宇宙的架构师及黑洞内部新物理的代理

Itzhak Bars

专题命中 Agent评测 :agent(title)

AI总结 希格斯场在极端引力区域创造反引力区域,解决黑洞信息悖论并恢复电弱对称性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06714 2026-02-09 cs.HC 71%

PrefIx: Understand and Adapt to User Preference in Human-Agent Interaction

PrefIx: 在人机交互中理解并适应用户偏好

Jialin Li, Zhenhao Chen, Hanjun Luo, Hanan Salam

专题命中 Agent评测 :agent(title)

AI总结 PrefIx通过交互作为工具范式,评估智能体在人机交互中的偏好适应能力,提升用户体验和偏好对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14606 2026-01-22 cs.CR 71%

An LLM Agent-based Framework for Whaling Countermeasures

基于LLM代理的鲸鱼攻击防御框架

Daisuke Miyamoto, Takuji Iimura, Narushige Michishita

专题命中 Agent评测 :agent(title)

AI总结 本研究提出基于LLM代理的鲸鱼攻击防御框架,通过构建个性化防御资料和分析电子邮件,提升对高权威目标的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02750 2026-01-07 cs.IR 71%

Ahead of the Spread: Agent-Driven Virtual Propagation for Early Fake News Detection

提前传播:基于代理的虚拟传播用于早期虚假新闻检测

Bincheng Gu, Min Gao, Junliang Yu, Zongwei Wang, Zhiyi Liu, Kai Shu, Hongyu Zhang

专题命中 Agent评测 :agent(title)

AI总结 AVOID通过基于代理的虚拟传播方法,主动模拟早期虚假新闻的扩散行为,从而提升早期检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13262 2025-12-16 cs.RO cs.CV 71%

Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving

生成代理行为模型在交互式自动驾驶中的训练和测试时间缩放

Hyunki Seong, Jeong-Kyun Lee, Heesoo Myeong, Yongho Shin, Hyun-Mook Cho, Duck Hoon Kim, Pranav Desai, Monu Surana

专题命中 Agent评测 :agent(title)

AI总结 本文提出GRBO和Warm-K两种方法,用于提升交互式自动驾驶中生成代理行为模型的训练和测试时间性能,提高安全性和鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05615 2025-12-08 physics.med-ph 71%

Fate of gadolinium in inflamed mouse brain: Release and phosphate interaction post-contrast agent administration

钆在炎症小鼠脑中的命运:对比剂给药后释放及与磷酸盐的相互作用

Lina Anderhalten, Nicole Höfer, Daria Dymnikova, Julia Hahndorf, Matthias Taupitz, Heike Traub, Christian Teutloff, Carmen Infante-Duarte, Robert Bittl

专题命中 Agent评测 :agent(title)

AI总结 研究通过EPR和ENDOR光谱学揭示炎症条件下小鼠脑中钆的释放及与磷酸盐的相互作用,表明体内和体外分析结合能更准确评估长期钆保留机制。

Comments 50 pages (41 main part, 9 supplementary material), 13 figures (6 main part, 7 supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21661 2025-11-27 cs.DC cs.DB 71%

AI/ML Model Cards in Edge AI Cyberinfrastructure: towards Agentic AI

边缘AI计算基础设施中的AI/ML模型卡片:迈向代理AI

Beth Plale, Neelesh Karthikeyan, Isuru Gamage, Joe Stubbs, Sachith Withana

专题命中 Agent评测 :agentic(title)

AI总结 本文探讨了在边缘AI计算基础设施中使用模型卡片和模型上下文协议,以提升AI/ML模型的动态管理和使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏