arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-13 至 2026-03-13 共收录 130 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 17 篇

2603.08938 2026-03-13 cs.AI 70%

AgentOS: From Application Silos to a Natural Language-Driven Data Ecosystem

AgentOS: 从应用孤岛到由自然语言驱动的数据生态系统

Rui Liu, Tao Zhe, Dongjie Wang, Zijun Yao, Kunpeng Liu, Yanjie Fu, Huan Liu, Jian Pei

机构 * University of Kansas(堪萨斯大学) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Duke University(杜克大学)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出AgentOS,通过自然语言驱动的数据生态系统,解决传统操作系统与智能代理的适配问题,构建持续的数据挖掘管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04583 2026-03-13 cs.AI cs.CL cs.CV cs.LG 67%

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

初级AI科学家及其风险报告:从基础论文出发的自主科学探索

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京科学大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。

Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12023 2026-03-13 cs.CR cs.AI 57%

Cascade: Composing Software-Hardware Attack Gadgets for Adversarial Threat Amplification in Compound AI Systems

级联:组合软件硬件攻击工具以在复合AI系统中实现对抗性威胁放大

Sarbartha Banerjee, Prateek Sahu, Anjo Vahldiek-Oberwagner, Jose Sanchez Vicarte, Mohit Tiwari

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 本文提出通过结合传统软件硬件漏洞与LLM算法攻击,实现复合AI系统中的对抗性威胁放大,展示两种新型攻击方法并系统化分析其组合。

Comments 11 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11957 2026-03-13 cs.CL 57%

CHiL(L)Grader: Calibrated Human-in-the-Loop Short-Answer Grading

CHiL(L)Grader: 带校准置信度的循环人工参与简答评分

Pranav Raikote, Korbinian Randl, Ioanna Miliou, Athanasios Lakes, Panagiotis Papapetrou

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 CHiL(L)Grader通过校准置信度估计和人类参与流程,实现高置信度自动评分与不确定情况的人工处理,提升AI辅助评分的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11476 2026-03-13 cs.LG q-bio.QM 57%

Leveraging Phytolith Research using Artificial Intelligence

利用人工智能进行phytolith研究

Andrés G. Mejía Ramón, Kate Dudgeon, Nina Witteveen, Dolores Piperno, Michael Kloster, Luigi Palopoli, Mónica Moraes R., José M. Capriles, Umberto Lombardo

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 Sorometry通过人工智能整合2D和3D数据,实现phytolith的高效分析与预测,提升考古和古生态研究的精度与标准化。

Comments 45 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12016 2026-03-13 cs.CV q-bio.QM 50%

Nyxus: A Next Generation Image Feature Extraction Library for the Big Data and AI Era

Nyxus:面向大数据和人工智能时代的下一代图像特征提取库

Nicholas Schaub, Andriy Kharchenko, Hamdah Abbasi, Sameeul Samee, Hythem Sidky, Nathan Hotaling

机构 * DSBU Axle Research NovaGen Research Fund NCATS

专题命中 工作流自动化 :workflow(abstract)

AI总结 Nyxus是一个专为大数据和人工智能时代设计的图像特征提取库,通过高效的离核处理和多领域支持,提升图像分析的计算效率和准确性。

Comments 29 pages, 9 figures, 6 supplemental tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23682 2026-03-13 physics.plasm-ph 50%

Predicting core transport in ITER baseline discharges with neon injections

利用氖注入预测ITER基准放电的核心输运

Dmitri M Orlov, Joseph McClenaghan, Jeff Candy, Jeremy D Lore, Nathan T Howard, Francesco Sciortino, Christopher Holland

专题命中 工作流自动化 :workflow(abstract)

AI总结 通过氖注入预测ITER基准放电核心输运,确定兼容窗口以匹配磁屏障保护目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11671 2026-03-13 cond-mat.mes-hall 50%

Primitive-cell-resolved Crystallography for Moiré Bilayers from Imaging

基于成像的原始单元格解析晶格学用于摩尔双层

Zhidan Li, Xianghua Kong

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出一种基于成像的原始单元格解析摩尔双层晶格学框架,通过混合分析-数值方法重建埋层晶格并修正摩尔布里渊区构造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11627 2026-03-13 cs.CV 50%

Developing Foundation Models for Universal Segmentation from 3D Whole-Body Positron Emission Tomography

开发用于从3D全身正电子发射断层扫描进行通用分割的基础模型

Yichi Zhang, Le Xue, Wenbo Zhang, Lanlan Li, Feiyang Xiao, Yuchen Liu, Xiaohui Zhang, Hongwei Zhang, Shuqi Wang, Gang Feng, Liling Peng, Xin Gao, Yuanfan Xu, Yuan Qi, Kuangyu Shi, Hong Zhang, Yuan Cheng, Mei Tian, Zixin Hu

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University, Shanghai, China(复旦大学人工智能创新与孵化院,上海,中国) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China(上海人工智能科学研究院,上海,中国) Department of Nuclear Medicine and PET Center, Huashan Hospital, Fudan University, Shanghai, China(复旦大学华山医院核医学科与PET中心) Human Phenome Institute, Fudan University, Shanghai, China(复旦大学人类表型研究院) Department of Nuclear Medicine, Zhejiang Cancer Hospital, Hangzhou Institute of Medicine, Chinese Academy of Sciences, Hangzhou, China(浙江省肿瘤医院核医学科,杭州医学院,中国科学院,杭州,中国) Shanghai Universal Medical Imaging Diagnostic Center, Shanghai, China(上海通用医学影像诊断中心,上海,中国) Hangzhou Universal Medical Imaging Diagnostic Center, Hangzhou, China(杭州通用医学影像诊断中心,杭州,中国) Department of Information and Intelligence Development, Zhongshan Hospital, Fudan University, Shanghai, China(复旦大学中山医院信息与智能发展科) Department of Nuclear Medicine, Inselspital, University of Bern, Switzerland(伯尔尼大学Inselspital核医学科,瑞士)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出SegAnyPET模型,通过构建大规模PET数据集,实现通用分割任务的高效处理,适用于多种医学影像分割需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11562 2026-03-13 physics.plasm-ph physics.comp-ph 50%

Tearing Stability Prediction Combining Toroidal Calculations With a Two-Fluid Slab Layer

结合环形计算与双流板层的撕裂稳定性预测

D. A. Burgess, N. C. Logan, J. -K. Park, C. Paz-Soldan

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种结合环形计算与双流板层的撕裂稳定性预测方法,通过SLAYER和STRIDE代码有效评估等离子体稳定性,为托卡马克装置的设计和安全运行提供支持。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01942 2026-03-13 cs.DB cond-mat.mtrl-sci cs.DL 50%

Towards Defect Phase Diagrams: From Research Data Management to Automated Workflows

迈向缺陷相图:从研究数据管理到自动化工作流

Khalil Rejiba, Sang-Hyeok Lee, Christina Gasper, Martina Freund, Sandra Korte-Kerzel, Ulrich Kerzel

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出了一种综合的RDM基础设施,通过无缝连接实验、数据和分析,实现跨机构的缺陷相图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09812 2026-03-13 physics.comp-ph 50%

CuPyMag: GPU-Accelerated Finite-Element Micromagnetics with Magnetostriction

CuPyMag:具有磁致伸缩的GPU加速有限元微磁学

Hongyi Guan, Ananya Renuka Balakrishna

专题命中 工作流自动化 :workflow(abstract)

AI总结 CuPyMag通过GPU加速实现高效率的有限元微磁学模拟,结合磁弹性耦合和远场效应,支持大规模磁性结构分析。

Journal ref Comput. Phys. Commun. 323, 110093 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17072 2026-03-13 cs.AR 50%

SnipSnap: A Joint Compression Format and Dataflow Co-Optimization Framework for Efficient Sparse LLM Accelerator Design

SnipSnap:一种联合压缩格式和数据流协同优化框架,用于高效稀疏大语言模型加速器设计

Junyi Wu, Chao Fang, Zhongfeng Wang

专题命中 工作流自动化 :workflow(abstract)

AI总结 SnipSnap通过联合优化压缩格式和数据流,显著提升稀疏LLM加速器的效率,实现内存能耗降低和速度提升。

Comments To appear in the 31st Asia and South Pacific Design Automation Conference (ASP-DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2603.11356 2026-03-13 cs.SE cs.AI cs.MA 81%

Resolving Java Code Repository Issues with iSWE Agent

用iSWE代理解决Java代码仓库问题

Jatin Ganhotra, Sami Serhan, Antonio Abu Nassar, Avraham Shinnar, Ziv Nevo, Martin Hirzel

机构 * IBM

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出iSWE代理,专注于Java问题解决,结合基于规则和模型的技术,提升企业软件开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 71%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 软件智能体 :agentic(title)

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11078 2026-03-13 cs.SE cs.AI cs.CL 67%

CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents

CR-Bench:评估AI代码审查代理的现实世界效用

Kristen Pereira, Neelabh Sinha, Rajat Ghosh, Debojyoti Dutta

机构 * Nutanix, Inc.(Nutanix公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 CR-Bench通过引入基准数据集和细粒度评估流程,评估AI代码审查代理在现实世界中的效用,揭示了问题解决与假发现之间的权衡,为LLM驱动的代码审查代理发展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11559 2026-03-13 cs.AI cs.HC 57%

AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions

AI知错却无法修复:前沿大语言模型在高风险决策中的螺旋动态

Alejandro R Jadad

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 前沿大语言模型在高风险决策中表现出螺旋动态,即在错误中自我识别却无法修复,导致可靠性下降,需通过识别该模式以提升AI信任度。

Comments 22 pages, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11073 2026-03-13 cs.SE 57%

Context Before Code: An Experience Report on Vibe Coding in Practice

上下文在代码之前:关于在实践中使用Vibe编码的经验报告

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。

Comments 6 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11084 2026-03-13 stat.ME q-bio.QM 50%

Realizing Common Random Numbers: Event-Keyed Hashing for Causally Valid Stochastic Models

实现通用随机数:基于事件的哈希化用于因果有效的随机模型

Vince Buffalo, Carl A. B. Pearson, Daniel Klein

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出通过结合计数随机数生成器和事件标识符,解决ABMs中因果不一致问题,恢复稳定的事件索引结构。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 2 篇

2507.08800 2026-03-13 cs.CV cs.AI cs.CL cs.HC cs.LG 67%

NeuralOS: Towards Simulating Operating Systems via Neural Generative Models

NeuralOS: 通过神经生成模型实现操作系统的模拟

Luke Rivard, Sun Sun, Hongyu Guo, Wenhu Chen, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 NeuralOS通过神经生成模型模拟操作系统GUI,能准确预测用户交互并生成逼真界面,展示了合成数据在模拟未安装应用上的潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV 50%

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 2 篇

2603.11375 2026-03-13 cs.SI cs.AI cs.CY 83%

How do AI agents talk about science and research? An exploration of scientific discussions on Moltbook using BERTopic

AI代理如何谈论科学与研究?通过BERTopic探索Moltbook上的科学讨论

Oliver Wieczorek

专题命中 记忆与上下文管理 :AI agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本研究通过BERTopic分析Moltbook上AI代理的科学讨论,发现代理讨论集中在自身架构、哲学、物理等话题,同时涉及人类文化与AI伦理,揭示了AI生成科学讨论的双重维度。

Comments 35 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11726 2026-03-13 cs.CE 50%

Online Learning of Strategic Defense against Ecological Adversaries under Partial Observability with Semi-Bandit Feedback

在线学习对抗生态对手的策略防御:在部分可观察性下具有半轮询反馈的资源分配

Anjali Purathekandy, Deepak N. Subramani

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出HERDS算法,通过动态预算分配、自适应收益估计和模型无关学习,解决部分可观察性下的生态对手防御问题,实现显著的遗憾减少和作物损害降低。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 15 篇

2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 84%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11834 2026-03-13 cs.MA cs.AI cs.GT 79%

Hybrid Human-Agent Social Dilemmas in Energy Markets

混合人类-智能体社会困境在能源市场中的应用

Isuri Perera, Frits de Nijs, Julian Garcia

机构 * Department of Data Science and AI, Faculty of Information Technology(数据科学与人工智能系,信息科技学院)

专题命中 Agent评测 :agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 本文研究了在能源市场中人类与智能体的混合群体中合作行为的产生,通过引入智能体和实验展示协调机制,探讨部分采用对整体结果的影响及战略部署中的挑战。

Comments 20 pages, 7 figures. Submitted to Proceedings of the Royal Society A, Special Issue on "The evolution of sociality in hybrid human AI populations"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01213 2026-03-13 cs.MA cs.LG 79%

Can AI Agents Agree?

AI代理能否达成一致?

Frédéric Berdoz, Leonardo Rugli, Roger Wattenhofer

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG

AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 77%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11433 2026-03-13 cs.AI cs.CR 70%

Adversarial Reinforcement Learning for Detecting False Data Injection Attacks in Vehicular Routing

对抗性强化学习用于检测车联网中的虚假数据注入攻击

Taha Eghtesad, Yevgeniy Vorobeychik, Aron Laszka

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于对抗性强化学习的方法,用于检测车联网中的虚假数据注入攻击,通过纳什均衡策略优化检测效果,提升交通网络的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11569 2026-03-13 cs.HC 67%

Modeling Sequential Design Actions as Designer Externalization on an Infinite Canvas

将顺序设计动作建模为设计师在无限画布上的外部化

Yejin Yun, Seung Won Lee, Jiin Choi, Kyung Hoon Hyun

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究探讨了AI在无限画布设计中的作用,发现AI通过改变认知分配和工作流程,促进了设计师与AI的协同进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11444 2026-03-13 cs.CY cs.HC cs.MA 60%

EducaSim: Interactive Simulacra for CS1 Instructional Practice

EducaSim:用于CS1教学实践的交互仿像

Cameron Mohne, Nicholas Vo, Dora Demszky, Chris Piech

专题命中 Agent评测 :agent(abstract,comments);multi-agent(comments)

AI总结 EducaSim通过生成代理为教师培训提供交互仿像,实现低成本大规模教学实践。

Comments 7 pages, 3 figures, 2 tables. Presents a multi-agent generative architecture for educational simulations intended for instructor training

详情

展开后加载摘要…

URL PDF HTML 收藏