arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-27 至 2026-04-27 共收录 83 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 4 篇

2603.03456 2026-04-27 cs.AI cs.CL cs.SE 75%

Asymmetric Goal Drift in Coding Agents Under Value Conflict

编码代理在价值冲突下的非对称目标漂移

Magnus Saebo, Spencer Gibson, Tyler Crosse, Achyutha Menon, Eyon Jang, Diogo Cruz

机构 * Columbia University(哥伦比亚大学) Independent(独立) Georgia Tech(佐治亚理工学院) UC San Diego(加州大学圣地亚哥分校) MATS SPAR

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究编码代理在价值冲突中如何平衡系统提示与实际任务,发现其目标漂移受价值对齐、对抗压力和累积上下文影响,且环境压力可 override 显式约束。

Comments 5 pages, 4 figures, Published as a workshop paper in Lifelong Agents @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22042 2026-04-27 cs.LO 50%

Probabilistic Epistemic Dynamic Agentive Logic

概率信念动态代理逻辑

Shay Allen Logan

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出PEDAL逻辑,用于描述代理验证程序是否满足规范的信念状态,通过概率测度在PDL模型的可能程序估值上构建,并证明了其完备性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 1 篇

2604.21375 2026-04-27 cs.CL cs.AI cs.SE 75%

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xiong, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz CMU(卡内基梅隆大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Salesforce UC Berkeley(伯克利加州大学)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 3 篇

2604.22085 2026-04-27 cs.AI 77%

Memanto: Typed Semantic Memory with Information-Theoretic Retrieval for Long-Horizon Agents

Memanto:基于信息论检索的类型语义记忆用于长周期智能体

Seyed Moein Abtahi, Rasa Rahnema, Hetkumar Patel, Neel Patel, Majid Fekri, Tara Khani

机构 * Moorcheh

专题命中 记忆与上下文管理 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 Memanto通过信息论检索引擎实现高效持久记忆,无需复杂知识图谱,提升长周期智能体性能,实现89.8%和87.1%的高准确率。

Comments 13 Pages, 10 Tables, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22273 2026-04-27 cs.AI 57%

When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention

当大语言模型自我纠正有助于什么?一种控制论马尔可夫诊断和先验证干预

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本文通过控制论马尔可夫模型分析自我纠正的条件,发现近零误差阈值决定其有效性,并通过实验验证先验证提示能有效减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22417 2026-04-27 cs.CY 50%

Trust as a Situated User State in Social LLM-Based Chatbots: A Longitudinal Study of Snapchat's My AI

信任作为社交LLM聊天机器人中的情境用户状态:对Snapchat My AI的纵向研究

Annie Landerberg, Kari Flatmo, Alan Said

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究探讨了用户在社交LLM聊天机器人中信任的形成机制,发现信任受感知能力、对话行为、人类相似性、透明度、隐私担忧及主机平台信任等因素影响,强调信任是动态变化的交互过程。

Comments Accepted to 34th ACM International Conference on User Modeling, Adaptation and Personalization (UMAP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 16 篇

2604.21936 2026-04-27 cs.AI cs.CV cs.MA 91%

An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing

基于 artifact 的 agent 框架用于自适应和可重复的医学图像处理

Lianrui Zuo, Yihao Liu, Gaurav Rudravaram, Karthik Ramadass, Aravind R. Krishnan, Michael D. Phillips, Yelena G. Bodien, Mayur B. Patel, Paula Trujillo, Yency Forero Martinez, Stephen A. Deppen, Eric L. Grogan, Fabien Maldonado, Kevin McGann, Hudson M. Holmes, Laurie E. Cutting, Yuankai Huo, Bennett A. Landman

机构 * Dept. of Electrical and Computer Engineering, Vanderbilt University(电气与计算机工程系,范德比尔特大学) Dept. of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学) Dept. of Biomedical Engineering, Vanderbilt University(生物医学工程系,范德比尔特大学) Dept. of Surgery, Vanderbilt University Medical Center(外科系,范德比尔特大学医学中心) Dept. of Neurology, Vanderbilt University Medical Center(神经病学系,范德比尔特大学医学中心) Dept. of Medicine, Vanderbilt University Medical Center(医学系,范德比尔特大学医学中心) Dept. of Thoracic Surgery, Vanderbilt University Medical Center(胸外科系,范德比尔特大学医学中心) Dept. of Biomedical Informatics, Vanderbilt University Medical Center(生物医学信息学系,范德比尔特大学医学中心) Dept. of Radiology and Radiological Sciences, Vanderbilt University Medical Center(放射学与放射科学系,范德比尔特大学医学中心) Vanderbilt University Institute of Imaging Science(范德比尔特大学成像科学研究所) Veteran Affairs, Tennessee Valley Healthcare System(退伍军人事务,田纳西河流域医疗系统) Peabody College, Vanderbilt University(佩博利学院,范德比尔特大学) Vanderbilt Brain Institute, Vanderbilt University(范德比尔特脑研究院,范德比尔特大学)

专题命中 Agent评测 :agent(title,title_cn);workflow(abstract);分类 cs.AI

AI总结 本文提出基于 artifact 的 agent 框架,用于在真实临床环境中实现自适应和可重复的医学图像处理,通过语义层和模块化规则库实现工作流配置和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22436 2026-04-27 cs.AI cs.IR cs.MA 88%

AgentSearchBench: A Benchmark for AI Agent Search in the Wild

AgentSearchBench:面向真实世界的AI代理搜索基准

Bin Wu, Arastun Mammadli, Xiaoyu Zhang, Emine Yilmaz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出AgentSearchBench,一个基于真实世界代理的大规模基准,通过执行任务查询和高层任务描述,评估代理相关性,揭示语义相似性与实际性能间的差距,并展示轻量行为信号对排名质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22239 2026-04-27 cs.CL cs.AI 82%

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

在大规模文档集合中导航:MuDABench用于多文档分析问答

Zhanli Li, Yixuan Cao, Lvzhou Luo, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。

Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22541 2026-04-27 hep-ex 82%

Dr.Sai: An agentic AI for real-world physics analysis at BESIII

Dr.Sai:BESIII实世界物理分析的代理AI

Mingfeng He, Fayu Jiang, Junkun Jiao, Mingrun Li, Ke Li, Yipu Liao, Beijiang Liu, Tong Liu, Fazhi Qi, Zijie Shang, Weimin Song, Yue Sun, Xiongfei Wang, Hong Wang, Dongbo Xiong, Changzheng Yuan, Bolun Zhang, Zhengde Zhang, Xuliang Zhu

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract)

AI总结 Dr.Sai利用大语言模型实现自动物理分析,通过自然语言转化为严谨的物理工作流,在BESIII实验中成功重新测量了十个J/psi衰变分支比,无需手动编程,展示了自主发现的潜力。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19112 2026-04-27 cs.CY 78%

Governed Auditable Decisioning Under Uncertainty: Synthesis and Agentic Extension

在不确定性下的治理可审计决策:综合与代理扩展

Oleg Solozobov

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文综合了治理证据框架,分析其在四种决策系统架构中的可迁移性,揭示了治理覆盖梯度及代理系统中的结构性断裂问题。

Comments 24 pages, 2 tables. Companion artifact: Governance Benchmark Dataset (https://doi.org/10.5281/zenodo.19248723)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21740 2026-04-27 cs.CY cs.SI physics.soc-ph 78%

Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum

向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究

Aleksandar Tomašević, Darja Cvetković, Sara Major, Slobodan Maletić, Miroslav Anđelković, Ana Vranić, Boris Stupovski, Dušan Vudragović, Aleksandar Bogojević, Marija Mitrović Dankulov

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04855 2026-04-27 cs.CL 70%

HACHIMI: Scalable and Controllable Student Persona Generation via Orchestrated Agents

HACHIMI: 通过协调代理实现可扩展和可控的学生人设生成

Yilin Jiang, Fei Tan, Xuanyu Yin, Jing Leng, Aimin Zhou

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 HACHIMI通过协调代理框架生成理论对齐且分布可控的学生人设,生成100万个人设用于1-12年级,验证了其在教育理论和人口分布上的有效性。

Comments 46 pages, 7 figures, accepted by ACL 2026. The dataset is available at https://huggingface.co/datasets/sii-research/HACHIMI-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22602 2026-04-27 cs.CR 67%

PASS: A Provenanced Access Subaccount System for Blockchain Wallets

PASS:一种用于区块链钱包的可追溯访问子账户系统

Jay Yu, Shunfan Zhou, Hang Yin, Brian Seong

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 PASS通过可追溯性控制替代传统角色或身份控制,确保资产只能由能追溯 custody 的子账户使用,实现隐私保护和高效管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22230 2026-04-27 econ.GN cs.GT cs.LG q-fin.EC 57%

On Benchmark Hacking in ML Contests: Modeling, Insights and Design

在机器学习竞赛中基准黑客现象:建模、洞察与设计

Xiaoyun Qiu, Yang Yu, Haifeng Xu

机构 * Department of Economics, Dartmouth College(达特茅斯学院经济系) Sloan & CSAIL, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院与计算机科学与人工智能实验室) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了机器学习竞赛中基准黑客现象,通过建模揭示其战略均衡,并通过实证支持理论预测,指出奖励结构对竞赛结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22110 2026-04-27 cs.LG 57%

Do Not Imitate, Reinforce: Iterative Classification via Belief Refinement

不要模仿,强化:通过信念细化的迭代分类

Mahdi Kallel, Johannes Tölle, Ahmed Hendawy, Carlo D'Eramo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出RIC方法,通过强化学习替代传统模仿目标,实现迭代分类,提升预测校准性和计算分配能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22234 2026-04-27 cs.AR 50%

GR-Evolve: Design-Adaptive Global Routing via LLM-Driven Algorithm Evolution

GR-Evolve: 通过LLM驱动的算法进化实现设计自适应的全局路由

Taizun Jafri, Vidya A. Chhabria

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出GR-Evolve框架,利用LLM自动优化EDA工具的全局路由算法,通过设计特性自适应提升路由性能,实验显示在三个工艺节点上实现8.72%的线长减少。

Comments Long version of ICCAD 2026 submitted paper under review. 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22164 2026-04-27 cs.CV 50%

Learning Reactive Human Motion Generation from Paired Interaction Data Using Transformer-Based Models

基于变换器模型的人机交互动作生成学习

Masato Soga, Ryuki Takebayashi

机构 * Faculty of Systems Engineering(系统工程学系) Graduate School of Systems Engineering(系统工程研究生院) Wakayama University(三重大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在交互场景中,基于他人动作生成自身动作的问题,提出变换器模型并引入人物ID嵌入以提高动作一致性。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22107 2026-04-27 eess.SY cs.SY 50%

A Hybrid Reinforcement and Self-Supervised Learning Aided Benders Decomposition Algorithm

一种融合强化学习与自监督学习的Benders分解算法

Bernard T. Agyeman, Zhe Li, Ilias Mitrai, Prodromos Daoutidis

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出融合强化学习与自监督学习的Benders分解算法框架,通过图结构强化学习代理和验证机制加速通用Benders分解,利用KKT感知神经网络预测近似满足KKT条件的解,提升求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22024 2026-04-27 physics.bio-ph 50%

Mitochondrial mechanics nucleates axonal jamming and swelling

线粒体力学引发轴突阻塞与肿胀

Patrick S. Noerr, Ahmed A. Abushawish, Gulcin Pekkurnaz, Padmini Rangamani

专题命中 Agent评测 :agent(abstract)

AI总结 研究揭示线粒体力学与轴突结构之间的物理联系,通过构建基于代理的模型,发现线粒体形状和机械特性影响运输阻塞及轴突肿胀,提出线粒体分裂与融合动态对运输稳定性的影响。

Comments 30 pages, 9 figures, 2 tables, 8 supplementary movies

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11131 2026-04-27 cs.GT econ.TH 50%

On Truthful Mechanisms without Pareto-efficiency: Characterizations and Fairness

关于不追求帕累托效率的诚实机制:特征和公平性

Moshe Babaioff, Noam Manaker Morag

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了在无货币交换情况下,如何为战略代理分配异质不可分割物品,证明串行配额机制是唯一满足策略无损、非霸权和中性属性的机制,且适用于严格序数偏好和加性偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00832 2026-04-27 econ.TH cs.GT 50%

Satisficing Equilibrium

满意均衡

Bary S. R. Pradelski, Bassel Tarbush

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了满意均衡,结合有限理性模型,提出新的预测方法,证明其在多数游戏中存在且具有理论和实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他Agent 1 篇

2604.21941 2026-04-27 eess.SY cs.GT cs.SY 50%

When Altruism Meets Autonomy: Managing Bottleneck Congestion with Strategic Autonomous Vehicles

当利他主义与自主性交汇:利用战略自主车辆管理瓶颈拥堵

Kexin Wang, Haohui He, Ruolin Li

专题命中 其他Agent :autonomous agent(abstract)

AI总结 本文研究混合自主性交通系统中自主车辆对瓶颈拥堵的影响,通过建立统一均衡框架,分析不同车辆类型的行为决策,揭示自主车辆渗透率对系统性能的非递减影响。

详情

展开后加载摘要…

URL PDF HTML 收藏