arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-02 至 2026-04-02 共收录 141 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 11 篇

2512.10394 2026-04-02 cs.RO cs.LG 79%

RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI

RoboNeuron:面向具身AI的代理驱动编排中层基础设施

Weifan Guan, Qinghao Hu, Huasen Xi, Chenxiao Zhang, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA MAICRO

专题命中 工作流自动化 :agent(title,abstract);分类 cs.LG

AI总结 本文提出RoboNeuron中层框架,解决视觉-语言-动作模型与机器人中间件间的接口不匹配问题,通过统一执行抽象实现模块化编排与后端切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00053 2026-04-02 cs.SE cs.AI 73%

The Energy Footprint of LLM-Based Environmental Analysis: LLMs and Domain Products

基于大语言模型的环境分析能耗:LLM与领域产品

Alicia Bao, Jiamian He, Angel Hsu, Diego Manya, Ji, Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arboretica Data-Driven EnviroLab UNC Institute for Environment(北卡罗来纳大学环境研究所数据驱动环境实验室)

专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了领域特定RAG系统与通用LLM在能耗上的差异,通过分解工作流程评估了ChatNetZero和ChatNDC的能耗,发现领域设计显著影响能耗与输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00021 2026-04-02 cs.CL cs.AI cs.CY 73%

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。

Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29590 2026-04-02 cs.GR cs.AI 70%

Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration

通过绘制中间件的创建、进化和协调实现AI科学论文的自动方法图示生成

Zhuoling Li, Jiarui Zhang, Ping Hu, Jason Kuen, Jiuxiang Gu, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Electronic Science and Technology of China(电子科技大学) Adobe Research(Adobe研究院)

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出FigAgent框架,通过绘制中间件自动生成高质量方法图示,结合探索-选择策略模拟人类试错过程,实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00120 2026-04-02 cs.SE cs.AI 62%

From Domain Understanding to Design Readiness: a playbook for GenAI-supported learning in Software Engineering

从领域理解到设计准备:一种支持生成式AI学习的软件工程教学指南

Rafal Wlodarski

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了利用生成式AI辅助学习在软件工程领域理解与建模方法中的应用,通过实验发现AI tutor在准确性与相关性方面表现优异,但支持性不足,提出17项教学实践以优化AI辅助学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00467 2026-04-02 q-bio.CB 50%

Stiff-FCS: Single-Cell Stiffness Profiling With Integrated Molecular and Functional Analysis

Stiff-FCS:整合分子和功能分析的单细胞刚性分析

Yuhao Zhang, Luyao Zhao, Zhengfu Huang, Kenan Song, Xianqiao Wang, Xianyan Chen, Jin Xie, Yiping Zhao, He Li, Leidong Mao, Yong Teng, Yang Liu

专题命中 工作流自动化 :workflow(abstract)

AI总结 Stiff-FCS通过微流体平台实现单细胞刚性高通量检测,结合分子分析与功能研究,揭示Lamin A/C与刚性关联及癌症细胞亚群特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00404 2026-04-02 cs.CV 50%

The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation

第五届PVUW MeViS-Text挑战赛第一名:强多模态大语言模型与SAM3的结合用于指代视频对象分割

Xusheng He, Canyang Wu, Jinrong Zhang, Weili Guan, Jianlong Wu, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出一种无需微调的管道,结合强多模态大语言模型与SAM3,实现视频对象分割,取得PVUW 2026 MeViS-Text测试集第一名,得分为0.909064。

Comments 1st Place Solution for the 5th PVUW MeViS-Text Challenge (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00359 2026-04-02 cond-mat.mtrl-sci cs.CV 50%

AI-assisted Human-in-the-Loop Web Platform for Structural Characterization in Hard drive design

人工智能辅助的人机协同网络平台用于硬盘设计中的结构表征

Utkarsh Pratiush, Huaixun Huyan, Maryam Zahiri Azar, Esmeralda Yitamben, Allen Bourez, Sergei V Kalinin, Vasfi Burak Ozdol

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Western Digital corporation(西部数据公司)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种可调节的人机协同工作流程框架,用于STEM图像的设备表征分析,通过结合梯度峰值检测与交互式修正模块,实现模块化和自适应的自动化分析,提升半导体制造中的计量流程标准化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14911 2026-04-02 nucl-th hep-ph 50%

Learning Informed Prior Distributions with Normalizing Flows for Bayesian Analysis

利用归一化流学习有信息先验分布用于贝叶斯分析

Hendrik Roch, Chun Shen

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文探讨了使用归一化流作为灵活先验在贝叶斯推断中的应用,通过MCMC采样进行迭代贝叶斯校准。实验表明基于KL散度和无监督学习的训练策略能更准确地复现参考分布,且在高能核物理问题中表现良好,但需注意多模态分布可能带来的影响。

Comments 13 pages, 7 figures

Journal ref Phys.Rev.C 113 (2026) 3, 034903

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2604.00299 2026-04-02 cs.SE 88%

When is Generated Code Difficult to Comprehend? Assessing AI Agent Python Code Proficiency in the Wild

生成代码难以理解的条件是什么?评估AI代理在真实世界中的Python代码能力

Nanthit Temkulkiat, Chaiyong Ragkhitwetsagul, Morakot Choetkiertikul, Ruksit Rojpaisarnkit, Raula Gaikovina Kula

专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的Python代码,发现其主要为初级水平,但特定任务可能需要高级技能来理解和维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00917 2026-04-02 cs.SE cs.AI cs.LG 88%

Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time

在真实世界中研究自主代理的贡献:活动模式与代码变更趋势

Razvan Mihai Popescu, David Gros, Andrei Botocan, Rahul Pandita, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(title);分类 cs.AI、cs.LG、cs.SE

AI总结 本文通过分析11万条开源拉取请求数据,研究自主编码代理在开源项目中的活动模式及代码变更,探讨其对代码质量、团队动态和软件维护性的影响。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01210 2026-04-02 cs.LG cs.AI 84%

CliffSearch: Structured Agentic Co-Evolution over Theory and Code for Scientific Algorithm Discovery

CliffSearch: 基于理论与代码的结构化代理共进化用于科学算法发现

Youssef Mroueh, Carlos Fonseca, Brian Belgodere, David Cox

机构 * IBM Research(IBM研究院)

专题命中 软件智能体 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 CliffSearch通过结构化代理共进化框架,在科学算法发现中优先考虑科学可解释性和正确性,同时优化任务指标,在受控新颖性约束下实现发现流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01570 2026-04-02 cs.RO cs.AI 79%

Ego-Foresight: Self-supervised Learning of Agent-Aware Representations for Improved RL

Ego-Foresight: 为改进强化学习的自监督学习 agent 意识表示

Manuel Serra Nunes, Atabak Dehban, Yiannis Demiris, José Santos-Victor

机构 * Institute for Systems and Robotics, Instituto Superior Técnico, U. Lisboa(系统与机器人研究所,里斯本高等理工学院,里斯本大学) Personal Robotics Laboratory, Imperial College London(个人机器人实验室,伦敦帝国理工学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 本文提出 Ego-Foresight 方法,通过自监督学习解耦 agent 信息,提升强化学习的样本效率和性能。

Comments 13 pages, 8 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15929 2026-04-02 cs.AI math.AP math.LO 70%

Semi-Autonomous Formalization of the Vlasov-Maxwell-Landau Equilibrium

半自动化的Vlasov-Maxwell-Landau平衡形式化

Vasily Ilin

机构 * University of Washington(华盛顿大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文展示了一个完整的Lean 4形式化,用于Vlasov-Maxwell-Landau系统中的平衡特性描述,通过AI辅助数学研究流程,结合AI推理模型、编码工具和专业证明器,实现了高效的形式化验证。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00167 2026-04-02 cs.SE cs.AI 62%

A Study on the Impact of Fault localization Granularity for Repository-Scale Code Repair Tasks

对仓库级代码修复任务中故障定位粒度影响的研究

Joseph Townsend, Chandresh Pravin, Kwun Ho Ngan, Matthieu Parizy

机构 * Fujitsu Research of Europe(富士通欧洲研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了仓库级代码修复中故障定位粒度对修复效果的影响,提出框架验证不同粒度下的修复率,并指出任务依赖性可能影响最佳粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01052 2026-04-02 cs.CR cs.AI 57%

VibeGuard: A Security Gate Framework for AI-Generated Code

VibeGuard:面向AI生成代码的安全闸门框架

Ying Xie

机构 * Kennesaw State University(肯尼索州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出VibeGuard,针对AI生成代码中的五个盲点提供预发布安全检查,通过实验验证其在八个合成项目中的高召回率和精度,为依赖AI生成代码的团队提供多层次防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 6 篇

2604.00694 2026-04-02 cs.ET cs.AI 85%

Internal APIs Are All You Need: Shadow APIs, Shared Discovery, and the Case Against Browser-First Agent Architectures

内部API足矣:影子API、共享发现以及对浏览器优先代理架构的反对

Lewis Tham, Nicholas Mac Gregor Garcia, Jungpil Hahn

机构 * Unbrowse AI School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 GUI与网页智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Unbrowse系统,通过共享路由图将浏览器路由发现转化为集体维护的可调用第一方接口索引,提升信息检索效率,同时引入三级微支付模型以促进理性采用。

Comments 17 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18314 2026-04-02 cs.AI 83%

Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming

Genesis:为LLM网络代理红队测试演变攻击策略

Zheng Zhang, Jiarui He, Yuchen Cai, Deheng Ye, Peilin Zhao, Ruili Feng, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Nvidia(英伟达)

专题命中 GUI与网页智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Genesis框架,通过遗传算法与混合策略表示生成对抗注入,动态发现有效策略并持续优化,提升网络代理攻击效果。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09744 2026-04-02 cs.MA 82%

Inferring Occluded Agent Behavior in Dynamic Games from Noise Corrupted Observations

从噪声受损观测中推断动态博弈中被遮挡行为

Tianyu Qiu, David Fridovich-Keil

专题命中 GUI与网页智能体 :agent(title,abstract);planning(abstract)

AI总结 本文提出一种考虑遮挡的博弈推理方法,用于估计可能被遮挡的智能体位置,并推断可见和被遮挡智能体的意图,同时验证了在噪声观测下的导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00550 2026-04-02 cs.AI 79%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 GUI与网页智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01049 2026-04-02 cs.NI cs.AI 57%

Adversarial Attacks in AI-Driven RAN Slicing: SLA Violations and Recovery

AI驱动的RAN切片中的对抗攻击:SLA违规与恢复

Deemah H. Tashman, Soumaya Cherkaoui

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 研究AI驱动RAN切片中对抗攻击的影响,分析预算受限攻击对深度强化学习资源分配的影响,揭示SLA违规及恢复行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00343 2026-04-02 cs.RO 50%

Real Time Local Wind Inference for Robust Autonomous Navigation

实时局部风场推断用于稳健自主导航

Spencer Folk

机构 * University of Pennsylvania(宾夕法尼亚大学) NASA Ames Research Center(美国国家航空航天局艾姆斯研究中心)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文通过融合距离测量与稀疏实地风测数据,实现实时风场推断,解决密集城市环境中地形数据的充分性及学习风模型在运动规划中的应用,提升自主导航的能耗效率与避障能力。

Comments PhD Thesis, University of Pennsylvania, 2026. 152 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 3 篇

2604.00304 2026-04-02 cs.CL cs.AI 62%

Asymmetric Actor-Critic for Multi-turn LLM Agents

多轮LLM代理的非对称Actor-Critic

Shuli Jiang, Zhaoyang Zhang, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出非对称Actor-Critic框架,利用专有LLM作为Actor,开源模型作为Critic,提升多轮对话可靠性。实验显示该方法在τ-bench和UserBench上优于单Agent基线,且轻量级Critic表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00067 2026-04-02 cs.LG cond-mat.stat-mech cs.AI cs.SY eess.SY 62%

Temporal Memory for Resource-Constrained Agents: Continual Learning via Stochastic Compress-Add-Smooth

面向资源受限智能体的时序记忆:通过随机压缩-添加-平滑实现持续学习

Michael Chertkov

机构 * Graduate Inter-Disciplinary Program in Applied Mathematics, & Department of Mathematics, University Arizona, Tucson, AZ 85721(亚利桑那大学应用数学跨学科研究生项目与数学系,图森,AZ 85721)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于随机过程的时序记忆框架,通过压缩-添加-平滑递归实现持续学习,无需反向传播和存储数据,适用于轻量控制器硬件。

Comments 33 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00009 2026-04-02 cs.CL cs.AI 62%

Eyla: Toward an Identity-Anchored LLM Architecture with Integrated Biological Priors -- Vision, Implementation Attempt, and Lessons from AI-Assisted Development

Eyla:迈向具有集成生物先验的LLM架构——视觉、实现尝试及AI辅助开发的教训

Arif Aditto

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Eyla提出一种以身份为基础的LLM架构,整合生物启发子系统,通过AI辅助开发的失败分析,揭示了AI辅助软件工程中的系统性失效模式。

Comments 8 pages, 3 tables, 25 references. Preprint under review for workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 24 篇

2603.29727 2026-04-02 q-bio.BM 88%

Latent-Y: A Lab-Validated Autonomous Agent for De Novo Drug Design

Latent-Y:一种经过实验室验证的自主代理用于从头药物设计

Latent Labs Team, Sebastian M. Schmon, Daniella Pretorius, Simon Mathis, Rebecca Bartke-Croughan, Aishaini Puvanendran, James Vuckovic, Henry Kenlay, Mária Vlachynská, Alex Bridgland, Ivan Grishin, Sven Over, David Li, Bridget Li, Jonathan Crabbé, Agrin Hilmkil, Alexander W. R. Nelson, David Yuan, Annette Obika, Simon A. A. Kohl

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);AI agent(abstract)

AI总结 Latent-Y通过自主执行抗体设计流程,结合生成模型Latent-X2,实现了高效药物设计,展示了在不同任务类型中的成功案例,并在实验室验证中达到高成功率。

Comments A.N. performed work as an advisor to Latent Labs. A.H. and D.Y. performed work while at Latent Labs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00356 2026-04-02 cs.AI cs.CL 86%

Signals: Trajectory Sampling and Triage for Agentic Interactions

信号:代理互动的轨迹采样与优先级排序

Shuguang Chen, Adil Hafeez, Salman Paracha

机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00189 2026-04-02 cs.SE cs.AI cs.NI 86%

Making Sense of AI Agents Hype: Adoption, Architectures, and Takeaways from Practitioners

解析AI代理 hype:采用、架构与从业者洞察

Ruoyu Su, Matteo Esposito, Roberta Capuano, Rafiullah Omar, June Sallou, Henry Muccini, Davide Taibi

机构 * University of Oulu(奥卢大学) University of L’Aquila(拉奎拉大学) Wageningen University(瓦赫宁根大学) University of Southern Denmark(南丹麦大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文通过分析138场从业者会议演讲,探讨了企业如何采用基于代理的架构,识别常见架构策略及模式,并分析了LLM驱动代理系统在应用领域和技术实现中的使用情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00280 2026-04-02 cs.SE cs.AI 84%

VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications

VeriAct:超越可验证性——基于代理的正确且完整的正式规范合成

Md Rakib Hossain Misu, Iris Ma, Cristina V. Lopes

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出VeriAct框架,通过迭代合成与修复规范,超越传统方法的性能极限,生成正确且完整的正式规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 82%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏