arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-04 至 2026-05-04 共收录 97 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 13 篇

2605.00428 2026-05-04 stat.ME cs.PF cs.SY eess.SY 50%

How to Do Statistical Evaluations in ECE/CS Papers: A Practical Playbook for Defensible Results

如何在ECE/CS论文中进行统计评估:可辩护结果的实用指南

Bhaskar Krishnamachari

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提供了一套实用流程,帮助研究人员在系统、网络和应用机器学习领域进行可靠的实验评估,涵盖从假设检验到可重复性验证的完整方法。

Comments 30 pages, 8 figures; Tutorial paper; companion student workbook and claude skill available as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00340 2026-05-04 econ.GN q-fin.EC 50%

RSDM: The Consensus Honest Money in the AI Era

RSDM:人工智能时代中的共识诚实货币

Boliang Lin, Ruixi Lin

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出RSDM框架,旨在解决人工智能时代跨境资本池和资产配置中货币贬值问题,通过tokenized commodity money实现长期价值存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00158 2026-05-04 math.OC cs.GT cs.SY eess.SY 50%

Moral Hazard in LTI Dynamics: A Hypothesis Testing Approach

LTI动态中的道德风险:假设检验方法

Jaewon Jeong, Pan-Yang Su, S. Shankar Sastry, Anil Aswani

专题命中 工作流自动化 :agent(abstract)

AI总结 本文研究了在信息不对称条件下设计控制系统的激励机制,通过假设检验方法确定最优支付方案以激励代理选择最小化二次成本的控制器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00147 2026-05-04 cs.CV 50%

From Images2Mesh: A 3D Surface Reconstruction Pipeline for Non-Cooperative Space Objects

从图像到网格:一种用于非合作空间物体的3D表面重建流水线

Bala Prenith Reddy Gopu, Patrick Quinn, George M. Nehma, Madhur Tiwari, Matt Ueckermann, David Hinckley, Christopher McKenna

机构 * Department of Aerospace, Physics and Space Sciences, Florida Institute of Technology(航空航天物理与空间科学系,佛罗里达理工学院)

专题命中 工作流自动化 :planning(abstract)

AI总结 本文提出了一种基于单目图像的神经隐式表面重建流水线,用于非合作空间物体的在轨检查影像处理,解决了真实场景中背景分割和光照校正的问题。

Comments 25 Pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00027 2026-05-04 physics.chem-ph physics.bio-ph quant-ph 50%

Non-Equilibrium Dynamics of the Time-Dependent Excitonic Coupling in Fluorescent Protein Dimers

非平衡动力学:荧光蛋白二聚体中时间依赖性激子耦合

Robson Christie, Cerys Murray, Youngchan Kim, Jaewoo Joo

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究通过量子-经典混合方法量化荧光蛋白二聚体中的激子耦合,发现近场多极效应在27.6Å距离下起关键作用,且时间尺度分离缓解了实验与生物环境之间的理论矛盾。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11218 2026-05-04 cs.HC 50%

Video Game Accessibility through Shared Control for People with Upper-Limb Impairments

通过共享控制提升视频游戏可及性:为上肢障碍者设计

Dragan Ahmetovic, Matteo Manzoni, Filippo Corti, Sergio Mascetti

专题命中 工作流自动化 :agent(abstract)

AI总结 研究探讨了上肢障碍者通过共享控制与协作者协作或部分自动化技术进行视频游戏互动的可行性与效果。

Comments 23 pages (excluding references and appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2603.25719 2026-05-04 cs.AI cs.AR cs.LG 81%

Agent Factories for High Level Synthesis: How Far Can General-Purpose Coding Agents Go in Hardware Optimization?

用于高级综合的代理工厂:通用编程代理在硬件优化中能走多远?

Abhishek Bhandwaldar, Mihir Choudhury, Ruchir Puri, Akash Srivastava

机构 * IBM Corporation(IBM公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究通用编程代理在无硬件特定训练下优化硬件设计的能力,提出代理工厂流程,通过分阶段优化子内核并协调多个自主优化代理,实现全局优化,实验显示代理数量增加可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00803 2026-05-04 cs.SE cs.AI cs.CL 80%

Can Coding Agents Reproduce Findings in Computational Materials Science?

编码代理能否在计算材料科学中复现研究成果?

Ziyang Huang, Yi Cao, Ali K. Shargh, Jing Luo, Ruidong Mei, Mohd Zaki, Zhan Liu, Wyatt Bunstine, William Jurayj, Somdatta Goswami, Tyrel McQueen, Michael Shields, Jaafar El-Awady, Paulette Clancy, Benjamin Van Durme, Nicholas Andrews, William Walden, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究探讨编码代理在计算材料科学领域复现研究结果的能力,提出AutoMat基准测试,发现当前LLM代理在复现复杂科学流程时表现有限,存在流程不完整、方法偏差等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10652 2026-05-04 cs.HC cs.AI cs.CY cs.ET 57%

Vibe Coding in Product Teams: Reconfiguring AI-Assisted Workflows, Prototyping, and Collaboration

产品团队中的Vibe编码:重新配置AI辅助的工作流、原型设计与协作

Jie Li, Youyang Hou, Laura Lin, Ruihao Zhu, Hancheng Cao, Abdallah El Ali

机构 * Netherlands and MIT Media Lab(荷兰和MIT媒体实验室) Notion Labs(Notion实验室) Collov AI Cornell University(康奈尔大学) Goizueta Business School, Emory University(埃默里大学戈伊兹埃塔商学院) Centrum Wiskunde & Informatica, The Netherlands and Utrecht University, The Netherlands(荷兰代尔夫特理工大学和乌得勒支大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文研究Vibe编码如何重塑产品开发流程与协作,揭示其四阶段工作流及带来的效率与创造力提升,同时指出代码不可靠、集成困难等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00405 2026-05-04 cs.CV 50%

BOLT: Online Lightweight Adaptation for Preparation-Free Heterogeneous Cooperative Perception

BOLT:面向无准备异构协作感知的在线轻量适应

Kang Yang, Tianci Bu, Peng Wang, Deying Li, Yongcai Wang

机构 * Renmin University of China(中国人民大学) National University of Defense Technology(国防科技大学)

专题命中 软件智能体 :agent(abstract)

AI总结 本研究提出BOLT模块,通过 ego-as-teacher 蒸馏实现在线特征域对齐,无需预训练协调,在无准备场景下提升AP@50达32.3点,优于 ego-only 结果。

Comments 21 pages, 10 figures, 10tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 2 篇

2604.23455 2026-05-04 cs.SE 83%

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

CUJBench:跨模态故障诊断的LLM-代理基准测试

Haoming Meng

专题命中 GUI与网页智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。

Comments 10 pages, 1 figure; updated source code url

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00551 2026-05-04 cs.CL cs.AI 81%

A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction

A11y-Compressor:通过视觉上下文重建和冗余减少提升GUI代理观察效率的框架

Michito Takeshita, Takuro Kawada, Takumi Ohashi, Shunsuke Kitada, Hitoshi Iyatomi

机构 * Hosei University(Hosei大学)

专题命中 GUI与网页智能体 :agent(title);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出A11y-Compressor框架,通过视觉上下文重建和冗余减少技术,将线性化可访问性树转换为紧凑结构化表示,实验表明其在OSWorld基准测试中将输入token减少至原22%,任务成功率提升5.1个百分点。

Comments 18 pages, 5 figures, 5 tables. Accepted to ACL SRW 2026. Project page: https://iyatomilab.github.io/a11y-compressor/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 5 篇

2510.19897 2026-05-04 cs.CL cs.AI cs.LG 78%

Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation

通过语义和事件记忆学习:一种反思式智能体适应方法

Jackson Hassell, Dan Zhang, Hannah Kim, Tom Mitchell, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种基于记忆增强的框架,利用预训练大语言模型生成的批判性反馈,通过语义和事件记忆提升智能体适应能力,实验证明其在多个任务中有效。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00034 2026-05-04 cs.CR cs.PL cs.SE 70%

Symbolic Execution Meets Multi-LLM Orchestration: Detecting Memory Vulnerabilities in Incomplete Rust CVE Snippets

符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞

Zeyad Abdelrazek, Young Lee

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.SE

AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。

Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00393 2026-05-04 cs.LG 57%

Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation

基于双 oracle 效率的模型驱动强化学习:在策略优化和离线估计中的应用

Haichen Hu, Jian Qian, David Simchi-Levi

机构 * Laboratory for Information and Decision Systems(信息与决策系统实验室) Massachusetts Institute of Technology(麻省理工学院) The University of Hong Kong(香港大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种新的算法,通过 log-barrier 和 log-determinant 正则化,在离线 oracle 效率的 episodic RL 中实现最优 regret 绑定,且 oracle 复杂度与状态和动作空间大小无关,适用于大规模和连续环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23557 2026-05-04 stat.ML cs.LG 57%

Minimizing Human Intervention in Online Classification

在在线分类中最小化人类干预

William Réveillard, Vasileios Saketos, Alexandre Proutiere, Richard Combes

机构 * KTH Royal Institute of Technology(皇家理工学院) Univ. Paris-Saclay, CNRS, CentraleSupélec(巴黎-萨克雷大学、国家科学研究中心、中央超导实验室)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文研究了在主动学习框架下,如何通过保守包络分类器(CHC)和通用包络分类器(GHC)在不同条件下最小化人类干预,同时保证误差保障。

Comments 53 pages, 10 figures. AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00160 2026-05-04 math.OC math.PR 50%

Approximations and Learning for Decentralized Stochastic Control and Near Optimal Finite Window Policies

近似与学习用于去中心化随机控制及近最优有限窗口策略

Omar Mrani-Zentar, Serdar Yuksel

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究去中心化随机控制问题,提出在一般标准Borel空间下,通过有限窗口信息策略实现近最优局部策略,并证明其稳定性条件及Q学习算法的收敛性。

Comments arXiv admin note: text overlap with arXiv:2408.13828

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 20 篇

2505.23723 2026-05-04 cs.CL cs.AI cs.LG 91%

ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering

ML-Agent: 通过强化学习增强大语言模型代理以实现自主机器学习工程

Zexi Liu, Jingyi Chai, Xinyu Zhu, Shuo Tang, Rui Ye, Bo Zhang, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于强化学习的代理机器学习框架,通过探索增强微调、分步强化学习和专用奖励模块,训练出性能媲美大模型但成本更低的ML-Agent,实现跨任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18829 2026-05-04 cs.CR cs.AI 86%

Agent Control Protocol: Admission Control for Agent Actions

代理控制协议:代理行为的准入控制

Marcelo Fernandez

机构 * TraslaIA

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。

Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19932 2026-05-04 cs.AI 85%

CASE: An Agentic AI Framework for Enhancing Scam Intelligence in Digital Payments

CASE:一种增强数字支付中诈骗情报的代理AI框架

Nitish Jaipuria, Lorenzo Gatto, Zijun Kan, Shankey Poddar, Bill Cheung, Diksha Bansal, Ramanan Balakrishnan, Aviral Suri, Jose Estevez

机构 * Google, Inc(谷歌公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CASE框架,通过收集和管理用户诈骗反馈,提升诈骗识别能力,实现在数字支付中21%的欺诈打击提升。

Comments 7 pages, 5 figures, Version published in IEEE Xplore

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 2177-2183

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28139 2026-05-04 cs.SE cs.AI 84%

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准

Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Xiamen University(厦门大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。

Comments Project page: https://claw-eval-live.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00073 2026-05-04 cs.AI 83%

AgentReputation: A Decentralized Agentic AI Reputation Framework

AgentReputation: 一种去中心化的代理AI声誉框架

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AgentReputation框架,旨在解决去中心化代理AI市场中声誉机制失效的问题,通过分层架构和上下文感知声誉卡片实现声誉管理,同时提供风险驱动的决策引擎。

Comments 5 pages, 1 figure, accepted to FSE 2026, Ideas, Visions and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10887 2026-05-04 cs.AI 83%

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

InfantAgent-Next:一种用于自动化计算机交互的多模态通用代理

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Connecticut(康涅狄格大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Cisco Research(思科研究)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出InfantAgent-Next,一种多模态通用代理,能够通过文本、图像、音频和视频与计算机交互。该代理结合工具型和纯视觉代理,在高度模块化架构中协同解决解耦任务。在OSWorld等基准上取得7.27%准确率,超越Claude-Computer-Use。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00382 2026-05-04 cs.SE cs.AI cs.SI 82%

Social Bias in LLM-Generated Code: Benchmark and Mitigation

LLM生成代码中的社会偏见:基准测试与缓解

Fazle Rabbi, Lin Ling, Song Wang, Jinqiu Yang

机构 * Concordia University(康科德大学) Lassonde School of Engineering, York University(York大学工程学院)

专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM生成代码中的社会偏见问题,通过SocialBias-Bench基准测试发现四种主流模型存在严重偏见,提出Fairness Monitor Agent (FMA)有效降低偏见并提升代码正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 82%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00383 2026-05-04 cs.CL 79%

Agentic AI for Substance Use Education: Integrating Regulatory and Scientific Knowledge Sources

代理AI用于物质使用教育:整合监管与科学知识源

Kosar Haghani, Zahra Kolagar, Mohammed Atiquzzaman

机构 * Department of Social Science, Texas Woman's University(德克萨斯女子大学社会科学系) Department of Computer Science, Augsburg University of Applied Sciences(应用科学大学计算机科学系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出一种基于代理的AI系统,结合监管数据与科学文献,提供实时、权威的物质使用教育,通过专家评估验证其准确性与适用性。

Comments 22 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00314 2026-05-04 cs.CR cs.AI cs.PL 79%

Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

Semia:通过约束引导的表示合成审计代理技能

Hongbo Wen, Ying Li, Hanzhi Liu, Chaofan Shou, Yanju Chen, Yuan Tian, Yu Feng

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00007 2026-05-04 math.OC cs.AI stat.ML 70%

Mean-Field Path-Integral Diffusion: From Samples to Interacting Agents

均场路径积分扩散:从样本到交互代理

Michael Chertkov

机构 * Graduate Interdisciplinary Program in Applied Mathematics & Department of Mathematics, University of Arizona(应用数学联合计划与数学系,亚利桑那大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出均场路径积分扩散框架,通过共享统计量使样本协调传输概率质量,统一生成模型与多代理控制,证明在二次交互势能下,自洽引导是初始与目标均值的精确线性插值。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14201 2026-05-04 cs.CR cs.AI cs.CL 62%

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench:评估LLM代理在网络安全调查中的表现

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Security AI Research(微软安全AI研究) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 ExCyTIn-Bench是首个评估LLM代理在网络安全调查任务中的基准,通过从调查图中生成的安全问题进行测试。该基准利用Azure租户中的SQL环境和Microsoft Sentinel日志构建威胁调查图,并生成问题以评估LLM代理的能力。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00723 2026-05-04 stat.ML cs.LG math.PR 57%

Decentralized Proximal Stochastic Gradient Langevin Dynamics

去中心化近端随机梯度兰格朗日动力学

Mohammad Rafiqul Islam, Lingjiong Zhu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出去中心化近端随机梯度兰格朗日动力学算法,用于在凸域内采样对数凹概率分布。通过共享的近端正则化约束,保证更新一致性。算法在2-瓦瑟斯坦距离下具有非渐近收敛性,并在合成和真实数据集上验证了其有效性。

Comments 42 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏