arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-05 至 2026-08-05 共收录 218 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 23 篇

2608.03626 2026-08-05 cs.CR cs.AI cs.CY 新提交 70%

A Security-Oriented Lifecycle Model for Large Language Model Systems

面向大型语言模型系统的安全导向生命周期模型

Eleftherios Batzolis, George Drosatos, Vassilis Katsouros, Konstantinos Rantos

专题命中 工作流自动化 :workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。

Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03534 2026-08-05 cs.CR 新提交 67%

A Challenge-Nonce Freshness Gap in Project Veraison's TPM Reference Schemes, Found by Appraising Application-Layer Action Evidence End-to-End

通过端到端评估应用层行动证据发现Project Veraison的TPM参考方案中存在的挑战随机数新鲜度缺口

Anton Sokolov

专题命中 工作流自动化 :agent(abstract);AI agent(abstract)

AI总结 本文发现Project Veraison的TPM参考方案存在挑战随机数新鲜度缺口,通过端到端测试验证修复方案,使重放Quote的评估结果变为否定,提升了RATS架构的安全性。

Comments 18 pages, 3 figures. Responsible disclosure: veraison/services#427, fixed in PR #432. Artifact and data: doi:10.5281/zenodo.20998730

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03926 2026-08-05 cs.LG cs.AI cs.CV 新提交 62%

PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection

PRISM:用于多元异常检测的强大时间序列转图像(TS2I)表示

Mateusz Smendowski, Kamil Faber, Piotr Nawrocki, Nathalie Japkowicz, Roberto Corizzo

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 PRISM是用于多元异常检测的即插即用元工作流,通过构建基于图像的时间序列表示,在14个数据集中的10个上取得最佳VUS-PR,冻结ImageNet预训练编码器可高效迁移至TSAD,性能损失小且训练更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03913 2026-08-05 cs.LG cs.CL 新提交 62%

Sparse Weight Decomposition for Efficient Circuit Extraction

用于高效电路提取的稀疏权重分解

Chuanhao Yan, Xuhan Huang, Yawen Duan, Zhenfei Yin, Hang Zhao, Bryan Dai, Jie Fu

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 提出Sparse Weight Decomposition(SWD)方法,将预训练Transformer权重矩阵分解为稀疏因子以提供可解释电路单元,在低数据量下实现高保真电路提取,适用于多模型及全模型替换,还支持零数据变体以拓展机械可解释性分析应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02662 2026-08-05 cs.LG cs.AI 新提交 62%

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现

Farbod Faraji, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02638 2026-08-05 cs.SE cs.AI 新提交 62%

Studying, Identifying, and Fixing Hidden Technical Debt in AI-Intensive Cyber-Physical Systems

研究、识别与修复人工智能密集型网络物理系统中的隐性技术债务

Beena

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本论文针对AI密集型网络物理系统(AI-CPS)的特殊技术债务,通过分析生态系统、代码仓库及开发者访谈刻画其特征,提出识别与缓解方法,并计划开发自动化工具以监控和偿还该类技术债务。

Comments Doctoral Symposium of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03600 2026-08-05 cs.AI 新提交 57%

Large language models for partial differential equation workflows

用于偏微分方程工作流的大语言模型

Han Wan, Rui Zhang, Hao Sun

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文探讨大语言模型(LLMs)辅助偏微分方程(PDE)工作流在模型构建、求解器生成等阶段的进展,指出其受限于数据集稀缺与仿真-现实差距,是科学AI系统开发的关键试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03055 2026-08-05 cs.CV cs.CL 新提交 57%

PDD-RRG: Posterior Diagnostic Decision for Study-level Radiology Report Generation

PDD-RRG:面向研究级放射学报告生成的后验诊断决策

Yang Yu, Yiming Ji, Bin Dai, Dong Zhang, Zhiyong Zhou, Shoushan Li, Yakang Dai

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 针对现有RRG模型未充分利用检查信息、易因额外输入引发诊断错误的问题,提出PDD-RRG框架,通过多视角生成报告并聚合诊断结论,无需重训练即可提升RRG模型临床效能。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02630 2026-08-05 cs.AI cs.DB cs.PL 新提交 57%

PULSE: An Executable Contract Language for Spatiotemporal Knowledge Graph Engineering

PULSE:用于时空知识图谱工程的可执行合约语言

Dongxu Yang, Ziyi Liang

机构 * DeepLethe

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 PULSE是一种受对象-过程-方法论启发的可执行合约语言,经Lean 4等验证,在时空知识图谱工程中可实现证据约束等功能,能匹配工作流、区分变异体,在NOAA数据集上表现良好。

Comments 6 pages, 5 tables, 1 code listing; submitted to KGSWC 2026. Research artifact available under the Apache-2.0 license

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新 57%

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03670 2026-08-05 cs.CY 新提交 50%

Accountability Asymmetry and Structural Trust in Autonomous AI Systems

自主AI系统中的问责不对称性与结构性信任

Nathan DeBardeleben

专题命中 工作流自动化 :AI agent(abstract)

AI总结 本文针对自主AI系统中问责不对称导致的信任问题,提出将其治理视为基础设施可靠性问题,通过工程异质性方案,即独立监测审查补充流程,解决该问题。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03500 2026-08-05 cs.CY 新提交 50%

LLM-Assisted Review Prioritization for German Statutory Health Insurance Websites: A Multi-Stage Corpus Audit

大语言模型辅助的德国法定医疗保险网站审核优先级排序:多阶段语料审计

Martin Möller

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究针对德国法定医疗保险网站,提出一种结合多步骤的大语言模型辅助审核优先级排序工作流程,经实验验证可有效分配审核工作量,区分AI来源信号与质量声明。

Comments 31 pages, 5 figures. Also archived at Zenodo: https://doi.org/10.5281/zenodo.21738595

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03379 2026-08-05 cs.CV 新提交 50%

Residual Flow Matching with Dynamic Cross-Interaction for 3D Multi-Person Motion Prediction

面向三维多人运动预测的带动态交叉交互的残差流匹配

Wei Wei, Yinyuan Zhao, Ruixuan Yu

专题命中 工作流自动化 :agent(abstract)

AI总结 针对三维多人运动预测中流匹配的结构一致性与智能体交互问题,提出先验引导残差流匹配框架,含DCP、DCI机制和解耦关节-运动架构,在多数据集上实现最优预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03285 2026-08-05 cs.AR 新提交 50%

Fovea: Physical-Implication-Aware Wafer-Scale DSE with Decision-Domain-Guided Cross-Fidelity Refinement

Fovea:具备物理含义感知的晶圆级设计空间探索,结合决策域引导的跨保真度优化

Jinxi Li, Huizheng Wang, Jinyi Deng, Yang Hu, Shouyi Yin

专题命中 工作流自动化 :workflow(abstract)

AI总结 Fovea是一种晶圆级设计空间探索方法,通过物理含义感知的空间构建与决策域引导的跨保真度优化,在LLM训练工作负载的晶圆架构选择中实现了最优解恢复与显著加速。

Comments 13 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03179 2026-08-05 cs.CV 新提交 50%

EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation

EditFlow3D:保留轨迹的3D资产自动化局部编辑

Rui Nie, Chuang Wang, Haitao Zhou, Jiahe Song, Buyu Li, Sheng Wang, Qian Yu

专题命中 工作流自动化 :workflow(abstract)

AI总结 EditFlow3D是一种无需训练的3D局部编辑框架,通过VLM驱动工作流生成掩码与视觉引导,结合掩码引导差分流和轨迹保留技术,在新基准EditFlow-Bench上验证了其编辑准确性与非目标区域保留能力优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03668 2026-08-05 quant-ph 新提交 50%

DAMPyF: a Python implementation of the DAMPF method for the simulation of open-system dynamics

DAMPyF:用于开放系统动力学模拟的DAMPF方法的Python实现

Nicola Lorenzoni, Susana F. Huelga, Martin B. Plenio

专题命中 工作流自动化 :workflow(abstract)

AI总结 DAMPyF是DAMPF方法的开源Python实现,用于数值精确模拟与玻色环境耦合的有限维量子系统,支持激发能量转移与分子光谱计算两种工作流,本文介绍了其相关模型、算法及使用内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02418 2026-08-05 physics.plasm-ph 版本更新 50%

Direct Optimization of Stellarator Omnigenity from the Second Adiabatic Invariant

直接从第二绝热不变量优化仿星器全向性

Hanlin Chen, Zhiyuan Lu, Guosheng Xu, Shuai Cao, Yang Han, Dehong Chen, Baonian Wan

专题命中 工作流自动化 :workflow(abstract)

AI总结 该研究针对仿星器三维几何导致粒子损失的问题,提出可微框架直接优化控制粒子约束的基本轨道作用量,得到兼具多项优势的紧凑仿星器设计,实现第一性原理轨道优化与工程约束的整合。

Comments 25 pages, 13 figures. Corresponding authors: zhiyuan.lu@ipp.ac.cn, gsxu@ipp.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 15 篇

2601.19138 2026-08-05 cs.CR cs.AI cs.LG cs.SE 版本更新 90%

AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection

AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(title);agent(abstract);multi-agent(abstract)

AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02986 2026-08-05 cs.CR cs.AI cs.MA 新提交 86%

Internalising the Identity Primitive: Cryptographic Individuality for an Autonomous Agent on a Public Blockchain

内化身份基元:公有区块链上自主智能体的密码学个体性

Keisuke Suzuki

专题命中 软件智能体 :agent(title,abstract);autonomous agent(title);分类 cs.AI

AI总结 本文提出将公有区块链上自主智能体的身份密钥-权重绑定信任根转移至密码学假设,在Solana开发网部署了首个身份基元为密码学不变量的链上智能体,完成了2.36天链上运行,实例化了密码学个体性。

Comments 52 pages, 3 figures, 11 tables. Cryptographic key-to-weights binding (W = HKDF(sk) inside Groth16) with an on-chain state-commitment chain on Solana devnet; active-query, homeostatic, and economic-metabolism extensions; 166- and 168-cycle continuous runs. Code, threat model, and per-cycle telemetry: https://github.com/ksk-S/internalising-identity-2026 (tag arxiv-v1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03585 2026-08-05 cs.AI cs.CY 新提交 83%

From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities

从社交编码到智能体编码:开源社区中的生产力与关系重构

Mengying Zhou, Yongjie Yin, Yang Chen

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26275 2026-08-05 cs.CL 版本更新 83%

SPEAR: Code-Augmented Agentic Prompt Optimization

SPEAR: 代码增强的智能体提示优化

Mengyin Lu, Cong Feng, Huimin Han, Guangming Lu, Yu Sun, Xiaonan Ding, Shihui Long, Fengyi Li, Tanvi Motwani

机构 * LinkedIn Corporation(领英公司)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 提出SPEAR方法,将代码执行作为智能体工具进行提示优化,通过Python沙箱实现结构错误分析,并在工业任务和基准测试中取得显著提升。

Comments 19 pages, 3 figures, EMNLP 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11589 2026-08-05 cs.SE 83%

A Study of Library Usage in Agent-Authored Pull Requests

对代理生成的拉取请求中图书馆使用情况的研究

Lukas Twist, Jie M. Zhang

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE

AI总结 研究探讨了代理生成的拉取请求中图书馆使用情况,发现代理频繁导入图书馆但很少引入新依赖项,且在引入时遵循严格的版本控制实践。

Comments 5 pages, 3 tables. Accepted at MSR '26 (Challenge Track)

Journal ref 23rd International Conference on Mining Software Repositories: MSR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 78%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 软件智能体 :agent(title,abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03588 2026-08-05 cs.PL cs.AI cs.SE 新提交 73%

GenOS: Compositional Certificates for Semantic Robustness in AI Code Generation

GenOS:AI代码生成中语义鲁棒性的组合式证书

Corrado Priami

专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 GenOS是针对AI代码生成语义鲁棒性的概率操作语义,通过马尔可夫核与等价关系确保工作流中组件替换的安全性,经实验验证其鲁棒性界与兼容性可测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28587 2026-08-05 cs.SE cs.AI 版本更新 73%

PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks

PAIChecker:揭示与检查类SWE-Bench基准中的PR-Issue不匹配问题

Manyi Wang, Junjielong Xu, Pinjia He

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究针对类SWE-Bench基准中13.6%的PR-Issue不匹配问题,提出多智能体系统PAIChecker,经实验验证其在两类基准上的二元准确率最高达92.12%

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Github Repo: https://github.com/manyiResearch/PAIChecker

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 70%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02685 2026-08-05 cs.SE cs.AI 新提交 62%

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

BulkPR-Bench:针对交互拉取请求的队列级治理基准

Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。

Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 57%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02642 2026-08-05 physics.chem-ph cs.AI 新提交 57%

MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows

MDArena:面向真实分子动力学工作流的编码智能体评估基准

Nithishwer Mouroug Anand, Wei-Tse Hsu, Kyle Vaccaro, Eden James Gage, Jonathan David Colburn, Linda Xi Phan, Minjoon Seo, Kevin Guan, Philip C. Biggin

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。

Comments 17 pages including appendices, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00450 2026-08-05 cs.HC cs.SE 版本更新 57%

Revibing Code from Papers: Reimplementing HCI Artifacts

从论文中重构代码:重新实现人机交互(HCI)人工制品

Eytan Adar, Yoonjoo Lee, Nina Lei, Q. Vera Liao, Weirui Peng

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本研究利用智能体AI技术直接从HCI研究论文重构交互式软件,提出重构性指标,经UIST论文验证可生成强基线代码,有望改变HCI研究人工制品的生产评估方式。

Comments UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏