arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-13 至 2026-08-13 共收录 181 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 多智能体 29 篇

2608.11592 2026-08-13 cs.RO 新提交 67%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 67%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 多智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11229 2026-08-13 cs.AI cs.RO 新提交 57%

Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)

人机自主团队中基于二阶心理理论的信念同步(扩展版)

Jack Mirenzi, Henny Admoni

专题命中 多智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对奖励无法直接指定的场景,提出人机团队中教师与学习者通过二阶心理理论同步信念的方法,仿真显示该方法能提升偏好学习性能并修复模型漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 工作流自动化 20 篇

2608.12249 2026-08-13 cs.AI 新提交 89%

An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

面向传统高性能计算现代化的智能体工作流:转换GAMESS的双电子积分核心

Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon

专题命中 工作流自动化 :workflow(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出智能体工作流,将GAMESS的双电子积分核心从Fortran77转为Fortran2008,通过Claude智能体实现56448行代码转换,所有测试均达基准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12277 2026-08-13 cond-mat.mtrl-sci 新提交 87%

PACE-SIMS: Checkpoint-Gated Autonomous SIMS Characterization with AI-Agent Quality Control

PACE-SIMS:带AI智能体质量控制的检查点门控自主二次离子质谱表征

Anton V Ievlev, Heather Hare, Yiyang Li, Sergei V Kalinin

专题命中 工作流自动化 :agent(title,abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 PACE-SIMS是带AI智能体质量控制的自主SIMS表征工作流,经实验验证可高效完成WOx薄膜研究,可迁移至其他分析技术的破坏性测量场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11483 2026-08-13 cs.AI cs.LG q-bio.QM 新提交 86%

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

用于合成约束多目标先导化合物优化的模块化智能体框架

Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Alterovitz, Marcello DeLuca, Alexander Tropsha

专题命中 工作流自动化 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出开源模块化智能体框架SABLE,结合LLM与专用工具实现合成约束下的多目标先导化合物优化,可高效富集符合计算目标的候选集,为早期药物发现提供决策支持。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11924 2026-08-13 cs.CL 新提交 77%

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

Spark-to-Paper:作为可组合技能的端到端研究论文生成系统

Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng, Jin Jiang, Junsheng Zhang, Wenhao Wang

机构 * Vast Intelligence Lab(星智实验室) University of Technology Sydney(悉尼科技大学)

专题命中 工作流自动化 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.CL

AI总结 Spark-to-Paper是在现有编码助手中实现的端到端研究论文生成系统,含13项可组合技能,在8个研究主题中实现高引用与图表有效性,提升伪造检测率,成本与耗时较低。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12144 2026-08-13 cs.SE cs.LG 新提交 62%

ADEPT: A Unified Framework for Deep Learning Test Adequacy

ADEPT:深度学习测试充分性的统一框架

Yidi Kao, Shawn Burnham, Tommi Rose Fahy, Ali Ghanbari

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 本文提出 ADEPT 框架,整合多种深度学习测试充分性指标,提供统一工作流与配置管理,解决指标难复现、难比较问题,方便研究人员和从业者使用。

Comments Proceedings of 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11271 2026-08-13 eess.IV cs.LG 新提交 57%

Hardware-Aware Deployment of Joint SAR Compression and Despeckling on FPGA

面向FPGA的联合SAR压缩与去噪的硬件感知部署

Cédric Léonard, Francescopaolo Sica, Martin Schulz

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本研究在ZCU102 FPGA平台部署联合SAR去噪与数据压缩框架,发现ReLU比GDN更适配SAR图像、残差块增益低且FPGA能效最高,为星载SAR压缩提供部署方案。

Comments Submitted to IEEE Transactions on Geoscience and Remote Sensing (TGRS). 11 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12302 2026-08-13 cs.LG 新提交 57%

A Framework for Designing Reward Functions: From Objectives to Features to Human-Aligned Reward Functions

奖励函数设计框架:从目标到特征再到人类对齐的奖励函数

Di Yang Shi, W. Bradley Knox

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 该研究提出一套三步式奖励函数设计框架,首次将奖励项选择简化为因果DAG上的最小成本部分覆盖问题,能保持无冲突可行权重区域,为非专家设计人类对齐的奖励函数提供了可行方案。

Comments Presented at RLC "Finding the Frame" and "AutoRL" workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11638 2026-08-13 cs.LG cs.CV 新提交 57%

Transferable Above-Ground Biomass (AGB) Estimation Model from Multi-Sensor Data with Sparse Field Calibration

结合稀疏地面校准的多传感器可迁移地上生物量(AGB)估算模型

Pann Thinzar Seint, Bryan Atwood, Subas Chhatkuli

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 该研究提出结合稀疏地面校准的多传感器可迁移AGB估算框架,以全局训练CNN为核心,经GEDI数据训练后用少量样地校准,提升了AGB估算精度,优于现有产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11629 2026-08-13 cs.CL 新提交 57%

Easper: An Accessible ASR Pipeline for Language Documentation

Easper:一款用于语言文档编制的易用ASR流水线

Aso Mahmudi, Ting Dang, Ekaterina Vylomova, Nick Thieberger

机构 * The University of Melbourne(墨尔本大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.CL

AI总结 研究针对语言文档编制的音频转录瓶颈,提出无需代码的开源ASR工作流Easper,通过评估转录优先级策略,发现优先词汇丰富叙述并增加声学语音重复可更快提升转录质量。

Comments Accepted in Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11625 2026-08-13 cs.AI 新提交 57%

Making AI-Generated Feedback Matter: From Provision to Student Enactment

让AI生成的反馈发挥作用:从提供到学生执行

Omar Alsaiari, Nilufar Baghaei, Jason M. Lodge, Dragan Gaševi'c, Naomi Winstone, Hassan Khosravi

机构 * The University of Queensland(昆士兰大学) University of Surrey(萨里大学) The University of Hong Kong(香港大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 该研究通过13037名学生的大规模准实验,发现主动构建的AI反馈执行工作流可显著提升学生对AI反馈的接受度、自我评估信心及作品质量,强调需设计针对性AI反馈工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11451 2026-08-13 cs.RO cs.AI cs.SY eess.SY 新提交 57%

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

通过神经符号安全护卫实现端到端自动驾驶的引导

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 该研究针对端到端驾驶智能体违反交通规则的问题,提出无需重训的神经符号安全护卫,在Fail2Drive和Bench2Drive基准上使成功率提15%、安全碰撞降53%且保留原驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11220 2026-08-13 cs.AI cs.MA 新提交 57%

LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs

流程图表工程中的大语言模型:从最优工艺流程图到经验证的管道及仪表流程图

Timur Zakarin, Sergei Voitov, Sergei Shumilin, Evgeny Burnaev

机构 * Skoltech(斯科尔科沃科技学院) AIRI(人工智能研究院(AIRI))

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 本研究提出P&ID Pilot端到端AI流水线,结合GA与LLM生成最优PFD,再通过基于LLM的智能体将其转换为100%执行成功的合规P&ID,实现工艺设计自动化并减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22015 2026-08-13 cs.SE 版本更新 57%

Are Production Cloud Skills Adequately Tested? Measuring and Governing Skill Test Adequacy in Practice

生产云技能是否得到充分测试?在实践中衡量和管理技能测试覆盖率

Haotian Si, Junyi Chen, Shuyang Yu, Ruifeng Nie, Jiate Li, Jianqiang Zhao, Meng Li, Dengcheng He

专题命中 工作流自动化 :AI agent(abstract);分类 cs.SE

AI总结 研究生产云技能测试覆盖率问题,开发测量管道恢复操作义务、映射测试用例并生成覆盖报告,结合模型辅助与专家评审确保覆盖率基于证据,将覆盖差距转化为测试改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11876 2026-08-13 cs.RO cs.HC 新提交 50%

D3D-GEN: Robot-Aware Domain-Grounded Interactive 3D World Generation for Social Robotics

D3D-GEN:面向社交机器人的机器人感知、领域锚定的交互式3D世界生成

Anh Duc Do, Volodymyr Scherbyna, Tai Duc Nguyen, Spaarsh Thakkar, Zhengcheng Shen, Teham Buiyan, Archan Misra, Linh Kästner

机构 * Singapore Management University(新加坡管理大学) Technical University Berlin(柏林工业大学) Max Planck Institute(马克斯·普朗克研究所) Technical University Braunschweig(布伦瑞克工业大学)

专题命中 工作流自动化 :agent(abstract)

AI总结 D3D-GEN是一种新型3D世界生成系统,结合领域智能体与RAG流水线,可快速生成领域锚定的交互式3D世界,已构建多领域数据库并生成数十种仿真环境,适配Isaac Sim等仿真器。

Comments 8 pages, 5 figures, and 5 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11524 2026-08-13 cs.DC 新提交 50%

Descriptive Dispatch of Computational Work

计算任务的描述性调度

Vanessa Sochat, Daniel Milroy

专题命中 工作流自动化 :agent(abstract)

AI总结 该研究针对多集群环境下科学工作流的调度挑战,评估了AI/ML调度智能体的可靠性,发现描述性元数据可显著提升作业执行成功率与应用性能。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11512 2026-08-13 cs.CY 新提交 50%

Cheap, Fallible Cognition and the Political Economy of Expertise

廉价、易出错的认知与专业知识的政治经济学

Christophe Kolb, Jim Caron

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文构建基于任务与制度的框架,引入任务脆弱性指数等,分析生成式AI对劳动力市场的影响,指出其命运是制度均衡,而非机械失业或自动充裕。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11407 2026-08-13 cs.RO cs.MA 新提交 50%

Top-down Traffic Scenario Generation via Joint Initial-Goal Diffusion and Trajectory Infilling

基于联合初始-目标扩散与轨迹填充的自上而下交通场景生成

Da Saem Lee, Yash Vardhan Pant, Sebastian Fischmeister

机构 * University of Waterloo(滑铁卢大学)

专题命中 工作流自动化 :agent(abstract)

AI总结 提出TrafficDiffuser框架,联合建模初始与目标状态对生成高级交通场景,在Argoverse 2数据集上验证,其智能体初始化性能优于次优方法,可降低速度分布距离与越野率。

Comments Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03337 2026-08-13 cs.CV stat.AP 版本更新 50%

Significance and Stability Analysis of Genotype-Environment Interaction using GxEStat

基于RGxEStat的基因-环境互作的显著性与稳定性分析

Meng'en Qin, Zhe Li, Hui Huang, Xihong Liu

机构 * Henan Engineering Research Center for Artificial Intelligence Theory and Algorithms(河南人工智能理论与算法工程研究中心) Department of Electrical and Electronic Engineering(电子与电气工程系) Faculty of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出两种关键模型用于基因-环境互作研究,介绍了RGxEStat工具,旨在简化育种数据分析,提升研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14109 2026-08-13 cs.DB 版本更新 50%

TLSQL: Table Learning Structured Query Language

基于表格的结构化查询语言:TLSQL

Feiyang Chen, Ken Zhong, Aoqian Zhang, Zheng Wang, Li Pan, Jianhua Li

专题命中 工作流自动化 :workflow(abstract)

AI总结 TLSQL是一种通过SQL-like声明性规范直接在关系数据库上执行表格学习的系统,旨在降低将机器学习集成到数据库工作流程中的门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17038 2026-08-13 q-bio.OT 版本更新 50%

Omnibenchmark: transparent, reproducible, extensible and standardized orchestration of solo and collaborative benchmarks

Omnibenchmark:透明、可重复、可扩展和标准化的独奏和协作基准测试 orchestration

Izaskun Mallona, Almut Luetge, Ben Carrillo, Daniel Incicau, Reto Gerber, Aidan Meara, Anthony Sonrel, Charlotte Soneson, Mark D. Robinson

专题命中 工作流自动化 :workflow(abstract)

AI总结 Omnibenchmark 提供灵活的基准计划语法和标准化工作流,实现独奏和协作基准测试的透明、可重复和可扩展

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 软件智能体 19 篇

2408.06849 2026-08-13 cs.AI cs.CL 版本更新 88%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 软件智能体 :agent(title,summary_cn);分类 cs.AI、cs.CL

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12311 2026-08-13 cs.SE 新提交 87%

The Role Specialization Model (RSM): Coordinating LLM-Based Tools in Agentic Software Development - An Exploratory Case Study

角色专业化模型(RSM):在智能体软件开发中协调基于大语言模型(LLM)的工具——一项探索性案例研究

Carlos Alberto Fernández-y-Fernández, Jorge R. Aguilar-Cisneros

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);workflow(abstract)

AI总结 本研究通过探索性案例研究提出角色专业化模型(RSM),协调Antigravity、Gemini CLI等三种LLM工具开发Python气候可视化应用,发现明确角色协调可优化开发质量但需配套策略与人工验证。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11274 2026-08-13 cs.CR cs.AI 新提交 85%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 83%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11241 2026-08-13 cs.AI cs.IR 新提交 83%

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

RecSys Factory:限制LLM智能体在工业推荐生命周期内的自主决策点

Dongyang Ao, Kaixiang Fang, Shijie Xu

机构 * Tencent(腾讯) FiT(腾讯FiT)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 RecSys Factory 是限制 LLM 智能体自主到决策点的平台,解决工业推荐系统运营的三角困境,在腾讯三业务线部署 78 天,CLI 调度成功率达 78.6%。

Comments 21 pages, 6 figures, 9 tables. Reports a 78-day deployment across three heterogeneous industrial recommender business lines (1,624 CLI-tool dispatches). Companion paper: AutoResearch (P3b), which instantiates the same substrate for autonomous research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 81%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12123 2026-08-13 cs.DC cs.AI cs.OS 新提交 79%

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返

Josef Liyanjun Chen

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。

Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-

详情

展开后加载摘要…

URL PDF HTML 收藏