arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-13 至 2026-08-13 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 19 篇

2408.06849 2026-08-13 cs.AI cs.CL 版本更新 88%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 软件智能体 :agent(title,summary_cn);分类 cs.AI、cs.CL

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12311 2026-08-13 cs.SE 新提交 87%

The Role Specialization Model (RSM): Coordinating LLM-Based Tools in Agentic Software Development - An Exploratory Case Study

角色专业化模型(RSM):在智能体软件开发中协调基于大语言模型(LLM)的工具——一项探索性案例研究

Carlos Alberto Fernández-y-Fernández, Jorge R. Aguilar-Cisneros

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);workflow(abstract)

AI总结 本研究通过探索性案例研究提出角色专业化模型(RSM),协调Antigravity、Gemini CLI等三种LLM工具开发Python气候可视化应用,发现明确角色协调可优化开发质量但需配套策略与人工验证。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11274 2026-08-13 cs.CR cs.AI 新提交 85%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 83%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11241 2026-08-13 cs.AI cs.IR 新提交 83%

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

RecSys Factory:限制LLM智能体在工业推荐生命周期内的自主决策点

Dongyang Ao, Kaixiang Fang, Shijie Xu

机构 * Tencent(腾讯) FiT(腾讯FiT)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 RecSys Factory 是限制 LLM 智能体自主到决策点的平台,解决工业推荐系统运营的三角困境,在腾讯三业务线部署 78 天,CLI 调度成功率达 78.6%。

Comments 21 pages, 6 figures, 9 tables. Reports a 78-day deployment across three heterogeneous industrial recommender business lines (1,624 CLI-tool dispatches). Companion paper: AutoResearch (P3b), which instantiates the same substrate for autonomous research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 81%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12123 2026-08-13 cs.DC cs.AI cs.OS 新提交 79%

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返

Josef Liyanjun Chen

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。

Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10450 2026-08-13 cs.SE cs.AI cs.MA cs.NE 版本更新 73%

Persistent Recursive Worlds Enable Autonomous Software Evolution

持久递归世界支持自主软件演化

Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-13 cs.AI cs.CL cs.HC cs.LG cs.MA 新提交 67%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11282 2026-08-13 eess.IV cs.AI cs.LG 新提交 62%

Physics-Informed Implicit Neural Representations for Improved Myocardial Perfusion MRI Quantification

用于改进心肌灌注MRI定量的物理信息隐式神经表示

Christos Tsepas, Chang Yan, Maximilian Fuetterer, Sebastian Kozerke, Cian M Scannell

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究将物理信息神经网络(PINN)框架扩展加入时空隐式神经表示(INRs),在真实模拟CMR数据集上提升了心肌灌注参数估计的鲁棒性与准确性。

Comments Accepted at the STACOM workshop at MICCAI, Strasbourg 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 62%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10986 2026-08-13 cs.CL cs.LG 交叉投稿 62%

What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model

语言模型迭代自馈探测的测量对象,以及一种区分构造与模型的测试方法

Nicolás Vera Zúñiga

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究探究语言模型迭代自馈探测的测量对象,提出区分探测构造与模型的测试方法,揭示两类测量量的差异,复现验证工具并纠正错误判断。

Comments 16 pages, 4 figures. Code, per-run results, and the findings ledger: https://github.com/nicoveraz/token-lattice-ca (archived: https://doi.org/10.5281/zenodo.21880472)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20667 2026-08-13 cs.SE cs.AI 版本更新 62%

REVERE: Reflective Evolving Research Engineer

REVERE:面向科学工作流的反思性进化研究工程师

Balaji Dinesh Gangireddi, Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(TCS研究) Yale University(耶鲁大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 REVERE通过全局训练上下文学习和反思优化框架,提升科研编码任务性能,实现4.50%、3.51%和4.89%的提升。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 62%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 57%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11225 2026-08-13 cs.AI 新提交 57%

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

来自外部的身份:AI人格克隆的概念框架与研究计划

Luc E. Brunet

机构 * R&D Mediation(调解研发部)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12195 2026-08-13 cs.HC 新提交 50%

IF:CARGO: LLM-Based Semantic Compilation for Al-Native Rule Programming Games

IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译

Ting-Chen Hsu, Lianye Zhang, Jiangxu Lin, Zhaoyi Yu, Fei Qin, Zihao Chen

专题命中 软件智能体 :agent(abstract)

AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。

Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11932 2026-08-13 math.OC 新提交 50%

Joint Identifiability and Conditioning in Finite-Horizon Continuous-Time Inverse LQR with Unknown Dynamics

未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束

Meiling Yu, Yuan-Hua Ni, Lei Jiang

专题命中 软件智能体 :agent(abstract)

AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏