arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-24 至 2026-07-24 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2607.21495 2026-07-24 cs.AI cs.ET cs.MA 新提交 88%

Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry

迈向工业中人工智能代理创建民主化的持续保障

Natan Levy, Harel Berger

专题命中 软件智能体 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 针对工业中人工智能代理创建民主化带来的可靠性挑战,提出轻量级持续保障框架,结合依赖映射等多种方法评估代理运行状态,还展示了原型审核器及评估,为公民创建的组织代理提供保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03316 2026-07-24 cs.SE cs.AI 版本更新 84%

Is Agentic Code Review Helpful? Mining Developers' Feedback to CodeRabbit Reviews in the Wild

智能代码审查有用吗?挖掘开发者对CodeRabbit在实际应用中代码审查的反馈

Hong Yi Lin, Mingzhao Liang, Patanamon Thongtanunam, Kla Tantithamthavorn

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 以CodeRabbit为例对智能代码审查进行实证研究,通过大量代码审查与开发者反馈数据,揭示其审查结果及被拒原因,还探索预测审查被拒的方法,指出改进空间与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19605 2026-07-24 cs.SD 版本更新 82%

RIME: Enabling Large-Scale Agentic Music Post-Production

RIME:实现大规模智能后期制作

Noah Schaffer, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 研究针对音乐后期制作问题,引入RIME框架,利用POEMS工具包生成配对数据,评估多模态语言模型,展示其通过监督微调提升智能体性能,是迈向迭代音乐智能体、变革音乐制作的早期步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05385 2026-07-24 cs.IR cs.AI 版本更新 79%

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework

TeaRAG:一种令牌高效的智能检索增强生成框架

Chao Zhang, Yuhao Wang, Derong Xu, Haoxin Zhang, Yuanjie Lyu, Yuhao Chen, Shuochen Liu, Tong Xu, Xiangyu Zhao, Yan Gao, Yao Hu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Xiaohongshu Inc.(小红书公司)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-07-24 cs.CV cs.RO eess.IV 版本更新 78%

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Urban Autonomous Agents

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :autonomous agent(title,abstract)

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21217 2026-07-24 cs.AI 新提交 77%

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

ICAE-Bench:将编码智能体评估为交互式项目构建者

Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao, Shibo Hong, David Lo, Lin Qiu, Xuezhi Cao, Jiyuan He, Yixin Cao

机构 * Meituan(美团)

专题命中 软件智能体 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20759 2026-07-24 cs.CR cs.AI cs.SE 新提交 73%

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试

Ankur Singh, Jinqiu Yang, Tse-Hsun Chen

机构 * Concordia University(康科德大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20972 2026-07-24 cs.AI cs.SE 新提交 62%

Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents

传递而非存储:线索锚定工作记忆作为编码代理的一种约束属性

Swapnanil Saha

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究编码代理记忆问题,提出基于认知文献的两层设计理论及线索锚定记忆模型,通过实际编码任务评估,表明传递而非存储是关键,可靠记忆通道应让代理无需思考,给出相关实验结果及贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 62%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20852 2026-07-24 cs.AI 新提交 57%

Code Monitor Red Teaming for Public-Test-Passing Code

用于通过公开测试的代码的代码监控红队

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13357 2026-07-24 cs.HC 版本更新 50%

TANDE: Disentangling Verbal and Nonverbal Backchannels in Emotional AI-Avatar Conversations with Young Adults

TANDE:在与年轻人的情感人工智能-虚拟化身对话中区分言语和非言语反馈渠道

Ann-Kareen Gedeus, Jack Good, Nadine Wagener, Angelique Taylor

专题命中 软件智能体 :agent(abstract)

AI总结 研究在与年轻人的情感人工智能-虚拟化身对话中反馈渠道模式的影响,引入TANDE这个由LLM驱动的ECA,通过实验探讨其对融洽关系、同理心和参与度的作用及性别差异,得出相关设计启示。

Comments This paper has been accepted for publication at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏