arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-16 至 2026-06-16 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 22 篇

2604.26963 2026-06-16 cs.OS cs.DC cs.LG cs.MA 版本更新 85%

MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems

MARS:面向异构智能体系统的高效自适应协同调度

Yifei Wang, Hancheng Ye, Yechen Xu, Cong Guo, Chiyue Wei, Qinsi Wang, Dongting Li, Tingjun Chen, Hai "Helen" Li, Danyang Zhuo, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 提出MARS协同调度系统,通过统一信息流全局协调GPU推理与CPU工具执行,解耦准入与执行防止资源过载,并采用智能体中心调度器最小化端到端延迟,实验显示延迟降低5.94倍。

Comments 14 pages, 13 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16458 2026-06-16 cs.RO 新提交 85%

RHO: Your Coding Agent is Secretly a Roboticist

RHO:你的编码代理其实是个机器人专家

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 软件智能体 :agent(title,abstract);planning(abstract);agentic(abstract)

AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。

Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15994 2026-06-16 cs.AI cs.LG 新提交 84%

Agentic Framework for Deep Learning workload migration via In-Context Learning

基于上下文学习的深度学习工作负载迁移智能体框架

Qiyue Liang, Steven Ingram, George Vanica, Andi Gavrilescu, Newfel Harrat, Hassan Sipra, Sethuraman Sankaran

机构 * Google(谷歌)

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15906 2026-06-16 cs.IR cs.AI cs.CL cs.DB cs.MM 新提交 81%

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG

Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16523 2026-06-16 cs.CL 新提交 79%

SkillWiki: A Living Knowledge Infrastructure for Agent Skills

SkillWiki: 一个用于智能体技能的活知识基础设施

Dingcheng Huang, Yuda Ding, Bingshuo Liu, Qingbin Liu, Xi Chen, Jiang Bian, Hongliang Sun, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL

AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15283 2026-06-16 cs.SE 新提交 79%

AI-driven Software Development: A Pragmatic Path to Agentic Development Processes

AI驱动的软件开发:迈向智能开发过程的务实路径

Peter Mandl, Paul Mandl

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出一个务实框架,指导从辅助性AI使用到可控智能开发过程的过渡,聚焦技术、组织和质量保障机制,并通过中型软件公司案例验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15390 2026-06-16 cs.CL cs.AI cs.LG 新提交 78%

Not All Skills Help: Measuring and Repairing Agent Knowledge

并非所有技能都有用:测量与修复智能体知识

Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Purdue(普渡大学) NVIDIA(英伟达)

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15385 2026-06-16 cs.AI 新提交 77%

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

语言模型智能体中的奖励黑客:重新审视AI安全网格世界

Ömer Veysel Çağatan, Xuandong Zhao

机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。

Comments 28 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16707 2026-06-16 cs.AI 新提交 70%

User as Code: Executable Memory for Personalized Agents

用户即代码:面向个性化智能体的可执行记忆

Bojie Li

机构 * Pine AI

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出可执行记忆范式User as Code,将用户模型转化为可运行的Python代码,通过两阶段流水线实现精确聚合与规则执行,在长对话基准上达到78.8%召回率,聚合问题准确率99%,并能主动触发安全警报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16231 2026-06-16 cs.LG cs.AI 新提交 62%

From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation

从令牌到区域:面向GPU内核生成的CUDA敏感指令微调

Wentao Chen, Jiace Zhu, Xing Zhe Chai, Zeng Qu, Qiaoling Xiao, Liucheng Duan, An Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Biren Technology(壁仞科技)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出CuSeT方法,通过自适应令牌级掩码和区域感知样本重加权,在简单SFT框架内提升LLM生成CUDA内核的功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15762 2026-06-16 cs.CR cs.AI cs.SE 新提交 62%

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

Snyk VulnBench JS 1.0: LLM 能否两次发现相同的漏洞?

Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

机构 * Snyk

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 通过300次重复漏洞扫描实验,评估LLM在相同JavaScript代码上安全审查的可重复性,发现引用匹配结果稳定但额外报告波动大,建议结合确定性SAST使用。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15300 2026-06-16 cs.AI cs.CL 新提交 62%

CODA-BENCH: Can Code Agents Handle Data-Intensive Tasks?

CODA-BENCH:代码智能体能否处理数据密集型任务?

Yuxin Zhang, Ju Fan, Meihao Fan, Shaolei Zhang, Xiaoyong Du

机构 * Renmin University of China(中国人民大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出CODA-BENCH基准,在数据密集型环境中联合评估代码与数据智能,包含1009个任务,平均每个环境980个文件,揭示当前智能体在数据发现与代码执行整合上的不足。

Comments Accepted at ICML 2026. 37 pages, 11 figures. Project page: https://coda-bench.github.io/ Code: https://github.com/ruc-datalab/CoDA-Bench Data: https://huggingface.co/datasets/RUC-DataLab/CoDA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28734 2026-06-16 cs.CR cs.CL cs.LG 版本更新 62%

Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

代码即武器:用于衡量编码模型对恶意代码请求遵从性的共识标记提示库

Richard J. Young, Gregory D. Moody

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校) Department of Information Systems(信息系统系)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建一个经五名评审共识标记的提示库(包含4,748个可执行恶意代码请求和1,923个有害安全知识请求),为编码模型对恶意代码请求的拒绝行为提供了可靠且可跨语料库比较的测量基准。

Comments 23 pages, 9 figures, 6 tables. Consensus-labeled prompt bank consolidating eight malicious-code corpora (ASTRA, CySecBench, AdvBench/harmful_behaviors, JailbreakBench, MalwareBench, RedCode, RMCBench, Scam2Prompt) spanning diverse elicitation paradigms; 6,675 prompts, 33,375 classification calls

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30208 2026-06-16 cs.SE cs.AI 版本更新 62%

Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency

自动化低风险代码审查在Meta:RADAR、风险校准与审查效率

Chris Adams, Arjun Singh Banga, Parveen Bansal, Souvik Bhattacharya, Payal Bhuptani, Rujin Cao, Pedro Canahuati, Nate Cook, Brian Ellis, Prabhakar Goyal, Gurinder Grewal, Tianyu He, Matt Labunka, Alex Manners, David Molnar, Ging Cee Ng, Vishal Parekh, Jiefu Pei, Frederic Sagnes, James Saindon, Will Shackleton, Sid Sidhu, Gursharan Singh, Karthik Chengayan Sridhar, Matt Steiner, Pratibha Udmalpet, Sean Xia, Stacey Yan, Audris Mockus, Peter Rigby, Nachiappan Nagappan

机构 * Meta USA, UK, Canada(Meta美国、英国、加拿大)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出RADAR系统,通过多阶段漏斗对代码差异进行风险分层自动化审查,在Meta部署后显著提升审查效率并降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17106 2026-06-16 cs.CL cs.LG 版本更新 62%

HyDRA: Hybrid Dynamic Routing Architecture for Heterogeneous LLM Pools

HyDRA:异构LLM池的混合动态路由架构

Aashna Garg, Siddharth Singha Roy, Jinu Jang, Federico Brancasi, Shengyu Fu

机构 * Microsoft(微软)

专题命中 软件智能体 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。

Comments preprint v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20709 2026-06-16 cs.SE cs.AI cs.CR 版本更新 62%

DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents

DualGauge: 对仅由LLM和编码代理生成的规范代码进行自动化联合安全-功能基准测试

Rupam Patir, Keyan Guo, Suvadra Barua, Abhijeet Pathak, Dinesh Gudimetla, Jiawei Guo, Hongxin Hu, Haipeng Cai

机构 * University at Buffalo, SUNY(布法罗大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出DualGauge框架,首个自动化联合评估规范代码正确性与安全性的系统,通过307个任务基准测试发现功能正确性高估可靠代码生成,联合成功率低于15%,且模型因素和代理系统均无法可靠提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16769 2026-06-16 cs.AI 新提交 57%

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体

Tianyi Zhang, Zhonghao Qi

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。

Comments Preprint. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16545 2026-06-16 cs.CL 新提交 57%

Can LLM Coding Agents Reason About Time Series?

LLM 编码智能体能否推理时间序列?

Filip Rechtorík, Ondřej Dušek, Zdeněk Kasner

机构 * Institute of Formal and Applied Linguistics, Faculty of Mathematics and Physics, Charles University(查尔斯大学数学与物理学院形式与应用语言学研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 研究 LLM 编码智能体在时间序列分析中的能力,发现代码访问可提升性能达 10%,但仍有 22-34% 错误,并分析了推理差距。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16540 2026-06-16 q-bio.QM cs.LG q-bio.BM q-bio.GN 新提交 57%

MultiMolecule: a modular ecosystem for biomolecular sequence-model workflows

MultiMolecule: 一个用于生物分子序列模型工作流的模块化生态系统

Zhiyuan Chen

机构 * DanLing Team(丹 Ling 团队)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 提出MultiMolecule开源生态系统,通过标准化接口整合RNA、DNA和蛋白质序列模型,提供53个模型族实现、112个检查点和16个数据集资源,支持模型复用、评估和生物预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15349 2026-06-16 cs.CY cs.AI 新提交 57%

LearnOpt: Recovering the Latent Cognitive Structure of Standardized Examinations via Knowledge Graphs and Constrained Optimization

LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构

Joy Bose, Om Thomas

机构 * Independent Researchers(独立研究者)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。

Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15348 2026-06-16 q-bio.NC cs.AI 新提交 57%

Intrinsic Computational Functionalism and Simulated Consciousness

内在计算功能主义与模拟意识

Ryota Kanai, Shuqin Ma

机构 * Araya Inc.(Araya公司) School of Philosophy, Fudan University(复旦大学哲学学院) Sussex Centre for Consciousness Science, University of Sussex(Sussex大学意识科学中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文从内在计算功能主义出发,提出机制丰富的规范结构,论证若意识是计算构成的,则任何满足内在因果-计算实现关系的系统(生物、人工或模拟)都实现相同的意识相关属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15891 2026-06-16 math.CO math.RT 新提交 50%

On the number of symmetric chain decompositions of the minuscule lattices $L(m,n)$ and $M(n)$

关于极小格 $L(m,n)$ 和 $M(n)$ 的对称链分解的数量

Robert Dorward

专题命中 软件智能体 :agent(abstract)

AI总结 研究极小格 $L(m,n)$ 和 $M(n)$ 的对称链分解计数,给出 $L(2,n)$ 的显式公式,并猜想 $\#SCD(L(m,n))$ 和 $\#SCD(M(n))$ 超指数增长,与晶体基和Lusztig对合等建立联系。

Comments 27 pages, 6 figures. In preparation for submission. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏