arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-30 至 2026-07-30 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2604.06688 2026-07-30 cs.CE 版本更新 82%

Diagon: A Programmable Testbed for AI-Agent Cognitive Labor Markets

当智能体市场到来时

Xuan Liu, Haoyang Shang, Haojian Jin

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)

AI总结 本文提出可编程市场系统diagon,作为智能体认知劳动市场的制度设计实验平台,研究发现市场交换能带来生产力提升,但效果强烈依赖于制度结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27167 2026-07-30 cs.SE cs.CL 新提交 81%

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤

Yihao Chen, Shi Chang, Feng Lin, Khaled Chawa, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26083 2026-07-30 cs.SE 新提交 79%

Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms

跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度

Shiqi Cheng, Evelyne Ringoot, Rabab Alomairy, Alan Edelman

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25175 2026-07-30 cs.MA 版本更新 78%

Agentic AI-enabled discovery across large-scale sleep physiology

基于智能体的人工智能助力大规模睡眠生理学研究

Rahul Thapa, Umaer Hanif, Robin Guillard, Andreas Brink-Kjaer, Adrien Specht, Matteo Saibene, Magnus Ruud Kjaer, Harrison G. Zhang, Federico Bianchi, Elisabeth Roxane M. Heremans, Eric C. Landsness, Emmanuel Mignot, James Zou

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 70%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 67%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26819 2026-07-30 cs.SE cs.AI 新提交 62%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 57%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26375 2026-07-30 cs.CL cs.HC 新提交 57%

(Im)Paired Programming: Coding Agents Improve Productivity but Harm Understanding

(非)配对编程:编码智能体提升生产力但损害理解能力

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26117 2026-07-30 cs.SE cs.AI cs.LG 新提交 56%

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

再试一次,不要回头:小型代码模型中盲重采样优于自我修复

Yuvraj Verma

专题命中 软件智能体 :分类 cs.AI、cs.LG、cs.SE;agent(comments)

AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。

Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26283 2026-07-30 cs.CV cs.RO 新提交 50%

HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework

HeteroPROPMT:一种实时且隐私保护的异构协同感知框架

Armin Maleki, Hayder Radha

机构 * Michigan State University(密歇根州立大学)

专题命中 软件智能体 :agent(abstract)

AI总结 HeteroPROPMT是一种实时隐私保护异构协同感知框架,通过模块化提示与轻量调优对齐异构智能体特征,在OPV2V-H等数据集上性能优于现有方法,且参数效率高、隐私性好。

Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18699 2026-07-30 cs.DS cs.SC 版本更新 50%

A more accurate rational non-commutative algorithm for multiplying 4x4 matrices using 48 multiplications

一种更精确的有理非交换算法用于使用48次乘法的4x4矩阵乘法

Jean-Guillaume Dumas, Clément Pernet, Alexandre Sedoglavic

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出一种更精确的4x4矩阵乘法算法,使用48次非交换乘法,改进了误差界指数并提升了实际精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 9 篇

2607.25904 2026-07-30 cs.AI 版本更新 79%

Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification

交互式奖励智能体:通过环境状态验证进行图形用户界面任务评估

Chenrui Shi, Yuwei Wu, Yang Liu, Ruining Feng, Zirui Shang, Zhi Gao, Lifeng Fan, Che Sun

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 研究图形用户界面任务评估难题,提出交互式奖励智能体IRA,基于提议验证框架,结合可见界面与环境状态证据。IRA在GUI-RewardBench基准测试中准确率达86.9%,应用于强化学习时实现34.0%的OSWorld成功率,能为训练图形用户界面智能体提供有效奖励信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26631 2026-07-30 cs.LG cs.IR 新提交 70%

RAG-HAR+: Towards Cost-Efficient LLM-Based Human Activity Recognition for Edge Deployment

RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别

Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney(悉尼大学) Curtin University(科廷大学) Colorado State University(科罗拉多州立大学)

专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.LG

AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。

Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26385 2026-07-30 cs.GT cs.AI cs.CR 新提交 57%

Collusion with Competitive Marginals: Price-Level Audits Are Blind by Construction

具有竞争性边际的合谋:价格水平审计天生具有盲目性

Xin Xu, Chengrui Wu, Jiayu Lu, Kaizhen Tan, Siru Tao, Hanzhe Hong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 该研究指出价格水平审计天生对特定算法合谋盲目,通过理论分析、语言模型智能体实验及以太坊拍卖数据验证,提出监管应转向竞价身份计数而非检测。

Comments 11 pages, 4 figures, includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26464 2026-07-30 cond-mat.mtrl-sci cs.AI 新提交 57%

PUDA: An AI-Native Hardware Harness for Self-Driving Laboratories

PUDA:面向自动驾驶实验室的AI原生硬件控制框架

Zekun Ren, Hongzhao Tan, Jiaen Yee, Kedar Hippalgaonkar

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 该研究提出面向自动驾驶实验室的AI原生硬件控制框架PUDA,通过命令行环境实现智能体与硬件的确定性交互,分离科学编排与物理操作,为智能体自动驾驶实验室提供实用执行与数据环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 50%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26295 2026-07-30 physics.bio-ph cond-mat.stat-mech q-bio.NC 新提交 50%

A behavior-environment information loop drives sensory navigation

行为-环境信息回路驱动感官导航

Kevin S. Chen, Matthew P. Leighton, Damon A. Clark, Thierry Emonet

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。

Comments 14 pages, 6 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 50%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10348 2026-07-30 cs.RO 版本更新 50%

Semantic Evidence Regulation via Relational Bias for Zero-Shot Object Navigation

通过关系归纳偏差重新思考具身导航

Weitao An, Chenghao Xu, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出DB-Nav框架,利用激活偏置和抑制偏置双关系偏置重塑搜索空间,通过关系激活-抑制探索图调节前沿探索,显著提升目标导航成功率和路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新 50%

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 17 篇

2607.26953 2026-07-30 cs.NI 新提交 85%

Assurance-Scoped Reliability for Agentic Networks: Capturing the State That Matters

智能体网络的保障范围型可靠性:捕获关键状态

Bilgehan Erman, Andrea Francini, Nikos Papadis

专题命中 记忆与上下文管理 :agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 针对智能体网络的传统可靠性措施无法覆盖的失效模式,提出Reliability Assurance Intelligence架构,通过服务可靠性配置文件和上下文胶囊保障服务可靠性与问责性,以确定性网络服务为例验证该架构。

Comments 7 pages, 4 figures, 2 tables, 15 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02259 2026-07-30 cs.CL cs.AI cs.LG 版本更新 85%

MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent

MemAgent:基于多轮对话强化学习的记忆智能体重构长上下文大语言模型

Hongli Yu, Tinghong Chen, Jiangtao Feng, Jiangjie Chen, Weinan Dai, Qiying Yu, Ya-Qin Zhang, Wei-Ying Ma, Jingjing Liu, Mingxuan Wang, Hao Zhou

机构 * ByteDance Seed(字节跳动种子期) Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学)

专题命中 记忆与上下文管理 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出MemAgent智能体工作流,结合扩展的DAPO算法优化长文本任务,实现从8K到3.5M上下文的高效外推,在RULER测试中表现优异。

Comments Accepted to ICLR 2026 as an Oral presentation. OpenReview: https://openreview.net/forum?id=k5nIOvYGCL Project page: https://memagent-sialab.github.io/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26520 2026-07-30 cs.DB cs.AI cs.IR 新提交 83%

A Graph-Native Bitemporal Memory Store for Conversational AI Agents

面向对话式AI智能体的原生图双时态内存存储

Alp Niksarli, Gopesh Baheti

专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对对话式AI智能体跨会话持久内存缺失的问题,提出原生图双时态内存存储方案,经LongMemEval基准测试,在知识更新等任务上取得良好效果,为纯检索的局限性提供了改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26410 2026-07-30 cs.CL cs.AI cs.SD eess.AS 新提交 81%

Voice Memory for Agentic Speech Recognition

面向智能体语音识别的语音记忆

Chao-Han Huck Yang, Zih-Ching Chen, Piotr Zelasko, Zhehuai Chen, Jagadeesh Balam, Boris Ginsburg

机构 * NVIDIA(英伟达)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出仅推理方案Voice Memory,通过听者-思考者架构克制过度校正,在10个HyPoradise域上将加权词错误率降至7.52%,可跨校正器迁移且不增加推理参数。

Comments Preprint. Technical report and open source: https://huggingface.co/huckiyang/voice-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27080 2026-07-30 cs.CR cs.AI 新提交 79%

MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair

MemSecBench:追踪智能体内存中毒从持久性到后果及修复的全生命周期

Xuanze Chen, Xukang Xie, Wentao Fu, Jiajun Zhou, Shanqing Yu, Qi Xuan

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出MemSecBench基准测试,通过24种配置的实验发现不同内存系统栈在智能体内存中毒的持久性、后果及选择性修复上存在显著差异,为智能体内存安全评估提供了工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26072 2026-07-30 cs.IR cs.AI 新提交 72%

IFCMemoryBench: Evaluating Long-Term Memory of LLM-Based Agents in BIM Information Retrieval

IFCMemoryBench:评估基于大语言模型(LLM)的智能体在建筑信息模型(BIM)信息检索中的长期记忆能力

Changyu Du, Alexander Vosseler, Filippo Mazza, André Borrmann

专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract);分类 cs.AI;agentic(comments)

AI总结 本文推出IFCMemoryBench基准,评估基于LLM的智能体在BIM信息检索中的长期记忆,发现现有通用记忆系统在该场景下表现差,存在领域迁移差距。

Comments KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26475 2026-07-30 cs.DC 新提交 67%

DualDecoder: Accelerate Long Context LLM Inference by Predictive Prefetch

DualDecoder:通过预测预取加速长上下文大语言模型推理

Zuning Liang, Zhiyi Yao, Qi Chen, Yuedong Xu, Hao Dai, Zhiqiang Ding, Tongkai Yang, Jinlong Hou, Yuan Cheng

专题命中 记忆与上下文管理 :agentic(abstract,abstract_cn)

AI总结 该研究针对长上下文LLM推理的内存墙瓶颈,提出轻量级服务系统DualDecoder,通过双token解码流水线预测预取关键KV条目,消除辅助状态开销,使解码吞吐量最高提升2.62倍且保留延迟与模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26637 2026-07-30 cs.CL cs.AI 新提交 62%

Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability

面向LLM智能体的基于文件系统的内存:组织、演化与可持续性

Sizhe Zhou, Sheldon Yu, Hui Wei, Junda Wu, Siru Ouyang, Yizhu Jiao, Shijia Pan, Julian McAuley, Yu Zhang, Tong Yu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Merced(加利福尼亚大学默塞德分校) Adobe Research(奥多比研究院) Texas A&M University(德克萨斯农工大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究首次系统探索面向LLM智能体的基于文件系统的内存,定义三个智能体角色开展实验,发现有组织存储可减半检索成本,但多数智能体组织会退化,工具集对存储形态的影响与更换模型相当,将文件系统设为智能体内存的设计空间。

Comments 59 pages, 12 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16986 2026-07-30 cs.CL cs.AI 版本更新 62%

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Jingxing Wang, Chenyu Zhou, Zhihui Fu, Jun Wang, Weiwen Liu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏