arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-02 至 2026-07-02 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2607.01213 2026-07-02 cs.SE 新提交 57%

RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究

Zhihao Lin, Mingyi Zhou, Zhensu Sun, Yizhuo Yang, Renyu Yang, David Lo, Li Li

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00895 2026-07-02 cs.CL 新提交 57%

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

机构 * KR Labs(KR实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) TU Wien(维也纳工业大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 50%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 软件智能体 :agentic(abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00213 2026-07-02 cs.CR 新提交 50%

Federated Sovereign Transport Protocol (FSTP): Verifiable Coordination Without Disclosure

联邦主权传输协议 (FSTP):无需披露的可验证协调

Ramón Soto C., Liz Soto

专题命中 软件智能体 :agent(abstract)

AI总结 提出联邦主权传输协议 (FSTP),通过编译时类型系统强制数据隔离、上下文无关身份模型和基于Blocklace的事件日志,实现无需暴露内部数据的可验证联邦协调。

Comments 26 pages, 4 figures, 3 tables. Reference implementation in Rust (fstp-core). Protocol specification and code to be linked from GitHub release v0.1.0 upon announcement

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06452 2026-07-02 cs.HC 版本更新 50%

Code Semantic Zooming

代码语义缩放

Jinsheng Ba, Sverrir Thorgeirsson, Zhendong Su

专题命中 软件智能体 :agent(abstract)

AI总结 提出基于伪代码的CodeZoom方法,通过多层语义抽象迭代探索、理解和优化代码,在用户研究中相比Claude Code显著提升代码理解与控制感。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 5 篇

2606.31980 2026-07-02 cs.CL cs.AI cs.HC 新提交 76%

DigitalCoach: Communication and Grounding Gaps in Human and Agentic Computer Use Coaching

DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距

Meng Chen, Anya Ji, Tsung-Han Wu, Tobias Maringgele, David M. Chan, Alane Suhr, Amy Pavel

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑工业大学)

专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.CL

AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 70%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00502 2026-07-02 cs.CL 新提交 57%

A Task-State Representation for Long-Horizon Mobile GUI Agents

面向长时程移动GUI代理的任务状态表示

Yujie Zheng, Zikang Liu, Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。

Comments Preprint. 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08316 2026-07-02 cs.CR cs.CL cs.CV 版本更新 57%

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA:针对基于VLM的GUI代理的高效后门攻击

Junxian Li, Tu Lan, Haozhen Tan, Yan Meng, Haojin Zhu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。

Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00709 2026-07-02 cs.NI 新提交 50%

Mobile Base Station Positioning in Smart Ports Based on Kriged Sparse Measurements and Obstacle Inference

基于克里金稀疏测量与障碍推断的智慧港口移动基站定位

Paulo Furtado Correia, André Coelho, Manuel Ricardo

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 提出DOCKING框架,利用普通克里金法重建无线环境图并推断障碍物模型,实现移动集成接入与回传部署优化,在稀疏测量下达到高精度与容量增益。

Comments 15 pages, 14 figures. Submitted to IEEE Open Journal of the Communications Society

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 7 篇

2607.01047 2026-07-02 cs.CL 新提交 79%

Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates

可对话的复杂性:作为可解释基质的智能体LLM集体

Elias Najarro, Ane Espeseth, Eleni Nisioti, Sebastian Risi, Stefano Nichele

机构 * IT University of Copenhagen(哥本哈根信息技术大学) University of Oslo(奥斯陆大学) Østfold University of Applied Sciences(东福尔应用科学大学) Sakana AI

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出将智能体大语言模型集体作为人工生命研究的计算基质,利用自然语言通信实现可解释性,并综述了相关实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01224 2026-07-02 cs.AI cs.CL cs.MA 新提交 62%

AutoMem: Automated Learning of Memory as a Cognitive Skill

AutoMem:自动化学习记忆作为认知技能

Shengguang Wu, Hao Zhu, Yuhui Zhang, Xiaohan Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出AutoMem框架,通过双循环自动优化LLM的记忆管理结构和使用能力,在长时域任务中提升性能约2-4倍。

Comments Project Website: https://autolearnmem.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14660 2026-07-02 cs.CR cs.AI cs.CL 版本更新 62%

NeuroFilter: Activation-Based Guardrails for Privacy-Conscious LLM Agents

NeuroFilter: 基于激活的隐私意识LLM智能体防护栏

Saswat Das, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出基于激活探测的隐私过滤器,高效检测LLM智能体在单轮和多轮对话中的不当信息泄露,首次系统研究对话轨迹中的模型内部状态变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01131 2026-07-02 cs.CV cs.AI 新提交 57%

Autonomous Scientific Discovery via Iterative Meta-Reflection

通过迭代元反射实现自主科学发现

Bingchen Zhao, Sara Beery, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 记忆与上下文管理 :tool use(abstract);分类 cs.AI

AI总结 提出DiscoPER框架,利用大语言模型进行开放式的自主科学发现,通过动态代码生成、统计检验和二阶推理机制,在iNatDisco基准上以72.7%假设支持率恢复8/9已知模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00339 2026-07-02 cs.CL 新提交 57%

TRACE: State-Aware Query Processing over Temporal Evidence Graphs for Conversational Data

TRACE:面向对话数据的时间证据图状态感知查询处理

Maolin Wang, Yu Wang, Zichun Liu, Baiyuan Qiu, Chenbin Zhang, Jiguang Shen, Haoran Yang, Hao Miao

机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学香港人工智能科学研究院) Independent Researcher(独立研究者) Central South University(中南大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.CL

AI总结 提出TRACE框架,通过构建时间证据图并维护有效性标注,实现对话数据中状态感知的查询处理,提升时间推理和多跳推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30296 2026-07-02 cs.AI 版本更新 57%

ManimAgent: Self-Evolving Multimodal Agents for Visual Education

ManimAgent: 用于视觉教育的自进化多模态智能体

Wenjia Jiang, Zongyuan Cai, Yuanhang Shao, Chenru Wang, Boyan Han, Zhixue Song, Keyu Chen, Shengwei An, Xu Yang, Zhou Yang

机构 * University of Alberta(阿尔伯塔大学) Southeast University(东南大学) Virginia Tech(弗吉尼亚理工学院) Xidian University(西安电子科技大学) Vivavia Inc(Vivavia公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 提出ManimAgent,通过双通道情节记忆库跨任务传递反思经验,无需权重更新或人工种子,在代码生成任务中提升通过率并减少反思轮次。

Comments Project page: https://manimagent.github.io/. Code: https://github.com/jwj1342/Paper2Manim

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00179 2026-07-02 physics.soc-ph cond-mat.soft nlin.AO 新提交 50%

Synchronization and Swarming of Two-Mode Stochastic Oscillators

双模式随机振荡器的同步与集群

Szabolcs Vitus, Ferenc Járai-Szabó

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究提出一种新型智能体模型,通过空间与内部状态的双向耦合,发现七种形态及量化拓扑吸引子,并推导出宏观标度律,为自主机器人集群设计提供框架。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 25 篇

2607.00939 2026-07-02 cs.SE quant-ph 新提交 85%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 83%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 82%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01136 2026-07-02 cs.SE cs.AI 新提交 81%

Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

技能并非孤岛:衡量智能体技能供应链中的依赖性与风险

Changguo Jia, Tianqi Zhao, Runzhi He, Minghui Zhou

机构 * Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00304 2026-07-02 cs.LG cs.AI cs.CL 新提交 78%

Mapping the Evaluation Frontier: An Empirical Survey of the Bias-Reliability Tradeoff Across Eleven Evaluator-Agent Conditions

映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查

Zewen Liu

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 73%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 70%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30863 2026-07-02 cs.AI 新提交 70%

Beyond expert users: agents should help users construct preferences, not just elicit them

超越专家用户:智能体应帮助用户构建偏好,而不仅仅是引出偏好

Irena Saracay, Ludwig Schmidt, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出用户通常不具备完整偏好,智能体应通过示例或解释帮助用户学习领域知识以构建偏好,并基于信息经济学引入CoPref模型,在推荐系统中通过CoShop基准测试发现现有智能体表现不佳。

Comments Update URLs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00926 2026-07-02 cs.LG cs.AI 新提交 62%

Human-Machine Collaboration on Generative Meta-Learning: Model and Algorithm

人类与机器在生成式元学习中的协作:模型与算法

Midhun Parakkal Unni, Samuel Kaski

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Centre for Machine intelligence, University of Sheffield(谢菲尔德大学机器智能中心) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出生成式元学习与人类反馈框架,通过专家直觉引导数据合成,利用条件神经ODE和强化学习迭代优化生成轨迹,理论证明分布对齐降低泛化误差,实验验证在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 62%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01034 2026-07-02 cs.CL cs.AI cs.HC 新提交 62%

Behavior-Adaptive Conversational Agents: Toward a Fluid Personality Framework

行为自适应对话代理:迈向流动人格框架

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出流动人格框架,根据任务上下文、用户目标和情境紧迫性,动态调整代理的隐喻角色和人格表达强度,以提升用户信任和体验。

Comments Presented at Bridging AI and Behavior Change, a Bridge Program organized at the AAAI Conference on Artificial Intelligence 2026 (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 62%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13715 2026-07-02 cs.AI cs.CL cs.MA 新提交 62%

WorkBench Revisited: Workplace Agents Two Years On

WorkBench 再探:两年后的工作场所智能体

Olly Styles, Sam Miller

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。

Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823

详情

展开后加载摘要…

URL PDF HTML 收藏