arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-13 至 2026-07-13 共收录 109 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 7 篇

2607.09502 2026-07-13 cs.LG cs.AI cs.IR 新提交 73%

All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models

所有解释都是错误的,但许多解释是有用的:用大语言模型探索罗生门解释集

Pan Li

机构 * Scheller College of Business, Georgia Tech(舍勒商学院,佐治亚理工学院)

专题命中 记忆与上下文管理 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究指出机器学习模型解释存在准确性与可解释性权衡非根本性的观点,引入罗生门解释范式,提出RashomonLLM工作流程,经实验验证其在多任务中显著优于基线,提升业务性能并奠定消费者信任基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09641 2026-07-13 cs.LG cs.AI 新提交 62%

Semantic Pareto-DQN: A Multi-Objective Reinforcement Learning Framework for Financial Anomaly Detection

语义帕累托深度Q网络:一种用于金融异常检测的多目标强化学习框架

Cláudio Lúcio do Val Lopes, Lucca Machado da Silva

机构 * A3Data(A3数据公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对金融异常检测的类不平衡问题,提出语义帕累托深度Q网络框架,合成交易特征,优化向量奖励,映射帕累托前沿,经实验验证可打破零召回陷阱,提升少数类召回率,为金融异常发现提供新途径。

Comments BRACIS 2026 - 36th Brazilian Conference on Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09385 2026-07-13 cs.DC cs.AI cs.PF 新提交 57%

STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

STEEL:用于在AMD的XDNA NPU上进行节能长序列推理的稀疏感知融合注意力

Victor J. B. Jung, Gagandeep Singh, Joseph Melber, Kristof Denolf, Francesco Conti, Luca Benini

机构 * AMD Research and Advanced Development (RAD)(AMD研究与先进开发) Integrated Systems Laboratory (IIS)(集成系统实验室) ETH Zürich(苏黎世联邦理工学院) Department of Electrical, Electronic and Information Engineering (DEI)(电气电子信息工程系) University of Bologna(博洛尼亚大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 研究针对笔记本级SoC上节能推理,提出STEEL这一针对类似XDNA的NPU的FlashAttention开源实现,通过引入预填充注意力数据流公式化及稀疏感知流水线布局,降低能耗与延迟,相比CPU和GPU有显著性能提升。

Comments Accepted at IEEE COINS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09106 2026-07-13 math.DS 新提交 50%

Nonexchangeable logit dynamics with cost constraints: different viewpoints and numerical analysis

具有成本约束的不可交换逻辑动力学:不同观点与数值分析

Hidekazu Yoshioka, Tomohiro Tanaka

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究受异质主体成本约束的逻辑动力学,从SDE和FPE两个观点分析其适定性,通过在成本约束中添加正则化因子防止数值计算崩溃,给出计算FPE的数值方法并进行交叉领域示范应用研究。

Comments Ver. June 19, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22786 2026-07-13 cs.CV 版本更新 50%

Predictive Photometric Uncertainty in Gaussian Splatting for Novel View Synthesis

预测性光度不确定性在新型视角合成中的高斯点散射应用

Chamuditha Jayanga Galappaththige, Thomas Gottwald, Peter Stehr, Edgar Heinert, Niko Suenderhauf, Dimity Miller, Matthias Rottmann

机构 * QUT Centre for Robotics, Australia(昆士兰大学机器人中心,澳大利亚) ARIAM Hub, Australia(ARIAM中心,澳大利亚) University of Wuppertal, Germany(乌尔姆大学,德国) University of Osnabrück, Germany(奥斯纳布吕克大学,德国)

专题命中 记忆与上下文管理 :autonomous agent(abstract)

AI总结 本文提出轻量级框架,通过贝叶斯正则化线性最小二乘优化重建残差,实现像素级视图依赖性预测不确定性,提升3D高斯点散射在自主代理和安全关键应用中的可靠性。

Comments Accepted at ECCV26. Project Page: https://chumsy0725.github.io/3DGS-Uncertainty/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 13 篇

2607.09586 2026-07-13 cs.AI 新提交 88%

TrustX Agent Risk Classification Framework (ARC): Risk-Tiering Internally Created Agentic AI Systems

TrustX智能体风险分类框架(ARC):对内部创建的智能体人工智能系统进行风险分层

Hannah M. Liu, Rhea Saxena, Shiv Asthana

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 针对智能体人工智能系统超出通用风险框架治理能力的问题,提出TrustX智能体风险分类框架(ARC),利用十二维度评分标准等组件量化风险,输出三层治理结果,为相关人员提供工具,且会持续迭代完善。

Comments This is a working paper on our risk classification tool, with iterations currently underway

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09065 2026-07-13 cs.SE cs.AI 新提交 84%

Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills

深入技能市场:从软件工程活动到可复用的智能体技能

Jialun Cao, Xinru Yan, Songqiang Chen, Yaojie Lu, Zhongxin Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science(香港科技大学) University of Chinese Academy of Sciences Beijing, China(中国科学院大学) Institute of Software, Chinese Academy of Sciences Beijing, China(中国科学院软件研究所) Zhejiang University Hangzhou, China(浙江大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨软件工程活动如何转化为可复用智能体技能。通过对公共库和市场中SE技能大规模实证研究,分析其封装活动、生命周期覆盖等,发现SE活动正通过技能成为可复用工件,为技能推荐等提供研究机会及相关机制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09474 2026-07-13 cs.AI 新提交 84%

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

ProofCouncil:用于解决开放性数学问题的语言模型智能体

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学) Leiden University(莱顿大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究旨在提升大型语言模型解决数学开放性问题的性能,介绍了ProofCouncil智能体,它采用作者-评论家架构,在FirstProof挑战及其他问题测试中表现出色,还介绍了其开发及相关构建库并开源。

Comments 25 pages, 7 figures. ProofCouncil appears as System A (IMProofBench ProofCouncil) in the official FirstProof second-batch report (arXiv:2606.18119). Code and agent-building library: https://github.com/eth-sri/proof-council

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09420 2026-07-13 q-bio.PE 新提交 78%

PesTwin: A modular agent-based framework for pest and vector population control

PesTwin:一种用于害虫和病媒种群控制的基于模块化代理的框架

Andrea De Antoni, Giovanni Iacca, Andrea Pugliese, Anna Strampelli, Gerard Terradas, Matteo Rucco, Andrew Hammond

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对基因控制技术建模工具滞后问题,提出PesTwin框架,可跨物种等模拟基因控制技术,捕捉多种因素。经与实验室数据验证后可扩展到田间场景,能在基因控制系统实际应用前进行模拟测试,助力相关决策,缩短研发到应用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新 75%

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 73%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 73%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29762 2026-07-13 cs.IR 版本更新 67%

Do Recommendation Algorithms Work When Users Are LLM Agents? A Case Study on Moltbook

当用户是LLM智能体时推荐算法是否有效?基于Moltbook的案例研究

Daming Li, Simeng Han, Jialu Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究LLM智能体作为用户时推荐算法的有效性,在Moltbook平台上评估八种方法,发现基于流行度和物品协同过滤的方法优于用户表示学习,表明推荐从个性化退化为结构模式匹配。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 57%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08907 2026-07-13 q-fin.TR q-fin.CP 新提交 50%

Herding and Liquidity in Order-Book Markets. I. A Robust Liquidity-Stress Crossover and its Reflexive Mechanism

订单簿市场中的羊群行为与流动性。I. 稳健的流动性压力交叉及其反身机制

Jan Novotny

专题命中 Agent评测 :agent(abstract)

AI总结 研究订单簿市场中羊群行为与流动性,应用布沙尔相图方法于连续双拍卖模型,通过7x6网格定位流动性压力交叉,分析其稳健性及反身机制,还进行双市场分析,发现无方向性跨市场传染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09327 2026-07-13 cs.DS 新提交 50%

Subexponential Algorithm for High Multiplicity Fair Division of Mixed Instances via Stereometry

通过立体测量法对混合实例进行高多重性公平分配的次指数算法

Yuriy Dementiev, Fedor Pribytkov, Danil Sagunov

专题命中 Agent评测 :agent(abstract)

AI总结 研究n个代理对m个分三类的不可分割物品的无嫉妒分配问题,提出首个运行时间为(n·m)^O(√n)的次指数算法,利用几何表示和定理递归分解代理集,还扩展算法处理预固定分配代理以保持无嫉妒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09318 2026-07-13 cs.DC 新提交 50%

EcoKube: Simulating Carbon-Aware Scheduling Policies in Heterogeneous Edge-Cloud Environments

EcoKube:在异构边缘云环境中模拟碳感知调度策略

Gonçalo Ferreira, Shashikant Ilager

专题命中 Agent评测 :workflow(abstract)

AI总结 针对云与边缘计算能源需求增长及碳排放问题,提出EcoKube框架,用于在异构边缘云环境中评估可持续性感知调度策略,含事件驱动模拟器等,通过合成批处理工作负载评估,可在部署前比较策略。

Comments 6 pages, 2 figures. Submitted to EuroSys2026 (TDIS 2026) workshop

Journal ref Proceedings of the 4th International Workshop on Testing Distributed Internet of Things Systems (TDIS 2026), ACM, 2026, pp. 7-12

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09078 2026-07-13 cs.CV cs.RO 新提交 50%

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method

面向野外无人机的主动目标检测:大规模数据集、基准和方法

Tianpeng Liu, Xinhua Jiang, Li Liu, Qinmu Shen, Siwei Tang, Zhen Liu, Yongxiang Liu

专题命中 Agent评测 :agent(abstract)

AI总结 针对无人机主动目标检测缺乏高质量数据集和基准的问题,提出ATRNet-LUDO数据集并建立评估基准。利用联合嵌入预测架构构建世界模型,提出AOD-JEPA,经实验验证其有效性和优越性,推动无人机-地面主动目标检测领域研究。

Comments 18 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他Agent 1 篇

2607.08906 2026-07-13 cs.CR cs.DC 新提交 78%

Proof-of-Continuity: A Temporal Model for Authority Propagation in Distributed Systems and AI Agents

连续性证明:分布式系统和人工智能代理中权限传播的时间模型

Nicola Gallo

专题命中 其他Agent :AI agent(title,abstract)

AI总结 研究分布式系统和AI代理中权限传播问题,提出连续性证明模型,引入关系证明原语,其传递组合构成连续性证明,补充拥有证明,确保权限传播因果关系,避免混淆代理条件,解决源存在后权限传播问题。

Comments 23 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏