arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2608.12358 2026-08-14 cs.HC cs.AI 新提交 83%

Interaction Readiness: A Framework for Building and Evaluating AI Agents in Human Roles

交互就绪:构建和评估人类角色AI智能体的框架

Sudhir Alladi Venkatesh

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对带角色属性AI智能体的评估缺口,提出交互就绪框架,通过分离内容与交互规范、四项智能体操作实现评估,证实内容与交互质量独立,并给出规范模板与审核流程。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09696 2026-08-14 cs.AI 版本更新 83%

Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models

模型发现智能体:用于数据高效发现机制世界模型的大语言模型辅助贝叶斯实验设计

Kevin Murphy

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出模型发现智能体(MDA),结合LLM与贝叶斯机制,在少量干预下发现机制世界模型,在三类基准上实现数据高效模型学习与可靠干预预测的SOTA性能。

Comments v3: further improve app A (algorithm pseudocode), add new app G (further related work) - (main text unchanged)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11679 2026-08-13 cs.AI cs.IR cs.MA 新提交 83%

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) Auburn University(奥本大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新 83%

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23300 2026-08-13 q-fin.PM cs.AI cs.MA q-fin.ST 版本更新 83%

Designing Agentic AI-Based Screening for Portfolio Investment

基于代理AI的资产组合投资筛选设计

Mehmet Caner, Agostino Capponi, Nathan Sun, Jonathan Y. Tan

机构 * North Carolina State University, Nelson Hall, Department of Economics(北卡罗来纳州立大学,Nelson Hall,经济学系) Columbia University. Department of Industrial Engineering and Operations Research and Columbia Business School(哥伦比亚大学,工业工程与运筹学系及哥伦比亚商学院) Columbia University. Department of Industrial Engineering and Operations Research(哥伦比亚大学,工业工程与运筹学系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的资产组合投资筛选框架,通过两个专用代理筛选优质公司并生成买卖信号,结合高维精度矩阵估计确定最优权重,实验证明其在S&P 500数据上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10299 2026-08-12 cs.CL 新提交 83%

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

智能体系统中的协同进化:迈向超越人类设计的自主进化

Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本综述聚焦智能体系统的协同进化,提出三阶段分类法梳理其发展,探讨相关开放挑战,为构建超越人类设计路径的自主智能体系统提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09939 2026-08-12 cs.HC cs.AI 新提交 83%

How to Dogfood Your AI Chat Agent: A Three-Layer Evaluation Framework with Goal-Directed NPC Simulation

如何内部试用你的AI聊天智能体:一种结合目标导向NPC模拟的三层评估框架

Alexandre Cristovão Maiorano

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出三层评估框架,结合NPC模拟器验证LLM聊天智能体的多轮对话目标达成能力,其模拟器成本低、效率高,可用于CI/CD集成,相关资源已公开供其他团队使用。

Comments 24 pages, 11 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08636 2026-08-12 cs.CL 版本更新 83%

InternAgentHarness: A Scalable Synthetic Environment for Enhancing LLM Agentic Abilities

InternBootcamp 技术报告:通过可验证的任务扩展提升大语言模型推理能力

Xiaozhe Li, Yongkang Chen, Shujian Deng, Peiji Li, Yichuan Ma, Huaxi Huang, Qiye Cai, Tianyi Lyu, Le Ma, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出InternBootcamp框架,通过可验证的任务扩展方法提升大语言模型的推理能力,为基于强化学习的模型优化、合成数据生成和模型评估提供了基础设施。

Comments InternAgentHarness tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02478 2026-08-11 cs.AI 版本更新 83%

AIVV: Neuro-Symbolic LLM Agent-Integrated Verification and Validation for Trustworthy Autonomous Systems

AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证

Jiyong Kwon, Ujin Jeon, Sooji Lee, Guang Lin

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16481 2026-08-11 cs.LG 版本更新 83%

Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harms

评估智能体系统对抗恶意诱导危害的鲁棒性

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06984 2026-08-10 cs.CR cs.AI 新提交 83%

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

HarnessSafe:评估智能体框架中持久载体的安全性

Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。

Comments 21 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 83%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06353 2026-08-07 cs.GT cs.AI cs.MA 新提交 83%

Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents

资源权威:部署AI代理参与式治理的机制设计模型

Praphul Chandra, Sujit Gujar, Ganesh Ghalme

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出资源权威机制设计模型,用于通过计算预算使授权自我执行,实现对已部署AI代理的参与式治理,同时指出被治理代理操纵治理 electorate 是核心开放问题。

Comments 22 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16666 2026-08-07 cs.CL 版本更新 83%

Robust Native Language Identification through Agentic Decomposition

基于智能体分解的鲁棒原生语言识别

Ahmet Yavuz Uluslu, Tannon Kew, Tilia Ellendorff, Gerold Schneider, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文针对LLM原生语言识别易依赖表面线索的问题,提出受法医语言学启发的智能体分解流程,通过专用智能体积累分类证据、协调智能体综合预测,在基准数据集上提升了NLI的鲁棒性与性能一致性。

Comments Accepted at EMNLP* 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 8398-8414

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04830 2026-08-06 cs.AI 新提交 83%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 Agent评测 :workflow(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04562 2026-08-06 cs.AI 新提交 83%

What Is a Skill Worth? Structure-Aware Shapley Valuation of Agent Skills

技能价值几何?智能体技能的结构感知夏普利估值法

Tao Li, Junfeng Liu, Qinghua Zhao, Yifan Li, Lei Wang, Bo Shao, Xuejun Liu, Linjun Shou

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Pengcheng Laboratory(鹏城实验室) Hefei University(合肥学院) Microsoft(微软公司)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出结构感知夏普利式技能估值框架SkillSV,通过编译技能结构、分离内容与上下文价值,在四个智能体基准上验证其可恢复单元交互、指导技能压缩等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03018 2026-08-05 cs.AI 新提交 83%

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

UrbanAgent:面向跨系统城市任务的工具增强型智能体

Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 83%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00677 2026-08-04 cs.CL 新提交 83%

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

OpenART:通过开放式环境演化扩展智能体红队演练规模

Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) XSafeAI

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.CL

AI总结 本研究针对现有智能体安全基准无法捕捉累积风险的问题,推出开放式智能体红队演练平台OpenART,并提出EMHA攻击方法,在75种智能体模型配置上实现85.0%的汇总攻击成功率,为复杂环境下的智能体安全研究提供可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00102 2026-08-04 cs.AI cs.MA 新提交 83%

Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce

大语言模型智能体能否进行竞争性定价?面向智能体商务的动态多属性拍卖基准

Shimaa Ahmed, Yiwei Cai, Mohsen Minaei, Rahul Rachuri

机构 * Visa Research(维萨研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究推出动态多属性拍卖基准Bazaar,测试11个前沿LLM智能体的定价能力,发现其在客户获取与利润表现上存在差异,需求冲击下排名变化,最强智能体仅获不到三分之一最优利润,显示仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25379 2026-08-04 cs.AI 版本更新 83%

Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response

具备网络能力的人工智能代理:漏洞、评估遏制与防御响应

Abu Bakar Siddik

机构 * Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究具备网络能力的人工智能代理的漏洞等问题,综合五类漏洞,以特定事件为案例研究,探讨遏制等控制措施,确定评估网络能力及其运行环境安全性的实际优先事项。

Comments 27 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28802 2026-08-03 cs.AI 新提交 83%

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

模型还是控制?一种以交互为中心的智能体故障定位分类法

Harsh Raj, Vipul Gupta, Anas Mahmoud, Razvan-Gabriel Dumitru, Darvin Yi, Aakash Sabharwal, Yunzhong He

机构 * Scale

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出以交互为中心的智能体故障分类法,将故障定位到交互及责任组件,适用于多类智能体架构,经评估具有良好可重复性与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27677 2026-07-31 cs.MA cs.AI 新提交 83%

Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness

不要凭直觉部署AI智能体:能力并非生产就绪

Fouad Bousetouane

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对AI智能体部署依赖能力而非生产就绪性的问题,提出ProofAgent Index(PAI)这一四维度治理就绪指标,经医疗、金融领域验证可区分风险,实现从直觉部署到可审计决策的转变。

Comments 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04425 2026-07-31 cs.CR cs.AI 版本更新 83%

What If Prompt Injection Never Left? Rethinking Agent Security through Cross-Session Stored Prompt Injection

如果提示注入从未消失?探索智能体系统中的跨会话存储提示注入

Yuanbo Xie, Wenlei Zhu, Tianyun Liu, Yingjie Zhang, Suchen Liu, Yulin Li, Liya Su, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AI Sec Lab, Beijing Chaitin Technology Co.,Ltd(北京柴坦科技有限公司AI安全实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本研究引入跨会话存储提示注入,通过持久化状态使提示注入从单会话模型级威胁转变为长期系统级漏洞,并构建了分类法、基准测试和沙箱工具以评估风险。

Comments position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26367 2026-07-30 cs.AI 新提交 83%

Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?

探索物理问题中的结构:AI智能体能否发现统计力学映射?

Wanyu Zhao, Wanbing Zhao

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。

Comments Accepted to the AID-Wild workshop at CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25253 2026-07-30 cs.AI cs.IR 版本更新 83%

The User Asks, Platforms Compete: How Agentic Recommendation Markets Take Shape

用户提问,平台竞争:代理推荐市场如何形成

Deyao Hong, Kehan Zheng, Qian Li, Jun Zhang, Jie Jiang, Hongning Wang

机构 * Tsinghua University(清华大学) Tencent Inc.(腾讯公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究基于LLM的代理推荐市场,用户先提需求平台竞争注意力。实验发现新设置在获取与注意力间有紧张关系,竞争引发平台策略行为,关联反馈可增加购买机会,强调设计代理推荐需综合考虑多方面并作为联合机制设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25914 2026-07-29 cs.AI cs.CR cs.NI 新提交 83%

Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks

迈向自主网络中标准化的跨供应商代理工具信任管理

Ravi Kant Sharma, Ashutosh Uttam, Ajay Kumar

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究自主网络中跨供应商代理工具信任管理问题,提出AgentToolMO模型,含信任状态机等内容。模拟评估显示该模型能减少传播范围、保证级联收敛,为可信多供应商自主网络管理提供标准化途径。

Comments 22 pages, 7 figures, 9 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 83%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24006 2026-07-28 cs.CR cs.AI cs.DC 新提交 83%

Agentic Cloud Decoys: A Deception-Driven Framework for Autonomous Intrusion Investigation

智能云诱饵:一种用于自主入侵调查的欺骗驱动框架

Mohan Manivannan, Dalal Alharthi

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22824 2026-07-28 physics.med-ph cs.AI cs.CV 新提交 83%

Agentic Autoresearch for CT Reconstruction

用于CT重建的智能自动研究

Andreas Maier, Lucas Kachelriess, Siming Bayer, Yixing Huang, Yan Xia, Amber Simpson, Moritz Zaiss

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究CT重建方法比较难题,利用大语言模型智能体构建智能循环,独立实现、调整并基准测试26种方法,重组为紧凑求解器,发现理想数据排名无法预测现实噪声下表现,噪声会颠倒排名,重新训练可恢复部分排名,强调基准测试需考虑多种现实因素。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏