arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-28 至 2026-07-28 共收录 287 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 39 篇

2509.03059 2026-07-28 cs.LG cs.AI 版本更新 62%

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

Loong:通过验证器大规模合成长思维链

Xingyue Huang, Rishabh, Gregor Franke, Ziyi Yang, Jiamu Bai, Weijie Bai, Jinhe Bi, Zifeng Ding, Yiqun Duan, Chengyu Fan, Wendong Fan, Xin Gao, Ruohao Guo, Yuan He, Zhuangzhuang He, Xianglong Hu, Neil Johnson, Bowen Li, Fangru Lin, Siyu Lin, Tong Liu, Yunpu Ma, Hao Shen, Hao Sun, Beibei Wang, Fangyijie Wang, Hao Wang, Haoran Wang, Yang Wang, Yifeng Wang, Zhaowei Wang, Ziyang Wang, Yifan Wu, Zikai Xiao, Chengxing Xie, Fan Yang, Junxiao Yang, Qianshuo Ye, Ziyu Ye, Guangtao Zeng, Yuwen Ebony Zhang, Zeyu Zhang, Zihao Zhu, Bernard Ghanem, Philip Torr, Guohao Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24300 2026-07-28 cs.CL cs.MA 新提交 57%

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

在启发式自我改进智能体中自我编写的验证不可靠

Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24275 2026-07-28 cs.LO cs.AI cs.CY 新提交 57%

A Computational Ethical Framework for Financial Digital Phenotyping for Mental Health

用于心理健康的金融数字表型分析的计算伦理框架

Oluwadara Adedeji, Michael Mayowa Farayola, Jeff Brozena, Irina Tal, Regina Connolly, Mark Matthews

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。

Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 57%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23263 2026-07-28 cs.AI 新提交 57%

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

SeekJudge:计算机使用智能体强化学习的实用奖励框架

Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对计算机使用智能体强化学习中轨迹指令判断问题,提出SeekJudge框架,通过四个智能体循环裁决,用种子校准蒸馏管道训练共享主干模型,该框架在在线RL中匹配或超原生规则监督,还有诸多优势并改进奖励服务器,使模型奖励成实用替代品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23024 2026-07-28 cs.CV cs.LG stat.AP 新提交 57%

When Less Is More: A Controlled Benchmark of Lightweight CNNs for Satellite Land-Cover Segmentation on DeepGlobe

少即是多:用于DeepGlobe卫星土地覆盖分割的轻量级卷积神经网络的受控基准测试

Atiq Ur Rehman, Joseph Michael Donovan

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究在DeepGlobe数据集上比较VGG16等五种架构用于卫星土地覆盖分割,经三个迭代分离相关因素,采用相同预处理等协议。结果显示MobileNetV2_v1表现优,轻量级迁移学习模型在资源受限遥感环境中可匹配或超越更深模型,利于土地覆盖映射。

Comments 18 Figures, 8 Tables & 33 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22563 2026-07-28 cs.AI 新提交 57%

Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents

用于工业4.0智能体评估的合成场景生成

Sagar Chethan Kumar, Rohith Kanathur, Dhaval Patel, Kaoutar El Maghraoui

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对工业智能体基准测试场景有限问题,扩展AssetOpsBench并引入ScenarioGeneratorAgent管道,通过多种优化方式提高可扩展性,实现智能电网变压器场景生成的高效优化,有效扩展工业智能体基准测试且保证场景质量。

Comments 19 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22573 2026-07-28 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 57%

PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability

PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集

Wen-Kao Li, Ze-Feng Gao, Zhong-Yi Lu

机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。

Comments 18 pages, 3 figures, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31767 2026-07-28 cs.SE 版本更新 57%

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java

JETO-Bench: Java执行时间改进补丁的可复现基准测试

Khashayar Etemadi, Zhendong Su

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 提出JETO-Mine工具,通过静态分析、动态分析和评估框架自动构建可复现的Java执行时间改进补丁基准,并构建包含660个补丁的JETO-Bench,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28371 2026-07-28 cs.CY cs.AI 版本更新 57%

Coherent Without Grounding, Grounded Without Success: Observability and Epistemic Failure

无需基础的协调,协调的无需成功:可观测性与认知失败

Camilo Chacón Sartori

机构 * Institut Català de Nanociència i Nanotecnologia (ICN2)(加泰罗尼亚纳米科学与纳米技术研究所(ICN2)) Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在低可观测性和高可观测性领域中协调与基础的分离现象,提出认知三角模型以评估人工智能代理的认知能力。

Comments Error found in some results. I need to correct it before re-uploading

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 57%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22885 2026-07-28 cs.CR 新提交 50%

ReCon: A Resource-Constrained Benchmark for LLM-Based Cybersecurity Compliance Across Ingestion and Retrieval Pipelines

ReCon:用于跨摄取和检索管道的基于大语言模型的网络安全合规性的资源受限基准测试

Rohit Negi, Rishik Jain, Soumyo V Chakarborty, Amit Negi, Sandeep K Shukla

专题命中 Agent评测 :agentic(abstract)

AI总结 研究政府、企业和机构网络安全合规问题,利用无需GPU和高内存的大语言模型进行合规检查任务基准测试,实验证明低资源大语言模型在政策文件合规检查中可提供良好一致性/准确性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 50%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :agent(abstract)

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2607.22813 2026-07-28 hep-ph 新提交 78%

Agentic Re-Casting using Agentic Re-Simulations

使用智能重模拟进行智能重塑

Sascha Diefenbacher, Tilman Plehn, Daniel Schiller, Nikita Schmal

专题命中 其他Agent :agentic(title,abstract)

AI总结 研究如何利用智能系统结合物理学家更新LHC的全局SFitter分析,核心方法是基于MadAgents.v3构建智能接口,主要贡献是使先进方法能被更广泛受众使用且相关研究可推广至SFitter之外。

Comments 35 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22959 2026-07-28 cs.CV cs.AI 新提交 57%

HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale

HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统

Aniket Sakpal, Yang Jiang, Rouzbeh Davoudi, Shayan Hassantabar, Mani Najmabadi

机构 * Expedia Group(亿客行集团)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20393 2026-07-28 cs.DS cs.IR 版本更新 50%

Near-Optimal Dimension Lower Bounds for Single-Vector Embeddings of Maximum Inner Product Similarity

最大内积相似度单向量嵌入的近最优维度下界

Rajesh Jayaram, Honghao Lin, Vahab Mirrokni, David P. Woodruff

专题命中 其他Agent :agentic(abstract)

AI总结 研究针对最大内积相似度单向量嵌入的维度下界问题。此前上下界在m指数上有差距,本文几乎弥合。证明结合方法得出,对固定δ及足够小ε、m≥(1/ε)^A_δ,单向量近似维度D≥m^(c_δ/ε^(2 - 2δ)),此结论对多种情况适用,指数接近上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09179 2026-07-28 eess.SP 版本更新 50%

WiFo-M$^2$: Empower Wireless Communications With Plug-and-Play Environment Sensing via Foundation Model

WiFo-M$^2$:通过基础模型利用插件式环境感知增强无线通信

Haotian Zhang, Shijian Gao, Xiang Cheng

专题命中 其他Agent :agentic(abstract)

AI总结 WiFo-M$^2$通过基础模型实现环境感知与无线通信的无缝集成,提升物理层行为的性能和泛化能力。

Comments 16 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏