arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-31 至 2026-07-31 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 49 篇

2607.28226 2026-07-31 cs.CR cs.AI 新提交 57%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28033 2026-07-31 cs.AI 新提交 57%

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

DataClawEval:面向真实工业场景的数据工程智能体基准测试

Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

机构 * Tencent(腾讯) Xidian University(西安电子科技大学) South China Normal University(华南师范大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27984 2026-07-31 cs.AI 新提交 57%

Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation

共享评判,学习弃权:专业化在大语言模型评估中的作用

Weining Zhang

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。

Comments 12 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27687 2026-07-31 cs.AI 新提交 57%

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Rehearse:从自改进自动研究中的置信度悬崖后退

Jiazhen Ji, Shouhong Ding

机构 * Tencent(腾讯)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27674 2026-07-31 cs.SE 新提交 57%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27597 2026-07-31 cs.RO cs.AI cs.SY eess.SY 新提交 57%

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

面向视觉语言赋能的无人机分类与灾害响应的系统工程框架

Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik, Neelakshi Majumdar

机构 * University of Arkansas(阿肯色大学) University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。

Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum

Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27354 2026-07-31 cs.AI 新提交 57%

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

PAUSE:统一服务环境中面向用户的个人AI助手基准测试

Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 57%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14953 2026-07-31 cs.LG 版本更新 57%

Efficient Online Conformal Selection with Limited Feedback

高效有限反馈下的在线符合选择

Sreenivas Gollapudi, Kostas Kollias, Kamesh Munagala, Ali Sinop

机构 * Google Research(谷歌研究) Department of Computer Science, Duke University(杜克大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种在有限反馈下高效实现在线符合选择的方法,通过适应性符合推断更新规则,在保证目标概率下实现亚线性效率 regret,适用于带隙和半带隙反馈场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04697 2026-07-31 math.OC cs.LG q-fin.CP 版本更新 57%

Continuous-time reinforcement learning for optimal switching over multiple regimes

连续时间强化学习用于多 regime 最优化切换

Yijie Huang, Mengge Li, Xiang Yu, Zhou Zhou

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) School of Mathematics and Statistics, University of Sydney(数学与统计学学院,悉尼大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于连续时间强化学习的多 regime 最优化切换方法,通过熵正则化和马尔可夫链生成矩阵实现策略优化,并利用神经网络验证了算法有效性。

Comments Keywords: Optimal regime switching, continuous-time reinforcement learning, system of HJB equations, policy improvement, policy iteration convergence, financial applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27548 2026-07-31 econ.GN q-fin.EC 新提交 50%

Explaining the Macroeconomic Inertia Puzzle

解释宏观经济惯性之谜

Michael Cai

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过将调查预期替代主体自身预期,结合嵌入不可观测成分模型的异质性主体一般均衡框架,解释了宏观经济惯性之谜,并指出惯性政策会延长传导滞后。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27743 2026-07-31 cs.GT 新提交 50%

Delegated Fair Division

委托式公平分配

Argyrios Deligkas, Michail Fasoulakis, Stavros D. Ioannidis, Alviona Mancho, Evangelos Markakis

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对委托式公平分配模型,区分两种信息结构并提供高效算法,生成同时满足中心与代理人层面基于嫉妒的公平性保证的分配方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15114 2026-07-31 cs.IR cs.SI 版本更新 50%

CoSimRec: Measuring Coordinated-Content Penetration in Recommender Feedback Loops

CoSimRec:衡量推荐反馈循环中的协同内容渗透

Nan Li, Jiahong Shao, Jiuyang Lyu

专题命中 Agent评测 :agent(abstract)

AI总结 研究推荐反馈循环中协同内容渗透问题,提出CoSimRec离线代理评估框架,通过算法渗透率指标家族衡量相关情况,在多数据集和推荐器上评估,发现随机控制无显著正向渗透,基于流行度和反馈敏感排名有提升,同步感知排名降低APR。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10383 2026-07-31 cs.CV 版本更新 50%

Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios

代理视频生成:通过工具约束的LLM规划从文本到可执行事件图

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布奇实验室技术股份公司)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种代理系统,通过LLM生成结构化的事件图规范,并在3D引擎中确定性执行,解决了传统视频生成的语义可靠性问题,展示了在物理真实性和语义对齐上的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16443 2026-07-31 econ.GN q-fin.EC 版本更新 50%

The Turing Valley: How AI Capabilities Shape Labor Income

图灵谷:AI能力如何塑造劳动力收入

Enrique Ide, Eduard Talamàs

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究AI能力在不同维度上如何影响劳动力收入,揭示了人类与AI沟通方式对劳动力市场的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20540 2026-07-31 econ.TH 版本更新 50%

Diagnostic Feedback under Hidden Task Difficulty

隐藏任务难度下的诊断反馈

Mark Izgarshev, Georgy Lukyanov

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对隐藏任务难度的场景,提出均衡精炼机制,可在特定条件下实现对困难任务的诊断,证明隐藏难度能生成智能体相关信息,且该机制适用于连续努力与不完美诊断的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06947 2026-07-31 eess.IV cs.CV 版本更新 50%

BCNet: Bronchus Classification via Structure Guided Representation Learning

BCNet:基于结构引导表征学习的支气管分类

Wenhao Huang, Haifan Gong, Huan Zhang, Yu Wang, Xiang Wan, Haofeng Li, Guanbin Li, Hong Shen

专题命中 Agent评测 :planning(abstract)

AI总结 该研究针对自动支气管分类的个体拓扑差异挑战,提出结构引导的BCNet框架,在BronAtlas基准上F1分数超现有最优方法8%以上,还发布了支气管成像分析开放基准BronAtlas。

Comments The benchmark is available at https://osf.io/pskr9/?viewonly=94fa3d87274b4095ac9a4b88cc9a1341

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2607.27428 2026-07-31 physics.med-ph cs.AI 新提交 57%

Rethinking Artificial Intelligence in Medical Imaging: Assumptions, Reality, and Reframing

重新思考医学影像中的人工智能:假设、现实与重构

Arman Rahmim, Nourhan Bayasi, Xiaoxiao Li, Babak Saboury, Fereshteh Yousefirizi

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏