arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-29 至 2026-07-29 共收录 172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2607.25098 2026-07-29 cs.CC 新提交 82%

An Artificial Market for Brazilian Real Estate Investment Funds: An Agent-Based Proposal

巴西房地产投资基金的人工市场:基于代理的提议

Gilberto Gil F. G. Passos, Eber Assis Schmitz, Sildenir Alves Ribeiro

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)

AI总结 研究利用基于代理的建模方法开发巴西房地产投资信托人工市场,整合其价值链,纳入宏观经济变量体现代理异质性,经校准和验证,该模型能再现真实市场典型事实,为分析监管政策和定价机制提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交 81%

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24821 2026-07-29 cs.MM cs.CV cs.SD 新提交 80%

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

AVE-Compass:迈向音频-视频编辑能力的整体评估

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27243 2026-07-29 cs.IR cs.SE 版本更新 79%

NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

NOVA: 面向工业推荐系统架构演化的验证感知智能体框架

Shaohua Liu, Liang Fang, Yilong Sun, Shudong Huang, Qingsong Luo, Shaoxin Liu, Xiaoyang Chen, Dongqiang Liu, Chuangang Ma, Zhenzhen Chai, Henghuan Wang, Shijie Quan, Changyuan Cui, Zhangbin Zhu, Peng Chen, Wei Xu, Lei Xiao, Haijie Gu, Jie Jiang

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24822 2026-07-29 cs.IR 新提交 78%

A Position Paper on Recommender Systems in the Era of Autonomous Agents

关于自主智能体时代推荐系统的立场文件

Aixin Sun

专题命中 Agent评测 :autonomous agent(title,abstract)

AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。

Comments Accepted to the ACM RecSys 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22610 2026-07-29 cs.HC 78%

Everything Counts: The Managed Omnirelevance of Speech in Human-Voice Agent Interaction

一切都有价值:人类与语音代理互动中语音的受控全相关性

Damien Rudaz, Mathias Broth, Jakub Mlynar

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究探讨了人类与语音代理互动中语音的全相关性问题,分析了人类如何管理代理的轮流发言行为,以及技术进步对这一现象的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11665 2026-07-29 cs.RO 版本更新 75%

Nautilus: From One Prompt to Plug-and-Play Robot Learning

Nautilus:从一个提示到即插即用的机器人学习

Yufeng Jin, Jianfei Guo, Xiaogang Jia, Yu Deng, Zechu Li, Han Liu, Weiran Liao, Vignesh Prasad, Mathias Franzius, Gerhard Neumann, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) KIT(卡尔斯鲁厄理工学院) FZI(弗劳恩霍夫研究所) Robotics Institute Germany(德国机器人研究所) Honda Research Institute Europe(本田欧洲研究院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract)

AI总结 Nautilus通过单个提示生成可复现、评估、微调和部署的机器人学习工作流程,提供即插即用的代理技能集和统一接口,减少跨家族验证的工程负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13241 2026-07-29 cs.LG cs.AI 73%

Recursive Deep Inverse Reinforcement Learning

Paul Ghanem, Owen Howell, Michael Potter, Pau Closas, Alireza Ramezani, Deniz Erdogmus, Tales Imbiriba

机构 * Boston Dynamics AI Institute(波士顿动力AI研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25765 2026-07-29 cs.CL cs.DB 新提交 70%

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

WorkSurface-Bench:在多表面知识路由上对企业代理进行基准测试

Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村科学城) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL

AI总结 针对企业代理整合异构知识源时表面路由能力评估不足的问题,提出WorkSurface-Bench基准测试,含多种任务且答案可审计,评估多个模型主干,揭示表面选择与任务完成关系及干预效果,并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 67%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24999 2026-07-29 cs.CL cs.AI 新提交 62%

CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models

CogArena:大语言模型认知能力结构的多方法评估

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究围绕多方法框架构建CogArena基准评估大语言模型认知能力结构,通过多模型实验,发现范式相关性多为正但组内优势不明显,冻结确认标准及复制均失败,未建立稳定五维分布,提供了结合多种要素的工作流程。

Comments 21 pages, 8 figures. Code and the procedurally generated battery: https://github.com/dengzhe-hou/CogArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 57%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25045 2026-07-29 cs.AI eess.SP q-bio.NC 新提交 57%

CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。

Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08058 2026-07-29 cs.CV cs.AI cs.RO cs.SY eess.SY 版本更新 57%

Picasso: Holistic Scene Reconstruction with Physics-Constrained Sampling

Picasso: 基于物理约束采样的整体场景重建

Xihang Yu, Rajat Talak, Lorenzo Shaikewitz, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出Picasso,一种通过快速拒绝采样推理多物体交互并考虑几何、非穿透和物理约束的整体场景重建方法,在物理合理性和重建精度上显著优于现有技术。

Comments 15 pages, accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25568 2026-07-29 cs.GT 新提交 50%

Network Reciprocity Shapes Evolutionary Cybersecurity Dynamics

网络互惠塑造进化网络安全动态

Adeela Bashir, Zia Ush Shamszaman, Zhao Song, The Anh Han

专题命中 Agent评测 :agent(abstract)

AI总结 研究人工智能辅助网络安全系统中群体结构对攻防动态的影响。提出混合角色进化博弈框架,结合随机进化分析与模拟。发现交互结构是关键决定因素,局部网络交互组织防御主体可提升网络长期弹性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25131 2026-07-29 cs.HC q-bio.NC 新提交 50%

Beyond the Post Hoc User Study: Modeling Visual Decision-Making with Active Inference

超越事后用户研究:用主动推理对视觉决策进行建模

Harrison J. Goldwyn, Graham Johnson, Christopher Ibarra, Lace Padilla, Kenny Gruchalla

专题命中 Agent评测 :agent(abstract)

AI总结 研究旨在填补可视化解释机制空白,用主动推理将认知理论转化为模拟。以柱状图平均估计任务为例实现两类主体,分析其易出现的偏差及产生的认知痕迹,为可视化解释机制假设提供框架,支持更优的计算机模拟评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24826 2026-07-29 cs.IR cs.MA 新提交 50%

Aethel: A Reproducible Graph-Retrieval Framework for Multi-Hop Financial Diligence

Aethel:用于多跳金融尽职调查的可重现图检索框架

Krish Sapru

专题命中 Agent评测 :agent(abstract)

AI总结 针对二级私募股权交易中财务披露信息综合难题,Aethel框架结合二分个性化PageRank图检索等技术,将语料库建模为实体-段落图。在多跳金融尽职调查任务中,该框架在特定数据集上有较好表现,优势依赖语料库规模和实体索引质量,且发布相关工件保证可重现性。

Comments 11 pages, 3 figures, 2 tables. Includes evaluations on MuSiQue, 2WikiMultiHopQA, and a 4,123-chunk financial-disclosure corpus. Code and evaluation artifacts are available for reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25475 2026-07-29 physics.soc-ph nlin.AO q-bio.PE 新提交 50%

Coevolution of epidemic dynamics and network topology driven by disease fatality and waning immunity

由疾病致死率和免疫力下降驱动的流行病动力学与网络拓扑结构的共同演化

ThankGod I. S. Ikpe, Takayuki Hiraoka, Naoya Fujiwara

专题命中 Agent评测 :agent(abstract)

AI总结 研究流行病动力学与网络拓扑的相互作用,开发基于主体模型,发现模型会经历流行病转变,网络可能失去无标度特性,通过异质平均场近似验证结果,凸显网络演化在流行病模型中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25458 2026-07-29 cs.SI cs.CY nlin.AO 新提交 50%

Resilience: Understand Breakdown, Foster Recovery, and Choose the Right Perspective

恢复力:理解崩溃、促进恢复并选择正确视角

Frank Schweitzer

专题命中 Agent评测 :agent(abstract)

AI总结 研究恢复力,区分两种系统动态,指出崩溃常自我造成且正反馈有正负作用。认为易变系统中恢复力是主体交互的涌现属性,需数据驱动方法,模型显示恢复力是稳健性与适应性的妥协,二阶解决方案更有前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04748 2026-07-29 econ.TH 版本更新 50%

Honesty, Stigma, and Cooperation in an Overlapping-Generations Game

重叠世代博弈中的诚实、污名与合作

David Li, Georgy Lukyanov

专题命中 Agent评测 :agent(abstract)

AI总结 研究重叠世代博弈中诚实、污名与合作关系,通过纳入选择到均衡信念,分析不同情况下均衡状态,发现特定参数区域多种均衡共存,内部分支不稳定,还探讨了最大最小规则及记录清除对合作的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2607.06608 2026-07-29 cs.CR cs.AI cs.HC 版本更新 79%

Security and Privacy in Agentic AI: Grand Challenges and Future Directions

智能体人工智能中的安全与隐私:重大挑战与未来方向

Adam Jenkins, Agnieszka Kitkowska, Caterina Maidhof, Diego Paracuellos, Francesco Sovrano, Gonzalo Gabriel Mendez, Guillermo Suarez-Tangil, Hana Kopecka, Isabel Wagner, Isabel Barbera, Javier Carnerero-Cano, Jide Edu, Jose Luis Martin-Navarro, Jose Such, Josep Domingo-Ferrer, Juan Carlos Carrillo, Kopo Marvin Ramokapane, Mark Cote, Pablo Vellosillo, Ramon Ruiz-Dolz, Rongjun Ma, Ruba Abu-Salma, Sameer Patil, William Seymour, Xiao Zhan

机构 * King’s College London(伦敦国王学院) Jönköping University(琼斯平大学) Universitat Politècnica de València(巴塞罗那理工大学) Inria(法国国家信息与自动化技术研究所) IBM Research(IBM研究院) Aalto University(阿尔托大学) INGENIO (CSIC–Universitat Politècnica de València)(INGENIO(西班牙国家科研委员会-巴塞罗那理工大学)) IMDEA Networks(IMDEA网络研究所) University of Basel(巴塞尔大学) Dutch Data Protection Authority (AP)(荷兰数据保护局) University of Strathclyde(斯特拉斯克莱德大学) Universitat Rovira i Virgili(罗维拉-维古利大学) University of Bristol(布里斯托大学) University of Dundee(邓迪大学)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 探讨智能体人工智能安全与隐私关键挑战及未来方向,通过汇聚30位国际专家的视野扫描活动,针对人工智能增长带来的新风险展开讨论与协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08554 2026-07-29 cs.CY cs.HC 版本更新 67%

Three Lessons from Citizen-Centric Participatory AI Design

公民中心参与式AI设计的三个启示

Eike Schneiders, Sarah Kiden, Beining Zhang, Bruno Rafael Queiros Arcanjo, Zhaoxing Li, Ezhilarasi Periyathambi, Vahid Yazdanpanah, Sebastian Stein

专题命中 其他Agent :AI agent(abstract);agentic(abstract)

AI总结 本文通过参与式研讨会探讨公民中心视角下设计代理AI系统所面临的挑战,提出促进公众参与、建立共同语言及转化推测输入为可实施系统的核心问题。

Comments PARTICIPATE-AI: A Workshop at the 2026 ACM Conference on Intelligent User Interfaces (ACM IUI)

详情

展开后加载摘要…

URL PDF HTML 收藏