arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-14 至 2026-08-14 共收录 33 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 33 篇

2608.12721 2026-08-14 cs.CV 新提交 89%

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 Agent评测 :agent(title,title_cn)

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交 85%

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-14 cs.CL cs.AI cs.CY 新提交 84%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 Agent评测 :AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12358 2026-08-14 cs.HC cs.AI 新提交 83%

Interaction Readiness: A Framework for Building and Evaluating AI Agents in Human Roles

交互就绪:构建和评估人类角色AI智能体的框架

Sudhir Alladi Venkatesh

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对带角色属性AI智能体的评估缺口,提出交互就绪框架,通过分离内容与交互规范、四项智能体操作实现评估,证实内容与交互质量独立,并给出规范模板与审核流程。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09696 2026-08-14 cs.AI 版本更新 83%

Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models

模型发现智能体:用于数据高效发现机制世界模型的大语言模型辅助贝叶斯实验设计

Kevin Murphy

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出模型发现智能体(MDA),结合LLM与贝叶斯机制,在少量干预下发现机制世界模型,在三类基准上实现数据高效模型学习与可靠干预预测的SOTA性能。

Comments v3: further improve app A (algorithm pseudocode), add new app G (further related work) - (main text unchanged)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12359 2026-08-14 cs.CY 新提交 82%

Can We Trust AI Agents in the Supermarket? Sugar Content Inference from Product Images

我们能信任超市中的智能体吗?从产品图像推断糖含量

Jose Berengueres

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 该研究评估AI智能体从超市产品图像推断糖含量的能力,发现其准确率因场景和产品类型差异大,全球产品准确率高但本地产品与随机猜测无差异,指出AI营养工具应定位为辅助工具,需对齐本地生态的可审计基准。

Comments Accepted on April 15th 2026 to the 2026 48th Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25821 2026-08-14 cs.CL cs.AI cs.LG cs.MA 版本更新 82%

Doctorina MedBench: A Dialogue-Based Benchmark and Evaluation Framework for Agent-Based Medical AI

Doctorina MedBench:基于真实医患交互的医疗AI端到端评估框架

Anna Kozlova, Stanislau Salavei, Pavel Satalkin, Hanna Plotnitskaya, Sergey Parfenyuk, Andy Nkansah

机构 * A.I. Doctor Medical Assist LTD(A.I. Doctor Medical Assist有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Doctorina MedBench通过模拟真实医患对话评估医疗AI系统,包含诊断、观察、治疗和步骤计数四项指标,用于评估临床正确性和对话效率,同时支持多层级测试和质量监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12629 2026-08-14 cs.LG 新提交 79%

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 78%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 78%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03799 2026-08-14 cs.CL 版本更新 77%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12880 2026-08-14 cs.CR cs.AI 新提交 74%

Labels Are Not Endpoints: Treatment Leakage and Construct Validity in MCP Agent Security Evaluation

标签并非终点:MCP智能体安全评估中的处理泄露与构念效度

Rana Muhammad Ahmed, Sabahat Abbas

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本研究针对MCP智能体安全评估中标签与行为事实的偏差问题,通过审计留存评估活动发现处理泄露现象,提出七环节完整性链及端点完整性检查器,完成活动受限的测量审计。

Comments 24 pages, 10 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12814 2026-08-14 cs.CL 新提交 74%

FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Conversion for Voice Agent Pipelines

FastThaiG2P:面向语音智能体流水线的极速泰语字素转音素转换工具

Charin Polpanumas

机构 * AWS(亚马逊云科技)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 FastThaiG2P是一款极速泰语字素转音素转换工具,采用PyThaiNLP分词字典与归一化规则,亚毫秒级延迟,可支撑泰语TTS开发,经其处理的数据集训练出的StyleTTS 2模型合成语音清晰,实时率达0.25。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11392 2026-08-14 cs.CR cs.AI 版本更新 74%

AI Guardrail Survival under Single-Cycle Agentic Self-Summarization

单循环智能体自摘要下的AI安全护栏存续性

Ted Kwartler, Alan Aqrawi, Arian Abbasi

专题命中 Agent评测 :agentic(title);分类 cs.AI

AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12593 2026-08-14 cs.AI cs.LG 新提交 73%

DiG-bench: Discovery in Games

DiG-bench:游戏中的发现

Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan, Zihan Yan, Timothy Muller, Clare Maguire, Ales Kubicek, Fraser Greenlee-Scott, Sukrit Sumant, Tri Dao, Jürgen Schmidhuber, Michal Valko, Joshua Tenenbaum, Thomas L. Griffiths, Zeb Kurth-Nelson, James C. R. Whittington

专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本研究发布DiG-bench基准,含70个需智能体通过交互实验发现规则的游戏,设7个难度级,部分公开部分私有,用于评估智能体在目标未知环境中发现新知识的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12860 2026-08-14 cs.RO 新提交 67%

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

HumanoidVLN:面向多种人形机器人形态的基于物理的视觉语言导航模拟器与基准

Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

机构 * VinMotion, Inc.(VinMotion公司) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本研究针对人形机器人VLN的物理约束与形态差异问题,提出基于NVIDIA Isaac Sim的HumanoidVLN模拟器与基准,验证其与多种模型、机器人的兼容性,实验揭示了VLN模型、控制器与人形形态的交互关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14501 2026-08-14 cs.SE cs.AI cs.CL 版本更新 67%

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

仓颉基准:在低资源通用编程语言上评估大语言模型

Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。

Comments Accepted by ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 62%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06564 2026-08-14 cs.LG cs.CL 版本更新 62%

Which Decisions Low-Bit Quantization Breaks, and How to Predict Them

量化损伤是乘法性的,而非加法性的

Zekun Wu, Swati Dhiman, Adriano Koshiyama

机构 * Holistic AI(霍利斯提克人工智能公司) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。

Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13173 2026-08-14 cs.AI 新提交 57%

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法

Chang Liu, Yuqi Zhang, Yiman Zhong, Boyi Liu, Hengjun Wang, Shuyue Wei

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 57%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13096 2026-08-14 cs.LG cs.CE q-fin.CP q-fin.TR 新提交 57%

FlowLOB: Efficient and Controllable Limit Order Book Generation with Flow Matching

FlowLOB:基于流匹配的高效可控限价订单簿生成模型

Zhuohan Wang, Andreea Bacalum, Ollie Olby, Carmine Ventre, Namid Stillman

机构 * Simudyne(思慕迪恩) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出FlowLOB,一种基于流匹配的LOB轨迹生成模型,经HKEX数据训练可泛化至未见过的交易品种,采样效率与可控性优于基准模型,且能零样本泛化。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交 57%

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11941 2026-08-14 cs.AI 版本更新 57%

OEIS Open: How many conjectures can language models turn into theorems?

OEIS Open:语言模型能将多少个猜想转化为定理?

Tom Adamczewski

机构 * Epoch AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究构建OEIS Open基准,发现配备最少工具的语言模型在适中预算下可自主解决部分OEIS未解决数学猜想,访问大量数学文献或复杂智能体循环未提升其性能。

Comments 26 pages, 6 figures. Code: https://github.com/epoch-research/LeanOpenProblems, results: https://github.com/epoch-research/LeanOpenProblems-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05485 2026-08-14 cs.AI 版本更新 57%

Auditable Agents

可审计代理

Yi Nian, Aojie Yuan, Haiyue Zhang, Jiate Li, Li Li, Xiyang Hu, Hua Wei, Xiongye Xiao, Chaowei Xiao, Yue Zhao

机构 * FORTIS Lab, University of Southern California(南加州大学FORTIS实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了可审计代理系统的核心问题,提出五个可审计性维度和三种机制类别,通过实证证据证明代理系统需具备审计能力才能实现问责。

Comments 24 pages, 1 figure. Extended version. A condensed 4-page version appears in the Proceedings of the ACM AI Leadership Summit 2026 (Visionary Papers track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18455 2026-08-14 stat.ML cs.IT cs.LG math.IT 版本更新 57%

Multiview Representation Learning via Distributed Joint Latent Space Structuring

基于分布式联合隐空间构建的多视图表示学习

Milad Sefidgaran, Piotr Krasnowski, Abdellatif Zaidi

机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对分布式多视图表示学习的客户端协调问题,推导了基于MDL的泛化界,提出分布式高斯乘积混合先验方法,经多组实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12818 2026-08-14 econ.TH 新提交 50%

Schedule equilibria

日程均衡

Harry Kleyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究一般均衡下的不完全竞争,推导家庭与企业最优条件,建立均衡存在性与颤抖手精炼,将框架应用于多场景,发现内生价格反应会改变相关标准结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13085 2026-08-14 cs.GT 新提交 50%

Representation in Peer Selection: A Liquid Democracy Perspective

同行选择中的代表性:一种液体民主视角

Davide Grossi, Grzegorz Lisowski, Georgios Papasotiropoulos

专题命中 Agent评测 :agent(abstract)

AI总结 该研究从液体民主视角研究同行选择问题,引入液体概貌,分析比例公理在该域的表现及相关投票规则,发现可实现强比例保障,具现实应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12996 2026-08-14 cs.CR 新提交 50%

ATOBench: Tracing How Autonomous Penetration-Testing Agents Verify Vulnerabilities When Target Evidence Lies

ATOBench:当目标证据存在时,追踪自主渗透测试代理如何验证漏洞

Qiyang Chen, Yixi Li, Fengwei Zhang, Junlin Liu

专题命中 Agent评测 :agent(abstract)

AI总结 研究人员提出ATOBench框架,通过注入响应转换实现自主渗透测试代理验证过程的可观测性,经450回合评估发现,活动增加会掩盖断裂的验证链,成功恢复依赖于找到并保留可用证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12683 2026-08-14 cs.RO cs.CV 新提交 50%

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地

Zhou Chen, Sathyanarayanan N. Aakur

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。

Comments Under review. 15 Pages. 9 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏