arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-29 至 2026-06-29 共收录 107 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 5 篇

2606.27499 2026-06-29 cs.CV cs.AI cs.CL 新提交 62%

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

DMV-Bench: 通过偶然线索注入诊断长程多模态智能体的视觉记忆

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个交互式多模态智能体视觉记忆基准DMV-Bench,基于双编码理论设计DualMem架构,在长链任务中优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 14 篇

2606.22902 2026-06-29 cs.AI 新提交 92%

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26519 2026-06-29 cs.AI 新提交 87%

What the LLM Should Not Say: Boundary-Aware Context Grounding for A Seven-Channel EEG Agent

面向低通道EEG智能体的边界感知上下文接地

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉冲元素智能科技有限公司(NeuraDock))

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI

AI总结 提出NeuraDock Agent架构,通过分离确定性本地EEG引擎与硬件感知语言层,实现LLM对低通道EEG数据的边界感知接地,经288次测试验证了系统在数值重复性、故障恢复和边界感知方面的有效性。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16492 2026-06-29 cs.CL 版本更新 85%

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04160 2026-06-29 cs.GT 版本更新 78%

Representation theorems for actual and alpha powers over two-agent general concurrent game frames

关于双智能体一般并发博弈框架中实际权力和α权力的表示定理

Zixuan Chen, Fengkui Ju, Thomas Agotnes

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文针对双智能体一般并发博弈框架,证明了实际权力和α权力的八种类型分别可由八类邻域框架表示,推广了已有结果,并指出双智能体实际权力刻画无法推广到任意有限智能体集合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13072 2026-06-29 cs.CL cs.AI cs.LG 版本更新 75%

LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks

LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试

Xiang Long, Li Du, Yilong Xu, RongJian Xu, Qiyanhui Lu, Ying Gao, Qinhua Xie, Fangcheng Liu, Ning Ding, Haoqing Wang, Ziheng Li, Changjiang Zhou, Jianyuan Guo, Yehui Tang

机构 * Samsung Research(三星研究院) HKUST (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) City University of Hong Kong(香港城市大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 73%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28277 2026-06-29 cs.LG cs.AI cs.CL cs.CY 新提交 67%

Towards Automating Scientific Review with Google's Paper Assistant Tool

迈向自动化科学评审:谷歌论文助手工具

Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad

机构 * Google Research USA(谷歌美国研究)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出四层AI-人类协作分类法,并介绍论文助手工具(PAT),通过推理缩放技术实现深度科学评审,在SPOT基准上数学错误召回率提升34%,并在STOC和ICML会议中成功识别关键错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27406 2026-06-29 cs.SE cs.AI 新提交 62%

Towards Evaluation of Implicit Software World Models in Coding LLMs

面向编码大语言模型中隐式软件世界模型的评估

Egor Bogomolov, Yaroslav Zharov

机构 * JetBrains Research(JetBrains研究)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过预测执行资源(峰值内存、墙钟时间、分析器输出)扩展软件世界模型评估,发现前沿模型表现有限,表明对软件执行理解不足。

Comments Accepted to DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10238 2026-06-29 cs.CL cs.LG 版本更新 62%

Learning to Evict from Key-Value Cache

学习从键值缓存中驱逐

Luca Moschella, Laura Manduchi, Ozan Sener

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出基于强化学习的KV缓存驱逐策略KVP,通过轻量级逐头代理学习预测令牌未来效用,显著提升长上下文和多轮对话性能。

Comments Accepted to ICML 2026. Code available at: https://github.com/apple/ml-learning-to-evict

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27595 2026-06-29 cs.CL 新提交 57%

Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents

Ko-WideSearch: 面向网络代理的韩语广度搜索基准测试,用于穷举集合枚举

Minbyul Jeong

机构 * Upstage AI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出韩语广度搜索基准Ko-WideSearch,通过自动化合成与验证流水线构建,评估网络代理在穷举集合枚举任务中的性能,发现代理在行级召回上显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28025 2026-06-29 physics.soc-ph 新提交 50%

Indecision and accuracy under social information across groups sizes

群体规模下社会信息中的犹豫与准确性

Andrew M Bate, Charlie Pilgrim, Richard P. Mann

专题命中 Agent评测 :agent(abstract)

AI总结 研究社会信息下群体决策的犹豫与准确性,发现社会信息加速决策并提高准确性,但个体准确性在有限最优群体规模时最大,多数选择准确性随规模单调增加,且决策波常无法解决集体犹豫,未决定者后续决策偏差增大。

Comments 20 pages Main document, 18 pages Supplementary Material (together making 38 pages total). Main document has 9 Figures (20 Subfigures), Supplementary has 13 Figures (70 Subfigures), so total of 22 Figures (90 Subfigures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27968 2026-06-29 physics.soc-ph 新提交 50%

SimPol: Simulating polarisation in political belief networks in European countries

SimPol: 模拟欧洲国家政治信念网络中的极化现象

Isabela Burattini Freire, Hongryol Cha, Irina Epure, Sara Filippini, Karan K. H. Manjunatha, Chethan Kavaraganahalli Prasanna, Ivan Samoylenko, Niels Van Santen, Adarsh Prabhakaran, Guillermo Romero Moreno

专题命中 Agent评测 :agent(abstract)

AI总结 结合实证网络分析与基于智能体的建模,研究信念系统结构如何影响极化驱动,并揭示欧洲信念系统多样性导致的不同极化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24826 2026-06-29 cs.HC 新提交 50%

Virtual Simulation for Mental Health

心理健康虚拟仿真

Anna Fang

专题命中 Agent评测 :agent(abstract)

AI总结 本文探索利用虚拟仿真技术,通过基于智能体的建模评估社区层面结果,以及通过具身控制空间进行个体训练,为心理健康干预提供安全实验环境。

Comments Doctoral Dissertation, Carnegie Mellon University

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18879 2026-06-29 econ.TH 版本更新 50%

Motivating Innovation with a Misspecified Roadmap

用错误指定的路线图激励创新

Florian Mudekereza

专题命中 Agent评测 :agent(abstract)

AI总结 研究委托人用路线图指导代理人创新时,路线图错误指定导致代理人陷入突破陷阱,无法持续创新,并得到创新频率上界随错误程度增加而收紧的结论。

Comments Cleaner results and the static framework is now removed

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他Agent 2 篇

2606.26071 2026-06-29 cs.LG cs.AI 新提交 62%

Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment

模型取证:调查令人担忧的行为是否反映对齐失败

Aditya Singh, Gerson Kroiz, Senthooran Rajamanoharan, Neel Nanda

机构 * MATS

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27951 2026-06-29 cs.CY cs.CL cs.HC physics.soc-ph 新提交 57%

AI Persuasive Framing in Collective Dilemmas

集体困境中的AI说服性框架

Anders Giovanni Møller, Alessia Galdeman, Arianna Pera, Luca Maria Aiello

机构 * Data Science Section, IT University of Copenhagen(丹麦哥本哈根IT大学数据科学系) Computer Science Department, University of Milan(意大利米兰大学计算机科学系) Copenhagen Center for Social Data Science, University of Copenhagen(丹麦哥本哈根大学哥本哈根社会科学数据科学中心)

专题命中 其他Agent :AI agent(abstract);分类 cs.CL

AI总结 本研究通过集体风险博弈实验,测试AI助手使用个性化说服框架对合作行为的影响,发现亲社会效应短暂而反社会效应持久,揭示了AI影响集体行动的双重用途风险。

Comments The first two authors contributed equally to this research. The article contains 20 pages, 10 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏