arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-11 至 2026-06-11 共收录 168 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2606.12268 2026-06-11 cs.AI 新提交 70%

The Impossibility of Eliciting Latent Knowledge

引出潜在知识的不可能性

Korbinian Friedl, Francis Rhys Ward, Paul Yushin Rapoport, Tom Everitt, Jonathan Richens

机构 * The London School of Economics and Political Science(伦敦政治经济学院) Independent(独立机构)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文利用因果影响图形式化定义引出潜在知识问题,证明不存在仅依赖行为反馈的训练策略能确保智能体诚实报告其信念。

Comments 24 pages, 3 figures. Includes proofs in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 67%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10242 2026-06-11 cs.CV 版本更新 67%

MedVeriSeg: Teaching LISA-Like Medical Segmentation Models to Verify Query Validity Without Extra Training

MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练

Qinyue Tong, Xiaozhen Wang, Ziqian Lu, Jun Liu, Yunlong Yu, Zheming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) Southern Medical University(南方医科大学) School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 67%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12386 2026-06-11 cs.LG cs.AI 新提交 62%

ATLAS: Active Theory Learning for Automated Science

ATLAS: 自动化科学的主动理论学习

Noémi Éltető, Nathaniel D. Daw, Kimberly L. Stachenfeld, Kevin J. Miller

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ATLAS框架,通过主动学习迭代生成稀疏神经网络假设并设计最优区分实验,在bandit任务中恢复强化学习智能体,相比随机实验采样效率提升5-10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18543 2026-06-11 cs.AI cs.CL 版本更新 62%

ClawEnvKit: Automatic Environment Generation for Claw-Like Agents

ClawEnvKit:爪型智能体的自动环境生成

Xirui Li, Ming Li, Ion Stoica, Cho-Jui Hsieh, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Arena University of California, Berkley(伯克利大学) University of California, Los Angeles(洛杉矶大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ClawEnvKit自动生成多样、可验证的爪型智能体训练与评估环境,构建含1040个环境的Auto-ClawEval基准,成本降低13800倍,性能提升达15.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11625 2026-06-11 cs.LG 新提交 57%

TimeRouter: Efficient and Adaptive Routing of Time-Series Foundation Models

TimeRouter: 时间序列基础模型的高效自适应路由

Kanghui Ning, Yushan Jiang, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Dongjin Song

机构 * University of Connecticut(康涅狄格大学) Salesforce AI Research JP Morgan AI Research(摩根大通人工智能研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 提出TimeRouter框架,通过轻量判别路由、选择性门控和集成回退实现时间序列基础模型的自适应选择,无需LLM推理,在GIFT-EVAL榜单取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 50%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 Agent评测 :agent(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11980 2026-06-11 cs.HC 新提交 50%

Somewhere Over the Desktop: A Research Agenda for Ubiquitous Analytics

超越桌面:无处不在分析的研究议程

Niklas Elmqvist, Panagiotis D. Ritsos, Peter W. S. Butcher

专题命中 Agent评测 :agentic(abstract)

AI总结 空间计算、生成式AI与开放网络标准融合,催生无处不在分析(UA)新机遇,通过梳理认知、上下文、交互等七大领域交叉,提出42个未来研究挑战。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11397 2026-06-11 cs.GT econ.TH 新提交 50%

Invariant Price of Anarchy and Multiplicative Smoothness

无政府价格不变性与乘法平滑性

Ilia Shilov, Heinrich H. Nax, Saverio Bolognani

专题命中 Agent评测 :agent(abstract)

AI总结 针对基数不可比框架,提出乘法平滑性条件,推导无政府价格的不变性界,并扩展到粗相关均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11231 2026-06-11 cs.CV 新提交 50%

CFCamo: A Counterfactual Detect-or-Abstain Framework for Camouflaged Object Detection

CFCamo:一种用于伪装目标检测的反事实检测或放弃框架

Suhang Li, Osamu Yoshie, Yuya Ieiri

机构 * Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究生院)

专题命中 Agent评测 :agent(abstract)

AI总结 提出CFCamo框架,通过反事实配对训练和策略优化,使COD模型在检测到目标时输出结果,在无目标时放弃检测,解决了正样本训练导致的过度检测偏差。

Comments 10 pages, 7 figures, 5 tables. Code and data: https://github.com/suhang2000/CFCamo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11494 2026-06-11 math.OC econ.TH 新提交 50%

Epistemic fair division of independence structures

独立性结构的认知公平分配

Marcin Anholcer, Maciej Bartkowiak, Bartłomiej Bosek, Jarosław Grytczuk

专题命中 Agent评测 :agent(abstract)

AI总结 研究在独立性结构约束下(如网络中的无环边集)的公平分配问题,证明了当代理人数至少为图的树性时,存在至多一个物品嫉妒(EF1)的分配,并进一步对任意加性估值证明了认知EF1分配的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05835 2026-06-11 cs.GT 版本更新 50%

Bandit Social Learning with Exploration Episodes

带有探索回合的匪徒社会学习

Kiarash Banihashem, Natalie Collina, Aleksandrs Slivkins

专题命中 Agent评测 :agent(abstract)

AI总结 研究自利代理通过多臂匪徒协议进行社会学习时,尽管个体有探索动机,但集体探索失败导致贝叶斯遗憾线性增长,表明即使存在有机探索也需要外部驱动。

Comments Appears in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15580 2026-06-11 econ.TH cs.GT 版本更新 50%

Screening for Choice Sets

选择集的筛选

Tan Gan, Yingkai Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究代理人私下知道可行行动或技术集,仅向委托人披露子集的筛选问题,通过包含序假设刻画最优机制,并应用于说服管理、行动激励和生产技术激励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12210 2026-06-11 eess.SY cs.SY math.OC 版本更新 50%

Solvability of the Output Corridor Control Problem by Pulse-Modulated Feedback

脉冲调制反馈下输出走廊控制问题的可解性

Alexander Medvedev, Anton V. Proskurnikov

专题命中 Agent评测 :agent(abstract)

AI总结 针对具有特定结构的三阶正系统,证明脉冲调制反馈在稳态下总能解决输出走廊控制问题,并用于评估药代动力学-药效学模型的患者安全性可行性。

Comments shortened version will be presented at IFAC World Congress 2026, Busan, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13452 2026-06-11 physics.soc-ph cs.MA 版本更新 50%

Collective decision-making with higher-order interactions on $d$-uniform hypergraphs

在$d$-一致超图上的高阶交互集体决策

Thierry Njougouo, Timoteo Carletti, Elio Tuci

专题命中 Agent评测 :agent(abstract)

AI总结 研究在$d$-一致超图上基于群体交互的舆论动力学模型,通过平均场分岔分析识别两个临界阈值,揭示交互组大小和品质比决定共识稳定性,且大组规模可能导致采纳劣质选项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03999 2026-06-11 math.PR cs.DC cs.DM 版本更新 50%

Consensus on Dynamic Stochastic Block Models: Fast Convergence and Phase Transitions

动态随机块模型上的共识:快速收敛与相变

Haoyu Wang, Jiaheng Wei, Zhenyuan Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 研究动态随机块模型上多数规则共识的收敛性,证明马尔可夫模型中任意初始偏差导致最终获胜优势,并刻画非马尔可夫模型的相变阈值。

Comments 34 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2606.11217 2026-06-11 cs.CY cs.AI cs.HC 新提交 79%

Preregistration for Experiments with AI Agents

AI智能体实验的预注册

Michelle Vaccaro

机构 * MIT(麻省理工学院)

专题命中 其他Agent :AI agent(title,abstract);分类 cs.AI

AI总结 针对AI智能体实验中的方法论漏洞,提出将预注册实践扩展至该领域,并设计专用模板以提升研究可信度。

Comments Accepted at ICML 2026 as a Spotlight (Top 5%) Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏