arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-16 至 2026-06-16 共收录 352 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 55 篇

2606.16898 2026-06-16 cs.CV cs.AI 新提交 57%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16054 2026-06-16 cs.CY cs.AI 新提交 57%

How to Detect and Measure the AI Dangers to Democracy

如何检测和衡量人工智能对民主的危险

Giulia Sandri, Claudio Novelli

机构 * Université libre de Bruxelles(布鲁塞尔自由大学) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AI对民主进程的影响,提出基于委托代理理论和NIST框架的分析体系,通过可测量指标评估问责缺口与治理失败,强调机构可评估性是民主控制的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15971 2026-06-16 cs.CL 新提交 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG: 查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15508 2026-06-16 cs.AI 新提交 57%

ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents

ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试

Rahul Suresh Babu, Laxmipriya Ganesh Iyer

机构 * Independent Researcher(独立研究者) United States of America(美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交 57%

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 57%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14945 2026-06-16 cs.LG 新提交 57%

Remember, Don't Re-read: Stateful ReAct Agents for Token-Efficient Autonomous Experimentation

记住,不要重读:用于令牌高效自主实验的有状态ReAct智能体

Faramarz Jabbarvaziri

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出基于LangGraph的有状态ReAct智能体,通过持久化状态和固定大小对话窗口,将自主实验的令牌成本从O(n²)降至O(1),在超参数调优和代码优化任务中分别减少90%和52%的令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10456 2026-06-16 cs.CR cs.AI 新提交 57%

The Distributed Detectability Band Against Marginal-Preserving Attacks

针对边际保持攻击的分布式可检测性带

Zhang Qinqin, Gao Yuze

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AI监控的边际保持攻击,通过高斯Copula AR(1)构造将危害编码在时间相关性中,证明分布形状监控器失效而时间相关性监控器有效,形成非空可检测性带。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13725 2026-06-16 cs.CR cs.AI 版本更新 57%

Can We Stop Malicious AI? KILLBENCH: A Benchmark for External AI Kill Switch Feasibility

我们能阻止恶意AI吗?KILLBENCH:外部AI终止开关可行性基准

Sechan Lee, Hyounghun Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Killbench基准,通过外部信号(如输入文本)评估终止恶意AI代理行为的方法,无需访问内部参数,实验表明在多种模型上外部终止开关具有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20710 2026-06-16 cs.CV cs.AI cs.CR 版本更新 57%

Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?

受神经启发的多模态视觉-语言模型对成员推断隐私泄露是否具有弹性?

David Amebley, Sayanton Dibbo

机构 * The University of Alabama(阿拉巴马大学) Alabama Center for the Advancement of AI(阿拉巴马人工智能 advancement 中心) Trustworthy AI Lab(可信人工智能实验室) Department of Computer Science, The University of Alabama(计算机科学系)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究受神经启发的多模态视觉-语言模型(VLM)对基于图像-文本的成员推断攻击的弹性,提出拓扑正则化框架,实验表明神经VLM在保持模型效用同时显著降低攻击成功率。

Comments Accepted at USENIX WOOT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18909 2026-06-16 cs.LG cs.IT math.IT stat.ML 版本更新 57%

Best Arm Identification with Minimal Regret

最小化遗憾的最佳臂识别

Junwen Yang, Vincent Y. F. Tan, Tianyuan Jin

机构 * Institute of Operations Research and Analytics National University of Singapore(运营研究与分析研究所,新加坡国立大学) Department of Mathematics Department of Electrical and Computer Engineering Institute of Operations Research and Analytics National University of Singapore(数学系电子与计算机工程系运营研究与分析研究所,新加坡国立大学) Department of Mathematics National University of Singapore(数学系新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出在最小化累积遗憾的同时以置信度δ识别最佳臂的问题,利用信息论推导下界,并设计渐近最优的Double KL-UCB算法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16816 2026-06-16 cs.GT 新提交 50%

Verification of Stochastic Dominance Envy-Freeness in Time Proportional to Input Size

在输入规模成正比的时间内验证随机占优无嫉妒性

Kui-Wang Choi

专题命中 Agent评测 :agent(abstract)

AI总结 提出一种时间最优算法,通过单次前缀支配检查和惰性初始化,将随机占优无嫉妒性(SD-EF)及其松弛版本SD-EF1的验证复杂度从O(n²m)降至O(nm),达到输入规模下的渐近最优。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16743 2026-06-16 cs.GT 新提交 50%

Fair Division by Contribution: A Shapley Value Perspective

按贡献公平分配:Shapley值视角

Xiaohui Bei, Pinyan Lu, Xiaowei Wu, Shengwei Zhou

专题命中 Agent评测 :agent(abstract)

AI总结 针对无货币转移的可分割资源分配,提出基于Shapley值的公平性概念(SVF),将代理权解释为对最优社会福利的期望边际贡献,并分析不同估值函数下Shapley近似比的最坏情况界。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16493 2026-06-16 q-fin.MF 新提交 50%

Forward Hedging Reshapes Incentive Provision

远期套期保值重塑激励提供

René Aïd, Nizar Touzi, Stéphane Villeneuve

专题命中 Agent评测 :agent(abstract)

AI总结 研究在道德风险下,风险厌恶的委托人通过远期市场套期保值对代理人的激励影响,发现委托代理与外部套期保值部分替代,且委托代理下套期保值需求降低,推高均衡远期价格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16380 2026-06-16 econ.TH 新提交 50%

Informative Consumption

信息性消费

Xuehan Jiang, Xi Zhi Lim

专题命中 Agent评测 :agent(abstract)

AI总结 本文公理化地刻画了风险消费中的消费-信息权衡,通过分离客观风险与主观风险,将确定性等价分解为标准风险溢价和信息溢价,并引入可参数化模型以捕捉风险厌恶与信息激励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14887 2026-06-16 econ.EM econ.GN q-fin.EC 新提交 50%

Estimating Sloppy Directions via KDE: The Case of Kirman's Ants

通过KDE估计松散方向:以Kirman蚂蚁模型为例

Karl Naumann-Woleske

专题命中 Agent评测 :agent(abstract)

AI总结 本文使用核密度估计(KDE)从模拟数据中估计Fisher信息矩阵,以识别随机非线性模型中的松散方向,并以Kirman蚂蚁模型为例验证了KDE方法在有限模拟预算下的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14819 2026-06-16 cs.MA physics.soc-ph 新提交 50%

Selective Control under Noisy Perception: Governance Failures Hidden by Aggregate Metrics in Modular Networks

噪声感知下的选择性控制:模块化网络中聚合指标隐藏的治理失败

Igor Itkin

专题命中 Agent评测 :agent(abstract)

AI总结 通过智能体模型揭示,内容审核系统在标准准确率指标上表现良好,但错误集中在连接不同社区的桥梁用户上,导致治理损失倍增,而聚合指标无法反映这种伤害。

Comments 39 pages, 7 figures. Code and data: https://github.com/YehudaItkin/noisy-perception-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16791 2026-06-16 cs.DS cs.GT 版本更新 50%

Improved Parallel Algorithms for EF1 Allocations

改进的EF1分配并行算法

Kishen N Gowda, D Ellis Hershkowitz, Richard Z Huang, Gregory Kehne

专题命中 Agent评测 :agent(abstract)

AI总结 本文改进了EF1分配的并行算法,针对2个代理人的情况,将深度从O(log²m)改进到O(logm),并将工作量从O(m logm)减少到O(m)。同时,算法被推广到任意常数数量的代理人,并提出了随机算法,具有O(m/n)的深度和多项式工作量。此外,本文还展示了计算k≈√m的 envy-free up to k goods 分配在RNC中是可能的,或在子线性深度中对于任何常数ε>0,k=m^ε。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13599 2026-06-16 cs.GT econ.TH math.OC 版本更新 50%

Dynamic Wholesale Pricing under Censored-Demand Learning

基于删失需求学习的动态批发定价

Michalis Deligiannis, Marco Scarsini, Xavier Venel

专题命中 Agent评测 :agent(abstract)

AI总结 研究两级供应链中制造商与零售商在删失需求数据下的动态定价与订货博弈,利用维度缩减方法证明马尔可夫完美均衡存在性,并揭示公共学习引发的激励冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09882 2026-06-16 cs.GT cs.MA 版本更新 50%

Truth, Justice, and Secrecy: Cake Cutting Under Privacy Constraints

真理、公正与保密:隐私约束下的蛋糕分割

Yaron Salman, Tamir Tassa, Omer Lev, Roie Zivan

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出首个隐私保护的蛋糕分割协议,在保证无嫉妒和策略证明性的同时,通过密码学技术保护代理的偏好隐私。

Comments This is the full version of our paper published in the Proceedings of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2606.15591 2026-06-16 cs.AI cs.CL cs.MA 新提交 81%

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架

Tirthankar Mittra

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 提出ARVRE两阶段框架,通过离线时序差分学习构建有效物理方程链,结合智能检索增强生成控制问题结构与难度,再由大语言模型生成自然语言问题,实现复杂、新颖且可解的物理文字题生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15914 2026-06-16 cs.CL cs.HC 新提交 57%

Contaminated Collaboration: Measuring Gender Bias Transfer in LLM-Assisted Student Writing

污染的合作:测量LLM辅助学生写作中的性别偏见迁移

Ariyan Hossain, Kazi Kamruzzaman Rabbi, Farig Sadeque, S M Taiabul Haque

机构 * Brac University(布拉卡大学)

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 通过实验发现,使用性别偏见的LLM写作助手会显著增加学生职业规划作文中的性别刻板印象,且偏见迁移不对称:女性目标作文的能动性被抑制,男性目标作文受影响较小。

Comments 18 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏