arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2606.30701 2026-07-01 cs.CR cs.AI 新提交 57%

An AI-Based Solution for Secure Service Provisioning in IoT

基于人工智能的物联网安全服务提供解决方案

Marco Arazzi, Mert Cihangiroglu, Serena Nicolazzo, Antonino Nocera, Vinod P

机构 * Department of Electrical, Computer and Biomedical Engineering, University of Pavia(帕维亚大学电气、计算机与生物医学工程系) Department of Computer Applications, Cochin University of Science and Technology(科钦科技大学计算机应用系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种结合深度强化学习和联邦学习的框架,用于在物联网环境中选择可靠智能对象并监控其行为,以增强服务提供的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27595 2026-06-29 cs.CL 新提交 57%

Ko-WideSearch: A Korean Breadth-Search Benchmark for Exhaustive Set Enumeration by Web Agents

Ko-WideSearch: 面向网络代理的韩语广度搜索基准测试,用于穷举集合枚举

Minbyul Jeong

机构 * Upstage AI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出韩语广度搜索基准Ko-WideSearch,通过自动化合成与验证流水线构建,评估网络代理在穷举集合枚举任务中的性能,发现代理在行级召回上显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27027 2026-06-26 cs.CR cs.AI 新提交 57%

ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP

ShareLock: 针对MCP的隐蔽多工具阈值投毒攻击

Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ShareLock框架,利用Shamir阈值方案将恶意指令分散到多个工具描述中,实现隐蔽性和容错性,平均攻击成功率超90%。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26836 2026-06-26 cs.AI 新提交 57%

The Capability Frontier: Benchmarks Miss 82% of Model Performance

能力前沿:基准测试遗漏了82%的模型性能

Bradley Fowler, Ryan Smith, Daniel Thi Graviet, William Myers, Joshua Greaves, Narmeen Fatimah Oozeer, Antía García, Philip Quirke, Amirali Abdullah, Fazl Barez, Shriyash Kaustubh Upadhyay

机构 * Martian University of Oxford(牛津大学) ThoughtWorks

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26246 2026-06-26 cs.DL cs.AI cs.IR 新提交 57%

Lacuna: A Research Map for Machine Learning

Lacuna:机器学习研究地图

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。

Comments 14 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26158 2026-06-26 cs.AI 新提交 57%

Life After Benchmark Saturation: A Case Study of CORE-Bench

基准测试饱和之后:CORE-Bench 案例研究

Nitya Nadgir, Sayash Kapoor, Kangheng Liu, Peter Kirgis, Matilda Orona, Stephan Rabanser, Tilman Bayer, Abhishek Shetty, Yue Ling, Derrick Chan-Sew, Rumi Nakagawa, Saiteja Utpala, Zachary S. Siegel, Arvind Narayanan

机构 * Independent(独立机构) Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对基准测试准确率饱和问题,提出从构造效度、泛化性、效率、可靠性、模型与脚手架相对重要性及人机协作提升六个维度评估智能体,以CORE-Bench Hard为案例展示饱和后仍可获得有意义见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19336 2026-06-26 cs.CL 新提交 57%

Learning User Simulators with Turing Rewards

基于图灵奖励的学习用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25170 2026-06-25 stat.ML cs.LG 新提交 57%

Minimax PAC Bounds for Learning in Exogenous Contextual MDPs

外生上下文马尔可夫决策过程中学习的极小极大PAC界

Corentin Pla, Hugo Richard, Marc Abeille, Vianney Perchet

机构 * CREST, ENSAE(CREST与ENSAE) Criteo AI Lab(Criteo人工智能实验室) FairPlay Joint Team(FairPlay联合团队)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对外生上下文表格折扣MDP,提出方差缩减算法实现策略评估、最优值估计和最优策略提取,样本复杂度与上下文空间大小无关且达到极小极大最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 57%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25012 2026-06-25 cs.LG 新提交 57%

Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

偏置控制的原对偶自然演员-评论家:约束多目标平均奖励强化学习的最优速率

Ankur Naskar, Swetha Ganesh, Vaneet Aggarwal

机构 * Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度) Purdue University, USA(普渡大学,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对平均奖励设置下的约束多目标强化学习,提出基于MLMC的原对偶自然演员-评论家算法,控制标量化目标、约束评估和演员-评论家估计中的偏置,实现最优全局收敛和约束违反率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 57%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24340 2026-06-24 cs.LG 新提交 57%

Managing Task Execution for Unknown Workloads in Batteryless IoT: A Hardware-Agnostic Evaluation

无电池物联网中未知工作负载的任务执行管理:一种硬件无关的评估

Samer Nasser, Henrique Duarte Moura, Ritesh Kumar Singh, Maarten Weyn, Jeroen Famaey

机构 * University of Antwerp - imec, IDLab Research Group(安特卫普大学-imec, IDLab研究组)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对无电池物联网中未知工作负载,提出两种硬件无关的动态调度策略(强化学习和近似预测),通过物理仿真框架评估,揭示了不同策略在任务吞吐量、生存-执行平衡和能量缺口执行节奏上的权衡。

Comments Submitted to IEEE Transactions on Sustainable Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24176 2026-06-24 cs.CL stat.CO 新提交 57%

A Synthetic Reliability-Aware PINN Benchmark for Offshore Wind Turbine Support-Structure Monitoring with Bayesian Inverse Identification

一种用于海上风力发电机支撑结构监测的合成可靠性感知PINN基准测试,结合贝叶斯逆识别

Puneet Kant, Monika Tanwar

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院) School of Management and Entrepreneurship, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校管理与创业学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 提出Digi Turbine基准,结合物理信息神经网络、贝叶斯逆识别和FORM筛选,用于海上风机单桩支撑结构监测,验证基于NREL 5MW参考风机。

Comments 18 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24081 2026-06-24 cs.CR cs.AI 新提交 57%

PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

PixJail:面向文本到图像越狱评估的自演化论文到流水线复现

Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州)) East China Normal University(华东师范大学) Shanghai Qi Zhi Institute(上海启智研究院) Wuhan University(武汉大学) Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI) CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI)) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出PixJail框架,通过自演化论文到流水线代理,自动构建攻击模块和可运行评估流水线,忠实复现原始实验结果,平均误差仅2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-06-24 cs.LG 新提交 57%

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23175 2026-06-23 cs.LG 新提交 57%

Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时

Steven Young Eulig

机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。

Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 57%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22708 2026-06-23 cs.SD cs.AI 新提交 57%

Libretto: Giving LLM Agents a Sense of Musical Structure

Libretto:赋予LLM智能体音乐结构感

Yichen Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Libretto框架,通过LLM原生语法(显式起始槽、声部、小节组织)和基于语料库的统计评估(节奏、和声、旋律等),实现符号音乐的生成、诊断与迭代自修正,将符号音乐转化为可测量、可编辑的对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22613 2026-06-23 cs.AI 新提交 57%

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21926 2026-06-23 cs.SE 新提交 57%

A11YRepair: Bridging Web Accessibility Barriers via Knowledge-Enhanced Divide-and-Conquer Repair

A11YRepair: 通过知识增强的分治修复弥合网络无障碍障碍

Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 针对网络无障碍违规修复问题,提出基于LLM的分治框架A11YRepair,通过聚类关联违规并引入WCAG领域知识,实现多文件协调修复,在60个真实项目中优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21732 2026-06-23 cs.CR cs.AI 新提交 57%

Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

安全检查,不安全使用:LLM代理压缩边界处的重链接

Zesen Liu, Zihan Zhang, Dongdong She

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21409 2026-06-23 cs.AI 新提交 57%

Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

不要盲目信任:不可靠反馈如何破坏使用工具的LLM智能体

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Pengfei Zhou, Wangbo Zhao, Jingxuan Wu, Yaxin Zhou, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(新加坡科技研究局计算与推理中心) IHPC Agency for Science Technology and Research(新加坡科技研究局高性能计算研究所) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究不可靠反馈对工具增强型LLM智能体的影响,通过匹配循环对比实验发现,误导性反馈会导致价值反转,使智能体表现低于无反馈基线,并强调无反馈回退控制对评估的必要性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21020 2026-06-23 cs.CV cs.AI 新提交 57%

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

CheXpercept: 评估胸部X光片中专家级病变感知的基准

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

机构 * KAIST(韩国科学技术院) Samsung Medical Center(三星医疗中心) Konkuk University Medical Center(建国大学医疗中心)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 提出CheXpercept基准,通过粗粒度检测、细粒度轮廓评估与修正、语义级属性提取三个层次评估视觉语言模型在胸部X光片上的专家级病变感知能力,发现当前模型仅在粗粒度任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20960 2026-06-23 cs.GT cs.LG econ.TH 新提交 57%

Equilibrium with Internal Transfers

具有内部转移的均衡

Mingyang Liu, Gabriele Farina, Asuman Ozdaglar

机构 * LIDS, EECS, Massachusetts Institute of Technology(信息与电子科学系,麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究通过预算平衡的内部转移改善激励的博弈模型,提出自我执行转移均衡和中介自我执行转移均衡,证明社会最优策略可被支持为均衡,并给出多项式算法和分散学习动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20909 2026-06-23 cs.CV cs.AI eess.IV 新提交 57%

BELDE: Building a Large-scale Earth-observation Land-cover Dataset for Europe

BELDE:构建欧洲大规模对地观测土地覆盖数据集

Ümit Mert Çağlar, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(中东技术大学信息学研究生院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 针对现有土地覆盖数据集在规模、地理覆盖和公开性上的不足,提出基于Sentinel-2真彩色影像和ESA WorldCover标注的欧洲大规模RGB土地覆盖分割数据集BELDE,含108万+图像-分割图对,覆盖7类地物,并建立跨域泛化基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18774 2026-06-23 cs.LG 新提交 57%

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

RouteJudge: 一个可复现且偏好感知的LLM路由开放平台

Guannan Lai, Haoran Hu, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) SinapisAI

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出RouteJudge平台,通过匿名成对比较评估LLM路由策略的决策质量,并发布ORBIT工具箱标准化路由工作流,支持可复现和偏好感知的路由评估。

Comments Accepted by Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19683 2026-06-19 cs.AI cs.MA cs.SY eess.SY 新提交 57%

Exit-and-Join Dynamics for Decentralized Coalition Formation

去中心化联盟形成的退出与加入动力学

Quanyan Zhu

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究基于单边退出与加入决策的去中心化联盟形成动力学,利用Aumann-Dreze值计算个体收益,建立合作支付分配与非合作最优反应的关联,并分析均衡特征及成本对局部稳定性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18996 2026-06-19 cs.CR cs.AI 新提交 57%

TRAP: Benchmark for Task-completion and Resistance to Active Privacy-extraction

TRAP:任务完成与主动隐私提取抵抗基准

Moon Ye-Bin, Nam Hyeon-Woo, Baek Seong-Eun, Yejin Yeo, Tae-Hyun Oh

机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) Grad. School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出TRAP基准,评估智能体在文档密集型任务中平衡任务准确性与隐私泄露的能力,发现所有模型均存在非平凡泄露,并证明基于提示的防御无法同时实现高任务成功率和零泄露概率,提出结构化的私有字段隔离方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18527 2026-06-18 stat.ML cs.LG 新提交 57%

Toward Simultaneously Optimal Regret in U-Calibration

面向同时最优遗憾的U-校准

Rafael Frongillo, Haipeng Luo, Nishant A. Mehta, Jon Schneider

机构 * University of Colorado Boulder(科罗拉多大学波德穆尔分校) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种基于自和谐噪声的FTPL变体,实现对所有有界适当损失的最优$\tilde O(\sqrt{T})$遗憾和对光滑损失的对数遗憾。

Comments 30 pages; to appear at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏