arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

共收录 149
2603.16141 2026-08-07 cs.MA cs.LG cs.NI 版本更新

Communication-Aware Multi-Agent Reinforcement Learning for Decentralized Cooperative UAV Deployment

面向通信的多智能体强化学习用于分布式协同无人机部署

Enguang Fan, Yifan Chen, Zihan Shan, Klara Nahrstedt, Matthew Caesar, Jae Kim

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Boeing Research and Technology(波音研究与技术)

AI总结 本文提出基于图的多智能体强化学习框架,通过集中训练分散执行策略,在部分可观测和间歇性链路条件下实现高效无人机协同部署,展示了在合作中继部署和对抗任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16763 2026-08-07 cs.AI 版本更新

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

当AI基准测试达到平台期:基准饱和的系统性研究

Mubashara Akhtar, Anka Reuel, Prajna Soni, Sanchit Ahuja, Pawan Sasanka Ammanamanchi, Ruchit Rawal, Vilém Zouhar, Srishti Yadav, Chenxi Whitehouse, Dayeon Ki, Jennifer Mickel, Leshem Choshen, Marek Šuppa, Jan Batzner, Jenny Chim, Jeba Sania, Yanan Long, Hossein A. Rahmani, Christina Knight, Yiyang Nan, Jyoutir Raj, Yu Fan, Shubham Singh, Subramanyam Sahoo, Eliya Habba, Usman Gohar, Siddhesh Pawar, Robert Scholz, Arjun Subramonian, Jingwei Ni, Mykel Kochenderfer, Sanmi Koyejo, Mrinmaya Sachan, Stella Biderman, Zeerak Talat, Avijit Ghosh, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究定义并分析了60个语言模型基准的饱和现象,发现近半数基准出现饱和,且专家策划而非公开测试数据影响抗饱和能力,为延长基准寿命提供了设计建议。

Comments Published at ICML 2026 (Forty-Third International Conference on Machine Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06052 2026-08-06 cs.CL cs.AI 版本更新

A Survey of Agent Memory in the Second Half: Towards Self-Evolving and Long-Horizon Agents

重新思考基础智能体的内存机制:第二阶段综述

Wei-Chieh Huang, Weizhi Zhang, Yueqing Liang, Yuanchen Bei, Yankai Chen, Tao Feng, Xinyu Pan, Zhen Tan, Yu Wang, Tianxin Wei, Shanglin Wu, Ruiyao Xu, Liangwei Yang, Rui Yang, Wooseong Yang, Chin-Yuan Yeh, Hanrong Zhang, Haozhen Zhang, Siqi Zhu, Henry Peng Zou, Wanjia Zhao, Song Wang, Wujiang Xu, Zixuan Ke, Zheng Hui, Dawei Li, Yaozu Wu, Langzhou He, Chen Wang, Xiongxiao Xu, Baixiang Huang, Juntao Tan, Shelby Heinecke, Huan Wang, Caiming Xiong, Ahmed A. Metwally, Jun Yan, Chen-Yu Lee, Hanqing Zeng, Yinglong Xia, Xiaokai Wei, Ali Payani, Yu Wang, Haitong Ma, Wenya Wang, Chenguang Wang, Yu Zhang, Xin Eric Wang, Yongfeng Zhang, Jiaxuan You, Hanghang Tong, Xiao Luo, Xue Liu, Yizhou Sun, Wei Wang, Julian McAuley, James Zou, Jiawei Han, Philip S. Yu, Kai Shu

机构 * UIC(伊利诺伊大学香槟分校) IIT(伊利诺伊理工学院) UIUC(伊利诺伊大学厄巴纳-香槟分校) UW–Madison(威斯康星大学麦迪逊分校) ASU(亚利桑那州立大学) Emory(埃默里大学) Northwestern(西北大学) NTU(国立台湾大学) UCF(佛罗里达大学) Rutgers(新泽西罗格斯大学) Cambridge(剑桥大学) Harvard(哈佛大学) UTokyo(东京大学) UCSD(加州大学圣地亚哥分校) UCSC(加州大学圣塔克鲁斯分校) TAMU(德克萨斯大学奥斯汀分校) UCSB(加州大学圣塔芭芭拉分校) MBZUAI(马克斯·普朗克人工智能研究所) McGill(麦吉尔大学) UCLA(加州大学洛杉矶分校) Stanford(斯坦福大学) Salesforce Google(谷歌) Meta Roblox Cisco(思科) Capital One

AI总结 本文综述了基础智能体内存机制,从内存基质、认知机制和主体维度分析内存在不同拓扑结构下的实现,并探讨内存操作的学习策略与评估指标。

Comments Accepted at Transactions on Machine Learning Research (TMLR) with Survey Certification. Project page: https://github.com/AgentMemoryWorld/Awesome-Agent-Memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09764 2026-08-06 cs.LG 版本更新

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01463 2026-08-05 cs.AI cs.MA 版本更新

Where Reasoning Diverges: Localized Multi-Agent Debate for Multi-Hop Question Answering

推理分歧之处:本地化多智能体辩论

Weijun Gao, Xiang Ding, Haoyang Liu, Tiancheng Xing

机构 * The Chinese University of Hong Kong(香港中文大学) Nagoya University(名古屋大学) Institute of Science Tokyo(东京科学大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对多智能体辩论冗余交换完整推理轨迹的问题,提出LMAD协议,通过定位冲突并限制辩论范围,在十个骨干模型上实现宏平均评判准确率提升7.20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20956 2026-08-05 cs.LG cs.CY 版本更新

A Deployment Audit of Release-Side Risk in Conformal Triage under Prevalence Shift

发布侧风险的符合性分诊部署审计

Chengze Li, Xiao Liu, Hanrong Zhang, Haiyang Peng, Yanghao Ruan, Huanhuan Ma, Chunyu Miao, Qichao Zhou, Xiangrong Qi, Philip Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Manteia Technologies Co., Ltd(Manteia技术有限公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种泄漏感知的发布侧符合性分诊审计方法,用于评估在患病率变化下,是否真正经历目标事件的患者被释放而无需审查,通过将目标主体分为三个非重叠角色来评估发布直接安全性。

Comments 20 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25327 2026-08-04 cs.RO 版本更新

Belief-Aware Influence and Trust (BAIT): Shaping Human Belief During Repeated Human-Robot Interaction

信念感知影响与信任(BAIT):在人机重复交互中塑造人类信念

Ye-Ji Mun, Mahsa Golchoubian, Shahabedin Sagheb, Yan Bai, Tianhao Ji, Dylan P. Losey, Katherine Driggs-Campbell

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 研究针对重复人机交互问题,提出BAIT控制器将分层粒子滤波器与信念感知规划器集成,能推断人类信念变化,优化长期影响与人类信任的权衡,在多场景实验中任务性能与基线相当且用户信任更高。

Comments 9 pages, 4 figures, submitted to IEEE Robotics and Automation Letter (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06435 2026-08-04 cs.AI 版本更新

Trust but Verify:Evidence-Linked Multi-Agent Clinical Information Extraction in Pathology

从细则中发现幽门螺杆菌:基于证据关联的多智能体胃活检报告病例发现

Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor

机构 * Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理科) Duke–NUS Medical School(新加坡国立大学Duke-NUS医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者)

AI总结 研究针对胃活检报告中幽门螺杆菌证据提取难题,采用Nimblemind多智能体系统,经试点评估其总体准确率达98.61%,虽与其他比较器性能相似,但实现了工作流程整合和可追溯性,还能大幅减少审查时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20997 2026-08-04 cs.AI 版本更新

BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

BioInsight: 面向交互式生物医学知识发现的多智能体编排

Jieyi Wang, Bingxuan Li, Nanyi Jiang, Desong Meng, Zirui Fan, Yuxin Guo, Jiayu Liu, Kunlun Zhu, Eddie Yang, Xiusi Chen, Pan Lu, Bingxin Zhao

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Purdue University(普渡大学) Stanford University(斯坦福大学)

AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。

Comments Update some experiments and contents

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19258 2026-08-04 cs.CL cs.AI cs.CR cs.LG 版本更新

MAPLE: Metadata Augmented Private Language Evolution

MAPLE:元数据增强的隐私语言演化

Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz

机构 * National Taiwan University(国立台湾大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Meta

AI总结 MAPLE通过差分隐私元数据提取和上下文学习,解决私有演化中初始化瓶颈问题,实现更优的隐私-效用平衡和更低的API成本。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19957 2026-08-03 cs.CR cs.AI cs.LG 版本更新

HijackKV: New Threat in Position-Independent KV Cache Reuse

HijackKV:位置无关的键值缓存重用中的新威胁

Yichi Zhang, Zhiqi Wang, Huan Zhang, Yuchen Yang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究位置无关的KV缓存重用中的新威胁KV缓存劫持,介绍HIJACKKV攻击框架,该框架可优化攻击者控制的前缀,使受污染的KV在特定条件下劫持模型行为,单次尝试成功率达94%,还为构建安全KV重用系统提供设计见解。

Comments 20 pages, accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07161 2026-08-03 cs.AI 版本更新

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

SREGym:面向AI SRE代理的实时基准测试平台,具有高保真的故障场景

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

AI总结 SREGym通过模拟真实云原生系统栈中的高保真故障场景,为AI SRE代理提供实时基准测试环境,包含90个真实挑战性SRE问题,评估前沿代理能力差异显著,可达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25364 2026-07-30 cs.AI cs.SE 版本更新

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales

人工智能代理的解释约束工具执行:无需信任模型原理的服务器验证动作声明

Genliang Zhu, Chu Wang

机构 * Accentrust(Accentrust公司) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究针对人工智能代理工具执行问题,提出EBTE中介层,将原理内容转换为动作声明并经服务器检查。通过形式化和实现参考配置文件,经多场景验证其可行性与诊断价值,支持服务器检查动作声明而非其他相关特性。

Comments 25 pages, 1 figure, 15 tables. Revised presentation and synchronized evaluation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22916 2026-07-30 cs.AI 版本更新

Intent-Governed Tool Authorization for AI Agents

意图驱动的AI代理工具授权

Genliang Zhu, Chu Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Accentrust

AI总结 提出意图驱动访问控制(IGAC),通过将用户意图作为单调可审计策略属性,限制AI代理的工具调用权限,防止静态凭证滥用。

Comments 33 pages. Revised presentation and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15591 2026-07-30 cs.IR cs.AI 版本更新

BioHiCL: Hierarchical Multi-Label Contrastive Learning for Biomedical Retrieval with MeSH Labels

BioHiCL:基于MeSH标签的层次多标签对比学习的生物医学检索

Mengfei Lan, Lecheng Zheng, Halil Kilicoglu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 BioHiCL通过层次化MeSH标注实现多标签对比学习,提升生物医学信息检索的语义和层次理解能力,在检索、句子相似性和问答任务中表现优异且计算效率高。

Comments Accepted by ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06300 2026-07-30 cs.CL cs.AI cs.LG 版本更新

$\texttt{AMEND++}$: Benchmarking Eligibility Criteria Amendments in Clinical Trials

AMEND++:临床试验资格标准修订的基准测试

Trisha Das, Mandis Beigi, Jacob Aptekar, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Medidata Solutions(Medidata解决方案)

AI总结 AMEND++通过CAMLM模型提升临床试验资格标准修订预测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09800 2026-07-29 cs.LG 版本更新

Reference Traces for Auditing Invisible Weight Updates and Guiding Exact-Budget Protection

无声冻结:预测低精度训练何时停止学习

Zekai Shang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究低精度训练中权重更新低于半ULP时坐标冻结问题,通过高精度轨迹和目标尾数长度预测冻结,以小型GPT、GPT - 2变压器等为例展示结果,还表明随机舍入可消除冻结,此条件在多种模型适用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18952 2026-07-29 cs.LG stat.ME stat.ML 版本更新

Vector-Valued Distributional Reinforcement Learning Policy Evaluation: A Hilbert Space Embedding Approach

向量值分布式强化学习策略评估:一个希尔伯特空间嵌入方法

Mehrdad Mohammadi, Qi Zheng, Ruoqing Zhu

机构 * Department of Statistics, University of Illinois Urbana-Champaign(统计系,伊利诺伊大学厄巴纳-香槟分校) Department of Bioinformatics and Biostatistics, University of Louisville(生物信息学与生物统计学系,路易斯维尔大学)

AI总结 本文提出了一种基于希尔伯特空间嵌入的多维分布式强化学习框架,通过核均值嵌入估计价值分布,解决了多维状态-动作空间中瓦瑟斯坦距离计算的计算挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10431 2026-07-29 cs.AI cs.SY eess.SY 版本更新

Diffusion Model-based Parameter Estimation in Dynamic Power Systems

动态电力系统中基于扩散模型的参数估计

Feiqin Zhu, Dmitrii Torbunov, Zhongjing Jiang, Tianqiao Zhao, Amirthagunaraj Yogarathnam, Yihui Ren, Meng Yue

机构 * Brookhaven National Laboratory(布鲁海文国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究动态电力系统中参数估计的不适定问题,提出基于联合条件扩散模型的反问题求解器,利用扩散模型随机性产生候选解,联合多观测缩小后验分布,在复合负荷模型参数化中优势明显,降低误差且能准确复制系统动态响应,提供通用框架。

Comments Updated to match the published version. Minor corrections incorporated

Journal ref Zhu, F., Torbunov, D., Jiang, Z. et al. Diffusion model-based parameter estimation in dynamic power systems. Commun Eng 5, 123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00045 2026-07-28 cs.AI cs.ET quant-ph 版本更新

Universal Quantum Transformer

通用量子Transformer

Sungyong Chung, Alireza Talebpour

机构 * Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院土木与环境工程系)

AI总结 提出通用量子Transformer(UQT),利用多量子比特系统的物理特性作为归纳偏置,通过参数化几何相位嵌入和SU(2)波干涉实现精确的数学和代数推理,在紧凑的5量子比特基板上完美学习循环模算术和非阿贝尔代数,并实现确定性泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27660 2026-07-28 cs.AI 版本更新

From Context to Skills: Can Language Models Learn from Context Skillfully?

从上下文到技能:语言模型能否从上下文中熟练学习?

Shuzheng Si, Haozhe Zhao, Yu Lei, Qingyi Wang, Dingwei Chen, Zhitong Wang, Zhenhailong Wang, Kangyang Luo, Zheng Wang, Gang Chen, Fanchao Qi, Minjia Zhang, Maosong Sun

机构 * THU(清华大学) DeepLang AI UIUC(伊利诺伊大学香槟分校) FDU(福建大学) CUHK(香港中文大学)

AI总结 提出Ctx2Skill框架,通过多智能体自博弈和跨时间回放机制,自动从上下文中发现、提炼和选择技能,提升语言模型在复杂上下文中的学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08992 2026-07-28 cs.AI 版本更新

Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty

重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性

Rui Wang, Qihan Lin, Jiayu Liu, Qing Zong, Tianshi Zheng, Dadi Guo, Haochen Shi, Peixuan Han, Weiqi Wang, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03536 2026-07-28 cs.CL cs.AI cs.IR 版本更新

SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems

SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐

Haochang Hao, Yifan Xu, Xinzhuo Li, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。

Comments Accepted by SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏