LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection
LivePI:更真实的智能体对抗间接提示注入基准测试
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。
高校专区
LivePI:更真实的智能体对抗间接提示注入基准测试
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。
在符合推断中对虚假发现比例的处处有效界
机构 * Department of Statistics, Stanford University(斯坦福大学统计学系) ; Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计学与数据科学系) ; Department of Mathematics, Stanford University(斯坦福大学数学系)
AI总结 本文提出了一种在多重检验问题中对虚假发现比例(FDP)的处处有效界,通过构造高概率包络来保证在任意后验阈值选择下的统计保证,同时展示了该方法在异常检测和符合选择中的应用。
Comments 34 pages, 12 figures. Code available at https://github.com/sza919/everywhere-valid-fdp-bounds-in-conformal-inference
自主驾驶数据集:从2000万篇论文到大规模精细化生物医学知识
机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; Department of Genetics, University of Pennsylvania(宾夕法尼亚大学遗传学系) ; Departments of Bioengineering and Chemical and Biomolecular Engineering, University of Pennsylvania(宾夕法尼亚大学生物工程与化学与生物分子工程系)
AI总结 本文提出通过PubMed自动生成结构化数据集,实现更大规模、更精细和更准确的生物医学知识,展示Starling系统在多个任务中生成大规模数据集并提升准确性。
分解上下文召回中的预测机制
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 通过设计结合连续上下文学习与离散关联召回的新玩具问题,发现Transformer模型在上下文召回任务中存在两种具有不同学习动态的独立机制:一种依赖离散符号标签进行关联召回,另一种基于前一个token和上下文进行贝叶斯式预测。
Comments 45 pages, 47 figures, 2 tables
超越领域:通过可迁移交互模式重用网络技能
机构 * University of Michigan(密歇根大学) ; Alibaba Group(阿里巴巴集团) ; Purdue University(普渡大学) ; McMaster University(麦克马斯特大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出SkillMigrator代理,通过学习可迁移交互模式(TIP)匹配布局结构而非元素引用,实现跨站点技能重用,在WebArena和Mind2Web上成功轨迹的LLM动作数减少8-10%。
约束扩散模型与原始-对偶推理
机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)
AI总结 提出原始-对偶推理(PDI)方法,通过联合推断最优原始分布和其对偶变量,在扩散模型反向过程中交替去噪与对偶上升,实现平均约束下的熵正则化优化问题采样。
findsylls: 一种语言无关的音节级语音分词与嵌入工具包
机构 * Department of Linguistics, University of Pennsylvania, USA(宾夕法尼亚大学语言学系)
AI总结 提出语言无关的模块化工具包findsylls,统一经典音节检测器和端到端音节切分器,支持音节分割、嵌入提取和多粒度评估,在英语、西班牙语及低资源语言Kono上验证了跨语言可重复实验能力。
Comments 4 pages + 2 for references, disclosures & acknowledgements; to appear in Interspeech 2026; DOI to cite findsylls library: https://doi.org/10.5281/zenodo.20707804
UXBench: 衡量LLM生成的UX评论的可操作性
机构 * University of Notre Dame(诺丁汉大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Rochester(罗切斯特大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学) ; LMU Munich(慕尼黑路德维希-马克西米利安大学)
AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。
Comments 30 pages
PACT: 多轮工具使用智能体的特权轨迹协同训练
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Ohio State University(俄亥俄州立大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Arizona State University(亚利桑那州立大学)
AI总结 提出PACT框架,通过特权轨迹(专家轨迹)在训练时提供密集监督信号,结合轨迹条件RL和组件感知SFT损失,避免推理时依赖轨迹,显著提升多轮工具使用智能体的性能。
Comments Project page: https://zhenbangdu.github.io/pact-project-page/
算法推理中代码是否优于语言
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 通过分离中间表示与执行机制,在40个任务上比较代码执行与自然语言推理,发现代码执行优势源于外部执行而非表示变化。
Comments ICML 2026
平衡传播与耦合学习中的守恒律
机构 * SAS, University of Pennsylvania(宾夕法尼亚大学SAS学院)
AI总结 本文证明物理学习方法耦合学习和平衡传播在连续时间小扰动极限下守恒类质量量,并分析其对线性电路训练动力学的影响。
线性电路中物理学习的强制性与局部收敛性
机构 * Department of Mathematics, University of Pennsylvania, Philadelphia(宾夕法尼亚大学数学系)
AI总结 针对线性电路,分析三种物理学习方法(平衡传播、耦合学习及其伴随变体)在小扰动极限下的局部收敛性,发现强制条件(基于网络结构的秩条件)保证指数收敛,且非退化情况是普遍的。
通过迭代策略更新的鲁棒共形CBF和CLF控制器
机构 * Automatic Control Laboratory, ETH Zürich(瑞士苏黎世联邦理工学院自动控制实验室) ; Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)
AI总结 针对共形预测嵌入鲁棒控制时因分布偏移导致安全/稳定性保证失效的问题,提出迭代更新策略框架,结合对抗鲁棒共形预测与分布偏移预算,实现跨回合保证。
智能体AI中的弹性共识
机构 * KTH(瑞典皇家理工学院) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 研究LLM智能体在多智能体系统中的共识问题,发现经典弹性共识理论在LLM智能体中失效,但结合经典滤波器可改善一致性。
专家驱动的生存机器:改善多个临床队列中的分层与可解释性
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出一种基于混合专家模型的自适应深度聚类生存框架(AdaCSM),通过路由专家机制实现条件专业化,动态分配患者到专门的风险预测器,提升生存预测性能和可解释性。
课堂环境中的多模态说话人识别
机构 * University of Michigan(密歇根大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学)
AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。
Comments 9 pages, 5 tables, 3 figures
可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。
Comments Published at IEEE ICHI 2026
A2D2: 任意长度离散扩散模型的自适应解码微调
机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) ; School of Mathematics, Georgia Institute of Technology(佐治亚理工学院数学学院)
AI总结 提出A2D2框架,通过联合优化插入和去掩蔽策略及基于质量的推理调度,实现任意长度离散扩散模型的奖励引导微调,理论上保证收敛到奖励倾斜分布,实验提升奖励优化与生成灵活性和准确性。
NetCause:大规模网络中根因分析的反事实学习
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出NetCause框架,将网络事件建模为图时间过程,通过反事实模拟排序候选根因,在31个专家标注事件上准确率提升16.1%。
Comments 9 pages, 6 figures
MARS: 用于并行LLM测试时扩展的边际对抗风险控制停止策略
机构 * Amazon(亚马逊) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出MARS停止规则,通过监测中间检查点的聚合投票并利用对抗性边界估计未来投票变化,在保证准确率的同时节省25-47%的自一致性token。
AI智能体的战略决策支持
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 针对AI智能体作为主要决策者时的可靠性问题,提出通过优化问题最小化支持使用并控制反事实遗漏支持误差的战略决策支持框架,并开发在线算法自适应阈值化支持分数。
雷达引导的多项式拟合用于度量深度估计
机构 * Yale University(耶鲁大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出POLAR方法,利用雷达数据预测多项式系数,对单目深度估计的无尺度深度进行非均匀校正,实现度量深度估计,性能在三个数据集上平均提升24.9% MAE和33.2% RMSE。
Comments CVPR 2026
通过条件控制扩散实现超低比特率视频压缩的主动采样
机构 * Department of Electrical and Computer Engineering, University of California San Diego(电子与计算机工程系,加州大学圣地亚哥分校) ; Department of Electrical and Systems Engineering, University of Pennsylvania(电子与系统工程系,宾夕法尼亚大学)
AI总结 提出ActDiff-VC框架,利用条件扩散模型和主动采样策略(自适应关键帧选择与预算感知稀疏轨迹选择),在超低比特率下实现高感知质量视频压缩。
Comments 21 pages, 11 figures, 3 tables
具有可处理不确定性量化的保结构神经代理模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Stanford University(斯坦福大学) ; California Institute of Technology(加州理工学院)
AI总结 提出一种结合混合有限元空间与高斯过程回归的保结构降阶模型,通过拓扑结构实现状态-通量关系的不确定性量化,并导出狄利克雷-诺伊曼映射的闭式后验不确定性。
什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化
机构 * Amazon Responsible AI(亚马逊负责任人工智能) ; University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。
基于Transformer的脑电情绪识别时空特征学习模型
机构 * Beijing Neurodeep Technology Co., Ltd(北京纽罗德普科技有限公司) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出EEG-TransNet架构,通过局部自注意力块和模糊注意力同步Transformer捕捉脑电信号的时空特征,在三个数据集上优于现有方法。
使用合成理由数据进行监督微调损害真实世界疾病预测
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Merced(加州大学默塞德分校)
AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。
UniPixie: 基于流匹配的统一概率三维物理学习
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Southern University of Science and Technology(南方科技大学) ; MIT(麻省理工学院)
AI总结 提出UniPixie框架,通过流匹配学习从单张视觉输入到连续可控材料属性分布的映射,实现多样物理场生成并降低杨氏模量预测误差超50%。
Comments Published at CVPR 2026 as a Highlight. Project page: https://unipixie.github.io/
2023年脑肿瘤分割(BraTS)挑战:撒哈拉以南非洲患者群体的胶质瘤分割(BraTS-Africa)
机构 * Medical Artificial Intelligence Laboratory (MAI Lab)(医学人工智能实验室(MAI实验室)) ; Department of Radiation Biology, Radiotherapy and Radiodiagnosis, University of Lagos(拉各斯大学放射生物学、放射治疗与放射诊断系) ; Department of Radiology, University of California, San Diego(加州大学圣地亚哥分校放射科) ; Crestview Radiology Limited(Crestview放射科有限公司) ; Lagos University Teaching Hospital(拉各斯大学教学医院) ; Lagos State University Teaching Hospital, Ikeja, Lagos, Nigeria(拉各斯州大学教学医院,伊凯贾,拉各斯,尼日利亚) ; NSIA-Kano Diagnostic Center, Kano Nigeria(NSIA-卡诺诊断中心,卡诺,尼日利亚) ; Nnamdi Azikiwe University Teaching Hospital, Nnewi, Anambra State, Nigeria(恩内迪·阿齐基韦大学教学医院,恩韦伊,安纳博拉州,尼日利亚) ; Federal Medical Centre, Abeokuta, Ogun State, Nigeria(阿博库塔联邦医疗中心,奥贡州,尼日利亚) ; Federal Medical Centre, Umahia, Abia State, Nigeria(乌马希亚联邦医疗中心,阿比亚州,尼日利亚) ; National Hospital Abuja, FCT, Nigeria(阿布贾国家医院,联邦首都区,尼日利亚) ; Benue State University Teaching Hospital, Markurdi, Benue State, Nigeria(贝努埃州大学教学医院,马库尔迪,贝努埃州,尼日利亚) ; Duke University Medical Center, Department of Radiology, USA(达特茅斯大学医学中心,放射科,美国) ; University of California San Francisco, CA, USA(加州大学旧金山分校,CA,美国) ; Yale University, New Haven, CT, USA(耶鲁大学,新 Haven,CT,美国) ; Children's National Hospital, Washington DC, USA(儿童医院华盛顿特区,华盛顿特区,美国) ; George Washington University, Washington DC, USA(乔治·华盛顿大学,华盛顿特区,美国) ; Sage Bionetworks, USA(Sage生物网络,美国) ; Department of Neuroradiology, Technical University of Munich, Munich, Germany(慕尼黑技术大学神经放射科系,慕尼黑,德国) ; Helmholtz Research Center, Munich, Germany(海德堡研究中心,慕尼黑,德国) ; Duke University Medical Center, Department of Radiation Oncology, USA(达特茅斯大学医学中心,放射肿瘤科,美国) ; Children’s Hospital of Philadelphia, University of Pennsylvania, Philadelphia, PA, USA(费城儿童医院,宾夕法尼亚大学,费城,PA,美国) ; Center for AI and Data Science for Integrated Diagnostics (AI2D) & Center for Biomedical Image Computing and Analytics (CBICA), University of Pennsylvania, Philadelphia, PA, USA(人工智能与数据科学整合诊断中心(AI2D)及生物医学影像计算与分析中心(CBICA),宾夕法尼亚大学,费城,PA,美国) ; Athinoula A Martinos Center for Biomedical Imaging, Massachusetts General Hospital, Boston, MA, USA(Athinoula A Martinos生物医学影像中心,马萨诸塞总医院,波士顿,MA,美国) ; University of Zurich, Switzerland(苏黎世大学,瑞士) ; Cancer Imaging Program, National Cancer Institute, National Institutes of Health, Bethesda, MD 20814, USA(癌症成像计划,国家癌症研究所,国家卫生研究院,贝塞斯达,MD 20814,美国) ; Center for Clinical Epidemiology and Biostatistics, University of Pennsylvania, Philadelphia, USA(临床流行病学与生物统计学中心,宾夕法尼亚大学,费城,美国) ; Department of Applied Mathematics and Computer Science, Technical University of Denmark, Denmark(应用数学与计算机科学系,丹麦技术大学,丹麦) ; Mayo Clinic, MN, USA(梅奥诊所,MN,美国) ; Precision FDA, U.S. Food and Drug Administration, Silver Spring, MD, USA(Precision FDA,美国食品药品监督管理局,Silver Spring,MD,美国) ; Booz Allen Hamilton, McLean, VA, USA(Booz Allen Hamilton,麦肯,VA,美国) ; Department of Radiology, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA, USA(放射科,佩尔曼医学院,宾夕法尼亚大学,费城,PA,美国) ; Department of Pathology and Laboratory Medicine, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA, USA(病理学与实验室医学系,佩尔曼医学院,宾夕法尼亚大学,费城,PA,美国) ; Center for Global Health, Perelman School of Medicine, University of Pennsylvania, Philadelphia, Pennsylvania, USA(全球健康中心,佩尔曼医学院,宾夕法尼亚大学,费城,宾夕法尼亚,美国) ; Montreal Neurological Institute, McGill University, Montreal, Canada(蒙特利尔神经科学研究所,麦吉尔大学,蒙特利尔,加拿大) ; Department of Medicine, University of Cape Town, South Africa(医学系,开普敦大学,南非) ; Department of Radiation Medicine, University of Cape Town, South Africa(放射医学系,开普敦大学,南非)
AI总结 研究探讨了在资源有限的撒哈拉以南非洲地区,利用先进机器学习方法进行胶质瘤分割的可行性,旨在改进该地区胶质瘤的诊断和治疗。
Comments arXiv admin note: text overlap with arXiv:2107.02314
PTL-Diffusion: 具有周期终端定律的流形感知扩散
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Harvard University(哈佛大学) ; MIT(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 提出PTL-Diffusion,通过将前向噪声过程收敛到周期高斯终端族而非单一分布,显式嵌入相位结构,改善低维流形上的分布匹配,在点云和人脸数据集上降低误差。