LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection
LivePI:更真实的智能体对抗间接提示注入基准测试
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。
高校专区
LivePI:更真实的智能体对抗间接提示注入基准测试
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。
在符合推断中对虚假发现比例的处处有效界
机构 * Department of Statistics, Stanford University(斯坦福大学统计学系) ; Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计学与数据科学系) ; Department of Mathematics, Stanford University(斯坦福大学数学系)
AI总结 本文提出了一种在多重检验问题中对虚假发现比例(FDP)的处处有效界,通过构造高概率包络来保证在任意后验阈值选择下的统计保证,同时展示了该方法在异常检测和符合选择中的应用。
Comments 34 pages, 12 figures. Code available at https://github.com/sza919/everywhere-valid-fdp-bounds-in-conformal-inference
自主驾驶数据集:从2000万篇论文到大规模精细化生物医学知识
机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; Department of Genetics, University of Pennsylvania(宾夕法尼亚大学遗传学系) ; Departments of Bioengineering and Chemical and Biomolecular Engineering, University of Pennsylvania(宾夕法尼亚大学生物工程与化学与生物分子工程系)
AI总结 本文提出通过PubMed自动生成结构化数据集,实现更大规模、更精细和更准确的生物医学知识,展示Starling系统在多个任务中生成大规模数据集并提升准确性。
分解上下文召回中的预测机制
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 通过设计结合连续上下文学习与离散关联召回的新玩具问题,发现Transformer模型在上下文召回任务中存在两种具有不同学习动态的独立机制:一种依赖离散符号标签进行关联召回,另一种基于前一个token和上下文进行贝叶斯式预测。
Comments 45 pages, 47 figures, 2 tables
findsylls: 一种语言无关的音节级语音分词与嵌入工具包
机构 * Department of Linguistics, University of Pennsylvania, USA(宾夕法尼亚大学语言学系)
AI总结 提出语言无关的模块化工具包findsylls,统一经典音节检测器和端到端音节切分器,支持音节分割、嵌入提取和多粒度评估,在英语、西班牙语及低资源语言Kono上验证了跨语言可重复实验能力。
Comments 4 pages + 2 for references, disclosures & acknowledgements; to appear in Interspeech 2026; DOI to cite findsylls library: https://doi.org/10.5281/zenodo.20707804
可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。
Comments Published at IEEE ICHI 2026
雷达引导的多项式拟合用于度量深度估计
机构 * Yale University(耶鲁大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出POLAR方法,利用雷达数据预测多项式系数,对单目深度估计的无尺度深度进行非均匀校正,实现度量深度估计,性能在三个数据集上平均提升24.9% MAE和33.2% RMSE。
Comments CVPR 2026
通过条件控制扩散实现超低比特率视频压缩的主动采样
机构 * Department of Electrical and Computer Engineering, University of California San Diego(电子与计算机工程系,加州大学圣地亚哥分校) ; Department of Electrical and Systems Engineering, University of Pennsylvania(电子与系统工程系,宾夕法尼亚大学)
AI总结 提出ActDiff-VC框架,利用条件扩散模型和主动采样策略(自适应关键帧选择与预算感知稀疏轨迹选择),在超低比特率下实现高感知质量视频压缩。
Comments 21 pages, 11 figures, 3 tables
UniPixie: 基于流匹配的统一概率三维物理学习
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Southern University of Science and Technology(南方科技大学) ; MIT(麻省理工学院)
AI总结 提出UniPixie框架,通过流匹配学习从单张视觉输入到连续可控材料属性分布的映射,实现多样物理场生成并降低杨氏模量预测误差超50%。
Comments Published at CVPR 2026 as a Highlight. Project page: https://unipixie.github.io/
Proper Calibeating
机构 * Department of Statistics, Wharton, University of Pennsylvania, Philadelphia, and Amazon, New York(统计系、沃顿商学院、宾夕法尼亚大学费城分校,以及纽约亚马逊公司) ; Institute of Mathematics, Department of Economics, and Federmann Center for the Study of Rationality, The Hebrew University of Jerusalem(数学研究所、经济系、理性研究基金会,以色列希伯来大学)
AI总结 本文将经典校准预测和calibeating概念扩展到真确评分规则,定义proper-calibration和proper-calibeating,证明校准蕴含proper-calibration而calibeating不一定蕴含proper-calibeating,展示如何保证proper-calibeating和proper-multicalibeating,并证明proper-calibration与不确定性决策中对预测最佳回应时通用无遗憾的等价性。
Comments v2: Updated section 6 "Decision Making Under Uncertainty"
Symskill:符号与技能共发明用于数据高效且反应性强的长周期操作
机构 * GRASP Laboratory, University of Pennsylvania(GRASP实验室,宾夕法尼亚大学)
AI总结 Symskill通过联合学习谓词、运算符和技能,实现了数据高效且反应性强的长周期操作,结合了组合泛化与实时恢复能力。
Comments ICRA 2026 Best Conference Paper Award; ICRA 2026 Best Paper Award on Planning and Control; CoRL 2025 Best Paper Award on Learning Effective Abstractions for Planning (LEAP) Workshop (https://symskill.github.io/)
MatSciBench: 基准测试大型语言模型在材料科学中的推理能力
机构 * University of California, Los Angeles Computer Science Department(加州大学洛杉矶分校计算机科学系) ; University of Pennsylvania Department of Materials Science and Engineering(宾夕法尼亚大学材料科学与工程系) ; Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系)
AI总结 提出MatSciBench基准,包含1340道大学级材料科学问题,覆盖6个主领域和31个子领域,评估LLM推理能力,发现当前模型在领域知识、计算和图表理解方面存在局限。
VFEM: 视觉特征赋能的多变量时间序列预测与跨模态融合
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Pengcheng Laboratory(鹏城实验室) ; Ant Group(蚂蚁集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出VFEM模型,利用预训练大视觉模型通过跨模态注意力融合视觉与时间特征,仅训练7.45%参数即可捕捉跨变量依赖,提升多变量时间序列预测性能。
利用场景图扩展机器人模仿学习的时空上下文
机构 * University of Pennsylvania(宾夕法尼亚大学) ; RAI Institute(RAI研究院) ; University of Michigan(密歇根大学)
AI总结 提出使用场景图作为显式结构化记忆机制,通过动态维护对象中心关系及其时间演化,解决机器人模仿学习中的部分可观测性和长时推理问题。
ActiveGrasp: 基于校准能量模型的信息引导主动抓取
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Archimedes, Athena RC(阿基米德、阿提卡RC)
AI总结 针对密集杂乱环境中的抓取问题,提出一种校准能量模型生成抓取姿态,并基于抓取分布的信息增益主动选择视角,在有限视角下高效抓取目标物体。
Comments CVPR 2026