NeST: Neuron Selective Tuning for LLM Safety
NeST: 面向LLM安全的神经元选择性调优
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。
高校专区
NeST: 面向LLM安全的神经元选择性调优
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。
用于机器学习的多模波传播的任意控制
机构 * School of Applied and Engineering Physics, Cornell University(应用与工程物理系,康奈尔大学) ; NTT Physics and Informatics Laboratories, NTT Research, Inc.(NTT物理与信息实验室,NTT研究公司) ; E. L. Ginzton Laboratory, Stanford University(E. L. Ginzton实验室,斯坦福大学) ; Kavli Institute at Cornell for Nanoscale Science, Cornell University(康奈尔大学纳米科学研究所) ; Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) ; Department of Electrical Engineering and Computer Science, University of California(加州大学电气工程与计算机科学系) ; Department of Applied Physics, Yale University(耶鲁大学应用物理系)
AI总结 提出一种可快速重编程折射率的二维可编程波导,通过并行电光调制实现多模波传播的任意控制,并用于单次神经网络推理,理论表明面积增长为N^1.5而非N^2。
Journal ref Nat. Phys. 22, 164-171 (2026)
ShapeBench: 一种可扩展的基准和诊断套件,用于气动形状优化的标准化评估
机构 * Stanford University(斯坦福大学) ; Spinoza Labs(斯皮诺扎实验室)
AI总结 本文提出ShapeBench,一个开源的气动形状优化基准,提供统一的API,涵盖103个任务和八个形状类别,通过验证的代理模型和高保真CFD流程进行系统分析,展示了不同形状类别和问题形式中优化器排名的显著差异,强调了需要更通用方法的必要性。
GLIDE:未知环境下的空地协同搜索与救援框架
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出GLIDE框架,通过两架无人机与一辆无人地面车协同,实现未知环境中的快速受害者定位和障碍物感知导航,利用角色分离和地形侦察提升救援效率。
多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。
语言模型电路在神经元基上是稀疏的
机构 * Stanford University(斯坦福大学)
AI总结 本文实证发现MLP神经元与稀疏自编码器一样是稀疏特征基,并基于此开发了端到端梯度归因流水线,在多项任务中揭示了因果有效的神经元电路。
Comments ICML Spotlight, camera-ready
PLaID++: 一种用于定向无机材料设计的偏好对齐语言模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出PLaID++,通过对称性感知的Wyckoff文本表示和温度缩放熵正则化,结合可验证奖励的强化学习,实现稳定、新颖且满足空间群属性的晶体生成,比先前方法效率提高约50%。
Comments Code available at https://github.com/andaero/PLaID, model weights at https://huggingface.co/HOPE-Lab-HMC/PLaID
基于绝热谱子流形的数据驱动软体机器人控制
机构 * Institute for Mechanical Systems, ETH Zürich(机械系统研究所,苏黎世联邦理工学院) ; Autonomous Systems Lab, Stanford University(自主系统实验室,斯坦福大学) ; Automatic Control Laboratory, ETH Zürich(自动控制实验室,苏黎世联邦理工学院)
AI总结 针对软体机器人在非线性区域控制难题,提出基于绝热谱子流形(aSSM)的模型预测控制策略,通过数据驱动构建低维吸引子流形,实现高精度轨迹跟踪,性能提升达10倍。
Comments 41 pages, 24 figures, IJRR (2026) in press
MoReBench:评估语言模型中的程序性和多元道德推理,超越结果
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; Scale AI ; Harvard University(哈佛大学) ; University of Michigan(密歇根大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Center for AI Safety(人工智能安全中心) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; University of Oxford(牛津大学)
AI总结 提出MoReBench基准,包含1000个道德场景和超过2.3万条标准,用于评估语言模型在道德推理中的程序性推理能力,发现现有基准无法预测模型表现,且模型对特定道德框架存在偏好。
Comments 46 pages, 8 figures, 10 tables. Published in ICLR 2026. Accepted at CHAI workshop and SPP 2026 (non-archival)
GAE: 利用可泛化动作专家释放VLM的物理潜力
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出通用动作专家(GAE),通过稀疏几何接口将VLM的高层意图转化为连续动作轨迹,采用动作预训练-点云微调(APPF)方案解耦动作动力学与几何基础,实现跨视觉域、视角和指令的强泛化。
Prism: 通过GPU内存气球实现经济高效的多LLM服务
机构 * UCLA(加州大学洛杉矶分校) ; UC Berkeley(伯克利加州大学) ; Harvard University(哈佛大学) ; CMU(卡内基梅隆大学) ; University of Edinburgh(爱丁堡大学) ; Intel(英特尔) ; Stanford University(斯坦福大学) ; LMSYS(灵州市系统实验室) ; ByteDance(字节跳动) ; Alibaba Cloud(阿里云) ; Tsinghua University(清华大学) ; Novita AI ; Rice University(里士满大学)
AI总结 针对多LLM服务中资源效率低下的问题,提出基于内存气球的内存中心化LLM协同服务框架Prism,统一空间与时间共享,已在10K+ GPU生产环境部署。
Comments OSDI'26
基于共形预测从稀疏人类反馈中学习机器人安全
机构 * Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)
AI总结 通过人类对策略轨迹的二元反馈,利用共形预测识别包含未来策略错误的状态区域,构建具有保证漏检率的预警系统,并用于改进模型预测控制器的安全性。
潜意识学习是引导向量蒸馏
机构 * Stanford University(斯坦福大学)
AI总结 本文发现潜意识学习通过单个引导向量实现,并证明这是引导向量蒸馏的特例,解释了非语义数据如何传递语义特征。
人类引导的智能体AI用于多模态临床预测:来自AgentDS医疗基准的教训
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 通过人类引导智能体AI在多模态临床预测任务中取得领先性能,提炼出领域知识引导特征工程、任务特定多模态融合和临床动机模型集成三大通用经验。
Comments Presented at the Data Challenge track at the 14th IEEE International Conference on Healthcare Informatics (ICHI) 2026 on June 3, 2026
评估卡:AI评估报告的解释层
机构 * Hugging Face ; Stanford University(斯坦福大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; University of Copenhagen(哥本哈根大学) ; Trustible ; EleutherAI ; TU Darmstadt(达姆施塔特工业大学) ; Weizenbaum Institute & Technical University of Munich(魏森鲍姆研究所与慕尼黑工业大学) ; Harvard University(哈佛大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Iowa State University(爱荷华州立大学) ; IBM Research(IBM研究院) ; University of Chicago(芝加哥大学) ; Independent(独立) ; Berkeley AI Safety Institute (BASIS)(伯克利人工智能安全研究所) ; Simula ; University of Edinburgh(爱丁堡大学) ; ETH Zurich & ETH AI Center(苏黎世联邦理工学院与ETH AI中心) ; Oxford Internet Institute(牛津互联网研究所) ; Amherst College(阿默斯特学院) ; University of Nebraska(内布拉斯加大学) ; Syntony Research ; McGill University(麦吉尔大学) ; Evals Consensus ; Israel Institute of Technology(以色列理工学院) ; IOL.Learn & Zuse Institute Berlin(IOL.Learn与柏林祖泽研究所) ; Georgia Institute of Technology(佐治亚理工学院) ; Quebec AI Institute, Université de Montréal(魁北克人工智能研究所,蒙特利尔大学) ; University of Notre Dame(圣母大学) ; Georgetown University(乔治城大学) ; DHBW Stuttgart(斯图加特双元制大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对AI评估报告不一致的问题,提出EvalCards作为统一记录层,通过结构化模式、四种解释信号和监控工具,覆盖5816个模型和635个基准,揭示报告实践中的系统性差距。
利用人工智能推动一维核磁共振波谱在自动结构解析中的极限
机构 * Department of Chemistry, Stanford University(化学系,斯坦福大学) ; ACD/Labs(ACD实验室)
AI总结 提出基于Transformer的深度学习框架,仅利用一维1H和13C NMR谱,对含多达40个非氢原子的有机分子实现60.4%的首次15次预测准确率,克服化学空间组合爆炸。
AI生成语言中的标准语言意识形态
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 本文提出一个分类法,揭示大型语言模型如何强化标准语言意识形态,导致语言变体的边缘化,并讨论其社会影响及应对建议。
Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)
Whisper-GPT -- 语音和音乐的连续离散混合表示语言模型
机构 * Stanford University(斯坦福大学)
AI总结 提出Whisper-GPT,一种结合连续音频表示(如频谱图)和离散音频令牌的生成式大语言模型,解决了离散令牌方法上下文长度过长的问题,在语音和音乐的下一个令牌预测中降低了困惑度和负对数似然。
Comments 6 pages, 3 figures. 50th International Conference on Acoustics, Speech and Signal Processing, Hyderabad, India
ReSkill:在智能体强化学习中协调技能创建与策略优化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。
通过文本和语义定义的分割提示灵活控制3D CT生成
机构 * Boston University School of Engineering(波士顿大学工程学院) ; Stanford University(斯坦福大学) ; University of Pittsburgh Medical Center(匹兹堡大学医学中心) ; Boston University School of Medicine(波士顿大学医学院)
AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。
CalBench: 评估多智能体大语言模型中的协调-隐私权衡
机构 * Stanford University(斯坦福大学)
AI总结 提出CalBench基准,用于在私有信息下评估多智能体日程协调中任务完成、成本、通信、公平性和隐私泄露的权衡。
潜在缓存流:无需文本的模型间通信
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出潜在缓存流(LCF)方法,通过联合翻译和压缩键值缓存实现高效模型间通信,在上下文不同场景下比基于文本的通信准确率提高23%、速度提升8.5倍。
Comments 6 pages, 5 figures
通过扩散强迫实现统一且稳健的数据同化:ForcingDAS
机构 * University of Michigan(密歇根大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出ForcingDAS,一种基于扩散强迫的统一数据同化框架,能够捕捉长时序依赖并减少误差积累,同时在推理时无需重新训练即可实现滤波到平滑的全谱应用。
通过预训练分子嵌入距离推进基于配体的虚拟筛选和分子生成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 本文提出预训练嵌入距离作为高效替代方案,用于虚拟筛选和分子生成,展示其在结构信息捕捉和相似性测量方面的有效性。
Comments Accepted by ICML 2026 AI4Science (https://openreview.net/forum?id=HbfrCipfNl). Code and data are available
移动性嵌入的POI:从人类移动中学习场所身份与使用方式
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出ME-POIs框架,通过对比学习将大规模人类移动数据与语言模型嵌入结合,学习场所功能,并在五个地图丰富任务上超越文本或移动性单独基线。
规范性缩放揭示语言模型能力的演变
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。
Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling
当良性输入导致严重危害:引发计算机使用代理的不安全意外行为
机构 * DeepMind, London, UK(深度Mind,伦敦,英国) ; Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) ; UC Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加利福尼亚州,美国)
AI总结 提出AutoElicit框架,通过迭代扰动良性指令并利用CUA执行反馈,自动引发前沿CUAs(如Claude 4.5 Haiku等)的数百种有害意外行为,并验证其跨模型可迁移性。
Comments ICML 2026, Project Homepage: https://osu-nlp-group.github.io/AutoElicit/
条件归一化流用于前向和后向联合状态与参数估计
机构 * Department of Computer Science and Engineering University of Notre Dame(计算机科学与工程系诺特达姆大学) ; Department of Pediatrics Stanford University(儿科系斯坦福大学) ; Department of Applied and Computational Mathematics and Statistics University of Notre Dame(应用与计算数学与统计系诺特达姆大学)
AI总结 针对非线性非高斯系统,提出基于条件归一化流的状态滤波方法,结合MLP、Transformer或Mamba-SSM生成条件嵌入,并引入最优传输动力学损失缓解过参数化,在自动驾驶和COVID-19联合估计中验证有效性。
生理时间序列的自监督动力系统表示
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。
Comments Accepted to ICML 2026
社交平台领先滞后预测的基准数据集
机构 * Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
AI总结 本文提出领先滞后预测(LLF)问题,并发布arXiv和GitHub两个大规模基准数据集,通过统计检验验证领先滞后动态,为社交平台时间序列预测提供标准化测试平台。
Comments 11 pages, 8 figures, includes supplementary material (6 pages, 5 figures). Accepted at ACM SIGKDD 2026 (KDD '26). Code and data: https://lead-lag-forecasting.github.io