arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2206
2605.10851 2026-05-12 cs.AI cs.CL cs.LG

The Generalized Turing Test: A Foundation for Comparing Intelligence

通用图灵测试:比较智能的基础

Daniel Mitropolsky, Susan S. Hong, Riccardo Neumarker, Emanuele Rimoldi, Tomaso Poggio

机构 * MIT(麻省理工学院) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

AI总结 本文提出通用图灵测试框架,通过不可区分性比较任意智能体的能力,研究其性质并实证分析现代模型的智能层次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10817 2026-05-12 cs.AI

CLEF: EEG Foundation Model for Learning Clinical Semantics

CLEF:用于学习临床语义的EEG基础模型

Peng Cao, Ali Mirzazadeh, Jong Woo Lee, Aleksandar Videnovic, Dina Katabi

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院) Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院)

AI总结 本文提出CLEF,一种基于临床场景的长上下文EEG基础模型,通过对比学习将EEG会话与神经科报告和结构化电子健康记录对齐,提升了EEG解读的临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10237 2026-05-12 cs.LG

The Benefits of Temporal Correlations: SGD Learns k-Juntas from Random Walks Efficiently

时序相关性的益处:SGD 通过随机游走高效学习 k-联合

Elisabetta Cornacchia, Dan Mikulincer, Elchanan Mossel

机构 * Bocconi University(博科尼大学) University of Washington(华盛顿大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究时序相关性如何使稀疏学习问题更高效地被梯度方法解决,展示在超立方体上懒惰随机游走生成样本时,两层ReLU网络能高效学习k-联合。

Comments 10 pages main body, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22953 2026-05-12 cs.AI

General Agent Evaluation

通用智能体评估

Elron Bandel, Asaf Yehudai, Lilach Eden, Yehoshua Sagron, Yotam Perlitz, Elad Venezian, Natalia Razinkov, Natan Ergas, Shlomit Shachor Ifergan, Segev Shlomov, Michal Jacovi, Leshem Choshen, Liat Ein-Dor, Yoav Katz, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) MIT(麻省理工学院)

AI总结 本文系统评估了通用智能体在不同协议和环境下的性能,提出统一协议和评估框架,揭示了智能体架构和基础模型对性能的影响,发现通用智能体无需定制即可适应多种领域。

Comments Presented at the ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24601 2026-05-12 cs.AI cs.CL

Recursive Language Models

递归语言模型

Alex L. Zhang, Tim Kraska, Omar Khattab

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出递归语言模型(RLMs),通过将长提示视为外部环境的一部分,使大语言模型能够递归调用自身处理长输入,从而在多个长上下文任务中显著提升性能。

Comments 9 pages, 43 with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04660 2026-05-12 cs.CL

Composing Policy Gradients and Prompt Optimization for Language Model Programs

将策略梯度与提示优化组合用于语言模型程序

Noah Ziems, Dilara Soylu, Lakshya A Agrawal, Isaac Miller, Liheng Lai, Chen Qian, Kaiqiang Song, Meng Jiang, Dan Klein, Matei Zaharia, Karel D'Oosterlinck, Christopher Potts, Omar Khattab

机构 * University of Notre Dame(诺特大学) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Anyscale CMU(卡内基梅隆大学) Zoom, Inc.(Zoom公司) Contextual AI MIT(麻省理工学院)

AI总结 本文研究了如何将GRPO与自动提示优化结合,以提升多提示程序的性能,实验表明这种组合在分类、多跳搜索和隐私保护委托任务中平均提升准确率11%。

Comments ACM CAIS 2026. Lakshya*, Dilara*, and Noah* contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23009 2026-05-12 cs.LG cs.AI

Position: Stop Evaluating AI with Human Tests, Develop Principled, AI-specific Tests instead

评估:停止用人类测试评估AI,改而开发基于AI的原理性测试

Tom Sühr, Florian E. Dorner, Olawale Salaudeen, Augustin Kelava, Samira Samadi

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ETH Zurich, Zurich(苏黎世联邦理工学院,苏黎世) University of Tübingen, Methods Center, Tübingen(图宾根大学,方法中心,图宾根) Massachusetts Institute of Technology, Cambridge(麻省理工学院,剑桥)

AI总结 本文指出,将AI性能评估等同于人类心理特质是理论和实证上的错误,呼吁开发专门针对AI的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14927 2026-05-12 q-fin.TR cs.CE cs.LG

Hierarchical Reinforced Trader (HRT): A Bi-Level Approach for Optimizing Stock Selection and Execution

分层强化交易员(HRT):一种用于优化股票选择和执行的双层方法

Zijie Zhao, Roy E. Welsch

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出HRT,一种双层强化学习框架,用于多资产股票市场中的文本感知投资组合管理。HRT将交易分为两个协调决策:高层控制器选择资产层面的增仓、减仓或持有方向,低层控制器则在考虑风险和交易成本的情况下调整投资组合权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18923 2026-05-12 cs.CL

Holmes: A Benchmark to Assess the Linguistic Competence of Language Models

Holmes:一个评估语言模型语言能力的基准

Andreas Waldis, Yotam Perlitz, Leshem Choshen, Yufang Hou, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Technical University of Darmstadt(达姆施塔特技术大学) Information Systems Research Lab(信息系统研究实验室) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学) IBM Research AI(IBM AI研究部) MIT CSAIL(MIT CSAIL实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) IBM Research Europe - Ireland(IBM欧洲爱尔兰研究部)

AI总结 Holmes基准通过分类器探测方法评估语言模型对语法、形态学等语言现象的理解,发现模型大小、架构和指令微调显著影响性能,提出FlashHolmes提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09985 2026-05-12 cs.AI cs.LG cs.NE

Prospective Compression in Human Abstraction Learning

前瞻性压缩在人类抽象学习中的作用

Leonardo Hernandez Cano, Ivan Zareski, Luisa El Amouri, Pinzhe Zhao, Max Mascini, Emanuele Sansone, Yewen Pu, Bonan Zhao, Marta Kryven

机构 * Massachusetts Institute of Technology(麻省理工学院) Dalhousie University(达尔豪斯大学) Nanyang Technological University(南洋理工大学)

AI总结 本文研究了非平稳环境下人类如何前瞻性压缩未来任务,通过模式构建任务发现人类抽象学习与现有回顾性压缩算法存在差异。

Comments under review at neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09969 2026-05-12 cs.LG cs.CL

The Truth Lies Somewhere in the Middle (of the Generated Tokens)

生成标记中的真相位于中间

Sophie L. Wang, Phillip Isola, Brian Cheung

机构 * MIT(麻省理工学院)

AI总结 本文探讨了如何将自回归生成的隐藏状态汇总为反映语言模型内部状态的表示。通过核对齐发现,对生成标记的均池化比单个标记更有效,且生成标记的表示优于提示标记。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09716 2026-05-12 cs.AI

Medical Model Synthesis Architectures: A Case Study

医学模型合成架构:一种案例研究

Katherine M. Collins, Marlene Berke, Ilia Sucholutsky, Ayman Ali, Adrian Weller, Timothy J. O'Donnell, Tyler Brooke-Wilson, Lionel Wong, Joshua B. Tenenbaum

机构 * MIT(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) Duke University(杜克大学) The Alan Turing Institute(艾伦·图灵研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 本文提出一种框架,使AI系统能在不确定性下进行实用且形式透明的临床预测。通过语言模型检索知识并构建概率模型,实现校准和可验证的推理,用于鉴别诊断并讨论未来应用方向。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09301 2026-05-12 cs.LG cs.AI

Neural Cluster First, Route Second: One-Shot Capacitated Vehicle Routing via Differentiable Optimal Transport

神经聚类先,路径后:通过可微最优传输实现的一次性有容量车辆路径问题

Samuel J. K. Chin, Maximilian Schiffer

机构 * MIT(麻省理工学院) TUM(塔尔博特大学)

AI总结 本文提出神经CFRS框架,通过可微最优传输层实现一次性非自回归解决有容量车辆路径问题,理论保证了对空间对称性的抽象,并在实际应用中表现出鲁棒性和高效性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17879 2026-05-12 cs.LG cs.SD

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

生成对抗式后训练缓解实时人机音乐交互中的奖励黑客

Yusong Wu, Stephen Brade, Aleksandra Teng Ma, Tia-Jane Fowler, Enning Yang, Berker Banar, Aaron Courville, Natasha Jaques, Cheng-Zhi Anna Huang

机构 * Mila, Quebec Artificial Intelligence Institute, Université de Montréal(蒙特利尔大学人工智能研究所,魁北克机器学习研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) University of Washington(华盛顿大学) McGill University(麦吉尔大学) Independent Researcher(独立研究者)

AI总结 本文提出一种对抗训练方法,通过政策生成轨迹缓解生成序列模型后训练中的奖励黑客问题,提升音乐伴奏的多样性与和谐性。

Comments v3: fix the Figure numbering bugs

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21671 2026-05-12 cs.LG q-bio.NC

Neuroprobe: Evaluating Intracranial Brain Responses to Naturalistic Stimuli

Neuroprobe:评估自然刺激下的颅内脑响应

Andrii Zahorodnii, Christopher Wang, Geeling Chau, Bennett Stankovits, Charikleia Moraitaki, Eli Gross, Alexander Brady, Andrei Barbu, Boris Katz, Ila R Fiete

机构 * MIT CSAIL, CBMM(MIT CSAIL,CBMM) MIT McGovern Institute(MIT McGovern研究所) Caltech(加州理工学院) Columbia University(哥伦比亚大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 Neuroprobe通过高分辨率颅内EEG数据研究多模态语言处理,提供评估框架比较不同模型架构,揭示语言处理在大脑中的时间与空间动态。

Comments 38 pages, 7 main figures, 16 supplementary figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13484 2026-05-12 cs.CV cs.CY

MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes

MINGLE:用于城市场景中语义复杂区域检测的视觉语言模型

Liu Liu, Alexandra Kudaeva, Marco Cipriano, Fatimeh Al Ghannam, Freya Tan, Gerard de Melo, Andres Sevtsuk

机构 * Massachusetts Institute of Technology(麻省理工学院) Hasso Plattner Institute(于尔克·平特纳研究所)

AI总结 本文提出MINGLE模型,通过整合人类检测、视觉语言推理和轻量级空间聚合算法,实现城市场景中社交群体区域的检测,贡献包括新数据集和语义丰富的标注方法。

Comments 13 pages, 4 figures Updated with the camera-ready version after acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01008 2026-05-12 cs.RO

DexWrist: A Robotic Wrist for Constrained and Dynamic Manipulation

DexWrist:一种用于受限和动态操作的机械腕

Martin Peticco, Gabriella Ulloa, John Marangola, Nitish Dashora, Pulkit Agrawal

机构 * Improbable AI Lab, Massachusetts Institute of Technology(Improbable AI实验室,麻省理工学院)

AI总结 DexWrist通过结合准直接驱动和解耦并行运动机制,在紧凑设计中实现高扭矩和动态接触任务,提升了受限环境中的操作性能。

Comments 9 pages, 8 figures. Submitted to RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09196 2026-05-12 cs.CV cs.AI cs.GR cs.LG cs.RO

RigidFormer: Learning Rigid Dynamics using Transformers

RigidFormer:基于变换器学习刚体动力学

Zhiyang Dou, Minghao Guo, Haixu Wu, Doug Roble, Tuur Stuyck, Wojciech Matusik

机构 * MIT(麻省理工学院) Meta

AI总结 RigidFormer通过对象中心的变换器模型,高效建模无网格表示的高保真刚体动力学,采用可控积分步长和锚点池化技术,实现对点云等无网格输入的高精度模拟。

Comments Project Page: https://people.csail.mit.edu/frankzydou/projects/RigidFormer/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09173 2026-05-12 cs.LG cs.AI

WavesFM: Hierarchical Representation Learning for Longitudinal Wearable Sensor Waveforms

WavesFM:纵向可穿戴传感器波形的分层表示学习

Peng Cao, Zhijian Yang, Tennison Liu, Jonathan Wang, Jiang Wu, Magdalena Proszewska, Arvind Pillai, Mingwu Gao, Amir Farjadian, Lawrence Cai, Emily Blanchard, Daniel McDuff, Pramod Rudrapatna, Matthew Thompson, Anupam Pathak, Mark Malhotra, Shwetak Patel, Dina Katabi, Paolo Di Achille, Ming-Zher Poh

机构 * Google Research(谷歌研究) MIT(麻省理工学院) University of Washington(华盛顿大学)

AI总结 WavesFM通过分层自监督学习框架,解决长序列生理数据处理中的高采样频率、多模态依赖和长序列长度问题,实现对局部信号语义和复杂昼夜及跨日变化的建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08549 2026-05-12 cs.AI

Evaluating Developmental Cognition Capabilities of LLMs

评估大语言模型的发展认知能力

Xiao Xiao, Hayoun Noh, Mar Gonzalez-Franco

机构 * De Vinci Research Center(德文西研究中心) MIT Media Lab(MIT媒体实验室) University of Oxford(牛津大学) Google(谷歌)

AI总结 本文提出DSCT测试,通过自述文本评估发展认知阶段,发现LLM在模拟角色和真实人类响应中表现出不同的阶段特征,表明发展信号在合成响应中更清晰。

Comments 9 pages, 3 figures, (10 pages appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08505 2026-05-12 cs.LG cs.AI math.PR math.ST stat.TH

Scaling Limits of Long-Context Transformers

长上下文变换器的缩放极限

Giuseppe Bruno, Shi Chen, Zhengjiang Lin, Yury Polyanskiy, Philippe Rigollet

机构 * Departement Mathematik und Statistik, University of Bern(伯尔尼大学数学与统计学系) Department of Mathematics, Massachusetts Institute of Technology(麻省理工学院数学系) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系)

AI总结 研究softmax自注意力在长上下文极限下的行为,分析逆温度参数对注意力选择性的影响,揭示不同尺度下注意力权重和输出的极限分布。

Comments 40 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08503 2026-05-12 cs.CL cs.CY cs.HC

NARRA-Gym for Evaluating Interactive Narrative Agents

NARRA-Gym用于评估交互叙事代理

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong He, Zhengqing Yuan, Yujun Zhou, Kehan Guo, Chaoran Chen, Toby Jia-Jun Li, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Pennsylvania(宾夕法尼亚大学) Lehigh University(莱恩大学) Massachusetts Institute of Technology(麻省理工学院) Bake AI UC Santa Barbara(加州大学圣芭芭拉分校) University of Washington(华盛顿大学)

AI总结 本文提出NARRA-Gym,一个可执行评估环境,用于评估LLM在多轮交互中生成连贯故事的能力,通过模拟情感种子生成完整故事并记录完整模型在环轨迹,验证了不同模型在故事质量、鲁棒性和用户适应性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06226 2026-05-12 cs.AI q-bio.GN

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

一种多功能AI代理用于罕见病诊断和风险基因优先级排序

Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Genetics, Yale University(耶鲁大学遗传学系) Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)

AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02564 2026-05-12 eess.IV cs.CV

Why Invariance is Not Enough for Biomedical Domain Generalization and How to Fix It

为何不变性不足以实现生物医学领域泛化以及如何修复它

Sebo Diaz, Polina Golland, Elfar Adalsteinsson, Neel Dey

机构 * MIT(麻省理工学院) MGH(麻省总医院) HMS(哈佛医学院)

AI总结 MaskGen通过结合源域图像强度和领域稳定的基模型表示,提出了一种简单有效的领域泛化策略,在生物医学图像分割中实现了更强的泛化能力。

Comments Project GitHub https://github.com/sebodiaz/MaskGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05495 2026-05-12 cs.LG math.OC

Cheap Thrills: Effective Amortized Optimization Using Inexpensive Labels

廉价快感:利用廉价标签进行有效的摊还优化

Khai Nguyen, Petros Ellinas, Anvita Bhagavathula, Priya L. Donti

机构 * Massachusetts Institute of Technology(麻省理工学院) Technical University of Denmark(丹麦技术大学)

AI总结 本文提出一种利用廉价不完美标签的框架,通过监督预训练和自监督学习提升模型性能,在非凸约束优化、电网操作和刚性动力系统中实现更快收敛和更低计算成本。

Comments in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22158 2026-05-12 cs.CV

One-step Latent-free Image Generation with Pixel Mean Flows

无需潜在变量的一步图像生成:像素均值流

Yiyang Lu, Susie Lu, Qiao Sun, Hanhong Zhao, Zhicheng Jiang, Xianbang Wang, Tianhong Li, Zhengyang Geng, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。

Comments Tech report. Code at https://github.com/Lyy-iiis/pMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02012 2026-05-12 cs.CV cs.LG

Improved Mean Flows: On the Challenges of Fastforward Generative Models

改进的均值流:关于快速前向生成模型挑战的研究

Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) MIT(麻省理工学院) Adobe(Adobe公司) THU(清华大学)

AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。

Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02010 2026-05-12 cs.CL cs.LG

Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling

六分之四:更准确的NVFP4量化方法通过自适应块缩放

Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Keith Wyss, Mahdi Nazemi, Asit Mishra, Carlo del Mundo, Tijmen Blankevoort, Song Han

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

AI总结 本文提出4/6方法,通过自适应块缩放改进NVFP4量化,减少量化误差,提升模型性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09493 2026-05-12 cs.AI cs.LG

Consensus Sampling for Safer Generative AI

共识采样用于更安全的生成式AI

Adam Tauman Kalai, Yael Tauman Kalai, Or Zamir

机构 * OpenAI MIT(麻省理工学院) Tel Aviv University(特拉维夫大学)

AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏