Randomized YaRN Improves Length Generalization for Long-Context Reasoning
随机化 YaRN 提升长上下文推理的长度泛化能力
机构 * New York University(纽约大学)
AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。
高校专区
随机化 YaRN 提升长上下文推理的长度泛化能力
机构 * New York University(纽约大学)
AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。
有限状态平均场博弈的神经参数校准
机构 * Radboud University(拉德堡德大学) ; New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tel Aviv University(特拉维夫大学) ; New York University Shanghai(纽约大学上海)
AI总结 提出基于神经网络框架,通过隐式微分反向传播均衡,从观测群体动力学中学习有限状态平均场博弈的参数,无需个体动作或奖励数据。
MindTailor: 通过历史帖子基于案例构建和协作精炼的个性化情感支持
机构 * Sungkyunkwan University(成均馆大学) ; New York University(纽约大学)
AI总结 提出MindTailor框架,利用求助者历史帖子构建案例,并通过基于不同咨询策略的协作批评迭代精炼回复,在Reddit数据集上优于基线,提升共情和个性化。
Comments 45 pages, 21 figures
AI中介谈判:设计反思与经验教训
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学) ; New York University(纽约大学)
AI总结 通过构建理论驱动的教练系统Trucey并进行实验,发现对话AI在谈判准备中施加线性执行模型,而任务本质是递归的,静态手册反而优于AI条件,提出“先映射后路径,先路径后模拟”的序列原则。
Journal ref CSCW Companion '26: Companion Publication of the 2026 Conference on Computer-Supported Cooperative Work and Social Computing
智能体代码比人类代码更不易维护吗?
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。
通过内化学习
机构 * New York University(纽约大学) ; Toyota Technological Institute at Chicago(丰田芝加哥技术研究所) ; University of Chicago(芝加哥大学)
AI总结 研究神经网络系统通过将显式计算过程吸收到自身权重中的内化机制,分析变换器如何内化半自动机模拟及链式思维令牌,首次证明简化单层变换器在奇偶性学习任务中成功内化的过程。
Comments first version, 43 pages
GEOPHYS: 物理合理性的几何学
机构 * Bielefeld University(比勒费尔德大学) ; University of Oxford(牛津大学) ; Cold Spring Harbor Laboratory(冷泉港实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Independent(独立作者) ; Honda Research Institute EU(本田欧洲研究院) ; New York University(纽约大学) ; Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)
AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。
缩小语义缓存中的校准差距
机构 * New York University(纽约大学) ; Redis(Redis公司)
AI总结 针对语义缓存系统中离线指标与部署性能的差距,提出P-CHR AUC和CRR指标,发现校准差距由训练目标主导,模型选择本质是校准问题。
Comments 23 pages, 2 figures. Source code: https://github.com/aditeyabaral/calibration-gap-semantic-caching ; Models and Datasets: https://huggingface.co/redis
扩展端到端驾驶的自我对弈
机构 * Mila(米拉研究所) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; Torc Robotics ; NYU Tandon School of Engineering(纽约大学坦登工程学院) ; McMaster University(麦克马斯特大学) ; Princeton University(普林斯顿大学)
AI总结 提出大规模自我对弈训练策略,通过高效模拟器Gigapixel实现像素级自我对弈,结合DAgger蒸馏和感知适应,提升端到端驾驶模型性能。
小型LLM:剪枝 vs. 从头训练
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过六种剪枝方法在Llama-3.1-8B上比较剪枝与从头训练,发现有限预算下剪枝更优,预算充足时粗粒度剪枝可被超越。
Comments Our code is available at https://github.com/zlab-princeton/pruning-vs-scratch
电路同步先于泛化:来自Grokking Transformer中傅里叶结构的因果证据
机构 * New York University(纽约大学)
AI总结 提出频率同步度(FSD)指标,发现其在模算术任务中比grokking早500-3000步同步,且通过权重衰减控制验证了间隔期的正则化本质,提供因果证据。
Comments 19 pages, 9 figures, 11 tables. v2: corrected scaling-law to report error bars across seeds (R^2 0.89-0.99) rather than single-draw fits; added non-abelian (S5) transfer experiment; revised title
Samudra 2: 跨分辨率扩展海洋仿真器
机构 * Courant Institute School of Mathematics, Computing, and Data Science, New York University(Courant学院数学、计算与数据科学系,纽约大学) ; Open Athena AI Foundation, Inc.(开放Athena人工智能基金会) ; Program in Atmospheric and Oceanic Sciences, Princeton University(大气与海洋科学项目,普林斯顿大学)
AI总结 针对现有海洋神经仿真器在长期自回归滚动中出现的方差崩溃和印记伪影问题,提出Samudra 2,通过改进U-Net骨干网络和动态损失函数,在1°分辨率下将上层海洋全球平均温度R²从0.56提升至0.87,并将深层海洋温度误差降低约七倍,且可扩展至1/2°和1/4°分辨率。
进化物理信息时间融合用于换道意图预测
机构 * Tandon School of Engineering(工程学院) ; New York University(纽约大学) ; Khoury College of Computer Science(计算机科学学院) ; Northeastern University(东北大学) ; School of Business(商学院) ; Wake Forest University(威克森林大学) ; Independent Researcher(独立研究者) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Qualcomm CDMA Technologies(高通CDMA技术) ; University of Michigan(密歇根大学)
AI总结 提出一种进化物理信息时间融合框架,通过融合从传统交通信号导出的时间描述符和从原始轨迹序列学习的时间嵌入,实现三分类换道意图预测,在highD和exiD数据集上取得高F1分数。
语言模型中的伪 deliberation:当推理无法使价值观与行动一致时
机构 * New York University(纽约大学)
AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。
Comments 9 pages, 5 main figures
迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) ; New York University Abu Dhabi(纽约大学阿布扎克分校)
AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。
CHUCKLE -- 当人类教AI学习情感的简便方式
机构 * New York Institute of Technology, Department of Computer Science(纽约理工学院计算机科学系) ; New York University, Electrical and Computer Engineering Department(纽约大学电气与计算机工程系)
AI总结 CHUCKLE提出一种基于人类感知的课程学习框架,通过众包数据集中的标注者一致性和共识定义样本难度,提升LSTM和Transformer的性能,同时减少梯度更新次数,提高训练效率和模型鲁棒性。
Journal ref Proc. Interspeech 2026, Sydney, Australia, Aug. 2026
ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型
机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) ; Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)
AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。
Comments Interspeech 2026
基于核化随机插值的生成建模
机构 * CCM, Flatiron Institute, New York, USA(CCM,Flatiron研究所,纽约,美国) ; Courant Institute of Mathematical Sciences, New York University, New York, USA(数学科学学院,纽约大学,纽约,美国)
AI总结 提出一种基于核方法的随机插值生成框架,用线性系统替代神经网络训练,通过求解与数据维度无关的线性系统得到生成SDE的漂移项,并处理扩散系数在t=0处的奇异性,适用于多种特征映射,在金融时间序列、湍流和图像生成中验证有效性。
通用先验:通过贝叶斯推断和预训练解决经验贝叶斯问题
机构 * Courant Institute of Mathematical Sciences, NYU(纽约大学Courant数学科学研究所) ; Center for Data Science, NYU(纽约大学数据科学中心) ; Department of EECS, MIT(麻省理工学院电子工程与计算机科学系)
AI总结 本文从理论上证明,在合成数据上预训练的Transformer能通过后验收缩自适应未知测试分布,实现经验贝叶斯问题的近最优遗憾界。
Comments To appear at COLT 2026. 43 pages, 5 figures. Code release at https://github.com/Anzoteh96/eb-transformers
SURE: 使用轨迹优化的安全不确定性感知机器人-环境交互
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; New York University (NYU)(纽约大学) ; Carnegie Mellon University (CMU)(卡内基梅隆大学)
AI总结 提出SURE框架,通过分支轨迹处理接触时间不确定性,在轨迹优化中实现鲁棒性,在推车杆平衡和机器人抓蛋任务中分别提升21.6%和40%的成功率。
TrojanGYM:一种检测器在环的大语言模型用于自适应RTL硬件木马插入
机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) ; NYU Abu Dhabi(纽约大学阿布扎克分校)
AI总结 提出TrojanGYM框架,利用大语言模型智能体自动生成多样化的硬件木马,暴露基于GNN的检测器盲点,并设计鲁棒检测器Robust-GNN4TJ,在生成的基准上将检测率从0%提升至60%。
DASIP:基于随机插值策略的机器人控制动态测试时计算缩放
机构 * New York University(纽约大学) ; University of Maryland(马里兰大学) ; Harvard University(哈佛大学) ; Capital Fund Management(资本基金管理公司)
AI总结 提出难度感知随机插值策略(DA-SIP),通过难度分类器动态调整推理步数、求解器和ODE/SDE积分,在保持任务成功率的同时将计算时间减少2.6-4.4倍。