Randomized YaRN Improves Length Generalization for Long-Context Reasoning
随机化 YaRN 提升长上下文推理的长度泛化能力
机构 * New York University(纽约大学)
AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。
高校专区
随机化 YaRN 提升长上下文推理的长度泛化能力
机构 * New York University(纽约大学)
AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。
有限状态平均场博弈的神经参数校准
机构 * Radboud University(拉德堡德大学) ; New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tel Aviv University(特拉维夫大学) ; New York University Shanghai(纽约大学上海)
AI总结 提出基于神经网络框架,通过隐式微分反向传播均衡,从观测群体动力学中学习有限状态平均场博弈的参数,无需个体动作或奖励数据。
MindTailor: 通过历史帖子基于案例构建和协作精炼的个性化情感支持
机构 * Sungkyunkwan University(成均馆大学) ; New York University(纽约大学)
AI总结 提出MindTailor框架,利用求助者历史帖子构建案例,并通过基于不同咨询策略的协作批评迭代精炼回复,在Reddit数据集上优于基线,提升共情和个性化。
Comments 45 pages, 21 figures
AI中介谈判:设计反思与经验教训
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学) ; New York University(纽约大学)
AI总结 通过构建理论驱动的教练系统Trucey并进行实验,发现对话AI在谈判准备中施加线性执行模型,而任务本质是递归的,静态手册反而优于AI条件,提出“先映射后路径,先路径后模拟”的序列原则。
Journal ref CSCW Companion '26: Companion Publication of the 2026 Conference on Computer-Supported Cooperative Work and Social Computing
智能体代码比人类代码更不易维护吗?
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。
通过内化学习
机构 * New York University(纽约大学) ; Toyota Technological Institute at Chicago(丰田芝加哥技术研究所) ; University of Chicago(芝加哥大学)
AI总结 研究神经网络系统通过将显式计算过程吸收到自身权重中的内化机制,分析变换器如何内化半自动机模拟及链式思维令牌,首次证明简化单层变换器在奇偶性学习任务中成功内化的过程。
Comments first version, 43 pages
GEOPHYS: 物理合理性的几何学
机构 * Bielefeld University(比勒费尔德大学) ; University of Oxford(牛津大学) ; Cold Spring Harbor Laboratory(冷泉港实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Independent(独立作者) ; Honda Research Institute EU(本田欧洲研究院) ; New York University(纽约大学) ; Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)
AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。
缩小语义缓存中的校准差距
机构 * New York University(纽约大学) ; Redis(Redis公司)
AI总结 针对语义缓存系统中离线指标与部署性能的差距,提出P-CHR AUC和CRR指标,发现校准差距由训练目标主导,模型选择本质是校准问题。
Comments 23 pages, 2 figures. Source code: https://github.com/aditeyabaral/calibration-gap-semantic-caching ; Models and Datasets: https://huggingface.co/redis
扩展端到端驾驶的自我对弈
机构 * Mila(米拉研究所) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; Torc Robotics ; NYU Tandon School of Engineering(纽约大学坦登工程学院) ; McMaster University(麦克马斯特大学) ; Princeton University(普林斯顿大学)
AI总结 提出大规模自我对弈训练策略,通过高效模拟器Gigapixel实现像素级自我对弈,结合DAgger蒸馏和感知适应,提升端到端驾驶模型性能。
小型LLM:剪枝 vs. 从头训练
机构 * Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过六种剪枝方法在Llama-3.1-8B上比较剪枝与从头训练,发现有限预算下剪枝更优,预算充足时粗粒度剪枝可被超越。
Comments Our code is available at https://github.com/zlab-princeton/pruning-vs-scratch
电路同步先于泛化:来自Grokking Transformer中傅里叶结构的因果证据
机构 * New York University(纽约大学)
AI总结 提出频率同步度(FSD)指标,发现其在模算术任务中比grokking早500-3000步同步,且通过权重衰减控制验证了间隔期的正则化本质,提供因果证据。
Comments 19 pages, 9 figures, 11 tables. v2: corrected scaling-law to report error bars across seeds (R^2 0.89-0.99) rather than single-draw fits; added non-abelian (S5) transfer experiment; revised title