The Time Value of Evolution
进化的时间价值
机构 * New York University(纽约大学) ; University of Malta(马耳他大学)
AI总结 该研究提出LVPG框架,将进化的时间价值形式化,通过长视野信用分配加速有限预算搜索,提升了自动交易策略发现的性能。
Comments Submitted to AAAI 2026, 8 pages, 5 figures, 2 tables
高校专区
进化的时间价值
机构 * New York University(纽约大学) ; University of Malta(马耳他大学)
AI总结 该研究提出LVPG框架,将进化的时间价值形式化,通过长视野信用分配加速有限预算搜索,提升了自动交易策略发现的性能。
Comments Submitted to AAAI 2026, 8 pages, 5 figures, 2 tables
快速A/B/n测试:通过树耦合反馈共享实现精确多策略比较
机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学柯朗数学科学研究所)
AI总结 该研究提出树耦合A/B测试(TCAB)方法,通过树耦合反馈共享实现多策略精确比较,将奖励查询数从JT降至T+o(T),实验显示其在成本-精度上有显著提升。
单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题
机构 * Northeastern University(东北大学) ; New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。
Comments 41 pages, 28 figures
小规模实验:我们达到目标了吗?
机构 * FAIR at MSL Meta ; New York University(纽约大学)
AI总结 该研究指出小规模模型对超参数的敏感性是缩放定律在小规模实验中失效的关键,开发了以模型为中心的研究方法论,通过小规模实验证实Transformer中预归一化随模型规模增大效果更好,表明小规模实验可兑现缩放定律的承诺。
Comments 29 pages, 17 figures
面向分布外泛化的、受Epiplexity引导的数据选择与生成
机构 * New York University(纽约大学)
AI总结 该研究提出以Epiplexity为引导,通过数据选择与合成数据生成提升模型分布外泛化能力,实验显示更高Epiplexity可改善零样本及微调任务的下游性能。
Comments Code available for EpiSelect (https://github.com/eysu35/EpiSelect) and EpiGen (https://github.com/eysu35/EpiGen)
Dion3:全栈正交更新
机构 * Microsoft Research(微软研究院) ; New York University(纽约大学) ; Princeton University(普林斯顿大学) ; NVIDIA(英伟达) ; Yale University(耶鲁大学)
AI总结 Dion3是针对Muon优化器开销的改进版本,通过全栈优化降低了正交化、通信等开销,步长时间最多降6倍,可作为Muon的即插即用替代方案。
Comments 37 pages, 23 figures
双重应力:安全约束模型预测控制导航的运行时安全监测
机构 * American University of Beirut (AUB)(贝鲁特美国大学) ; New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校) ; New York University(纽约大学)
AI总结 本文提出基于MPC约束优化的Karush-Kuhn-Tucker乘子的双重应力信号,将其与15个几何检测器对比,发现其漏检碰撞的补充预警能力显著,结合后可提升制动可行碰撞的预警占比。
Comments 6 pages, 4 figures, 2 tables, submitted to the 13th International Conference on Automation, Robotics and Applications (ICARA 2027)
ELMER:探索与优化的进化语言模型
机构 * New York University(纽约大学) ; University of Malta(马耳他大学)
AI总结 本研究提出进化语言模型 ELMER,通过微调 Qwen3-8B 并结合 oDPO 优化,实现自然语言策略搜索与编译,提升进化搜索效率,证明语言可作为可执行程序空间的可引导搜索表示。
Comments Submitted to AAAI Conference 2026, 8 pages, 6 figures, 1 table
上下文并非权威:面向金融市场智能体的结构化运行时治理
机构 * OpenAsk ; Binance(币安) ; New York University(纽约大学) ; Xiamen University(厦门大学) ; Bank of Hebei(河北银行)
AI总结 针对金融智能体可能将正确上下文转化为未经授权影响的问题,提出SAGE-Fin金融领域权限交接合约,通过运行时控制影响保障合规,经测试和实际部署验证了其有效性。
Comments 15 pages, 1 figure, 9 tables. Qiangqiang Liu and Yichi Zhang are corresponding authors
从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力
机构 * New York University(纽约大学) ; Reflex ; Université de Montréal(蒙特利尔大学) ; Maastricht University(马斯特里赫特大学)
AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。
Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026
BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
机构 * New York University(纽约大学) ; Sensetime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; New York University Shanghai(上海纽约大学) ; University of Georgia(佐治亚大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。
Comments 33 pages, 16 figures
BioKD:通过可靠性门实现面向情感识别的选择性生理信号到视频的知识蒸馏
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; New York University(纽约大学)
AI总结 本文提出BioKD框架,以生理信号为训练特权信息指导视频学生模型,通过可靠性门控抑制负迁移,在DEAP、AMIGOS数据集上的情感识别任务中优于基线,且推理无额外开销。
贝叶斯数据重加权改进基于知识的视觉问答的多模态检索
机构 * University at Buffalo(布法罗大学) ; NEC Laboratories America(美国 NEC 实验室) ; Adobe Research(奥多比研究院) ; Iowa State University(爱荷华州立大学) ; New York University(纽约大学)
AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。
FinHardBench:大语言模型能否生成面向金融计算的延迟感知硬件?
机构 * Lehigh University(里海大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; NYU Tandon School of Engineering(纽约大学坦登工程学院) ; NYU Abu Dhabi(纽约大学阿布扎比分校)
AI总结 本文提出面向金融FPGA设计的开源基准FinHardBench,通过三类实验评估6种大语言模型,发现其在功能正确性、系统级配置优化等方面存在差异,策略级规格变更问题仍待解决。
Comments 16 pages (10 pages main text). Published as a conference paper at COLM 2026. Code and benchmark: https://github.com/owenfucell/FinHardBench
HP-JEPA:用于多分辨率图联合嵌入预测学习的层次划分方法
机构 * Stony Brook University(石溪大学) ; TikTok(TikTok(抖音海外版)) ; PayPal(PayPal(贝宝)) ; New York University(纽约大学)
AI总结 HP-JEPA是一种多分辨率图联合嵌入预测的层次划分框架,通过在不同分辨率下进行潜在预测并整合表示,在多数图分类与回归基准及不同规模图上,性能优于固定分辨率的Graph-JEPA。
Comments 15 pages, 4 figures, 5 tables
缩小英阿医学知识鸿沟:通过因果层选择实现针对性低秩适配
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; Cleveland Clinic Abu Dhabi(克利夫兰诊所阿布扎比分校)
AI总结 该研究针对阿拉伯语医学LLMs性能弱于英文的问题,提出TLoRA方法并构建阿拉伯医学对话基准,通过机制诊断实现针对性适配,提升了阿拉伯语医学任务性能。
AskChem:面向化学文献综合的以主张为中心的基础设施
机构 * New York University(纽约大学) ; Matterstack, Inc.(Matterstack公司)
AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。
用于可变基数空间点过程的存在场扩散模型
机构 * University of California, Riverside(加州大学河滨分校) ; New York University(纽约大学) ; Zhongguancun Academy(中关村学院)
AI总结 该研究针对可变基数空间点过程生成建模难题,提出存在场扩散模型(EFDM),通过关联存在变量实现空间位置与基数的联合建模,在可变基数数据集上提升了建模能力。
Comments 19 pages, 9 figures, 6 tables. Preprint
基于非梯度向量流的流图学习
机构 * Flatiron Institute(弗拉蒂隆研究所) ; Technical University of Denmark(丹麦技术大学) ; Courant Institute, New York University(纽约大学柯朗研究所)
AI总结 本文提出SGFlow方法,绕过流图学习的可逆性与迭代微分难题,在CIFAR基准上10采样步时FID最优,其他步数具竞争力且有驻点保证。
Comments ICLR 2026
最小化目标激活:大语言模型中仅输入的评估感知潜在因素抑制
机构 * Center for Data Science, New York University(纽约大学数据科学中心)
AI总结 研究大语言模型中仅通过输入优化提示来抑制“评估感知”潜在因素,采用特定方法在多种目标结构下对Llama模型进行实验,发现潜在因素可抑制,但激活可读性与行为可控性不同,还解决了相关问题。
PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Notre Dame(圣母大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。
数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; City College of New York, CUNY(纽约市立大学城市学院) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Nanyang Technological University(南洋理工大学)
AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。
Comments 19 pages
作为估计的逐出:测试时内存的固定延迟平滑视图,以及测量何时胜过累积
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; New York University(纽约大学)
AI总结 研究语言模型内存管理,将存储项保留决策转化为对项目是否被重用的估计问题,提出固定延迟平滑策略RMM。在受控设置中有优势,在第三方基准测试中表现一般,贡献了框架及测量与累积效果对比的映射。
Comments 8 pages, 3 figures, 3 tables
利用内容敏感资源分配探索预算图像分类
机构 * Tandon School of Engineering, New York University(纽约大学坦登工程学院)
AI总结 研究在动态计算环境下的预算图像分类问题,提出将其形式化为资源分配整数规划。针对原规划NP难问题,先提出连续松弛的内容无关策略,又改进为内容敏感策略,经实验验证性能更优,还从理论上研究策略并分析失败案例以指导未来研究。
贪心最长匹配分词的联合优化
机构 * Center for Data Science, New York University(纽约大学数据科学中心) ; Kensho Technologies(肯绍科技公司)
AI总结 研究针对贪心最长匹配解码,提出联合优化方法JOLT,将词汇学习设为整数规划,通过贪心一致性约束等确保训练与部署时分词对齐,求解线性规划松弛扩大优化规模,实验表明其能缩小与最优压缩差距,减少令牌数量。
Comments 18 pages, 6 figures
并非所有大语言模型的推理都能在思维链中体现
机构 * New York University(纽约大学) ; University of Maryland(马里兰大学) ; TogetherAI
AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。
CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析
机构 * New York University(纽约大学) ; McGill University(麦吉尔大学) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; MIT(麻省理工学院)
AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。
Comments Accepted to ECCV 2026
ConfidenceBench:评估大语言模型中的置信度校准
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; New York University(纽约大学)
AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。
更多并非更好:大语言模型观点多样性的关键因素是什么?
机构 * New York University(纽约大学)
AI总结 研究大语言模型观点多样性,通过析因实验分离输入条件设定和交互架构两维度,在7个模型上评估,发现更多角色细节非单调增多样性,不同架构探索不同观点区,组合架构覆盖更广,低成本措施效果差,揭示多样性受干预结构形式和组合影响。