Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning
多重性是多模态学习中不可避免且固有的挑战
机构 * Princeton University(普林斯顿大学)
AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。
Comments ICML 2026 Position Track
高校专区
多重性是多模态学习中不可避免且固有的挑战
机构 * Princeton University(普林斯顿大学)
AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。
Comments ICML 2026 Position Track
CoMet:多模态不确定性估计的上下文与多样性分解
机构 * Princeton University(普林斯顿大学)
AI总结 提出CoMet方法,将多模态大模型的不确定性分解为上下文项和多样性项,通过轻量级后验模块高效估计,无需自回归生成或重复采样,在多个基准上优于现有方法。
Comments 33 pages, 13.3MB
过去即序幕:面向顺序演化的大语言模型记忆的选择性更新插件控制器
机构 * University of Virginia(弗吉尼亚大学) ; Princeton University(普林斯顿大学) ; University of Central Florida(中佛罗里达大学)
AI总结 提出Janus插件控制器,通过记忆动量触发器检测异常并基于紧凑混合评估集决定是否接受记忆更新,避免有害覆盖,在六个数据集上提升准确率2.7-4.6点。
什么驱动了来自反馈的交互式改进?
机构 * University of Warsaw(华沙大学) ; AKCES NCBR ; Princeton University(普林斯顿大学) ; Mistral AI ; Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)
AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。
Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026
WAFT-Stereo:仅变形场变换的立体匹配方法
机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
AI总结 WAFT-Stereo通过仅使用变形场替代传统代价体,实现了高效的立体匹配,在多个数据集上取得最佳性能,速度提升显著。
同质深度网络中持续学习的收敛性
机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(塔夫茨大学Blavatnik计算机科学与人工智能学院) ; Princeton University(普林斯顿大学) ; Department of Electrical and Computing Engineering, Technion(技术学院电子与计算工程系)
AI总结 将弱正则化持续分类建模为任务间隔集上的顺序投影,证明全局收敛一般失败,但利用非凸投影理论识别同质深度网络的局部线性收敛条件,并扩展至持续回归。
现代BERT模型的法律领域自适应
机构 * Princeton University(普林斯顿大学) ; Princeton, New Jersey, USA(新泽西州普林斯顿, 美国)
AI总结 研究现代BERT模型在法律领域的领域自适应,通过在美国法院意见上进一步预训练ModernBERT,显著提升其性能,并支持长序列处理。
Comments To appear in Proceedings of the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), June 9-12, 2026, Singapore
无监督的景深估计
机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
AI总结 本文提出ZEDD基准和FOSSA网络,通过堆栈注意力层和焦点距离嵌入实现无监督景深估计,利用现有RGBD数据生成合成焦点堆栈,实验显示误差降低55.7%。
Comments Accepted to ECCV 2026. Added additional results and clarifications
SWE-fficiency:语言模型能否在真实工作负载上优化现实世界仓库?
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; Google(谷歌)
AI总结 本文提出SWE-fficiency基准,评估语言模型在真实工作负载上优化软件仓库性能的能力,发现现有模型在定位优化机会和保持正确性方面表现不佳。
Comments Appearing at ICML 2026. Data, code, and leaderboard are available at https://swefficiency.com/
通过拉普拉斯特征向量梯度正交化实现鲁棒切触空间估计
机构 * Program in Applied and Computational Mathematics, Princeton University(普林斯顿大学应用与计算数学项目) ; Department of Mathematics, UC San Diego(加州大学圣地亚哥分校数学系) ; Halicioğlu Data Science Institute, UC San Diego(加州大学圣地亚哥分校Halicioğlu数据科学研究所) ; Department of Mathematics and Halicioğlu Data Science Institute, UC San Diego(加州大学圣地亚哥分校数学系与Halicioğlu数据科学研究所)
AI总结 本文提出LEGO方法,利用数据全局结构指导局部切触空间估计,通过正交化图拉普拉斯算子低频特征向量梯度,提升噪声下的鲁棒性,改进流形学习等下游任务。
二阶方法在序列预处理中的威力
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
AI总结 本文提出利用Vovk-Azoury-Warmuth算法与USP结合,实现对边际稳定线性动力系统中序列预处理的强效结果,达到对数级别的 regret。
Comments 19 pages, 3 figures
语言模型中事实的持续记忆
机构 * Princeton Language and Intelligence (PLI), Princeton University(普林斯顿大学普林斯顿语言与智能研究所)
AI总结 提出持续记忆任务,发现语言模型在后续微调中严重遗忘事实,并提出REMIX方法(混合随机词序列或预训练语料)缓解遗忘,优于回放等方法。
Journal ref Transactions on Machine Learning Research, 2026
谜语谜题:测试大型语言模型和人类的灵活推理
机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
AI总结 通过谜语谜题范式,发现LLM在真实谜语上准确率高(84.9%),但在谜语谜题上表现差(50.7%),而人类相反;错误分析表明LLM更倾向于过度使用创造性推理。
基准测试饱和之后:CORE-Bench 案例研究
机构 * Independent(独立机构) ; Princeton University(普林斯顿大学) ; UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院)
AI总结 针对基准测试准确率饱和问题,提出从构造效度、泛化性、效率、可靠性、模型与脚手架相对重要性及人机协作提升六个维度评估智能体,以CORE-Bench Hard为案例展示饱和后仍可获得有意义见解。
平均场 PhiBE:基于离散时间数据的连续时间平均场强化学习
机构 * Department of Mathematics, University of Michigan, Ann Arbor, MI, USA(密歇根大学数学系,安阿伯,密歇根州,美国) ; Department of Statistics and Data Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校统计与数据科学系,加利福尼亚州,美国) ; Program in Applied and Computational Mathematics, Princeton University, Princeton, NJ, USA(普林斯顿大学应用与计算数学项目,普林斯顿,新泽西州,美国)
AI总结 针对仅离散时间数据可用但种群连续演化的模型无关连续时间平均场控制问题,提出平均场PhiBE方法,将离散时间信息融入Wasserstein空间上的连续时间PDE,并推导策略梯度定理,实现模型无关的演员-评论家算法,证明一阶一致性估计。
泛化谱:一种评估学习算法的色谱方法
机构 * ByteDance Seed(字节跳动Seed) ; Hong Kong University of Science and Technology(香港科技大学) ; Princeton University(普林斯顿大学) ; University of Oxford(牛津大学)
AI总结 提出泛化谱框架,通过构建从精确回忆到跨语言实现转移等不同转移距离的测试变体,揭示算法从单个样本泛化到其他样本的程度,并应用于竞争编程任务评估不同学习范式。
Comments Accepted at ICML 2026. 30 pages, 6 figures
RAVEN: 基于视觉-空间-时间记忆的长期推理与导航
机构 * Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出RAVEN记忆系统,通过存储视觉嵌入与位姿时间信息,实现长期机器人问答与导航,在多个基准上超越字幕记忆系统,以10倍更低检索成本匹配前沿VLM。
Comments Project website: https://ravenmem.github.io/
通用推理的可迁移性:多领域RLVR的自动课程
机构 * Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Princeton University(普林斯顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; ELLIS Institute Tübingen(ELLIS研究所图宾根) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; EuroSafeAI
AI总结 提出迁移感知课程(TAC),利用优势信号和投影梯度估计跨领域可迁移性,在多领域推理套件上实现最佳平均准确率。
Comments 32 pages, including supplementary material; code available at https://github.com/YangYongJin/transfer-aware-curriculum
AI辅助模拟法庭:模拟特定司法机关的口头辩论提问
机构 * Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学)
AI总结 本文研究AI能否有效模拟特定司法机关的提问以辅助模拟法庭训练,提出双层评估框架,发现模拟问题被人类标注者认为真实且能识别法律问题,但存在提问类型单一和奉承等问题。
Comments Accepted at CS & Law 2026
Journal ref CSLAW '26: Symposium on Computer Science and Law, March 3-5, 2026, Berkeley, CA, USA, ACM, pp. 136-172
基于对比目标推理的零样本模仿一致性方法
机构 * Department of Computer Science, Princeton University, Princeton, NJ, USA(普林斯顿大学计算机科学系)
AI总结 提出对比逆强化学习(CIRL),通过将多任务逆RL转化为目标推理问题,利用对比RL、自动目标提议和变分推断实现零样本模仿,理论证明其能一致恢复演示者意图,实验优于现有方法。
InSight: 通过可引导的VLA实现自主技能获取
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。
Comments Project website: https://insight-vla.github.io
连接语言与行动:语言引导的机器人操作综述
机构 * Technical University of Munich(慕尼黑技术大学) ; Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) ; University of California Berkeley(加州大学伯克利分校) ; Microsoft(微软) ; Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学) ; Imperial College London(伦敦帝国理工学院) ; Princeton University(普林斯顿大学) ; University of Southern California(南加州大学) ; Sun Yat-sen University(中山大学) ; University of Michigan(密歇根大学) ; Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) ; The State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
AI总结 本文综述了语言引导的机器人操作领域,探讨了语言如何与机器人系统整合,分析了现有方法的分类及最新进展,指出关键争议和未来研究方向。
迈向自主O-RAN:一种用于实时网络控制与管理的多尺度智能体AI框架
机构 * IDLab, Department of Information Technology at Ghent University - imec(IDLab,格鲁特大学信息科技系 - imec) ; Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)
AI总结 提出一种多尺度智能体AI框架,通过非实时、近实时和实时控制环的协调层次结构,实现O-RAN的自主网络控制与管理,并在非平稳条件下和意图驱动的切片资源控制场景中验证了其有效性。
Comments Accepted for publication in the IEEE Network magazine
CORE-Bench:通过计算可重复性智能体基准提升已发表研究的可信度
机构 * Princeton University(普林斯顿大学)
AI总结 提出CORE-Bench基准,包含270个基于90篇论文的任务,评估AI智能体在计算可重复性上的准确性,最佳智能体在最难任务上准确率仅21%,表明自动化科学任务仍有巨大提升空间。
Comments Benchmark harness and code available at http://github.com/siegelz/core-bench
Foresight: 基于动作条件世界模型潜在变量的长时程机器人操作故障检测
机构 * University of Michigan(密歇根大学) ; Princeton University(普林斯顿大学) ; University of Virginia(弗吉尼亚大学)
AI总结 提出Foresight框架,利用动作条件世界模型的潜在表征监测操作轨迹,仅用最终任务级标签训练,结合函数共形预测自适应校准阈值,在仿真和真实机器人长时程任务中实现高效故障检测。
RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯
机构 * Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。
OVIG: 通过梯度信号乐观验证AI训练完整性
机构 * Princeton University(普林斯顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 提出OVIG框架,利用异构重放校准的梯度差异经验边界,通过乐观采样和步长参数审计外包训练完整性,在多种攻击下保持0%攻击成功率,存储和传输开销降低1996倍。
Comments 18 pages, 7 figures, 11 tables. Submitted to IEEE Symposium on Security and Privacy (S&P)
作为发现引擎的AI科学家:在改革机构内发展的案例
机构 * Institute of Cosmos Sciences (ICCUB), University of Barcelona(巴塞罗那大学宇宙科学研究所) ; ICREA ; Cavendish Astrophysics, University of Cambridge(剑桥大学卡文迪什天体物理学) ; Kavli Institute for Cosmology, University of Cambridge(剑桥大学卡维里宇宙学研究所) ; Center for Computational Astrophysics, Flatiron Institute(弗拉蒂隆研究所计算天体物理中心) ; Department of Astrophysical Sciences, Princeton University(普林斯顿大学天体物理科学系) ; Avature ; Department of Physics and Astronomy, Johns Hopkins University(约翰霍普金斯大学物理与天文学系) ; Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) ; Flatiron Institute(弗拉蒂隆研究所) ; Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心) ; Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) ; School of Clinical Medicine, University of Cambridge(剑桥大学临床医学院)
AI总结 本文论证多智能体AI系统将从被动工具进化为“AI科学家”,通过原型框架Denario加速发现周期,并提出机构需为验证、问责、可解释性和双重用途安全进行改革。
扩展端到端驾驶的自我对弈
机构 * Mila(米拉研究所) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; Torc Robotics ; NYU Tandon School of Engineering(纽约大学坦登工程学院) ; McMaster University(麦克马斯特大学) ; Princeton University(普林斯顿大学)
AI总结 提出大规模自我对弈训练策略,通过高效模拟器Gigapixel实现像素级自我对弈,结合DAgger蒸馏和感知适应,提升端到端驾驶模型性能。
无中生有:语言模型能否发现0?
机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
AI总结 研究语言模型能否独立发现“零”的概念,通过算术任务测试,发现GPT-2规模模型无法在测试时泛化,但少量示例训练后显著提升,且语言预训练减少所需示例约50%。