Linear Scaling Video VLMs for Long Video Understanding
面向长视频理解的线性缩放视频视觉语言模型
机构 * Stanford University(斯坦福大学)
AI总结 提出StateKV方法,通过固定容量的重要性驱动循环状态实现线性时间视频预填充,在保持接近全自注意力性能的同时显著降低计算成本。
高校专区
面向长视频理解的线性缩放视频视觉语言模型
机构 * Stanford University(斯坦福大学)
AI总结 提出StateKV方法,通过固定容量的重要性驱动循环状态实现线性时间视频预填充,在保持接近全自注意力性能的同时显著降低计算成本。
关于稀疏自编码器中激活异常值与特征死亡之间关系的研究
机构 * Stanford University(斯坦福大学) ; Columbia University(哥伦比亚大学)
AI总结 本文通过理论分析和实验验证,揭示了稀疏自编码器中维度级激活异常值导致特征死亡的机制,并提出均值中心化预处理方法有效消除该问题。
Comments Accepted to ICML 2026 main conference
抓取中的两自由度振动运输
机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
AI总结 利用非对称振动实现抓取零件的两自由度(DoF)手内操作,通过闭环位置控制产生周期性粘滑波形,分析波形参数对平均速度的影响,并用实验验证。
MAVEN:提升智能体工具调用的泛化能力
机构 * CoreThink AI, USA(CoreThink AI, 美国) ; Stanford University, Stanford, CA, USA(斯坦福大学, 加州斯坦福, 美国)
AI总结 提出MAVEN框架,通过轻量级符号推理脚手架实现结构化分解、自适应工具编排和中间验证,在多个基准测试中显著提升模型性能,且成本仅为前沿专有模型的约1/10。
分数广播与去相关:基于广播的信用分配通用框架
机构 * KUIS AI Center, Koc University, Turkey(科克大学KUIS人工智能中心,土耳其) ; Electrical and Electronics Engineering, Koc University, Turkey(科克大学电子与电气工程系,土耳其) ; Department of Electrical Engineering, Stanford University, USA(斯坦福大学电气工程系,美国) ; John A. Paulson School of Engineering & Applied Sciences, Harvard University, USA(哈佛大学约翰·A·保罗森工程与应用科学学院,美国) ; Kempner Institute, Harvard University, USA(哈佛大学凯姆纳研究所,美国) ; Center for Brain Science, Harvard University, USA(哈佛大学脑科学中心,美国)
AI总结 提出分数广播与去相关(SBD)框架,通过输出分数与隐藏层激活的正交性原理,统一了多种可微损失函数下的广播式信用分配,并理论支撑了三因子学习规则。
EHRBench: 基于电子健康记录的自动化可靠临床决策基准测试,用于大语言模型
机构 * Emory University(埃默里大学) ; Stanford University(斯坦福大学)
AI总结 提出EHRBench,通过EHR-LLM-KB交互流水线自动构建近百万问答对,涵盖诊断、治疗和预后三大临床决策任务,系统评估30余种LLM的性能与鲁棒性。
Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Datasets and Benchmarks Track, Oral
SubsurfaceGen: 野外尺度地球模型与地震数据的程序化生成
机构 * Stanford University(斯坦福大学)
AI总结 提出SubsurfaceGen,一个GPU加速的3D速度模型与地震数据生成器,并发布包含4276个2D速度切片、5秒波场和8秒炮集记录的数据集,用于评估机器学习在全波形反演中的表现。
Comments 38 pages
MAAT: 多阶段适配器感知的定向遗忘学习
机构 * Indian Institute of Information Technology, Bhopal, India(印度比哈尔理工学院) ; University of California, Santa Cruz, USA(加州大学圣克鲁兹分校) ; Independent Researcher(独立研究者) ; Stanford University, USA(斯坦福大学) ; BITS Pilani Goa, India(比斯拉米印度学院)
AI总结 针对现有机器遗忘评估中因果知识(Why类)样本极少导致评估失衡的问题,提出5WBENCH平衡基准和MAAT多阶段框架,首次在Why类知识上同时实现高遗忘与高保留。
Comments 16 pages, 4 figures, 10 tables
奖励偏差替代:单轴偏差缓解措施重定向优化压力
机构 * Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。
Comments Improved readability (mostly appendix D)
蒸馏博弈:自适应攻击与高效防御
机构 * Stanford University(斯坦福大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; National University of Singapore(新加坡国立大学)
AI总结 通过最小化博弈框架研究蒸馏攻击中模型提供者的部署权衡,提出自适应评估规则和产品专家(PoE)防御方法,实验表明自适应学生能恢复更多能力,且PoE在成本和质量上具有优势。
学习的中继表示用于前向思考的离散扩散模型
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Toronto(多伦多大学) ; Stanford University(斯坦福大学) ; Imperial College London(伦敦帝国学院) ; Mila ; Vijil
AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。
Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: https://github.com/jacopo-minniti/relay
面向延迟优化的Web Agent规划与调度的Agent即时编译
机构 * Stanford University(斯坦福大学)
AI总结 提出Agent即时编译系统,通过JIT-Planner生成代码计划、JIT-Scheduler探索并行化策略及不变式工具协议,显著降低延迟并提高准确性。
Comments Accepted at ICML 2026
World Action Verifier: 通过前向-反向不对称性自我改进世界模型
机构 * Stanford University(斯坦福大学) ; UC San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Google DeepMind(谷歌DeepMind) ; Harvard University(哈佛大学)
AI总结 提出World Action Verifier (WAV)框架,利用状态合理性和动作可达性的独立验证以及前向-反向不对称性,通过视频语料库的多样子目标生成器和稀疏逆模型实现循环一致性,从而在欠探索区域自我改进世界模型,在多个任务中样本效率提升2倍且下游策略性能提升22%以上。
Comments Project Website: https://world-action-verifier.github.io
DEBATE:用于评估角色扮演LLM代理中观点动态的大规模基准
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Google DeepMind(谷歌DeepMind) ; Stanford University(斯坦福大学)
AI总结 提出DEBATE基准,通过多轮公共消息和Likert量表信念数据,评估多代理角色扮演LLM模拟中观点动态的真实性,发现零样本设置下代理组过度收敛,而监督微调可改善立场对齐并减少组级收敛误差。
SAW-Bench:在现实世界中学习情境感知
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Yale University(耶鲁大学) ; Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学学院市分校) ; Amazon(亚马逊) ; University of California, Merced(加州大学默塞德分校)
AI总结 提出SAW-Bench基准,通过自录视频和问答对评估多模态基础模型的以观察者为中心的情境感知能力,揭示人类与模型间的显著性能差距。
自适应物理Transformer融合全局-局部注意力用于地下能源系统
机构 * Department of Energy Science and Engineering, Stanford University(斯坦福大学能源科学与工程系) ; Department of Earth Sciences and Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; EarthFlow AI, Inc.(EarthFlow AI公司)
AI总结 提出自适应物理Transformer(APT),通过融合图编码器和全局注意力机制,高效处理地下能源系统中的异构网格和物理耦合问题,在规则与不规则网格上均优于现有架构,并首次直接从高分辨率自适应网格细化模拟中学习。
利用语言模型从时间序列中推断事件
机构 * University of Virginia(弗吉尼亚大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 研究大型语言模型能否从时间序列数据中推断自然语言事件,提出自动化任务生成方法和新基准,并通过蒸馏与强化学习提升小模型性能。
Comments 21 pages, 15 Figures