Moore, Escher, Penrose: A Conformal Golden Braid
摩尔、埃舍尔、彭罗斯:共形黄金辫
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 基于埃舍尔《版画画廊》的共形映射,提出将去噪步骤与变换及其广义逆编织,生成自指场景,避免仅提示或事后变换的不足。
摩尔、埃舍尔、彭罗斯:共形黄金辫
机构 * Technion - Israel Institute of Technology(以色列理工学院)
AI总结 基于埃舍尔《版画画廊》的共形映射,提出将去噪步骤与变换及其广义逆编织,生成自指场景,避免仅提示或事后变换的不足。
球面编码器2
机构 * University of Maryland(马里兰大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Cornell University(康奈尔大学)
AI总结 Sphere Encoder 2通过解决潜在空间采样间隙和像素级重建损失导致的模糊问题,在保持自编码器速度与简单性的前提下,显著提升图像生成质量。
Comments Code will be available at this https URL (https://github.com/kaiyuyue/sphere2)
一个基元驱动所有:高斯混合形状蒸馏用于实时虚拟化身
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; MWS AI(MWS AI公司)
AI总结 针对3D高斯化身实时动画的神经推理瓶颈,提出GALA蒸馏方法,用线性混合近似动画,显著降低CPU成本并保持质量,支持移动端60fps。
ROWBench:视频模型是否渲染了程序所指定的内容?
机构 * Alaya Lab(Alaya实验室)
AI总结 提出PROWBench基准,含170个程序化情节和600个代理视频,通过可重放世界记录和双VLM指标评估视频模型对程序指定事件、实体控制及长时记忆的视觉遵循度。
重建、练习、实战:具身智能体的引导式自我改进
机构 * UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; Amazon FAR(亚马逊FAR) ; University of Chicago(芝加哥大学)
AI总结 提出RPG框架,通过离线数据识别技能、仿真练习与诊断改进,无需更新权重即可提升具身智能体任务成功率,从28.6%提升至95.0%,并完成30次物理试验。
Comments 17 pages, 6 figures, 10 tables
嵌入预测有助于图像生成
机构 * University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出NEPA方法,通过预测下一嵌入作为扩散变换器的条件,结合多嵌入预测与REPA,在ImageNet上以约三分之一的训练计算达到FID 1.32。
Comments Project page: this https URL (https://sihanxu.me/nepa-dit)
ScholarCatalyst:一个用于检索激发新研究论文的基准
机构 * Stanford University(斯坦福大学) ; Seoul National University(首尔国立大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Allen Institute for AI(艾伦人工智能研究所) ; MIT(麻省理工学院)
AI总结 该基准由作者标注构建,评估检索激发新研究的论文,发现智能体搜索不优于嵌入检索,需新训练方法以赋予模型专家检索直觉。
Comments 57 pages
SILSA:用于保持拓扑的高分辨率3D生成的滑动窗口切片潜变量
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 SILSA提出滑动窗口切片潜变量与切片级拓扑监督,实现单阶段高分辨率3D生成,提升结构保真度并大幅降低计算成本。
Comments Accepted at NeurIPS 2026. Project link: this https URL (https://plan-lab.github.io/silsa)
VISTA:交互世界中的视觉推理驾驭框架
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 VISTA是一种视觉驾驭框架,通过无损视觉记忆和主动检索,释放多模态模型在交互环境中的推理潜力,在ARC-AGI-3上达到满分并显著超越基线。
Comments Tech report. An early version of this manuscript was in a blogpost published in Aug 5, 2026: this https URL (https://vista-research.github.io/)
FERPO:前向熵正则化策略优化
机构 * Applied and Theoretical Aspects of Robot Intelligence (ATARI) Lab(应用与理论机器人智能实验室) ; Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所) ; Technical University of Munich(慕尼黑工业大学)
AI总结 针对评论家动作梯度不可靠的问题,提出前向熵正则化策略优化(FERPO),利用前向KL目标与自归一化重要性采样改进策略,促进探索,在MuJoCo和ManiSkill上表现优异且更新更快。
Comments Code: this https URL (https://github.com/Atarilab/FERPO)
HiPhy:面向物理合理多原理视频生成的层次对齐方法
机构 * Virginia Tech(弗吉尼亚理工大学) ; Qualcomm AI Research(高通人工智能研究院)
AI总结 HiPhy提出层次物理对齐强化学习框架,通过局部与全局双层目标解决视频生成中多物理原理协同问题,并构建50K数据集和MultiPhyBench基准,显著提升物理常识与语义对齐。
Comments Project page: this https URL (https://hiphy-video.github.io/)
InterEvolve:人形机器人移动操作奖励程序的测试时进化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 InterEvolve提出测试时进化框架,通过对象感知前向-后向模型和LLM奖励程序进化,在无需重训练下释放人形机器人控制器既有技能,解决新移动操作任务。
Comments Project page: this https URL (https://sirui-xu.github.io/InterEvolve)
分层连续扩散语言模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-尚佩恩分校) ; Amazon.com, Inc.(亚马逊公司)
AI总结 提出分层连续扩散语言模型(HC-DLM),通过将离散标记生成与连续潜在轨迹耦合于统一去噪过程,解决扩散模型并行解码中标记独立采样及状态与标记配置脱节的问题,在数独、Countdown和LM1B上超越离散与连续扩散基线。
缺失的原语:诊断与修复大语言模型中的数学推理
机构 * Texas A&M University(德克萨斯A&M大学) ; Harvard University(哈佛大学) ; Vanderbilt University(范德堡大学) ; Stanford University(斯坦福大学) ; DARPA(美国国防高级研究计划局) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出数学原语概念和\hlei{}基准,诊断LLMs数学推理的四个维度,发现“发现”是主要瓶颈,并引入原语优先的自蒸馏框架\abs{},有效提升模型数学推理能力。
Comments 27 pages
通过强化稀疏自编码器特征的内在无序蛋白区域生成建模
机构 * Stanford University(斯坦福大学)
AI总结 本文提出IDiom模型和RL-SAE方法,用于内在无序蛋白区域的可解释设计,显著提升功能特征激活率。
DMAD:分布匹配作为对抗蒸馏用于快速视觉生成
机构 * Texas A\&M University
AI总结 提出DMAD,将分布匹配蒸馏重构为对抗分类,直接学习对数密度比,无需辅助分数拟合,在图像、文本到图像和视频生成上达到领先的少步性能。
Comments 28 pages, 15 figures. Project page: this https URL (https://yzmblog.github.io/projects/DMAD)
用于化学中生成模型和基础模型的高阶分子文法
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Stanford University(斯坦福大学) ; Imperial College London(帝国理工学院) ; Yonsei University(延世大学)
AI总结 本文提出高阶文法表示(HGR),将分子解析为规则序列以高效编码高阶拓扑,并构建富环基准RingDiv,在生成和表示学习任务中均取得领先性能。
更好地解码循环Transformer(几乎免费)
机构 * Apple(苹果公司)
AI总结 本文提出LoopCD,一种无需训练的对比解码框架,利用循环Transformer的中间状态作为引导信号,在减少推理计算的同时提升解码质量,并支持循环次数减半。
Comments 32 pages, 19 figures
SoftServe:一种用于深度学习的高可扩展拟牛顿方法
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Flatiron Institute(熨斗研究所) ; Cornell University(康奈尔大学)
AI总结 SoftServe提出一族无需线搜索的拟牛顿方法,通过正定曲率估计和Newton-Schulz迭代实现大规模深度学习优化,在病态任务上优于Adam等基线。
OmniSeek:面向多轮音视频推理的原生工具集成
机构 * Adobe Research(Adobe研究院) ; University of California Davis(加州大学戴维斯分校)
AI总结 OmniSeek将全模态大模型转变为主动多轮推理智能体,通过动态决定查看或聆听的时间窗口来检索关键证据,并利用合成轨迹与两阶段强化学习优化,显著提升跨模态音视频推理性能。
生成式电影摄影师:在3D中编排相机与物体运动
机构 * Johns Hopkins University(约翰霍普金斯大学)
AI总结 针对现有视频生成中2D控制歧义问题,提出GenCine系统,将单图提升为3D场景脚手架,通过局部3D手柄联合编排相机与前景运动,并投影为引导图控制预训练模型,实现相机相对运动一致与强可控性。
从梯度到能力:理解多教师同策略蒸馏
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-尚佩恩分校) ; Princeton University(普林斯顿大学) ; Westlake University(西湖大学)
AI总结 本研究通过分析Qwen3-1.7B多教师同策略蒸馏中的梯度、优化器更新和精度影响,揭示了损失平均、Adam一阶矩、BF16舍入及KL梯度截断对参数更新和任务性能的作用。
有效电阻与组织特异性相互作用组中的图神经网络可靠性
机构 * University of Montana(蒙大拿大学)
AI总结 本研究利用有效电阻作为信号,在24个组织特异性相互作用组中探究其与图神经网络节点损失的关系,发现残差信号可解释额外损失,且效应随深度增强。
Comments Accepted at IEEE BIBM (Doctoral Forum)
每一次消融都是一次剂量:配重与自我修复的表象
机构 * Lexsi Labs(Lexsi 实验室)
AI总结 本研究提出消融可视为剂量,揭示语言模型自我修复实为配重效应,通过仿射定律预测修复响应,并在多个模型上验证。
观察、推断、协调:推断机器人伙伴约束以实现零样本协调
机构 * Honda Research Institute USA(本田美国研究院) ; Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 本文提出观察、推断、协调方法,通过观察联合行为推断机器人伙伴的物理约束,显著提升零样本协调性能,接近真实约束预言机。
AutoCompact:在长时程编码智能体中学习何时压缩上下文
机构 * Singapore Management University(新加坡管理大学) ; Nanyang Technological University(南洋理工大学) ; Harvard University(哈佛大学)
AI总结 AutoCompact通过策略学习压缩决策,利用修正轨迹训练并强化学习优化,在SWE基准上显著提升编码智能体通过率。
世界观察者:用于持久世界建模的联合演员-观察者生成
机构 * KAIST AI(韩国科学技术院人工智能)
AI总结 本文提出世界观察者,通过联合生成演员与全景观察者解耦观察与行动,实现持久世界建模,显著提升视野外动态,同时保持视觉保真度与3D一致性。
DuoMind:通过语义通信实现分布式多机器人协调
机构 * University of California, Davis(加州大学戴维斯分校) ; Microsoft Research(微软研究院) ; Analog Devices(亚德诺半导体)
AI总结 提出DuoMind分布式分层框架,通过VLM编排器与VLA动作模型结合语义通信实现多机器人长期任务协调,并构建RoboPoly基准验证性能提升。
4Director:利用刚性三维几何控制视频世界模型
机构 * Stability AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 4Director通过显式四维场景表示和运动适配器,实现对视频中相机与物体运动的精确控制,并在新数据集上验证了其优越性。
Comments 28 pages, 15 figures. Project page: this https URL (https://stability-ai.github.io/4director/)
内在奖励何时导致探索?
机构 * Stanford University(斯坦福大学)
AI总结 本文提出反事实信息作为探索标准,证明现有内在奖励在简单环境中获取反事实信息时是帕累托次优的,并给出成功条件及改进目标。
Comments 45 pages, 4 figures; includes mathematical appendices. Code, data, and Lean proof sources: this https URL (https://github.com/scottviteri/what-is-exploration)