World Models' Last Exam in Physics
世界模型物理终极考试
机构 * Navers Lab, Einsia.AI(Navers实验室,Einsia.AI) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 针对视频世界模型物理不一致问题,提出基于测量的基准,含40个任务覆盖多物理领域,评估8个模型,最佳得分57.76,为诊断与进展提供可解释依据。
世界模型物理终极考试
机构 * Navers Lab, Einsia.AI(Navers实验室,Einsia.AI) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 针对视频世界模型物理不一致问题,提出基于测量的基准,含40个任务覆盖多物理领域,评估8个模型,最佳得分57.76,为诊断与进展提供可解释依据。
QF3:基于滤波Q梯度的快速流强化学习
机构 * UC Berkeley(加州大学伯克利分校) ; Amazon FAR(亚马逊FAR)
AI总结 QF3是一种离策略流强化学习算法,通过滤波Q梯度训练流策略,实现从零训练人形运动策略并零样本迁移到硬件,速度比FPO++快10倍,且能微调预训练操作策略。
Comments Project page: https://qf3-rl.github.io/
共形预测集量化信息增益:一个理论视角
机构 * MIT(麻省理工学院)
AI总结 本文从理论角度证明共形预测集大小减少可作为信息增益度量,引入广义信息度量族,并在11个分类设置中验证其与香农互信息的联系及差异。
PEARS:基于物理先验引导的高效适配,通过失败推理与扩散引导实现触觉操作
机构 * The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xense Robotics ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 PEARS提出物理先验引导的混合强化学习框架,通过失败推理与扩散引导,在触觉操作中实现样本高效在线适配,显著提升成功率并减少交互次数。
Comments 9 pages, 4 figures. Project website: https://song-kun.github.io/pears
4D-HOF:用于前馈4D交互重建的手-物体流匹配
机构 * NVIDIA(英伟达) ; Texas A&M University(德克萨斯A&M大学)
AI总结 4D-HOF提出一种前馈流匹配框架,利用视觉基础模型的粗略估计重建4D手-物体交互,通过条件流匹配和测试时引导实现稳定准确的生成式重建。
Comments Project page: https://tamu-visual-ai.github.io/4D-HOF/
IdeaAnchor:教大语言模型将文献转化为研究思路
机构 * Yale University(耶鲁大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tata Consultancy Services(塔塔咨询服务公司)
AI总结 IdeaAnchor通过结构化规范作为监督信号,训练大语言模型从文献中生成研究思路,结合锚点训练与检索增强,显著提升思路质量。
DepthWorld:用于机器人操作的3D世界模型
机构 * Czech Technical University in Prague(捷克理工大学)
AI总结 本文提出DepthWorld,一种基于稳定视频扩散的3D世界模型,通过校准的DROID-3D数据集和联合深度-RGB预测,实现机器人操作的精确几何建模与策略评估。
Comments Accepted at the Conference on Robot Learning (CoRL) 2026. Project page: https://www.jaibardhan.com/depthworld. 32 pages including supplementary material, 15 figures, 7 tables
ALIVE:面向首帧引导视频编辑的交互对齐物体插入
机构 * University of Rochester(罗切斯特大学) ; Adobe Research(Adobe 研究院)
AI总结 ALIVE通过首帧编辑和指令,使插入物体与源视频内容产生连贯交互,并训练VLM预测引导,显著提升交互保真度。
Comments Project page: https://real-time-video-research.github.io/alive/
Sherpa:教大语言模型自适应教学
机构 * Stanford University(斯坦福大学) ; Georgia Tech(佐治亚理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出多轮强化学习框架Sherpa,通过模拟多样学生原型并直接最大化学习成果,训练LLM教师自适应教学,平均提升学生表现20.5个百分点,教学得分从52.5%升至79.2%。
Comments 32 pages, 6 figures. Code and model are available at https://github.com/SALT-NLP/Sherpa
CtrlCache:利用控制感知缓存加速交互式视频世界模型
机构 * University of Auckland(奥克兰大学) ; UNSW Sydney(新南威尔士大学)
AI总结 提出CtrlCache,一种免训练的控制感知缓存框架,利用控制序列调度计算,在交互式视频世界模型中实现1.21-1.41倍加速并提升生成质量。
Comments 18 pages. Project page: https://wrecklong.github.io/CtrlCache/
瓶中智能体:LLM智能体能否将其能力转化为廉价、可扩展的工件?
机构 * University of Tübingen(蒂宾根大学) ; ELLIS Institute Tübingen(ELLIS研究所蒂宾根) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tübingen AI Center(蒂宾根人工智能中心) ; École Polytechnique(巴黎综合理工学院) ; Institut Polytechnique de Paris(巴黎综合理工学院) ; CNRS(法国国家科学研究中心) ; KAIST AI(韩国科学技术院人工智能研究所)
AI总结 本研究提出BOTTLED基准,检验LLM智能体能否将通用能力转化为廉价可扩展的特定任务解决方案,发现零样本性能不等于装瓶能力,但装瓶可大幅降低成本并保持较高性能。
AdvSim2Real:在网络世界模型中针对自适应提示注入训练网络智能体
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Amazon(亚马逊) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 AdvSim2Real通过共同演化任务课程、注入对手和智能体,在冻结网络世界模型中训练,使4B智能体在未见攻击下完成率提升33.6%,并增强鲁棒性与真实浏览器迁移能力。
Comments Code at https://github.com/Sarim-MBZUAI/advsim2real
后端无关的稀疏注意力用于快速高分辨率视觉生成
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; School of Data Science, Fudan University(复旦大学数据科学学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算及数据科学学院)
AI总结 针对扩散变换器高分辨率生成中全注意力计算昂贵的问题,提出后端无关的稀疏注意力 BASA,通过跨块窗口移位实现全局交互,无需定制内核,在 FLUX 和 Wan 上实现接近理论值的加速并保持生成质量。
基于Patch的高光谱图像分类中的数据泄漏:量化空间重叠的影响
机构 * University of Dubai(迪拜大学)
AI总结 本文量化了基于Patch的高光谱图像分类中随机采样导致的空间重叠数据泄漏,提出OP和AOR度量,实验表明3D-CNN在随机采样下OA达96.17%,非随机下降至55.20%,证明随机评估会显著高估性能。
Comments paper accepted for presentation at IEEE-WHISPERS
LBA-CBF:通过并行动力学推理实现快速自适应安全滤波器
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Constructor University(康斯特大学) ; King Fahd University of Petroleum and Minerals(法赫德国王石油与矿业大学)
AI总结 针对动力学突变导致CBF失效的问题,提出LBA-CBF,通过并行推理候选模型并自适应滤波,在仿真和实验中实现安全且高成功率的目标到达。
Comments 8 pages
VeriFine:具身推理中自我改进的验证扩展
机构 * NVIDIA(英伟达) ; UCLA(加州大学洛杉矶分校) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 VeriFine通过策略、课程与评判者共同进化扩展验证,在具身推理中实现持续自我改进,实验证明驾驶和导航任务中策略与评判能力均持续提升。
Comments Project Website: https://veri-fine.github.io/
WorldSonus:为世界赋予声音
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Noiz AI ; MetaX ; Shanghai Jiao Tong University(上海交通大学)
AI总结 WorldSonus提出交互式视频到音频框架,通过流式因果自回归扩散架构实现低RTF实时生成,支持交互控制与空间对齐,在开放域基准上达到或超越最先进模型。
Comments 25 pages, 4 figures, 16 tables. Project page: https://noizai.github.io/WorldSonus/
3D高斯溅射的后训练语义提升:分离检测器、提升与表示误差
机构 * University of Málaga(马拉加大学)
AI总结 提出一种后训练语义提升方法,通过多视角证据加权累积和双阈值过滤,分离检测器、提升与表示误差,在ScanNet++上显著提升mIoU。
Comments 18 pages, 11 figures, 9 tables. Code: https://github.com/ivanver02/semantic-lifting-3dgs
缺失的最小对:大语言模型中的刻板印象评估
机构 * University of Edinburgh(爱丁堡大学) ; University of Amsterdam(阿姆斯特丹大学)
AI总结 针对大语言模型刻板印象评估中单对比较不可靠的问题,提出双最小对设置及数据增强框架,并引入基于互信息的评估指标,实现跨语言和模型的稳健比较。
带共形动作集的强化学习:在序列推荐中的应用
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Washington State University(华盛顿州立大学)
AI总结 针对序列推荐中固定候选集大小的问题,提出带校准剪枝的强化学习(RLCP),通过评论家分数和在线阈值自适应调整动作集,在19种配置中至少一种变体实现最高目录多样性,达最强基线的1.11至5.21倍。
关于鲁棒多臂老虎机计算可处理性的研究
机构 * Technion(以色列理工学院) ; CORAL(计算理性智能体实验室)
AI总结 本文研究鲁棒多臂老虎机问题的计算可处理性,发现一个特例存在多项式时间且遗憾为Õ(√T)的学习器,而其若干推广为NP难,为AI对齐提供计算高效学习器迈出一步。
去噪层次化表示:用于语言建模的联合连续扩散
机构 * Ecole Polytechnique(巴黎综合理工学院) ; Archimedes, Athena RC(Archimedes,雅典研究与创新中心) ; University of Crete(克里特大学) ; IACM-Forth(希腊研究与技术基金会计算医学研究所)
AI总结 提出层次化连续扩散语言模型(H-CDLMs),通过并行扩散多粒度令牌表示,以极小开销提升连续扩散语言模型性能,在多个基准上超越基线及同等规模离散模型。
Comments 27 pages, 10 figures
PhoneBot:一种重用智能手机的低成本开源人形机器人平台
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 PhoneBot利用智能手机作为感知和计算核心,结合13个低成本执行器,构建了低成本开源人形机器人平台,实现稳定行走、视觉跟随和交互,适用于教育和研究。
最优且高效的在线逆向优化
机构 * Google Research(谷歌研究院) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出一种确定性多项式时间算法,在在线逆向线性优化中达到最优遗憾 $O(\sqrt d)$,通过变度量更新撤销机制解决了Sakaue提出的开放问题。
面向社交机器人语音对话的可扩展基准测试
机构 * Boise State University(博伊西州立大学) ; Semio(Semio公司) ; Peerbots(Peerbots公司) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 该研究提出一个可扩展的社交机器人语音对话基准,涵盖澄清、打断、具身信号和时间约束,并采用实时通信框架Retico以支持人机语音交互。
Comments Accepted to and presented at the IROS 2026 Workshop on Human-Robot Dialogue
EgoLAP:通过语言-动作推理从自我中心人类数据中学习
机构 * Princeton University(普林斯顿大学) ; Toyota Research Institute(丰田研究所) ; Physical Intelligence
AI总结 EgoLAP提出一种VLA预训练框架,通过语言动作思维链联合学习人类与机器人轨迹,利用运动意图跨具身迁移,在真实世界任务中达80.1%进展,性能提升2.3倍。
Comments Project website: https://ego-lap.github.io/
代理的历史能否预示压缩何时会带来损害?TRACE配对重放语料库上的一个适度、有界效应
机构 * Salesforce AI Research(赛富时人工智能研究院)
AI总结 本研究探究代理历史能否预测上下文压缩的损害,发现预测能力弱,最佳触发器避免21%有害边界并保留84%压缩机会,但需更多语料库验证。
Comments Accepted at the IAB Workshop (Interpreting Agent Behavior) at NeurIPS 2026 (non-archival). 20 pages
WorldSolver:LLM智能体能否通过求解器生成来模拟物理动力学?
机构 * NLPR & MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室与多模态人工智能系统全国重点实验室) ; PKU(北京大学)
AI总结 WorldSolver提出一个包含168个物理模拟任务的基准,评估LLM智能体生成求解器的能力,发现现有前沿智能体在视觉和物理正确性上表现不佳,最高得分仅48.7%。
当遗忘并非灾难性:关于虚假遗忘的机制
机构 * MPI for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所(蒂宾根)) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; EuroSafeAI ; Hector Foundation(赫克托基金会) ; Stanford University(斯坦福大学) ; ELLIS Institute Tübingen(ELLIS研究所(蒂宾根))
AI总结 研究微调中语言模型的虚假遗忘机制,发现遗忘包含可逆的共享访问丧失与不可逆的个体事实侵蚀,后者才是灾难性的,其主导性取决于新数据对旧记忆的移动方式。
路径与流的协同演化:通过路径-流对齐
机构 * Duke University(杜克大学)
AI总结 提出路径-流对齐统一训练目标,联合训练端点保持路径网络与流网络,识别路径过拟合失效模式并引入随机路径正则化器抑制低熵瓶颈,在ImageNet-256x256上持续改善FID。