Programmable World Model
可编程世界模型
机构 * Alaya Lab(Alaya实验室)
AI总结 提出可编程世界模型,将状态演化与视觉生成解耦,通过程序控制实体状态,在CombatStateBench上实现94%计数和98%状态准确率,支持持久可编程世界。
Comments Homepage: https://alaya-lab.github.io/pwm GitHub: https://github.com/AlayaLab/pwm
可编程世界模型
机构 * Alaya Lab(Alaya实验室)
AI总结 提出可编程世界模型,将状态演化与视觉生成解耦,通过程序控制实体状态,在CombatStateBench上实现94%计数和98%状态准确率,支持持久可编程世界。
Comments Homepage: https://alaya-lab.github.io/pwm GitHub: https://github.com/AlayaLab/pwm
IdeaAMBIG:研究思想规范中实现关键差距的基准测试
机构 * Yale University(耶鲁大学) ; TCS Research(塔塔咨询服务研究院)
AI总结 IdeaAMBIG基准测试660个实例,评估研究规范编码就绪性,发现缺陷定位是主要瓶颈,提供缺陷可大幅提升澄清成功率。
Comments Preprint. 74 pages, 18 figures
利用测试时部分观测引导图像到三维生成
机构 * University of Oxford(牛津大学)
AI总结 本文提出无需训练的测试时引导框架,利用射线一致观测似然将部分几何观测整合进预训练图像到三维模型,显著提升几何保真度与视觉质量。
BrainTaskonomy:学习如何在fMRI基础模型中进行预训练与迁移什么
机构 * Southern University of Science and Technology(南方科技大学) ; University of Warwick(华威大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Omni-Intelligence(全智能公司)
AI总结 本研究提出BrainTaskonomy,利用学习关系组织fMRI基础模型的预训练和迁移,通过优先级课程和任务图谱显著提升性能。
DUET-DINO:机器人操作中用于潜在规划的同步跨视角世界建模
机构 * University of Technology Nuremberg (UTN)(纽伦堡工业大学) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; NVIDIA(英伟达) ; Robotics Institute Germany(德国机器人研究所)
AI总结 提出DUET-DINO,一种同步跨视角潜在世界模型,利用侧视和腕部相机互补信息,在7自由度动作空间上实现潜在规划,在到达、倾斜到达和提升任务上分别取得92%、72.5%和60.0%的成功率,并展现出良好的泛化能力。
Comments Preprint, Project Page: https://utn-air.github.io/DUET-DINO
Field Converter:面向足球转播的基于几何初始化的时间残差精化世界坐标球员姿态估计
机构 * Institut de Biomécanique Humaine Georges Charpak (IBHGC), Arts et Métiers ParisTech(乔治·沙帕克人体生物力学研究所(IBHGC),巴黎高科国立高等工艺学校) ; French Football Federation (FFF)(法国足球联合会(FFF))
AI总结 提出Field Converter,利用球场几何初始化球员根部位置,并通过时间残差精化将世界坐标下姿态估计误差从49厘米降至10-11厘米,优于直接回归方法。
Comments 11 pages, 5 figures. Code available at https://github.com/KhanSimon/field_converter
跨模型一致性作为自动息肉分割的部署时可靠性信号
机构 * Indian Institute of Technology Roorkee(印度理工学院鲁尔基分校)
AI总结 本文提出基于裁判的质量估计(RBQE),利用主模型与独立裁判模型的一致性作为部署时可靠性信号,在外部基准上显著提升息肉分割的可靠性评估与选择性预测。
协方差矩阵学习:主成分分析与图学习相遇
机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Delft University of Technology(代尔夫特理工大学) ; University of Rochester(罗切斯特大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文综述协方差神经网络的理论基础,阐明其与主成分分析的概念等价性、稳定性界限及跨尺度可迁移性,并展示其在脑年龄差距预测等任务中的优势。
Comments Accepted for publication in IEEE Signal Processing Magazine
基于HoloOcean的海岸环境生成
机构 * Brigham Young University(杨百翰大学)
AI总结 针对海洋仿真环境创建依赖人工且需专业知识的问题,提出基于HoloOcean和虚幻引擎5的自动海岸环境生成管线,利用俯视图像生成高程图并自动放置资产。
Comments Accepted to OCEANS 2026 Monterey
AgroVisNet:用于萝卜、马铃薯和蛇瓜病害分类的轻量级卷积网络与BD-PlantDX专家验证基准
机构 * Bangladesh Army University of Science & Technology(孟加拉国陆军科技大学) ; Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)
AI总结 提出轻量级卷积网络AgroVisNet和专家验证基准BD-PlantDX,用于孟加拉国萝卜、马铃薯和蛇瓜病害分类,以29万参数实现99.52%准确率,显著优于预训练轻量级模型。
Semigroup-JEPA: 潜在动力学一致性用于零样本物理泛化
机构 * Yale University(耶鲁大学) ; Jump Trading(跃动交易公司) ; Brown University(布朗大学)
AI总结 提出Semigroup-JEPA,通过动作条件注入物理参数并联合训练编码器与预测器,实现零样本物理泛化,显著降低预测误差并提升控制成功率。
基于数据一致性扩散先验的层析X射线纳米成像中的先进脑组织成像
机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Paul Scherrer Institute(保罗·谢勒研究所) ; The Francis Crick Institute(弗朗西斯·克里克研究所) ; Mineral Resource CSIRO(澳大利亚联邦科学与工业研究组织矿产资源部) ; ESRF, The European Synchrotron(欧洲同步辐射光源)
AI总结 针对X射线层析成像中缺失锥导致的伪影问题,提出LUCID框架,结合多视图扩散先验与投影域数据一致性,在模拟和实验数据上显著提升空间保真度并恢复缺失傅里叶信息。
JarvisGUI:面向动态任务组合的跨设备GUI智能体
机构 * Beihang University(北京航空航天大学) ; Beijing Institute of Technology(北京理工大学) ; Baidu Inc.(百度公司)
AI总结 JarvisGUI是一个动态基准测试,通过跨Android、Windows和Ubuntu的多设备工作流评估GUI智能体,揭示现有智能体在状态传递和跨平台推理方面的关键能力差距。
Comments Accepted to EMNLP 2026 (Main Conference)
构建多语言桥梁:数据混合作为语言内推理泛化的支柱
机构 * Cohere Labs(Cohere 实验室) ; Cohere
AI总结 本文提出通过数据混合优化SFT,构建Tiny Aya L2-Thinker模型,在60种语言上实现超93%的L2推理率,证明推理可跨语言泛化。
ConvMem:用于长上下文推理的卷积记忆
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 针对LLM长上下文推理的挑战,ConvMem提出无需训练的层次卷积框架,将推理路径缩短为对数树,实现并行化,并在RULER基准上优于基线,避免过拟合。
语音基础模型真的学习到词汇了吗?
机构 * University of Toronto(多伦多大学)
AI总结 本文通过残差化方法剔除音素信息,证明HuBERT和wav2vec 2.0在深层确实学习到独立于词形的词汇表示,并能增强词汇发现任务中的高阶语言信息。
Comments Proceedings of Interspeech 2026
幸运回忆:面向LLM持久连贯性的本体驱动记忆生命周期管理
机构 * Bilkent University(比尔肯大学)
AI总结 提出本体驱动的记忆生命周期管理方法,按行为类型分类个人事实并应用差异化策略,在多个基准上提升检索正确率并大幅降低虚构。
Comments Preprint, under review. 2 figures. Code, benchmark and run logs: https://doi.org/10.5281/zenodo.20067778
基础模型能否审核在线内容?评估指令驱动与示例驱动的政策执行
机构 * MPI-SWS(马克斯·普朗克软件系统研究所) ; Saarland University(萨尔大学) ; INRIA(法国国家信息与自动化研究所)
AI总结 本文通过新基准ModerationBench比较指令驱动与示例驱动范式,证明基础模型在内容审核中显著优于现有系统,F1分数近三倍提升,为可靠政策执行提供路径。
Comments 33 pages, 28 figures, 8 tables
频率条件流匹配用于视觉-语言-动作模型
机构 * AGIBOT
AI总结 FreqFM提出频率条件流匹配框架,将动作频率作为显式条件维度,在DCT坐标中构建频谱匹配源分布并平衡目标,无需改变VLA主干,在LIBERO等基准及真实机器人任务上显著提升性能。
面向狭窄工业环境中大型异构车辆的车流管理系统
机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ; Gruppo TecnoFerrari S.p.a.(泰克诺法拉利集团股份公司)
AI总结 本文提出基于L-MAPF和滚动时域CBS的AGV车流管理系统,适用于狭窄双向走廊的异构车辆环境,通过自适应冲突消解与死锁检测,吞吐量较传统方法提升最高11%。
Journal ref The International Journal of Robotics Research. 2026
增强型可变形卷积:中心不变偏移与边缘感知掩码
机构 * Beihang University(北京航空航天大学) ; Shanghai Academy of Spaceflight Technology(上海航天技术研究院) ; Shanghai Radio Equipment Research Institute(上海无线电设备研究所) ; Cardiff University(卡迪夫大学) ; Shenzhen University(深圳大学) ; Sun Yat-sen University(中山大学) ; Lancaster University(兰卡斯特大学)
AI总结 本文提出增强型可变形卷积(EDC),通过中心不变偏移模块和边缘感知掩码模块,改进语义分割中的可变形卷积,提升空间适应性和目标聚焦,优于现有变体。
数据驱动的风险场用于更安全的端到端自动驾驶
机构 * Tsinghua University(清华大学)
AI总结 针对端到端自动驾驶缺乏显式风险感知的问题,提出数据驱动的风险场框架DRiF,通过相对风险排序监督连接安全先验与规划,在Bench2Drive上提升驾驶分数、成功率和碰撞指标。
形状引导的高斯溅射用于稀疏视角X射线三维重建
机构 * Polytechnique Montréal(蒙特利尔综合理工学院) ; Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) ; CHUM - University of Montreal Hospital(蒙特利尔大学医院中心)
AI总结 提出形状引导的高斯溅射框架,利用统计形状模型约束高斯位置和密度正则化,在仅5个稀疏视角下实现解剖一致的重建,PSNR提升2.83 dB。
Comments Accepted at: Off-Grid: 1st Workshop on Continuous Representations and Grid-Free Methods in Medical Imaging, MICCAI 2026
PACE:面向QoE高效检索增强对话服务的感知延迟级联路由与填充控制
机构 * Chongqing University(重庆大学) ; National University of Defense Technology(国防科技大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; University of Toronto Mississauga(多伦多大学密西沙加分校) ; Chongqing Huayuan Zhixin Technology Co., Ltd.(重庆华远智信科技有限公司) ; Inspur Yunzhou Industrial Internet Co., Ltd.(浪潮云洲工业互联网有限公司) ; Guoqi Zhimo (Chongqing) Technology Co., Ltd.(国器智模(重庆)科技有限公司)
AI总结 PACE框架通过联合控制级联路由和填充内容,最小化检索增强对话服务的感知首响应时间,在保持质量的同时显著降低延迟和成本。
超越弱标签:提示引导的局部细化用于高分辨率多光谱影像中的弱监督水体分割
机构 * University of Turku(图尔库大学) ; Finnish Geospatial Research Institute, National Land Survey of Finland(芬兰国家土地测量局芬兰地理空间研究所)
AI总结 针对高分辨率多光谱影像弱监督水体分割中伪标签噪声问题,提出两阶段框架,利用提示引导局部细化,在多个模型上提升IoU和F1,改善边界与细结构。
Comments Accepted for presentation at ICIP Workshop 2026 and to be published as part of the conference proceedings
OmniMed-FL:用于临床诊断的鲁棒多模态联邦学习框架
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; SRM University-AP(SRM大学安得拉邦分校)
AI总结 提出OmniMed-FL多模态联邦学习框架,融合影像与文本进行五类临床诊断,在非IID数据下评估多种策略,多模态融合优于单模态。
Comments Accepted in IEEE Globecom 2026, E-Health
SceneHI:可控光照下的高分辨率三维一致场景纹理生成
机构 * University of Glasgow(格拉斯哥大学)
AI总结 SceneHI提出一种无需微调或优化的三维纹理合成框架,通过解析像素到纹素映射和高分辨率潜在纹理实现多视角一致的高分辨率纹理生成,并嵌入光照感知阴影,相比现有方法生成时间减少80%。
Comments ECCV 2026
后续测试集并非新领域:预训练熟悉度在无污染留出集上依然存在
机构 * BrightMind AI ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
AI总结 通过构建无污染时间留出集,发现预训练模型优势源于语料库熟悉度而非记忆,提出基准需按语料库声明领域留出集。
Comments 11 pages, 2 figures, 5 tables. Code, data fetchers and per-series results: https://github.com/mahdinaser/tsfm-bench
Spot-the-shift:评估长期变化的有依据图像差异描述
机构 * University of Trento(特伦托大学) ; Sorbonne Université(索邦大学) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
AI总结 本文提出SPOT-THE-SHIFT基准和评估协议,用于衡量多模态大模型在真实驾驶场景中检测和描述长期结构变化的能力,并开发合成数据流水线提升模型性能。
Comments Preprint
为什么视频仍然如此昂贵?视频与视听大语言模型推理效率机制综述
机构 * SAMOVAR Laboratory, Télécom SudParis, Institut Polytechnique de Paris(萨莫瓦尔实验室,巴黎电信学院,巴黎综合理工学院) ; Moments Lab(Moments Lab公司)
AI总结 本综述系统梳理视频与视听大语言模型的推理效率优化机制,按流水线阶段组织帧采样、模态编码、标记缩减及预填充解码等方法,汇总共享条件下的精度-成本对比,指出视听效率与标准化评估的空白。
Comments Supplementary material at https://www.killian-steunou.com/videollm-survey/static/pdfs/videollm_survey_supplementary.pdf