arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2312
2609.10540 2026-09-10 cs.CV 新提交

Programmable World Model

可编程世界模型

Zheng-Hui Huang, Guixu Lin, Jiacheng Lin, Yi-Chuan Huang, Ruihan Yu, Muyao Niu, Siqi Yang, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang, Zhixiang Wang

机构 * Alaya Lab(Alaya实验室)

AI总结 提出可编程世界模型,将状态演化与视觉生成解耦,通过程序控制实体状态,在CombatStateBench上实现94%计数和98%状态准确率,支持持久可编程世界。

Comments Homepage: https://alaya-lab.github.io/pwm GitHub: https://github.com/AlayaLab/pwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10539 2026-09-10 cs.CL 新提交

IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications

IdeaAMBIG:研究思想规范中实现关键差距的基准测试

Yiling Ma, Yilun Zhao, Sihong Wu, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) TCS Research(塔塔咨询服务研究院)

AI总结 IdeaAMBIG基准测试660个实例,评估研究规范编码就绪性,发现缺陷定位是主要瓶颈,提供缺陷可大幅提升澄清成功率。

Comments Preprint. 74 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10531 2026-09-10 cs.CV 新提交

Guiding Image-to-3D Generation with Test-Time Partial Observations

利用测试时部分观测引导图像到三维生成

Jerred Chen, Simon Weber, Ronald Clark

机构 * University of Oxford(牛津大学)

AI总结 本文提出无需训练的测试时引导框架,利用射线一致观测似然将部分几何观测整合进预训练图像到三维模型,显著提升几何保真度与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10518 2026-09-10 cs.CV q-bio.NC 新提交

BrainTaskonomy: Learning How to Pretrain and What to Transfer in fMRI Foundation Models

BrainTaskonomy:学习如何在fMRI基础模型中进行预训练与迁移什么

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Jiayu Zuo, Mo Wang, Quanying Liu

机构 * Southern University of Science and Technology(南方科技大学) University of Warwick(华威大学) Shenzhen Loop Area Institute(深圳河套学院) Omni-Intelligence(全智能公司)

AI总结 本研究提出BrainTaskonomy,利用学习关系组织fMRI基础模型的预训练和迁移,通过优先级课程和任务图谱显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10506 2026-09-10 cs.RO cs.CV 新提交

DUET-DINO: Simultaneous Cross-View World Modeling for Latent Planning in Robot Manipulation

DUET-DINO:机器人操作中用于潜在规划的同步跨视角世界建模

Nisarga Nilavadi, Ralf Römer, Moritz Reuss, Michael Krawez, Tobias Jülg, Angela P. Schoellig, Rudolf Lioutikov, Wolfram Burgard

机构 * University of Technology Nuremberg (UTN)(纽伦堡工业大学) Technical University of Munich (TUM)(慕尼黑工业大学) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

AI总结 提出DUET-DINO,一种同步跨视角潜在世界模型,利用侧视和腕部相机互补信息,在7自由度动作空间上实现潜在规划,在到达、倾斜到达和提升任务上分别取得92%、72.5%和60.0%的成功率,并展现出良好的泛化能力。

Comments Preprint, Project Page: https://utn-air.github.io/DUET-DINO

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10498 2026-09-10 cs.CV 新提交

Field Converter: Geometry-Initialized Temporal Residual Refinement for World-Grounded Player Pose Estimation from Soccer Broadcasts

Field Converter:面向足球转播的基于几何初始化的时间残差精化世界坐标球员姿态估计

Simon Khan, Laurent Gajny, Jennyfer Lecompte, Sébastien Laporte

机构 * Institut de Biomécanique Humaine Georges Charpak (IBHGC), Arts et Métiers ParisTech(乔治·沙帕克人体生物力学研究所(IBHGC),巴黎高科国立高等工艺学校) French Football Federation (FFF)(法国足球联合会(FFF))

AI总结 提出Field Converter,利用球场几何初始化球员根部位置,并通过时间残差精化将世界坐标下姿态估计误差从49厘米降至10-11厘米,优于直接回归方法。

Comments 11 pages, 5 figures. Code available at https://github.com/KhanSimon/field_converter

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10495 2026-09-10 cs.CV cs.LG 新提交

Cross-Model Agreement as a Deployment-Time Reliability Signal for Automatic Polyp Segmentation

跨模型一致性作为自动息肉分割的部署时可靠性信号

Siddharth Gupta, Jitin Singla

机构 * Indian Institute of Technology Roorkee(印度理工学院鲁尔基分校)

AI总结 本文提出基于裁判的质量估计(RBQE),利用主模型与独立裁判模型的一致性作为部署时可靠性信号,在外部基准上显著提升息肉分割的可靠性评估与选择性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10490 2026-09-10 cs.LG eess.SP 新提交

Learning with Covariance Matrices: Principal Component Analysis Meets Learning with Graphs

协方差矩阵学习:主成分分析与图学习相遇

Saurabh Sihag, Andrea Cavallo, Elvin Isufi, Gonzalo Mateos, Alejandro Ribeiro

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Delft University of Technology(代尔夫特理工大学) University of Rochester(罗切斯特大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文综述协方差神经网络的理论基础,阐明其与主成分分析的概念等价性、稳定性界限及跨尺度可迁移性,并展示其在脑年龄差距预测等任务中的优势。

Comments Accepted for publication in IEEE Signal Processing Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10484 2026-09-10 cs.RO 新提交

Coastal Environment Generation with HoloOcean

基于HoloOcean的海岸环境生成

Abigail Austin, Brady Moon, Joshua G. Mangelson

机构 * Brigham Young University(杨百翰大学)

AI总结 针对海洋仿真环境创建依赖人工且需专业知识的问题,提出基于HoloOcean和虚幻引擎5的自动海岸环境生成管线,利用俯视图像生成高程图并自动放置资产。

Comments Accepted to OCEANS 2026 Monterey

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10469 2026-09-10 cs.CV 新提交

AgroVisNet: A lightweight Convolutional Network and the BD-PlantDX Expert-Validated Benchmark for Radish, Potato and Pointed Gourd Disease Classification

AgroVisNet:用于萝卜、马铃薯和蛇瓜病害分类的轻量级卷积网络与BD-PlantDX专家验证基准

Md. Abdullah Mandal, Saad Ahmed, Md. Khalid Syfullah

机构 * Bangladesh Army University of Science & Technology(孟加拉国陆军科技大学) Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学)

AI总结 提出轻量级卷积网络AgroVisNet和专家验证基准BD-PlantDX,用于孟加拉国萝卜、马铃薯和蛇瓜病害分类,以29万参数实现99.52%准确率,显著优于预训练轻量级模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10464 2026-09-10 cs.LG cs.AI cs.CV 新提交

Semigroup-JEPA: Latent Dynamics Consistency for Zero-Shot Physics Generalization

Semigroup-JEPA: 潜在动力学一致性用于零样本物理泛化

Andy Zeyi Liu, Haoran Sun, Lucas Baker, Randall Balestriero, John Sous

机构 * Yale University(耶鲁大学) Jump Trading(跃动交易公司) Brown University(布朗大学)

AI总结 提出Semigroup-JEPA,通过动作条件注入物理参数并联合训练编码器与预测器,实现零样本物理泛化,显著降低预测误差并提升控制成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10456 2026-09-10 cs.CV 新提交

Advanced Brain Tissue Imaging with Data-Consistent Diffusion Priors in Laminographic X-Ray Nanoimaging

基于数据一致性扩散先验的层析X射线纳米成像中的先进脑组织成像

Wenxuan Fang, Abraham L. Levitan, Ana Diaz, Carles Bosch, Adrian Wanner, Andreas T. Schaefer, Mirko Holler, Tomas Aidukas, Nicholas W. Phillips, Yuxin Zhang, Alexandra Pacureanu, Manuel Guizar-Sicairos, Luis Barba

机构 * École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Paul Scherrer Institute(保罗·谢勒研究所) The Francis Crick Institute(弗朗西斯·克里克研究所) Mineral Resource CSIRO(澳大利亚联邦科学与工业研究组织矿产资源部) ESRF, The European Synchrotron(欧洲同步辐射光源)

AI总结 针对X射线层析成像中缺失锥导致的伪影问题,提出LUCID框架,结合多视图扩散先验与投影域数据一致性,在模拟和实验数据上显著提升空间保真度并恢复缺失傅里叶信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10451 2026-09-10 cs.AI 新提交

JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition

JarvisGUI:面向动态任务组合的跨设备GUI智能体

Zixiang Chen, Yuheng Lu, Zihao Cheng, Zeming Liu, Jizeng Bai, Ziye Huang, Zhiyin Lin, Zihan Li, Yuhang Guo, Yunhong Wang, Haifeng Wang

机构 * Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Baidu Inc.(百度公司)

AI总结 JarvisGUI是一个动态基准测试,通过跨Android、Windows和Ubuntu的多设备工作流评估GUI智能体,揭示现有智能体在状态传递和跨平台推理方面的关键能力差距。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10445 2026-09-10 cs.CL 新提交

Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning

构建多语言桥梁:数据混合作为语言内推理泛化的支柱

Mehrnaz Mofakhami, Ananya Sahu, Alejandro R. Salamanca, Daniel D'souza, Alexandre Berard, Thomas Euyang, Marzieh Fadaee, Julia Kreutzer

机构 * Cohere Labs(Cohere 实验室) Cohere

AI总结 本文提出通过数据混合优化SFT,构建Tiny Aya L2-Thinker模型,在60种语言上实现超93%的L2推理率,证明推理可跨语言泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10441 2026-09-10 cs.AI cs.CL 新提交

ConvMem: Convolutional Memory for Long-Context Reasoning

ConvMem:用于长上下文推理的卷积记忆

Hongming Zhang, Zhaozhen Gu, Fengshuo Bai, Ming Hao, Qingyang Zhang, Yuanyuan Wang, Shiyang Tang, Yanna Wang, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对LLM长上下文推理的挑战,ConvMem提出无需训练的层次卷积框架,将推理路径缩短为对数树,实现并行化,并在RULER基准上优于基线,避免过拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10434 2026-09-10 cs.CL cs.SD 新提交

Do speech foundation models really learn words?

语音基础模型真的学习到词汇了吗?

Robin Huo, Ewan Dunbar

机构 * University of Toronto(多伦多大学)

AI总结 本文通过残差化方法剔除音素信息,证明HuBERT和wav2vec 2.0在深层确实学习到独立于词形的词汇表示,并能增强词汇发现任务中的高阶语言信息。

Comments Proceedings of Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10413 2026-09-10 cs.AI 新提交

Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs

幸运回忆:面向LLM持久连贯性的本体驱动记忆生命周期管理

Ansuman Mullick, Eray Tüzün

机构 * Bilkent University(比尔肯大学)

AI总结 提出本体驱动的记忆生命周期管理方法,按行为类型分类个人事实并应用差异化策略,在多个基准上提升检索正确率并大幅降低虚构。

Comments Preprint, under review. 2 figures. Code, benchmark and run logs: https://doi.org/10.5281/zenodo.20067778

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10410 2026-09-10 cs.CL cs.AI cs.CY 新提交

Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization

基础模型能否审核在线内容?评估指令驱动与示例驱动的政策执行

Ayan Majumdar, Shounak Paul, Pushpdeep Singh, Ines Abdelaziz, Sayeh Jarollahi, Seungeon Lee, Krishna P. Gummadi, Ingmar Weber, Abhisek Dash

机构 * MPI-SWS(马克斯·普朗克软件系统研究所) Saarland University(萨尔大学) INRIA(法国国家信息与自动化研究所)

AI总结 本文通过新基准ModerationBench比较指令驱动与示例驱动范式,证明基础模型在内容审核中显著优于现有系统,F1分数近三倍提升,为可靠政策执行提供路径。

Comments 33 pages, 28 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10405 2026-09-10 cs.RO 新提交

Frequency-Conditioned Flow Matching for Vision-Language-Action Models

频率条件流匹配用于视觉-语言-动作模型

Haochen Niu, Shengye Dong, Hao Liu, Peiwen Lin, Wang Chuang

机构 * AGIBOT

AI总结 FreqFM提出频率条件流匹配框架,将动作频率作为显式条件维度,在DCT坐标中构建频谱匹配源分布并平衡目标,无需改变VLA主干,在LIBERO等基准及真实机器人任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10400 2026-09-10 cs.RO cs.MA 新提交

A traffic management system for large and heterogeneous vehicles in narrow industrial environments

面向狭窄工业环境中大型异构车辆的车流管理系统

Alessandro Bonetti, Silvia Proia, Simone Guidetti, Lorenzo Sabattini

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) Gruppo TecnoFerrari S.p.a.(泰克诺法拉利集团股份公司)

AI总结 本文提出基于L-MAPF和滚动时域CBS的AGV车流管理系统,适用于狭窄双向走廊的异构车辆环境,通过自适应冲突消解与死锁检测,吞吐量较传统方法提升最高11%。

Journal ref The International Journal of Robotics Research. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10387 2026-09-10 cs.CV 新提交

Enhanced Deformable Convolution with Center-invariant Offset and Edge-aware Mask

增强型可变形卷积:中心不变偏移与边缘感知掩码

Yixiao Li, Xiaoyuan Yang, Jin Jiang, Minghao Zou, Guanghui Yue, Baoquan Zhao, Jun Liu, Wei Zhou

机构 * Beihang University(北京航空航天大学) Shanghai Academy of Spaceflight Technology(上海航天技术研究院) Shanghai Radio Equipment Research Institute(上海无线电设备研究所) Cardiff University(卡迪夫大学) Shenzhen University(深圳大学) Sun Yat-sen University(中山大学) Lancaster University(兰卡斯特大学)

AI总结 本文提出增强型可变形卷积(EDC),通过中心不变偏移模块和边缘感知掩码模块,改进语义分割中的可变形卷积,提升空间适应性和目标聚焦,优于现有变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10377 2026-09-10 cs.RO cs.CV 新提交

Data-Driven Risk Fields for Safer End-to-End Autonomous Driving

数据驱动的风险场用于更安全的端到端自动驾驶

Yuanxin Tian, Zhiyuan Liu, Jinhao Li, Zhenhua Xu, Wenhao Yu, Jianqiang Wang

机构 * Tsinghua University(清华大学)

AI总结 针对端到端自动驾驶缺乏显式风险感知的问题,提出数据驱动的风险场框架DRiF,通过相对风险排序监督连接安全先验与规划,在Bench2Drive上提升驾驶分数、成功率和碰撞指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10376 2026-09-10 cs.CV 新提交

Shape-guided Gaussian Splatting for Sparse-View X-ray 3D Reconstruction

形状引导的高斯溅射用于稀疏视角X射线三维重建

Pranav Poudel, Florence Dell'Aniello Picard, Nairouz Shehata, Frédéric Lavoie, Herve Lombaert

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) CHUM - University of Montreal Hospital(蒙特利尔大学医院中心)

AI总结 提出形状引导的高斯溅射框架,利用统计形状模型约束高斯位置和密度正则化,在仅5个稀疏视角下实现解剖一致的重建,PSNR提升2.83 dB。

Comments Accepted at: Off-Grid: 1st Workshop on Continuous Representations and Grid-Free Methods in Medical Imaging, MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10372 2026-09-10 cs.CV cs.AI cs.RO 新提交

PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving

PACE:面向QoE高效检索增强对话服务的感知延迟级联路由与填充控制

Lin Huang, Yujuan Tan, Weisheng Li, Lixiang Zeng, Kun Yang, Suihan Xiao

机构 * Chongqing University(重庆大学) National University of Defense Technology(国防科技大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Toronto Mississauga(多伦多大学密西沙加分校) Chongqing Huayuan Zhixin Technology Co., Ltd.(重庆华远智信科技有限公司) Inspur Yunzhou Industrial Internet Co., Ltd.(浪潮云洲工业互联网有限公司) Guoqi Zhimo (Chongqing) Technology Co., Ltd.(国器智模(重庆)科技有限公司)

AI总结 PACE框架通过联合控制级联路由和填充内容,最小化检索增强对话服务的感知首响应时间,在保持质量的同时显著降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10371 2026-09-10 cs.CV 新提交

Beyond Weak Labels: Prompt-Guided Local Refinement for Weakly Supervised Water Segmentation in High-Resolution Multispectral Imagery

超越弱标签:提示引导的局部细化用于高分辨率多光谱影像中的弱监督水体分割

Muhammad Farhan Humayun, Mohammad Imangholiloo, Afifah Shah, Tomi Westerlund, Jukka Heikkonen

机构 * University of Turku(图尔库大学) Finnish Geospatial Research Institute, National Land Survey of Finland(芬兰国家土地测量局芬兰地理空间研究所)

AI总结 针对高分辨率多光谱影像弱监督水体分割中伪标签噪声问题,提出两阶段框架,利用提示引导局部细化,在多个模型上提升IoU和F1,改善边界与细结构。

Comments Accepted for presentation at ICIP Workshop 2026 and to be published as part of the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10364 2026-09-10 cs.LG cs.AI 新提交

OmniMed-FL: A Robust Multimodal Federated Learning Framework for Clinical Diagnosis

OmniMed-FL:用于临床诊断的鲁棒多模态联邦学习框架

Ayush Debnath, Ruelia Saha, Sudip Misra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格普尔分校) KTH Royal Institute of Technology(瑞典皇家理工学院) SRM University-AP(SRM大学安得拉邦分校)

AI总结 提出OmniMed-FL多模态联邦学习框架,融合影像与文本进行五类临床诊断,在非IID数据下评估多种策略,多模态融合优于单模态。

Comments Accepted in IEEE Globecom 2026, E-Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10363 2026-09-10 cs.CV cs.GR 新提交

SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination

SceneHI:可控光照下的高分辨率三维一致场景纹理生成

Athanasios Tragakis, Marco Aversa, Daniela Ivanova, Chaitanya Kaul, Roderick Murray-Smith, Daniele Faccio, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学)

AI总结 SceneHI提出一种无需微调或优化的三维纹理合成框架,通过解析像素到纹素映射和高分辨率潜在纹理实现多视角一致的高分辨率纹理生成,并嵌入光照感知阴影,相比现有方法生成时间减少80%。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10357 2026-09-10 cs.LG 新提交

A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out

后续测试集并非新领域:预训练熟悉度在无污染留出集上依然存在

Mahdi Naser Moghadasi, Faezeh Ghaderi

机构 * BrightMind AI University of Texas at Arlington(德克萨斯大学阿灵顿分校)

AI总结 通过构建无污染时间留出集,发现预训练模型优势源于语料库熟悉度而非记忆,提出基准需按语料库声明领域留出集。

Comments 11 pages, 2 figures, 5 tables. Code, data fetchers and per-series results: https://github.com/mahdinaser/tsfm-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10356 2026-09-10 cs.CV 新提交

Spot-the-shift: Evaluating Grounded Image Difference Captioning of Long-term Changes

Spot-the-shift:评估长期变化的有依据图像差异描述

Benedetta Liberatori, Nermin Samet, Paolo Rota, Matthieu Cord, Elisa Ricci, Andrei Bursuc, Monika Wysoczańska

机构 * University of Trento(特伦托大学) Sorbonne Université(索邦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

AI总结 本文提出SPOT-THE-SHIFT基准和评估协议,用于衡量多模态大模型在真实驾驶场景中检测和描述长期结构变化的能力,并开发合成数据流水线提升模型性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.10355 2026-09-10 cs.CV cs.CL cs.MM 新提交

Why Is Video Still So Expensive? A Survey of Inference-Efficiency Mechanisms in Video and Audiovisual LLMs

为什么视频仍然如此昂贵?视频与视听大语言模型推理效率机制综述

Killian Steunou, Yannis Tevissen, Mounîm A. El Yacoubi

机构 * SAMOVAR Laboratory, Télécom SudParis, Institut Polytechnique de Paris(萨莫瓦尔实验室,巴黎电信学院,巴黎综合理工学院) Moments Lab(Moments Lab公司)

AI总结 本综述系统梳理视频与视听大语言模型的推理效率优化机制,按流水线阶段组织帧采样、模态编码、标记缩减及预填充解码等方法,汇总共享条件下的精度-成本对比,指出视听效率与标准化评估的空白。

Comments Supplementary material at https://www.killian-steunou.com/videollm-survey/static/pdfs/videollm_survey_supplementary.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏