arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Imperial College London(帝国理工学院)

共收录 180
2606.22918 2026-06-23 cs.CV cs.GT 新提交

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22556 2026-06-23 cs.CV 新提交

HiMatch-AD: DINOv3-driven Hierarchical Matching for Training-free Medical Anomaly Detection

HiMatch-AD: 基于DINOv3驱动的分层匹配的无训练医学异常检测

Jiayu Huo, Jingyuan Hong, Meng Zhou, Liyun Chen, Le Zhang

机构 * Imperial College London(帝国理工学院) SonoScape Medical Corp.(深圳开立生物医疗科技股份有限公司) University of Birmingham(伯明翰大学)

AI总结 提出HiMatch-AD框架,利用DINOv3预训练模型进行分层匹配,通过双分支检索、多阶段分层异常图生成和不确定性融合实现无训练医学异常检测,在BMAD基准上优于现有方法。

Comments 10 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22195 2026-06-23 cs.CV eess.SP 新提交

Resolving Multi-Target Association in OFDM-based ISAC via Vision-aided Multi-Modal Learning

基于OFDM的ISAC中通过视觉辅助多模态学习解决多目标关联

Meng Hua, Chenghong Bian, Deniz Gunduz

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系) Department of Electrical and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电气与计算机工程系)

AI总结 提出视觉辅助OFDM-ISAC框架,融合无线与视觉模态,通过深度联合源信道编码传输图像、YOLOv5检测目标特征,并利用多模态网络与延迟-多普勒图关联,解决多目标模糊和分辨率限制,实现16cm定位RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22046 2026-06-23 cs.RO 新提交

A Multimodal Tiltwing Framework for Bioinspired Aerial Robots

一种用于仿生空中机器人的多模态倾转机翼框架

Krispin C. V. Broers, Sophie F. Armanini

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 提出一种可切换悬停、高速前飞和高效滑翔的多模态倾转机翼框架,通过双独立扑翼推力矢量控制增强机动性,并采用混合苏格兰轭扑动机构实现宽扑动角度以利用拍合效应。

Comments 18 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21728 2026-06-23 cs.LG 新提交

Embedding Linear Equality Constraints in Probabilistic Neural Networks for Dynamic Modelling

在概率神经网络中嵌入线性等式约束用于动态建模

Matthew Marsh, Benoit Chachuat, Antonio del Rio Chanona

机构 * The Sargent Centre for Process Systems Engineering, Department of Chemical Engineering, Imperial College London, UK(伦敦帝国理工学院化学工程系过程系统工程萨金特中心)

AI总结 提出一种概率神经网络框架,在给定容差内保证线性等式约束满足并捕捉偶然不确定性,在减少数据时提升预测精度和约束遵守,在大数据时训练更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21396 2026-06-23 cs.RO 新提交

Overcoming Imperfect Kinematics in Surgical Robotics Through Sim-to-Real Visuomotor Learning

通过仿真到现实的视觉运动学习克服手术机器人中的不完美运动学

Zhaoxuan Yan, Kaizhong Deng, Zhaoyang Jacopo Hu, George P. Mylonas, Daniel S. Elson

机构 * Hamlyn Centre for Robotic Surgery, Institute of Global Health Innovation, Imperial College London(伦敦帝国理工学院全球健康创新研究所哈姆林机器人手术中心) Department of Surgery and Cancer, Imperial College London(伦敦帝国理工学院外科与癌症系) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

AI总结 提出基于教师-学生框架的视觉运动学习策略,融合不可靠内部读数与精确外部视觉数据,实时补偿运动学误差,在达芬奇研究套件上验证可行性。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21306 2026-06-23 cs.AI 新提交

Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment

迈向 Dys-XAI:基于影响的构音障碍严重程度评估解释

Xiaoliang Wu, Qiyang Sun, Yupei Li, Erfan Loweimi, Jennifer Williams, Zhengjun Yue

机构 * University of Southampton(南安普顿大学) Imperial College London(帝国理工学院) University of Edinburgh(爱丁堡大学) King's College London(伦敦国王学院)

AI总结 提出基于影响的实例级可解释性框架,通过支持性和竞争性训练样本解释构音障碍严重程度评估的深度学习模型决策,并通过删除实验验证解释有效性。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20774 2026-06-23 cs.CV cs.AI cs.RO 新提交

TriMotion: Modality-Agnostic Camera Control for Video Generation

TriMotion: 模态无关的摄像机控制用于视频生成

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng

机构 * GIST(光州科学技术院) Huawei Noah's Ark Lab(华为诺亚方舟实验室) Yonsei University(延世大学) Imperial College London(伦敦帝国理工学院)

AI总结 提出TriMotion框架,通过将视频、姿态和文本输入映射到共享运动嵌入空间,实现模态无关的摄像机控制视频生成,并引入潜在运动一致性目标,无需像素级解码即可准确跟随目标轨迹。

Comments ECCV Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20757 2026-06-23 cs.LG 新提交

Evidential Fusion Network for Multimodal Survival Prediction under Missing Modalities

缺失模态下的多模态生存预测证据融合网络

Yucheng Xing, Hailan Mo, Zi Wang, Ling Huang, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院)

AI总结 提出EMMS模型,利用Dempster-Shafer理论和高斯随机模糊数融合多模态决策,处理缺失模态下的生存预测,无需生成缺失数据,在四个癌症数据集上达到最优性能并提供校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23166 2026-06-23 cs.LG cond-mat.mtrl-sci 新提交

Substitution-Based Analysis of Structural Novelty for Generative Models of Materials

基于替换分析的材料生成模型结构新颖性评估

Masahiro Negishi, Aron Walsh

机构 * Imperial College London(伦敦帝国学院)

AI总结 针对无机晶体生成AI模型,提出工作流区分生成晶体是否为训练重复、元素替换产物或全新结构,发现81-92%的生成晶体为重复或替换结构,高对称性系统尤其明显,低对称性新结构可解释为数据丰富区域的插值。

Comments 27 pages (20 pages of main text). See https://github.com/WMD-group/xtaledit for the code

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22112 2026-06-23 cs.CV cond-mat.mtrl-sci cs.LG physics.chem-ph 新提交

Accurate identification and measurement of the precipitate area by two-stage deep neural networks in novel chromium-based alloys

基于两阶段深度神经网络的新型铬基合金中析出相面积的精确识别与测量

Zeyu Xia, Kan Ma, Sibo Cheng, Thomas Blackburn, Ziling Peng, Kewei Zhu, Weihang Zhang, Dunhui Xiao, Alexander J Knowles, Rossella Arcucci

机构 * Queensland University of Technology(昆士兰科技大学) Data Science Institute, Department of Computing, Imperial College London(帝国理工学院数据科学研究所,计算系) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院) Institute of Advanced Science Facilities, Shenzhen(深圳先进科学设施研究院) Department of Computer Science, University of York(约克大学计算机科学系) School of Mathematical Sciences, Tongji University(同济大学数学科学学院) Department of Earth Science and Engineering, Imperial College London(帝国理工学院地球科学与工程系)

AI总结 提出DT-SegNet两阶段深度学习方案,结合YOLOv5和SegFormer,实现电子显微镜图像中析出相的目标检测与分割,显著优于现有工具。

Comments 18 pages, 11 figures. Published in Phys. Chem. Chem. Phys

Journal ref Phys. Chem. Chem. Phys. 25, 15970-15987 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08375 2026-06-23 cs.LG 新提交

Few-step Cofolding with All-Atom Flow Maps

少步全原子流图共折叠

Gianluca Scarpellini, Ron Shprints, Peter Holderrieth, Juno Nam, Pranav Murugan, Rafael Gómez-Bombarelli, Tommi Jaakkola, Maruan Al-Shedivat, Nicholas Matthew Boffi, Avishek Joey Bose

机构 * Genesis Molecular AI Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) Imperial College London(伦敦帝国学院) Mila

AI总结 提出DeCAF框架,将全原子共折叠扩散模型蒸馏为流图,仅需几步推理即可生成高质量样本,并通过奖励引导搜索提升采样质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20143 2026-06-19 cs.CV 新提交

HEad and neCK TumOR (HECKTOR) 2025: Benchmark of Segmentation, Diagnosis, and Prognosis in Multimodal PET/CT

头颈肿瘤 (HECKTOR) 2025 挑战赛:多模态 PET/CT 中的分割、诊断与预后基准

Numan Saeed, Salma Hassan, Shahad Hardan, Lishan Cai, Xinglong Liang, Moona Mazher, Abdul Qayyum, Yansong Bu, Mengye Lyu, Yue Lin, Mingyuan Meng, Chuanyi Huang, Lisheng Wang, Dalal Chamseddine, Shamimeh Ahrari, Beining Wu, Yifei Chen, Fuyou Mao, Hao Zhang, Baixiang Zhao, Surajit Ray, Muzi Guo, Lei Xiang, Jakob Dexl, Michael Ingrisch, Adrien Depeursinge, Arman Rahmim, Mathieu Hatt, Vincent Andrearczyk, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Amsterdam UMC(阿姆斯特丹大学医学中心) The Netherlands Cancer Institute(荷兰癌症研究所) Radboud University Medical Centre(拉德堡德大学医学中心) University College London(伦敦大学学院) Imperial College London(帝国理工学院) Shenzhen Technology University(深圳技术大学) Shenzhen University(深圳大学) Newland Digital Technology(新大陆数字技术) The University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) University Hospital, Nantes(南特大学医院) Nantes Université, Centrale Nantes, CNRS, LS2N(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N实验室) Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学) Central South University(中南大学) University of Glasgow(格拉斯哥大学) China Mobile System Integration Co., Ltd.(中移系统集成有限公司) Subtle Medical Inc.(Subtle Medical公司) University Hospital, LMU Munich(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心) BC Cancer Research Institute(不列颠哥伦比亚癌症研究所) HES-SO Valais-Wallis University of Applied Sciences and Arts(HES-SO瓦莱州应用科学与艺术大学) Lausanne University Hospital (CHUV)(洛桑大学医院) LaTIM, INSERM, UMR 1101, Univ Brest(LaTIM实验室、法国国家健康与医学研究院、UMR 1101、布雷斯特大学)

AI总结 HECKTOR 2025 挑战赛利用多模态 PET/CT 和电子健康记录,建立了头颈癌自动分析的基准,涵盖肿瘤分割、复发预测和 HPV 分类三个任务,最佳算法分别达到 Dice 0.75、C-index 0.66 和平衡准确率 0.56。

Comments 17 pages, 4 figures, 4 tables. Overview paper for the HECKTOR 2025 challenge, held as a satellite event at MICCAI 2025. Challenge website: https://hecktor.grand-challenge.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19966 2026-06-19 cs.CV cs.LG 新提交

Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis

语义锚定证据融合用于域鲁棒的全切片生存分析

Yucheng Xing, Ling Huang, Pei Liu, Jingying Ma, Jiaqing Xu, Kai He, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院) Hunan University(湖南大学)

AI总结 提出SAEFS框架,通过视觉问答提取语义锚点,结合双流证据提取和狄利克雷主观逻辑建模不确定性,实现跨域零样本生存分析,平均C-index提升10.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19889 2026-06-19 cs.CV 新提交

SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics

SurgVista:具有合理器械-组织动力学的长程手术世界建模

Wentao Pan, Wuyang Li, Shengyuan Liu, Xinyu Liu, Hengyu Liu, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) EPFL(瑞士联邦理工学院洛桑) Imperial College London(伦敦帝国学院)

AI总结 提出SurgVista手术世界模型,通过变形一致性正则化和漂移适应训练,解决空间交互不连贯和时间保真度崩溃问题,在长程预测中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19542 2026-06-19 cs.LG 新提交

Tracking Representation Dynamics in Large Language Models with Persistent Homology

利用持续同调追踪大型语言模型中的表示动态

Naman Malhotra, Jay Ambadkar, Abhinav Gupta, Kushal Kasivel, Abbas Schwarz, Kamillo Ferry, Anthea Monod

机构 * Imperial College London(伦敦帝国学院)

AI总结 通过持续同调分析激活空间拓扑,发现对齐过程中拓扑重组主要发生在训练早期,且不同对齐目标产生可区分的拓扑轨迹。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19460 2026-06-19 cs.CV cs.AI cs.LG 新提交

Scaling Generative Foundation Models for Chest Radiography with Rectified Flow Transformers

使用整流流变换器扩展胸部X光片的生成式基础模型

Fabio De Sousa Ribeiro, Emma A. M. Stanley, Charles Jones, Tian Xia, Dominic C. Marshall, Laurent Renard Triché, Christopher V. Cosgriff, Panagiotis Dimitrakopoulos, Sotirios A. Tsaftaris, Ben Glocker

机构 * Imperial College London(帝国理工学院) Causality in Healthcare AI Hub(医疗AI因果关系中心) University of Edinburgh(爱丁堡大学) Cleveland Clinic London(克利夫兰诊所伦敦) Department of Perioperative Medicine, CHU Clermont-Ferrand(克莱蒙费朗大学医院围手术期医学科) Department of Medicine, Massachusetts General Hospital(麻省总医院医学部) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所)

AI总结 提出首个十亿参数级胸部X光片生成基础模型,通过整流流变换器实现高保真可控合成,显著提升合成图像与真实图像的不可区分性。

Comments Project page: https://RadiT-project.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19302 2026-06-18 physics.ao-ph cs.LG 新提交

Optimal scenario design for climate emulation

气候模拟的最优情景设计

Christopher B. Womack, Shahine Bouabid, Andrei Sokolov, Popat Salunke, Glenn Flierl, Sebastian D. Eastham, Noelle E. Selin

机构 * Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与航天系,麻省理工学院) Center for Sustainability Science and Strategy, Massachusetts Institute of Technology(可持续科学与战略中心,麻省理工学院) Department of Earth, Atmospheric, and Planetary Sciences, Massachusetts Institute of Technology(地球、大气与行星科学系,麻省理工学院) Brahmal Vasudevan Institute for Sustainable Aviation, Department of Aeronautics, Imperial College London(可持续航空研究所,帝国理工学院伦敦校区) Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院)

AI总结 针对气候模拟器泛化能力受限的问题,提出通过可微简单气候模型优化训练数据情景,使小数据集训练的模拟器性能优于标准情景集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19251 2026-06-18 physics.comp-ph cs.LG physics.flu-dyn 新提交

Acceleration of an algebraic multigrid pressure solver using graph neural networks

使用图神经网络加速代数多重网格压力求解器

Eric Chillón, Artur K. Lidtke, Nguyen Anh Khoa Doan, Bernat Font

机构 * Faculty of Mechanical Engineering, Delft University of Technology, The Netherlands(荷兰代尔夫特理工大学机械工程学院) Maritime Research Institute Netherlands, The Netherlands(荷兰海事研究院) Department of Aeronautics, Imperial College London, United Kingdom(英国伦敦帝国理工学院航空系)

AI总结 提出一种基于图卷积同构网络的代数多重网格平滑器,通过预测最优多项式系数构造稀疏伪逆算子,减少V-cycle迭代次数,在非结构化网格上实现4%-37%的加速,并泛化至训练时未见的大规模网格。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18098 2026-06-17 cs.AI 新提交

IsabeLLM: Automated Theorem Proving Applied to Formally Verifying Consensus

IsabeLLM: 自动化定理证明应用于共识的形式化验证

Elliot Jones, William Knottenbelt

机构 * Imperial College London(伦敦帝国学院)

AI总结 本文改进IsabeLLM自动化定理证明工具,通过检索增强生成、错误追踪和反例生成提升大语言模型上下文,并兼容最新Isabelle和Sledgehammer,用于验证比特币工作量证明共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17972 2026-06-17 cs.CV cs.AI 新提交

SegDINO: Introducing Multi-Scale Structure into DINO for Efficient Medical Image Segmentation

SegDINO: 将多尺度结构引入DINO以实现高效医学图像分割

Sicheng Yang, Hongqiu Wang, Zhaohu Xing, Sixiang Chen, Qiuxia Yang, Yize Mao, Guang Yang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University Cancer Center(中山大学肿瘤防治中心) Imperial College London(帝国理工学院)

AI总结 提出SegDINO框架,通过令牌金字塔适应和尺度感知解码将多尺度结构引入DINO,在保持高效的同时实现医学图像分割的最优性能。

Comments Code: https://github.com/script-Yang/segdino_v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17924 2026-06-17 cs.RO cs.AI 新提交

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA:潜在空间中的渐进式具身动作计划精炼

Bochen Yang, Lianlei Shan

机构 * Imperial College London(帝国理工学院) Tsinghua University(清华大学)

AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。

Comments 21 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17805 2026-06-17 cs.LG 新提交

QueryMarket: Cost-Aware Online Active Learning in Data Markets

QueryMarket: 数据市场中成本感知的在线主动学习

Xiwen Huang, Pierre Pinson

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院戴森设计工程学院) Halfspace (part of Accenture)(埃森哲旗下Halfspace) Technical University of Denmark (DTU Management)(丹麦技术大学(DTU管理系)) Aarhus University (CoRE)(奥胡斯大学(CoRE))

AI总结 提出QueryMarket框架和OVBAL算法,通过D-最优性准则估计边际效用,在滚动预算约束下实现成本感知的在线主动学习,适应非平稳流和异构标签成本。

Comments 10 pages, 8 figures. Submitted to IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16658 2026-06-16 cs.CV 新提交

Vision-Language Models as Zero-Annotation Oracles in Histopathology

视觉-语言模型作为组织病理学中的零标注预言机

Vishal Jain, Giorgio Buzzanca, Sarah Cechnicka, Maarten Naesens, Priyanka Koshy, Tri Nguyen, Jesper Kers, Candice Roufosse, Bernhard Kainz

机构 * Imperial College London(帝国理工学院) Leiden University Medical Center(莱顿大学医学中心) KU Leuven(鲁汶大学) University Hospitals Leuven(鲁汶大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Friedrich-Alexander University Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

AI总结 提出一种粗到细方法,利用通用视觉-语言模型作为零标注预言机进行前景分割,在特殊染色上优于监督基线,并通过伪标签蒸馏轻量学生模型。

Comments 11 pages, 1 figure, 6 tables. Code available at https://github.com/VishalJ99/vlm-wsi-auto-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16491 2026-06-16 cs.RO 新提交

HATS: A Human-Agent Teleoperation System for Multi-Arm Data Collection

HATS:用于多臂数据收集的人-智能体遥操作系统

Zesen Lin, Jian-Jian Jiang, Haoming Cen, Xiao-Ming Wu, Dandan Zhang, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Imperial College London(帝国理工学院)

AI总结 提出HATS系统,由单操作员借助MLLM智能体控制两主臂和两辅助臂,实现高效多臂数据收集,性能媲美双人专家团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16484 2026-06-16 cs.CV cs.AI cs.MM 新提交

Unified Multimodal Model for Brain MRI Imputation and Understanding

统一多模态模型用于脑MRI补全与理解

Zhiyun Song, Che Liu, Tian Xia, Avinash Kori, Wenjia Bai

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。

Comments Early accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16273 2026-06-16 stat.ML cs.LG stat.ME 新提交

Generative Modeling on Metric Graphs via Neural Optimal Transport

基于神经最优传输的度量图生成建模

Alessandro Micheli, Yueqi Cao, Anthea Monod, Samir Bhatt

机构 * Imperial College London(帝国理工学院伦敦分校) KTH Royal Institute of Technology(皇家理工学院) Statens Serum Institut(丹麦国家血清研究所) University of Copenhagen(哥本哈根大学)

AI总结 提出首个深度生成建模框架,用于度量图上连续分布,通过图嵌入、神经半对偶求解熵Kantorovich问题并投影回原图,理论证明收敛性,实验优于离散图OT基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16137 2026-06-16 cs.CL cs.AI 新提交

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型

Yupei Li, Qiyang Sun, Xiaoliang Wu, Chenxi Wang, Berrak Sisman, Björn W. Schuller

机构 * Imperial College London(帝国理工学院) Technical University of Munich(慕尼黑工业大学) University of Southampton(南安普顿大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-06-16 cs.CL 新提交

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏