arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1688 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1299 篇

2512.09925 2026-07-15 cs.CV 版本更新 57%

GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures

GAINS:基于高斯的稀疏多视图捕获逆渲染

Patrick Noras, Jun Myeong Choi, Didier Stricker, Pieter Peers, Roni Sengupta

机构 * University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) College of William & Mary(威廉与玛丽学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对稀疏视图设置下基于高斯的逆渲染精度下降问题,提出GAINS两阶段逆渲染框架,利用基础模型先验稳定几何和材质估计,经实验验证其在提升材质参数精度等方面效果显著,尤其在稀疏视图下优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26599 2026-07-14 cs.CV 版本更新 57%

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

VGGRPO:迈向世界一致的视频生成的4D潜在奖励

Zhaochong An, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez-Franco, Marta Tintore Gazulla

机构 * Google(谷歌) University of Oxford(牛津大学) CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。

Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13840 2026-07-14 cs.CV 版本更新 57%

MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation

MoLingo:用于文本到运动生成的运动-语言对齐

Yannan He, Garvita Tiwari, Xiaohan Zhang, Pankaj Bora, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Imperial College London(伦敦帝国理工学院) Zuse School ELIZA(Zuse ELIZA 学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MoLingo模型,通过在连续潜在空间中去噪生成逼真的人体运动。研究如何构建语义对齐的潜在空间和最佳注入文本条件以提高运动真实性与描述一致性。

Comments Accepted by CVPR 2026. Project page: https://hynann.github.io/molingo/MoLingo.html. Title type fixed, content unchanged

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recogn. (CVPR), 2026, pp. 38387-38398

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11928 2026-07-13 astro-ph.IM cs.CV 版本更新 57%

AS-Bridge: A Bidirectional Generative Framework Bridging Next-Generation Astronomical Surveys

AS-Bridge:一种连接下一代天文学巡天的双向生成框架

Dichang Zhang, Yixuan Shao, Simon Birrer, Dimitris Samaras

机构 * Stony Brook University(石桥大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 AS-Bridge 通过双向生成模型连接 LSST 和 Euclid 巡天,实现跨巡天的联合分析,提升科学发现能力。

Comments Accepted at KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19480 2026-07-10 cs.CV 版本更新 57%

Deep Sprite-based Image Models: An Analysis

基于深度精灵的图像模型:一种分析

Zeynep Sonat Baltacı, Romain Loiseau, Mathieu Aubry

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM研究所、国家科学研究中心、巴黎理工大学、ENPC、巴黎理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文分析了基于精灵的图像分解模型,提出了一种深度方法,在CLEVR基准上与最新无监督类感知分割方法相当,线性扩展对象数量并明确识别对象类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 57%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05044 2026-07-09 cs.CV 版本更新 57%

Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation

通过密集轨迹生成实现几何感知单图像4D合成

Yanran Zhang, Ziyi Wang, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对单图像4D合成挑战,提出MoGe4D框架,通过密集轨迹生成实现几何感知合成。引入数据集,构建4D-STraG及4D-ViSM。实验证明该方法能生成高质量4D场景,具强时空连贯性和几何感知一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16041 2026-07-08 cs.CV 版本更新 57%

From Pixels to Portraits: A Comprehensive Survey of Talking Head Generation Techniques and Applications

从像素到肖像:会说话头像生成技术与应用的全面综述

Shreyank N Gowda, Dheeraj Pandey, Shashank Narayana Gowda

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 综述会说话头像生成技术,将文献分为四类方法并讨论其技术思想等。分析定量指标与感知质量差距,比较公开模型,研究新兴趋势,确定开放挑战,为从业者提供领域地图,突出相关技术和社会问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01220 2026-07-07 cs.CV 版本更新 57%

Visual Implicit Autoregressive Modeling

基于隐式平衡层的视觉隐式自回归建模

Pengfei Jiang, Jixiang Luo, Luxi Lin, Zhaohong Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VIAR模型,通过隐式平衡层和可调节的计算控制,在保持生成质量的同时降低内存和提升效率,优于现有自回归基线和扩散模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27422 2026-07-07 cs.CV 版本更新 57%

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

野外稀疏视角3D高斯点云生成

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) GenGenAI Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦斯州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。

Comments 16 pages, 16 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08029 2026-07-07 cs.LG cs.CV 版本更新 57%

CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space

CLARITY:用于通过在潜在空间中建模情境感知疾病轨迹来指导治疗决策的医学世界模型

Tianxingjian Ding, Yuanhao Zou, Chen Chen, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 CLARITY通过在潜在空间中建模时间间隔和患者特定数据,预测疾病演变轨迹,生成个性化治疗方案,并在医学领域实现最先进的治疗规划性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08982 2026-07-07 cs.CV 版本更新 57%

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

SVG-EAR:通过误差感知路由实现稀疏视频生成的无参数线性补偿

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器二次注意力成本瓶颈问题,提出SVG-EAR,利用语义聚类后块内键值相似性,通过质心近似跳过块,用误差感知路由计算需精确补偿块,提升质量效率权衡并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01878 2026-07-07 cs.CV 版本更新 57%

CTForensics: A Comprehensive Dataset and Method for AI-Generated CT Image Detection

CTForensics:用于人工智能生成的CT图像检测的综合数据集和方法

Yiheng Li, Zichang Tan, Guoqing Xu, Yichun Yeh, Yang Yang, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究中心) Sangfor Technologies Inc.(深信服技术有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对人工智能生成CT图像检测难题,介绍含75990张二维CT图像的CTForensics数据集及十种生成模型样本,提出ESF-CTFD框架,实验表明该框架性能优且抗干扰强。

Comments under review, repo: https://github.com/liyih/CTForensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00205 2026-07-07 eess.IV cs.AI cs.CV 版本更新 57%

Efficient Flow Matching for Sparse-View CT Reconstruction

用于稀疏视图CT重建的高效流匹配

Jiayang Shi, Lincen Yang, Zhong Li, Tristan van Leeuwen, Daniel M. Pelt, K. Joost Batenburg

机构 * Centrum Wiskunde en Informatica(数学与信息学研究中心) LIACS, Leiden University(莱顿大学LIACS) Great Bay University(大湾大学) Mathematical Institute, Utrecht University(乌得勒支大学数学研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究利用流匹配(FM)模型进行CT重建,因其确定性与数据一致性操作天然兼容。提出基于FM的CT重建框架及高效变体,通过重用预测速度场减少神经网络函数评估次数,提高推理效率,实验证明效果良好。

Journal ref MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 57%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20446 2026-07-07 cs.CV 版本更新 57%

Learning to Generate Human-Human-Object Interactions from Textual Descriptions

从文本描述中学习生成人与人-物体交互

Jeonghyeon Na, Sangwon Baik, Inhee Lee, Junyoung Lee, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出建模两人与物体共享交互相关性的问题,通过新数据集和数据合成方法,利用分数扩散模型训练文本到人和物体交互及人和人交互模型,构建统一框架,可扩展到多人交互场景。

Comments Project Page: https://tlb-miss.github.io/hhoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09423 2026-07-07 cs.CV 版本更新 57%

FunPhase: A Periodic Functional Autoencoder for Motion Generation via Phase Manifolds

FunPhase:通过相位流形进行运动生成的周期性功能自动编码器

Marco Pegoraro, Evan Atherton, Bruno Roy, Aliasghar Khani, Arianna Rampini

机构 * Autodesk Research(Autodesk研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究因空间几何与时间动态强耦合导致的自然人体运动学习难题。核心方法为引入FunPhase,用函数空间公式替代离散时间解码。主要贡献是统一运动预测与生成,泛化能力强,支持下游任务,重建误差低。

Comments Accepted at ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 57%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13546 2026-07-07 cs.CV 版本更新 57%

NABLA: Neighborhood Adaptive Block-Level Attention

$\nabla$NABLA:邻域自适应块级注意力

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。

Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19226 2026-07-03 cs.CV 版本更新 57%

Under One Sun: Multi-Object Generative Perception of Materials and Illumination

同一太阳下:材质与光照的多物体生成式感知

Nobuo Yoshii, Xinran Nicole Han, Ryo Kawahara, Todd Zickler, Ko Nishino

机构 * Kyoto University(京都大学) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MultiGP生成式逆渲染方法,利用同一场景物体共享光照的共识,从单张图像中随机采样反射率、纹理和光照,通过级联架构、协调调度、轴向注意力和纹理提取控制网络实现解耦。

Comments ECCV2026. Project page: https://vision.ist.i.kyoto-u.ac.jp/research/onesun/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10083 2026-07-03 cs.CV 版本更新 57%

A locally statistical active contour model for SAR image segmentation can be solved by denoising algorithms

一种可由去噪算法求解的局部统计活动轮廓模型用于SAR图像分割

Guangming Liu

机构 * Yantai Science and Technology Association(烟台科技协会)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于I散度-TV去噪模型的局部统计活动轮廓模型,融合GAC和ACWE模型,用于分割乘性伽马噪声图像,并通过反应扩散方程和ROF模型转化实现快速求解。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01896 2026-07-02 cs.CV 版本更新 57%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30552 2026-07-02 cs.RO cs.CV 版本更新 57%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19570 2026-07-02 cs.CV 版本更新 57%

RF-HiT: Rectified Flow Hierarchical Transformer for General Medical Image Segmentation

RF-HiT:校正流分层变换器用于通用医学图像分割

Ahmed Marouane Djouamaa, Abir Belaala, Abdellah Zakaria Sellam, Salah Eddine Bekhouche, Cosimo Distante, Abdenour Hadid

机构 * Computer Science department Mohamed Khider University Biskra, Algeria ISASI, CNR \& University of Salento 73100 Lecce, Italy AI University of the Basque Country (UPV/EHU), Spain Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RF-HiT通过整合hourglass变换器骨干和多尺度分层编码器,实现高效的医学图像分割,在保持精度的同时提升效率,达到91.27%的Dice系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13793 2026-07-02 cs.CV 版本更新 57%

From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation

从同步到序列:通过插值实现外视角到视角的视频生成

Mohammad Mahdi, Nedko Savov, Danda Pani Paudel, Luc Van Gool

机构 * 1 INSAIT, Sofia University “St. Kliment Ohridski”

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Syn2Seq-Forcing方法,通过插值生成连续信号解决外视角到视角视频生成中的时空和几何断点问题,提升扩散模型在跨视角视频合成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19122 2026-07-02 cs.CV 版本更新 57%

Revisiting Autoregressive Models for Generative Image Classification

重新审视自回归模型用于生成式图像分类

Ilia Sudakov, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex 研究)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过利用任意顺序自回归模型估计边缘化预测,解决了固定token顺序限制,使自回归生成分类器在性能上超越扩散模型,效率提升25倍。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06299 2026-07-02 eess.IV cs.CV cs.LG stat.AP 版本更新 57%

Explainability in mulimodal deep transformation models for stroke outcome prediction

多模态深度转换模型在卒中结局预测中的可解释性

Lisa Herzog, Jonas Brändli, Maurice Schneeberger, Loran Avci, Nordin Dari, Martin Hänsel, Hakim Baazaoui, Pascal Bühler, Susanne Wegener, Beate Sick

机构 * University Hospital Zurich, Department of Neurology(苏黎世大学医院神经内科) Zurich University of Applied Sciences, Institute of Data Analysis and Process Design (IDP)(苏黎世应用科学大学数据分析与流程设计研究所) University of Zurich, Epidemiology, Biostatistics and Prevention Institute (EBPI)(苏黎世大学流行病学、生物统计学与预防研究所) Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出多模态深度转换模型,结合统计方法和神经网络,通过改进Grad-CAM和Occlusion实现图像分支的可解释性,在卒中功能结局预测中达到AUC 0.81。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29303 2026-07-01 cs.CV 版本更新 57%

Occlusion-Robust Multi-Object Decoupling for Physics-Based Robotic Interaction

基于物理的机器人交互的遮挡鲁棒多对象解耦

Xin Dong, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种无掩码方法,从稀疏遮挡视角实现无损多对象3D重建,通过MPM模拟实现物理合理的机器人交互,核心是利用联合SDS过程结合扩散先验实现对象解耦。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新 57%

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏