arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2607.05133 2026-07-07 cs.CV 新提交 57%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05056 2026-07-07 cs.CV 新提交 57%

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

一致且可编辑:文本引导视频编辑的平衡框架

Tao Jin, Li Xiao

机构 * USTC(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频编辑中时间一致性和可编辑性难以平衡的问题,提出EquiEdit框架。通过时间Mamba模块增强时间一致性,设计基于频谱变换的噪声注入策略提升可编辑性,实验证明该方法有效。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04553 2026-07-07 cs.MM cs.AI 新提交 57%

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

灯光、相机、碳:视频生成能耗的架构缩放定律

Nidhal Jegham, Boris Gamazaychikov, Sasha Luccioni

机构 * University of Rhode Island, Sustainable AI Group(罗德岛大学,可持续人工智能小组) Sustainable AI Group(可持续人工智能小组)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 提出双向框架,从架构原理和生成参数估算文本到视频等模型能耗。正向预测能耗,反向从推理时间恢复架构缩放行为,基于视频扩散模型性质证明能耗服从缩放定律,为模型可持续性基准测试提供框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03875 2026-07-07 cs.CV 新提交 57%

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization

MACRO:用于特写渲染优化的免训练多平面注意力

Nitzan Hodos, Roy Amoyal, Lior Fritz, Ianir Ideses, Sagie Benaim, Netalee Efrat

机构 * Amazon Prime Video(亚马逊Prime视频) Technion, Israel Institute of Technology(以色列理工学院) Ben Gurion University(本古里安大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对特写渲染难题,分析现有方法失败原因,提出MACRO,利用场景3D结构解决比例差距,无需架构改变和额外训练,贡献新基准和评估协议,取得领先成果。

Comments Project page: https://nitzanhod.github.io/MACRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02638 2026-07-07 cs.CV q-bio.QM 新提交 57%

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

CLABTOOLKIT:用于神经影像数据常规处理、操作和可视化的开源工具包

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann

机构 * Connectomics Lab, Department of Radiology, Lausanne University Hospital (CHUV)(洛桑大学医院(CHUV)放射科连接组学实验室) University of Lausanne (UNIL)(洛桑大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 神经影像研究面临数据结构多样、工具接口和格式不兼容问题。CLABTOOLKIT将相关操作整合为统一框架,核心数据结构可处理多种格式数据,还有多个模块支持多种分析及可视化,其配置系统方便定制工作流程。

Comments Presented at OHBM 2026 in Bordeaux, France. Submitted to Aperture Neuro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02596 2026-07-07 cs.CV cs.LG 新提交 57%

CIPHER: Causal Intervention Pathways for Healthcare Equity and Robustness

CIPHER:用于医疗公平性和稳健性的因果干预路径

Xinyu Jia, Weidong Guo, Wangyuan Zhao, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究医疗诊断深度学习模型在敏感亚组间表现差异问题,基于结构因果模型揭示敏感属性影响图像内容的四条路径,引入CIPHER框架干预因果路径,提升诊断准确性并减少差异。

Comments 8 pages, 2 figures. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交 57%

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02508 2026-07-03 cs.CV 新提交 57%

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

从SRA到Self-Flow:数据增强还是自监督?

Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过提出注意力分离方法,发现Self-Flow中双时间调度的性能提升主要源于噪声维度的数据增强,而非token间交互,并验证了该设计在ImageNet上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02045 2026-07-03 cs.CV 新提交 57%

PWM-ArtGen: Part World Model for Articulated Object Generation

PWM-ArtGen: 面向铰接物体生成的部分世界模型

Wentao Zheng, Ancong Wu

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(计算机科学与工程学院,中山大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出部分世界模型PWM-ArtGen,通过联合学习视觉动态和运动学参数,利用无标注数据协同训练,实现从单张图像生成铰接3D物体,在静止状态和零样本泛化上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01825 2026-07-03 cs.CV 新提交 57%

Rethinking Conditional Generation for Underwater Salient Object Detection

重新思考水下显著性目标检测的条件生成

Hua Li, Yongjie Weng, Yutong Li, Zhiyuan Li, Runmin Cong, Sam Kwong

机构 * School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) Key Laboratory of Machine Intelligence and System Control, Ministry of Education, Shandong University(山东大学机器智能与系统控制教育部重点实验室) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对水下图像低对比度、不均匀光照和颜色失真问题,提出退化感知条件生成网络(DCGNet),通过动态多粒度模块、水下物理先验模块和空间高斯模块,结合扩散变压器,显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01768 2026-07-03 cs.CV 新提交 57%

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation

JointHOI:联合生成接触图增强手物交互生成

Mingyeong Song, Jungbin Cho, Jisoo Kim, Ananya Bal, Kartik Sharma, Youngjae Yu, Laszlo A. Jeni, Junhyug Noh

机构 * Ewha Womans University(梨花女子大学) Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出单阶段扩散框架JointHOI,联合生成3D手物运动与距离接触图,通过接触引导采样提升时间稳定性和物理合理性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 57%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01555 2026-07-03 cs.CV 新提交 57%

Boosting Infrared Small Target Detection via Logit-Domain Contrast and Adaptive Shape Refinement

通过Logit域对比与自适应形状细化提升红外小目标检测

Handong Zeng, Zhengeng Yang, Shuai Zhang, Shikai Chen, Hongshan Yu

机构 * College of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对红外小目标检测中弱目标辨别难和边界模糊问题,提出AC-SLSIoU损失函数,通过Logit域边界约束增强弱目标辨别,自适应边界抑制细化轮廓,并引入假警报聚焦损失,无需额外推理开销即可提升检测精度与形状质量。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 57%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 57%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01176 2026-07-02 cs.CV 新提交 57%

High-dimensional Embedding Prior for Noisy K-space Domain MRIReconstruction

高维嵌入先验用于噪声k空间域MRI重建

Yu Guan, Tianjia Huang, Qinrong Cai, Qiuyun Fan, Dong Liang, Qiegen Liu

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Mathematics and Computer Science, Nanchang University(南昌大学数学与计算机科学学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Academy of Medical Engineering and Translational Medicine, Medical School, Faculty of Medicine, Tianjin University(天津大学医学部医学工程与转化医学研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对噪声k空间MRI重建,提出高维嵌入框架增强扩散模型表示能力,在多种噪声和欠采样条件下提升重建质量,尤其在高噪声场景效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00975 2026-07-02 cs.CV cs.AI 新提交 57%

TRCGL-Net: A Long-Tailed Multi-Label Chest X-Ray Classification Framework with Generative Data Augmentation and Label Co-Occurrence Modeling

TRCGL-Net:基于生成式数据增强和标签共现建模的长尾多标签胸部X光分类框架

Tong Shao, Hongshun Ling, Li Zhang, Jinjing Wu, Junke Wang, Yuan Gao, Fang Wang

机构 * School of Biomedical Engineering, South-Central Minzu University(中南民族大学生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对胸部X光多标签分类中的长尾分布问题,提出TRCGL-Net,利用可学习文本引导扩散模型生成尾部类样本、通道重加权和类别注意力机制增强特征,以及基于标签共现的图卷积网络建模类别关系,在PadChest数据集上尾部类mAP达0.4904。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00486 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

PAPA: Online Personalized Active Preference Alignment

PAPA:在线个性化主动偏好对齐

Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas, Muralikrishnan Gopalakrishnan Meena, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PAPA方法,无需参数化奖励模型,通过实时用户反馈直接优化扩散模型,实现高效的偏好对齐,并基于理论提出加速微调的EPAPA策略。

Comments Accepted to ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32033 2026-07-01 cs.CV 新提交 57%

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

SpheRoPE:基于球形RoPE的零样本无优化360度全景生成

Or Hirschorn, Aaron Olender, Eli Alshan, Ianir Ideses, Lior Fritz, Sagie Benaim

机构 * Amazon Prime Video(亚马逊Prime Video) Tel-Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出零样本、无训练、无优化的框架,通过向预训练扩散Transformer注入球形先验,直接生成360度全景图像和视频,无需微调或多步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31777 2026-07-01 cs.CV 新提交 57%

Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

Mesh BDF: 用于原生3D网格生成的重心支配场

Gaochao Song, Haohan Weng, Luo Zhang, Zibo Zhao, Shenghua Gao

机构 * HKU(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯混元3D) NTU(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出重心支配场(BDF),一种在三角网格表面上定义的连续表示,将顶点拓扑连接编码为连续信号,弥合离散网格拓扑与连续扩散生成模型之间的差距,使扩散模型能生成高质量、可扩展且鲁棒的原生网格。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31574 2026-07-01 cs.CV cs.AI cs.LG 新提交 57%

Temperature Field Reconstruction of Tungsten Monoblock Divertor on EAST using Physics-aware Neural Operator Transformer

基于物理感知神经算子Transformer的EAST钨单体偏滤器温度场重建

Zikang Yan, Xiao Wang, Qingquan Yang, Zhendong Yang, Gaoting Chen, Zehua Chen, Bo Jiang, Jin Tang, Guosheng Xu

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Institute of Plasma Physics, Chinese Academy of Sciences(中国科学院等离子体物理研究所) Tongling University(铜陵学院) College of Physics, Donghua University(东华大学物理学院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对偏滤器温度场实时重建需求,提出物理感知神经算子Transformer(PNOT),通过图注意力捕捉空间物理依赖、物理感知算子聚合相似物理条件点、梯度约束Sobolev正则化保持物理一致性,实现高精度快速重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交 57%

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31018 2026-07-01 cs.CV 新提交 57%

WarpI2I: Image Warping for Image-to-Image Translation

WarpI2I:用于图像到图像翻译的图像扭曲

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30968 2026-07-01 cs.CV 新提交 57%

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

PhotoQuilt: 通过引导式分块去噪实现无训练任意分辨率的光马赛克

Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Samsung Research(三星研究院) KITE Research Institute(KITE研究所) Queen’s University(女王大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhotoQuilt框架,通过引导式分块去噪过程,在无需训练的情况下生成任意分辨率的光马赛克,兼顾全局结构与局部细节,并避免二次注意力成本。

Comments 17 pages, 9 figures. Project page: https://kooroshrh.github.io/photo-quilt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30849 2026-07-01 cs.CV cs.SD eess.AS 新提交 57%

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

SyncCache: 利用非对称动力学实现快速音频驱动肖像动画

Juncheng Ma, Yuxuan Du, Yanan Sun, Zhening Xing, Changlin Li, Zhenyu Tang, Bo Li, Peng-Tao Jiang, Li Yuan, Daquan Zhou, Yonghong Tian

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shanghai AI Laboratory(上海人工智能实验室) Tencent Hunyuan(腾讯混元) vivo

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SyncCache,一种针对DiT肖像动画的无训练缓存加速方法,通过空间非对称探测和模态解耦缓存利用非对称动力学,实现高达4.12倍加速且保持视觉保真度和音频对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30807 2026-07-01 cs.RO cs.CR cs.CV 新提交 57%

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations

脱轨:利用违反安全的对抗扰动劫持生成式端到端驾驶规划器的评分头

Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对生成式端到端自动驾驶规划器中评分头的攻击面,提出Derail对抗框架,通过安全违规目标扰动使轨迹选择从安全候选翻转为不安全候选,评分下降39-80%,碰撞率高达50%。

Comments 23 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交 57%

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15305 2026-07-01 cs.CV 新提交 57%

CoMNet: A MedNeXt-CorrDiff Framework for Multi-Site Brain Tumor Segmentation

CoMNeT: 一种用于体积脑肿瘤分割的MedNeXt-CorrDiff框架

Michael L. Evans, MD Fayaz Bin Hossen, MD Shibly Sadique, Walia Farzana, Khan M. Iftekharuddin

机构 * Old Dominion University(欧道明大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMNeT框架,结合3D卷积分割模型MedNeXt与校正扩散后处理CorrDiff,通过集成学习提升胶质瘤分割精度,在UTSW-Glioma数据集上取得优于基线模型的Dice分数。

Comments 15 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27364 2026-06-26 cs.CV 新提交 57%

PhysiFormer: Learning to Simulate Mechanics in World Space

PhysiFormer: 在世界空间中学习模拟力学

Yiming Chen, Yushi Lan, Andrea Vedaldi

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。

Comments Project page: https://yimingc9.github.io/physiformer

详情

展开后加载摘要…

URL PDF HTML 收藏