arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2289 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2289 篇

2607.07192 2026-07-09 cs.CV 新提交 57%

Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection

用于未知域目标检测的原型锚定广义流形回归

Zihao Zhang, Aming Wu, Yang Li, Yahong Han

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究单域广义目标检测,提出MR-DCoT方法,通过视觉-文本双思维链生成离群示例,利用类特定原型锚定学习校正算子,将未知域泛化建模为流形回归问题,实验验证了该方法在多场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07027 2026-07-09 cs.LG cs.AI cs.CV 新提交 57%

Latent graph encoding of multimodal neuroimaging features with generative AI architectures

基于生成式人工智能架构的多模态神经影像特征的潜在图编码

Ishaan Batta, Meenu Ajith, Vince Calhoun

机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。

Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04653 2026-07-09 cs.CV 新提交 57%

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

通过角色感知联合训练和模态解耦去噪增强视频物理一致性

Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对视频扩散模型长程物理一致性挑战,提出VPT微调框架。通过角色感知信号清晰建模不同物理角色,采用模态解耦去噪策略及损失权重衰减,引入跨步自动引导,增强物理动力学,提升物理一致性与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交 57%

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交 57%

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05850 2026-07-08 cs.CV 新提交 57%

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning

通过生成式随机化和跨变体自监督学习打破虚假相关性

Suraj Yadav, Anjaneya Sharma, Siddharth Yadav

机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对深度神经网络在分布转移时因利用虚假相关性而失败的问题,提出两阶段框架,先通过生成式干预分离前景对象并生成变体,再引入跨变体自监督学习,经微调后在多个基准测试中取得优异最差组性能。

Comments Accepted at CVPR Workshop 2026 GCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05733 2026-07-08 cs.CV 新提交 57%

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions

ARMS:用于无缝单人-社交运动转换的锚定关系运动流

Huakun Liu, Qing Yu, Kent Fujiwara, Hideaki Uchiyama, Kiyoshi Kiyokawa

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) LY Corporation(LY 公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在从文本生成连续且连贯的人类运动。提出ARMS框架,统一单人运动和人际互动,引入动态不对称表示,用因果关系扩散模型及关系门控实现。实验表明其提升了转换平滑度与社会连贯性,在互动基准测试中表现良好。

Comments Accepted by ECCV 2026. Project page: https://hkliu.com/arms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05352 2026-07-08 cs.CV cs.AI cs.LG 新提交 57%

Multiplayer Interactive World Models with Representation Autoencoders

基于表示自编码器的多智能体交互世界模型

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Alyx Liao, Amélie Royer, Manu Orsini, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

机构 * Epic Games École nationale des ponts et chaussées(法国国家桥梁与道路学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对复杂物理交互的高动态环境,该研究提出首个多智能体世界模型,以多智能体动作流为条件训练隐扩散模型,可实时生成稳定长时四智能体对局,开源相关资源。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05373 2026-07-07 cs.CV 新提交 57%

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

PixWorld:在像素空间中统一3D场景生成与重建

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

机构 * Nanyang Technological University(南洋理工大学) AISphere(人工智能领域)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。

Comments Project page: https://sensengao.github.io/PixWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05133 2026-07-07 cs.CV 新提交 57%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05056 2026-07-07 cs.CV 新提交 57%

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

一致且可编辑:文本引导视频编辑的平衡框架

Tao Jin, Li Xiao

机构 * USTC(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频编辑中时间一致性和可编辑性难以平衡的问题,提出EquiEdit框架。通过时间Mamba模块增强时间一致性,设计基于频谱变换的噪声注入策略提升可编辑性,实验证明该方法有效。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04553 2026-07-07 cs.MM cs.AI 新提交 57%

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

灯光、相机、碳:视频生成能耗的架构缩放定律

Nidhal Jegham, Boris Gamazaychikov, Sasha Luccioni

机构 * University of Rhode Island, Sustainable AI Group(罗德岛大学,可持续人工智能小组) Sustainable AI Group(可持续人工智能小组)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 提出双向框架,从架构原理和生成参数估算文本到视频等模型能耗。正向预测能耗,反向从推理时间恢复架构缩放行为,基于视频扩散模型性质证明能耗服从缩放定律,为模型可持续性基准测试提供框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03875 2026-07-07 cs.CV 新提交 57%

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization

MACRO:用于特写渲染优化的免训练多平面注意力

Nitzan Hodos, Roy Amoyal, Lior Fritz, Ianir Ideses, Sagie Benaim, Netalee Efrat

机构 * Amazon Prime Video(亚马逊Prime视频) Technion, Israel Institute of Technology(以色列理工学院) Ben Gurion University(本古里安大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对特写渲染难题,分析现有方法失败原因,提出MACRO,利用场景3D结构解决比例差距,无需架构改变和额外训练,贡献新基准和评估协议,取得领先成果。

Comments Project page: https://nitzanhod.github.io/MACRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02638 2026-07-07 cs.CV q-bio.QM 新提交 57%

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

CLABTOOLKIT:用于神经影像数据常规处理、操作和可视化的开源工具包

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann

机构 * Connectomics Lab, Department of Radiology, Lausanne University Hospital (CHUV)(洛桑大学医院(CHUV)放射科连接组学实验室) University of Lausanne (UNIL)(洛桑大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 神经影像研究面临数据结构多样、工具接口和格式不兼容问题。CLABTOOLKIT将相关操作整合为统一框架,核心数据结构可处理多种格式数据,还有多个模块支持多种分析及可视化,其配置系统方便定制工作流程。

Comments Presented at OHBM 2026 in Bordeaux, France. Submitted to Aperture Neuro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02596 2026-07-07 cs.CV cs.LG 新提交 57%

CIPHER: Causal Intervention Pathways for Healthcare Equity and Robustness

CIPHER:用于医疗公平性和稳健性的因果干预路径

Xinyu Jia, Weidong Guo, Wangyuan Zhao, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究医疗诊断深度学习模型在敏感亚组间表现差异问题,基于结构因果模型揭示敏感属性影响图像内容的四条路径,引入CIPHER框架干预因果路径,提升诊断准确性并减少差异。

Comments 8 pages, 2 figures. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交 57%

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02508 2026-07-03 cs.CV 新提交 57%

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

从SRA到Self-Flow:数据增强还是自监督?

Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过提出注意力分离方法,发现Self-Flow中双时间调度的性能提升主要源于噪声维度的数据增强,而非token间交互,并验证了该设计在ImageNet上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02045 2026-07-03 cs.CV 新提交 57%

PWM-ArtGen: Part World Model for Articulated Object Generation

PWM-ArtGen: 面向铰接物体生成的部分世界模型

Wentao Zheng, Ancong Wu

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(计算机科学与工程学院,中山大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出部分世界模型PWM-ArtGen,通过联合学习视觉动态和运动学参数,利用无标注数据协同训练,实现从单张图像生成铰接3D物体,在静止状态和零样本泛化上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01825 2026-07-03 cs.CV 新提交 57%

Rethinking Conditional Generation for Underwater Salient Object Detection

重新思考水下显著性目标检测的条件生成

Hua Li, Yongjie Weng, Yutong Li, Zhiyuan Li, Runmin Cong, Sam Kwong

机构 * School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) Key Laboratory of Machine Intelligence and System Control, Ministry of Education, Shandong University(山东大学机器智能与系统控制教育部重点实验室) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对水下图像低对比度、不均匀光照和颜色失真问题,提出退化感知条件生成网络(DCGNet),通过动态多粒度模块、水下物理先验模块和空间高斯模块,结合扩散变压器,显著提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01768 2026-07-03 cs.CV 新提交 57%

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation

JointHOI:联合生成接触图增强手物交互生成

Mingyeong Song, Jungbin Cho, Jisoo Kim, Ananya Bal, Kartik Sharma, Youngjae Yu, Laszlo A. Jeni, Junhyug Noh

机构 * Ewha Womans University(梨花女子大学) Yonsei University(延世大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出单阶段扩散框架JointHOI,联合生成3D手物运动与距离接触图,通过接触引导采样提升时间稳定性和物理合理性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 57%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01555 2026-07-03 cs.CV 新提交 57%

Boosting Infrared Small Target Detection via Logit-Domain Contrast and Adaptive Shape Refinement

通过Logit域对比与自适应形状细化提升红外小目标检测

Handong Zeng, Zhengeng Yang, Shuai Zhang, Shikai Chen, Hongshan Yu

机构 * College of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对红外小目标检测中弱目标辨别难和边界模糊问题,提出AC-SLSIoU损失函数,通过Logit域边界约束增强弱目标辨别,自适应边界抑制细化轮廓,并引入假警报聚焦损失,无需额外推理开销即可提升检测精度与形状质量。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00920 2026-07-03 cs.CV 新提交 57%

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

GMO-E$^2$DIT:面向电商图像的接地多操作编辑

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

机构 * Wuhan University(武汉大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 57%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01176 2026-07-02 cs.CV 新提交 57%

High-dimensional Embedding Prior for Noisy K-space Domain MRIReconstruction

高维嵌入先验用于噪声k空间域MRI重建

Yu Guan, Tianjia Huang, Qinrong Cai, Qiuyun Fan, Dong Liang, Qiegen Liu

机构 * School of Advanced Manufacturing, Nanchang University(南昌大学先进制造学院) School of Mathematics and Computer Science, Nanchang University(南昌大学数学与计算机科学学院) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Academy of Medical Engineering and Translational Medicine, Medical School, Faculty of Medicine, Tianjin University(天津大学医学部医学工程与转化医学研究院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对噪声k空间MRI重建,提出高维嵌入框架增强扩散模型表示能力,在多种噪声和欠采样条件下提升重建质量,尤其在高噪声场景效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00975 2026-07-02 cs.CV cs.AI 新提交 57%

TRCGL-Net: A Long-Tailed Multi-Label Chest X-Ray Classification Framework with Generative Data Augmentation and Label Co-Occurrence Modeling

TRCGL-Net:基于生成式数据增强和标签共现建模的长尾多标签胸部X光分类框架

Tong Shao, Hongshun Ling, Li Zhang, Jinjing Wu, Junke Wang, Yuan Gao, Fang Wang

机构 * School of Biomedical Engineering, South-Central Minzu University(中南民族大学生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对胸部X光多标签分类中的长尾分布问题,提出TRCGL-Net,利用可学习文本引导扩散模型生成尾部类样本、通道重加权和类别注意力机制增强特征,以及基于标签共现的图卷积网络建模类别关系,在PadChest数据集上尾部类mAP达0.4904。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00486 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

PAPA: Online Personalized Active Preference Alignment

PAPA:在线个性化主动偏好对齐

Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas, Muralikrishnan Gopalakrishnan Meena, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PAPA方法,无需参数化奖励模型,通过实时用户反馈直接优化扩散模型,实现高效的偏好对齐,并基于理论提出加速微调的EPAPA策略。

Comments Accepted to ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32033 2026-07-01 cs.CV 新提交 57%

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

SpheRoPE:基于球形RoPE的零样本无优化360度全景生成

Or Hirschorn, Aaron Olender, Eli Alshan, Ianir Ideses, Lior Fritz, Sagie Benaim

机构 * Amazon Prime Video(亚马逊Prime Video) Tel-Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出零样本、无训练、无优化的框架,通过向预训练扩散Transformer注入球形先验,直接生成360度全景图像和视频,无需微调或多步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31777 2026-07-01 cs.CV 新提交 57%

Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

Mesh BDF: 用于原生3D网格生成的重心支配场

Gaochao Song, Haohan Weng, Luo Zhang, Zibo Zhao, Shenghua Gao

机构 * HKU(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯混元3D) NTU(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出重心支配场(BDF),一种在三角网格表面上定义的连续表示,将顶点拓扑连接编码为连续信号,弥合离散网格拓扑与连续扩散生成模型之间的差距,使扩散模型能生成高质量、可扩展且鲁棒的原生网格。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏