arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2289 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2289 篇

2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 67%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract)

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26047 2026-07-29 cs.RO 新提交 67%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14984 2026-07-17 cs.AI 新提交 67%

Demographically-Conditioned Synthetic Medical Images for Bias Mitigation and Bias Detection in Disease Classifiers

用于减轻疾病分类器偏差和检测偏差的人口统计学条件合成医学图像

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gokhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院数据科学研究所) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院高级计算科学系) VITO(比利时弗拉芒技术研究所)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究医学图像分类器亚组公平性审计的样本量问题,提出用人口统计学条件合成生成器减轻训练偏差、检测评估偏差。以COVID-19胸部CT分类为例,发现其在偏差减轻和检测上的作用,如预训练效果好、能再现亚组排名等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10504 2026-07-14 cs.RO 新提交 67%

SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation

SUREFlow:用于鲁棒机器人操作的状态空间不确定性感知残差流匹配

Md Tanvir Islam, Sai Navaneet Peddapalli, Sangmoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆尚国立大学电子与电气工程学院)

专题命中 扩散模型 :diffusion(abstract);generative vision(abstract)

AI总结 研究针对机器人操作策略在复杂条件下的不稳定性问题,提出SUREFlow框架,基于Mamba主干联合预测动作速度与残差不确定性,能选择性细化动作维度,在LIBERO等平台实验中取得良好效果,提升了机器人操作的鲁棒性与效率。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots & Systems (IROS) 2026, Pittsburgh, PA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 67%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07101 2026-07-09 cs.RO cs.AI 新提交 67%

GeoProp: Grounding Robot State in Vision for Generalist Manipulation

GeoProp:将机器人状态在视觉中进行定位以实现通用操作

Guoyang Zhao, Quanhao Qian, Gongjie Zhang, Wenhao Li, Jiuniu Wang, Xiaowei Lu, Deli Zhao, Ran Xu

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究针对机器人操作中本体感觉与视觉缺乏有效对齐问题,提出轻量级GeoProp适配器,通过几何定位、特征采样及FiLM调制等使两者对齐,在多任务中提升策略性能,是具身策略的简单高效归纳偏差。

Comments 21 pages, 8 figures, 11 tables. Project page: https://alibaba-damo-academy.github.io/GeoProp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 67%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07665 2026-07-09 cs.LG cs.NA math.NA 新提交 67%

Guidance Breaks the Fitted Operator: A Terminal-Fitted Repair for Classifier-Free Guidance

引导打破拟合算子:无分类器引导的终端拟合修复

Shiheng Zhang

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究无分类器引导(CFG)在大引导时的问题,通过数值分析发现引导使判别子空间异常硬化致DDIM不再拟合。提出单系数零额外NFE修复方法,经实验验证该方法能稳定高引导,减少残差放大饱和,提升FID并保持精度,但也有其局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00047 2026-07-08 cs.MM cs.CV cs.GR 新提交 67%

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

眩晕眩晕:通过其预测性AI双重重建电影理想

Adam Cole, Mick Grierson

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。

Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 67%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24025 2026-06-24 cs.LG 新提交 67%

Information-Theoretic Classifier-Free Guidance with Adaptive Schedule Optimization

信息论分类器自由引导与自适应调度优化

Haobo Chen, Xiangxiang Xu, Yuheng Bu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Rochester(罗彻斯特大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 针对扩散模型中分类器自由引导(CFG)导致的多样性-覆盖权衡问题,提出基于信息论的CFG调度优化框架,通过清洁端点参考优化实际分布,在ImageNet-512和COCO上实现竞争性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23872 2026-06-24 cs.LG cs.AI 新提交 67%

MGI: Member vs Generated Inference

MGI:成员与生成推断

Bihe Zhao, Michel Meintz, Juangui Xu, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 针对生成模型输出与训练样本难以区分的问题,提出MGI任务,并设计数据断路器(DCB)方法,结合自编码器和潜在生成器的互补信号,有效区分训练成员与生成样本。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21960 2026-06-23 cs.LG 新提交 67%

A Standard Processing Pipeline for High-accuracy Measurement of Few-shot Regression on Laser Induced Breakdown Spectroscopy

激光诱导击穿光谱小样本回归高精度测量的标准处理流程

Hao Li

机构 * University of Arizona(亚利桑那大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 提出集成扩散去噪、注意力自编码器降维、组混洗数据增强和普通最小二乘回归的标准流程,在LIBS小样本回归中实现平均RMAE 0.2847,较基线提升37.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17090 2026-06-17 cs.PL cs.AI cs.MS 新提交 67%

ANEForge: Python for direct computation on the Apple Neural Engine

ANEForge: 用于直接在Apple Neural Engine上进行计算的Python工具

Spencer H. Bryngelson

机构 * School of Computational Science \& Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA -0.35cm George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, GA 30332, USA

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 ANEForge是一个Python包,通过编译惰性张量图直接编程Apple Neural Engine,无需CoreML,支持推理和训练,性能接近引擎硬件极限。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13191 2026-06-12 cs.LG 新提交 67%

The Geometry of Phase Transitions in Generative Dynamics via Projection Caustics

生成动力学中相变的几何:投影焦散视角

Ryosuke Sakamoto, Kotaro Sakamoto

机构 * Institute for the Advanced Study of Human Biology, Institute for Advanced Study, Kyoto University(京都大学高等研究院人类生物学高等研究所) Graduate School of Engineering, The University of Tokyo(东京大学大学院工学系研究科)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文通过投影焦散几何解释生成动力学中的相变行为,提出临界边界检测器(CBD)诊断分数方向不稳定性,定位模式承诺并支持敏感区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13929 2026-08-17 cs.CV cs.GR 新提交 62%

RGBX-Next: Towards Realistic Generative Rendering from G-Buffers

RGBX-Next:基于G-buffers的真实感生成式渲染

Zheng Zeng, Marco Salvi, Lifan Wu, Jan Novák, Daqi Lin, Saeed Hadadan, Yichen Sheng, Robert Pottorff, Shiqiu Liu, Ravi Ramamoorthi, Ling-Qi Yan, Miloš Hašan

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) NVIDIA(英伟达公司) University of California, San Diego(加利福尼亚大学圣迭戈分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出RGBX-Next框架,将扩散Transformer(DiT)微调为正向与反向渲染器,可从图像等估算G-buffers或从G-buffers渲染真实感内容,在相关任务中表现优异,将公开模型并推动领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09110 2026-08-11 cs.CV cs.GR 新提交 62%

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation

适用于视图一致的2D到3D生成的视图自适应渲染器

U-Chae Jun, Jaeeun Ko, Jiwoo Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对单目2D转3D生成的视图不一致与计算负担问题,提出视图自适应神经渲染框架,结合自注意力融合模块,在无扩散SDS监督下实现高效高保真3D重建,性能接近当前最优。

Journal ref Multimedia Systems, vol.32, pp. 511, Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01825 2026-08-04 cs.CV cs.AI cs.GR 新提交 62%

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

PartMat:基于单个全局隐变量的材质感知三维部件分解

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 该研究提出PartMat,一种用单个全局隐变量的材质感知三维部件分解流水线,可按材质边界分解物体,推理高效且分解准确率优于基线,几何质量相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22674 2026-07-28 cs.GR cs.CV cs.HC 新提交 62%

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: https://ruihangao.github.io/Text2TactileGraphics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19437 2026-07-23 eess.IV cs.CV cs.MM 新提交 62%

Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling

潜在组:通过掩码潜在生成建模实现极端比特率下的感知视频压缩

Shaokang Wang, Jinchang Xu, Peidong Jia, Zhijian Hao, Siyuan Qian, Fei Zhao, Rui Ma, Xiaozhu Ju, Jian Tang, Xiaodong Xie, Shanghang Zhang, Huizhu Jia

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国) State Key Discipline Laboratory of Wide Band-Gap Semiconductor Technology, School of Microelectronics, Xidian University, Xi'an, China(宽带隙半导体技术重点学科实验室,微电子学院,西安电子科技大学,西安,中国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对极低比特率视频压缩未充分探索的问题,提出统一生成框架,通过潜在组策略、深度压缩模块和统一潜在去噪模块,在极低比特率下实现高感知质量,有丰富空间细节和强大时间一致性,达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交 62%

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02798 2026-07-07 cs.CV cs.GR 新提交 62%

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究中心) Trinity College Dublin(都柏林三一学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。

Comments Project Page: https://phongnhhn.info/Unicamo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14721 2026-07-07 cs.GR cs.CV cs.RO 新提交 62%

DC-Motion: Decoupling Structure and Details via Discrete-Continuous Tokens for Human Motion Generation

DC-Motion: 通过离散-连续令牌解耦语义与细节以生成人体运动

Hequan Wang, Xuean Chen, Jiaxu Zhang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出DC-Motion框架,通过离散-连续VAE将运动分解为语义离散令牌和细节连续残差,结合掩码自回归模型和残差扩散模型,实现复杂文本指令下的高质量运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30673 2026-07-01 cs.GR cs.CV 新提交 62%

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

机构 * ZJU(浙江大学) Tencent(腾讯) THU(清华大学) CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-06-24 cs.CV cs.GR 新提交 62%

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: https://kim-youwang.github.io/FiCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23489 2026-06-23 cs.GR cs.CV 新提交 62%

MeshFlow: Mesh Generation with Equivariant Flow Matching

MeshFlow: 基于等变流匹配的网格生成

Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan, Qixing Huang, Alexander Rush, Leonidas Guibas, Gordon Wetzstein, Jing Liao, Guandao Yang

机构 * City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) The University of Texas, Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出MeshFlow,利用等变最优传输流匹配模型直接生成三角网格,避免序列化,通过改进扩散变压器架构实现等变性,推理速度提升约18倍。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22481 2026-06-23 cs.GR cs.CV 新提交 62%

Lighting-Consistent Object Transfer Across Radiance Fields

跨辐射场的一致光照物体迁移

Nicolás Violante, George Kopanas, Linus Franke, Julien Philip, George Drettakis

机构 * Inria Université Côte d’Azur(大学皮埃尔-皮埃尔·德·科蒂尔) Google DeepMind(谷歌DeepMind) Eyeline Labs(Eyeline实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对3D高斯泼溅中物体迁移时光照不一致的问题,提出一种扩散模型调和合成图像,结合合成、生成和真实数据训练,并通过后优化整合为3DGS表示,实现高质量物体迁移。

Comments Project page: https://repo-sam.inria.fr/nerphys/dot3d

Journal ref Computer Graphics Forum (EGSR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18243 2026-06-17 cs.CV cs.GR cs.RO 新提交 62%

MOCHI: Motion Enhancement of Collaborative Human-object Interactions

MOCHI: 协作人-物交互的运动增强

Jiye Lee, Yonghun Choi, Jungdam Won

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对多人-物交互数据中手物接触错位、运动抖动和手指细节缺失等问题,提出两阶段框架MOCHI,先通过优化生成物理合理的手部抓取,再基于扩散模型优化全身运动,有效增强噪声数据。

Comments SIGGRAPH 2026 Journal (ACM TOG); Project page: https://jiyewise.github.io/projects/MOCHI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13652 2026-06-12 cs.CV cs.GR 新提交 62%

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

世界追踪:超越可见表面的生成式像素对齐几何

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

机构 * World Labs University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出世界追踪(World Tracing),一种生成式像素对齐几何表示,通过扩散变压器预测有序点栈,同时重建可见表面和生成遮挡几何,在多个基准上超越深度预测和图像到3D方法。

Comments World Labs Technical Report; Page: https://haoz19.github.io/world-tracing-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交 61%

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(abstract,comments);分类 cs.CV

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏