arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-21 至 2026-08-21 共收录 70 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 1 篇

2608.19709 2026-08-21 cs.NI 新提交 50%

RFWM: Physics-Guided World Model for Dynamic Wireless Radiance Field Generation

RFWM:用于生成动态无线辐射场的物理引导世界模型

Zijiu Yang, Qianqian Yang

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究针对动态未知环境下RF场建模泛化难的问题,提出物理引导的RF世界模型RFWM,采用两阶段训练策略,在新构建的基准上实现了优于现有最优方法的RF场生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2608.20212 2026-08-21 cs.CV 新提交 70%

Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal

校正镜头:一种基于物理的视频眼镜去除方法

Radim Spetlik, David Futschik, Radek Danecek, Feitong Tan, Ziqian Bai, Rohit Pandey, Yinda Zhang

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出基于物理的迁移框架,将 Nano Banana 等模型知识迁移至 JFSnet,在 FFHQ 等数据集上实现高保真视频眼镜去除,性能优于扩散与 GAN 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-08-21 cs.RO 版本更新 50%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2608.20336 2026-08-21 cs.CV 新提交 83%

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

WithEveryone:面向群体图像生成的统一规划与身份定位

Hengyuan Xu, Qixun Wang, Yiji Cheng, Miles Yang, Zhao Zhong, Wei Cheng, Xingjun Ma, Yu-gang Jiang

机构 * Fudan University(复旦大学) Hunyuan, Tencent(腾讯混元) The University of Hong Kong(香港大学)

专题命中 个性化与一致性 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对多人物群体图像生成的身份保留难题,提出WithEveryone框架,通过布局定位身份损失等技术,提升了人脸相似度并降低伪影,实现高身份覆盖率与低重复率。

Comments Project Page: this http URL (http://doby-xu.github.io/WithEveryone/);Code will be released: this http URL (http://github.com/Doby-Xu/WithEveryone/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19719 2026-08-21 cs.CV cs.AI 新提交 79%

Scale-Separated Conditioning for Style-Encoder-Free Diffusion Stylization

用于无风格编码器的扩散风格化的尺度分离条件设置

Jingtao Zhang, Haorui Gao, Youqing Liang, Zeming Liu

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院) Courant Institute of Mathematical Sciences, New York University(纽约大学柯朗数学科学研究所) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无风格编码器的扩散风格化框架SEFS,通过单张图像低分辨率裁剪形成风格令牌,在未配对单张图像上训练,提升艺术风格化的内容一致性等性能,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 57%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 个性化与一致性 :inpainting(abstract);分类 cs.CV

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: this https URL (https://yigitekin.github.io/BeyondMasks/)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 4 篇

2608.20208 2026-08-21 cs.CV 新提交 57%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-21 cs.LG cs.CV 新提交 57%

Continuous Adversarial MeanFlow Transfer

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19906 2026-08-21 cs.LG 新提交 50%

PETA:Parameter-Efficient Test-Time Adaptation for Virtual Screening

PETA:用于虚拟筛选的参数高效测试时自适应方法

Jia-Qi Lin, Yinghua Yao, Chang-Dong Wang, Yew-Soon Ong, Yuangang Pan

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出参数高效测试时自适应框架PETA,仅更新预训练虚拟筛选模型约0.03%的LayerNorm参数,在测试时通过构建特定负样本等方式自适应,性能优于预训练及全重训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19209 2026-08-21 physics.comp-ph physics.chem-ph 新提交 50%

Physics-Informed Neural Networks as Fast Surrogate Models for Electrochemical Flow Reactors

用于电化学流动反应器快速替代模型的物理信息神经网络

Eric Fernández-García, Miguel Modestino, Sergio Maldonado

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出物理信息神经网络(PINN),将其作为电化学流动反应器的快速替代模型,经验证精度高、速度快,为低计算成本的数字孪生建模提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏