arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-06 至 2026-03-06 共收录 77 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2602.24290 2026-03-06 cs.CV 57%

UFO-4D: Unposed Feedforward 4D Reconstruction from Two Images

UFO-4D:从两幅图像中进行无约束前馈4D重建

Junhwa Hur, Charles Herrmann, Songyou Peng, Philipp Henzler, Zeyu Ma, Todd Zickler, Deqing Sun

机构 * Google(谷歌) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 UFO-4D通过统一的前馈框架,从两幅图像中高效重建密集4D表示,实现3D几何、运动和相机姿态的联合估计,提升4D重建精度与效率。

Comments ICLR 2026, Project page: https://ufo-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05080 2026-03-06 physics.geo-ph 50%

Quantifying Salt Precipitation During CO2 Injection: How Flow Rate, Temperature, and Phase State Control Near-Wellbore Crystallization

量化二氧化碳注入期间的盐沉淀:流速、温度和相态如何控制近井筒结晶

Karol M. Dąbrowski, Mohammad Nooraiepour, Mohammad Masoudi

专题命中 可控生成 :diffusion(abstract)

AI总结 研究通过微流体实验量化了二氧化碳注入过程中盐沉淀的控制因素,揭示了流速、温度和相态对近井筒结晶的影响,为地质储存模型提供了关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04880 2026-03-06 math.OC math.PR q-fin.MF 50%

A class of stochastic control problems with state constraints

一类具有状态约束的随机控制问题

Tiziano De Angelis, Erik Ekström

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一类具有状态约束的随机控制问题的概率解,通过线性控制保持过程在指定区域内并最小化二次成本。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 4 篇

2603.05507 2026-03-06 cs.CV cs.GR 82%

Transformer-Based Inpainting for Real-Time 3D Streaming in Sparse Multi-Camera Setups

基于Transformer的实时稀疏多摄像头设置下3D流媒体修复

Leif Van Holland, Domenic Zingsheim, Mana Takhsha, Hannah Dröge, Patrick Stotko, Markus Plack, Reinhard Klein

机构 * University of Bonn(波恩大学)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于Transformer的实时3D流媒体修复方法,通过多视图感知网络和自适应补丁选择策略,在稀疏多摄像头设置下实现高质量且快速的纹理修复。

Comments You can find the project page https://github.com/vc-bonn/transformer-based-inpainting

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00589 2026-03-06 cs.CV cs.AI 70%

AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution

AlignVAR: 向图像超分辨率的全局一致视觉自回归模型

Cencen Liu, Dongyang Zhang, Wen Yin, Jielei Wang, Tianyu Li, Ji Guo, Wenbo Jiang, Guoqing Wang, Guoming Lu

机构 * University of Electronic Science and Technology of China(电子科技大学) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous intelligence and trusted services 重点实验室)

专题命中 图像修复 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 AlignVAR 通过空间一致性自回归和层次一致性约束提升图像超分辨率的全局一致性与效率。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12670 2026-03-06 cs.CV 57%

TerraCodec: Compressing Optical Earth Observation Data

TerraCodec:压缩光学地球观测数据

Julen Costa-Watanabe, Isabelle Wittmann, Benedikt Blumenstiel, Konrad Schindler

机构 * IBM Research Europe(IBM欧洲研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 TerraCodec通过预训练的神经编码器实现高效压缩和云填充,提升地球观测数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00427 2026-03-06 math.OC 50%

Projected subgradient methods for paraconvex optimization: Application to robust low-rank matrix recovery

投影子梯度方法用于paraconvex优化:应用于鲁棒低秩矩阵恢复

Morteza Rahimi, Susan Ghaderi, Yves Moreau, Masoud Ahookhosh

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出了一种投影子梯度方法用于paraconvex优化,并将其应用于鲁棒低秩矩阵恢复问题,验证了方法的有效性。

Comments 38 pages, 69 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 4 篇

2603.04565 2026-03-06 cs.CV 83%

Structure-Guided Histopathology Synthesis via Dual-LoRA Diffusion

基于结构引导的组织病理学合成 via 双LoRA扩散

Xuan Xu, Prateek Prasanna

机构 * Stony Brook University(石溪大学)

专题命中 个性化与一致性 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出Dual-LoRA可控扩散框架,通过多类核质心和LoRA适配器实现局部结构修复与全局结构合成,提升组织病理学图像的真实感和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05183 2026-03-06 eess.IV 67%

Limited-Angle CT Reconstruction Using Multi-Volume Latent Consistency Model

有限角度CT重建使用多体积潜在一致性模型

Hinako Isogai, Naruki Murahashi, Mitsuhiro Nakamura, Megumi Nakao

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract)

AI总结 本研究提出多体积潜在扩散模型,用于有限角度CT重建,实现高精度图像生成和不同成像条件下的稳定性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03769 2026-03-06 cs.CV cs.AI cs.LG 57%

DMD-augmented Unpaired Neural Schrödinger Bridge for Ultra-Low Field MRI Enhancement

DMD增强的无配对神经施罗德桥用于超低场MRI增强

Youngmin Kim, Jaeyun Shin, Jeongchan Kim, Taehoon Lee, Jaemin Kim, Peter Hsu, Jelle Veraart, Jong Chul Ye

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) NYU Langone Health(纽约大学朗格one健康)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于DMD增强的无配对神经施罗德桥方法,用于提升超低场MRI图像质量,通过结合分布匹配与解剖结构保持正则化器,实现现实感与结构保真的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL 50%

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

专题命中 个性化与一致性 :personalized generation(abstract)

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 5 篇

2603.05503 2026-03-06 cs.CV 57%

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

通过校准稀疏注意力加速文本到视频生成

Shai Yehezkel, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar

机构 * Apple Tel Aviv University(苹果以色列大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CalibAtt通过校准稀疏注意力提升文本到视频生成的效率,实现1.58倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01776 2026-03-06 cs.CL cs.AI cs.CV 57%

FreeAct: Freeing Activations for LLM Quantization

FreeAct: 为LLM量化释放激活

Xiaohao Liu, Xiaobo Xia, Manyi Zhang, Ji-Fu Li, Xianzhi Yu, Fei Shen, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Huawei Technology(华为技术有限公司) Central South University(中央南大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FreeAct通过放松静态转换约束,为LLM量化提供动态适应的激活转换方法,实现性能提升5.3%。

Comments 26 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05589 2026-03-06 cs.CV cs.AI cs.LG 57%

ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation

ReactDance: 基于分层表示的高保真且一致的长形式反应舞蹈生成

Jingzhong Lin, Xinru Li, Yuanyuan Qi, Bohao Zhang, Wenxiang Liu, Kecheng Tang, Wenxuan Huang, Xiangfeng Xu, Bangyan Li, Changbo Wang, Gaoqi He

机构 * East China Normal University(东华师范大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReactDance通过分层潜在空间和非自回归采样策略,提升长形式反应舞蹈生成的高保真度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00425 2026-03-06 cs.MA cs.RO 50%

Conflict-Based Search as a Protocol: A Multi-Agent Motion Planning Protocol for Heterogeneous Agents, Solvers, and Independent Tasks

基于冲突的搜索作为协议:一种多智能体运动规划协议用于异构智能体、求解器和独立任务

Rishi Veerapaneni, Alvin Tang, Haodong He, Sophia Zhao, Viraj Shah, Yidai Cen, Ziteng Ji, Gabriel Olin, Jon Arrizabalaga, Yorai Shaoul, Jiaoyang Li, Maxim Likhachev

机构 * Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) UC Berkeley(伯克利大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于冲突的搜索协议,用于异构智能体的多智能体运动规划,利用多种单智能体规划算法实现无碰撞路径规划。

Comments Published at ICRA 2026, Project webpage: https://rishi-v.github.io/CBS-Protocol/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04535 2026-03-06 astro-ph.IM astro-ph.CO cs.LG 50%

A Fast Generative Framework for High-dimensional Posterior Sampling: Application to CMB Delensing

一种快速生成框架用于高维后验采样:应用于宇宙微波背景去棱镜化

Hadi Sotoudeh, Pablo Lemos, Laurence Perreault-Levasseur

机构 * Department of Physics, Université de Montréal(蒙特利尔大学物理系) Mila - Quebec AI Institute(魁北克人工智能研究院) Ciela, Montreal Institute for Astrophysics and Machine Learning(蒙特利尔天体物理与机器学习研究所) Center for Computational Astrophysics, Flatiron Institute(Flatiron研究所计算天文学中心)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种快速生成框架,用于高维后验采样,应用于宇宙微波背景去棱镜化问题,实现了比扩散方法快一个数量级的采样速度,并成功恢复了未棱镜化的宇宙微波背景功率谱。

Comments 12 pages, 4 figures. ML4Astro 2025 workshop paper on fast generative posterior sampling with application to CMB delensing

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他图像生成 1 篇

2603.04980 2026-03-06 cs.CV 57%

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

一种通过 vanilla next-token 预测统一理解、生成和编辑的简单基线

Jie Zhu, Hanghang Ma, Jia Wang, Yayong Guan, Yanbing Zeng, Lishuai Gao, Junqiang Wu, Jie Hu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education, China(高可信软件技术重点实验室(北京大学),教育部,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出 Wallaroo,一种通过 vanilla next-token 预测统一多模态理解、生成和编辑的简单基线模型,展示了其在多任务中的竞争力。

Comments Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing

详情

展开后加载摘要…

URL PDF HTML 收藏