arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 127 篇

2606.08375 2026-06-23 cs.LG 新提交 50%

Few-step Cofolding with All-Atom Flow Maps

少步全原子流图共折叠

Gianluca Scarpellini, Ron Shprints, Peter Holderrieth, Juno Nam, Pranav Murugan, Rafael Gómez-Bombarelli, Tommi Jaakkola, Maruan Al-Shedivat, Nicholas Matthew Boffi, Avishek Joey Bose

机构 * Genesis Molecular AI Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) Imperial College London(伦敦帝国学院) Mila

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出DeCAF框架,将全原子共折叠扩散模型蒸馏为流图,仅需几步推理即可生成高质量样本,并通过奖励引导搜索提升采样质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19377 2026-06-19 cs.LG cs.AI 新提交 50%

Emyx: Fast and efficient all-atom protein generation

Emyx: 快速高效的全原子蛋白质生成

Nicholas J. Williams, Ward Haddadin, Matteo P. Ferla, Constantin Schneider, Nicholas B. Woodall, Ruby Sedgwick, Christian D. Madsen, Andrew L. Hopkins, Edward O. Pyzer-Knapp

机构 * Xyme

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出Emyx,一种140M参数的流匹配模型,通过轻量条件表示和稀疏连接降低复杂度,在酶设计基准上超越现有方法,训练仅需682 GPU小时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14801 2026-06-16 cs.LG cs.AI cs.RO 新提交 50%

QPILOTS: Efficient Test-Time Q-Steering for Flow Policies

QPILOTS:面向流策略的高效测试时Q引导

Yifan Ruan, Chenyang Cao, Andreas Burger, Ali Pesaranghader, Kaveh Kamali, Jaehong Kim, Nandita Vijaykumar, Alan Aspuru-Guzik, Igor Gilitschenski, Nicholas Rhinehart

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) LG Electronics(LG电子)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出QPILOTS方法,在推理时通过投影去噪中间状态到最终动作估计并计算评论家梯度来引导流匹配和扩散策略,无需修改原策略,在离线到在线RL基准上达到90%平均成功率。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13992 2026-06-15 q-fin.MF q-fin.PR 新提交 50%

Group Quantization and Mellin Representations of the Heston Model

Heston模型的群量子化和Mellin表示

Santiago Garcia

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 通过构造Heston随机波动率模型的提升局部李群胚,给出其仿射变换结构的几何解释,并恢复特征函数和Riccati方程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12280 2026-06-15 cs.LG 新提交 50%

Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs

在8位权重和激活下保持FP8质量上限:Ideogram 4.0的INT8和GGUF后训练量化用于消费级GPU

Deep Gandhi, Ali Asaria, Tony Salomone

机构 * Transformer Lab

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文对Ideogram 4.0模型进行INT8 W8A8量化,在无FP8张量核心的Ampere GPU上达到FP8质量水平,并优于NF4,同时GGUF Q4_K在质量-内存前沿上成为帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12594 2026-06-12 cs.AI 新提交 50%

Pythagoras-Prover: Advancing Efficient Formal Proving via Augmented Lean Formalisation

Pythagoras-Prover: 通过增强型Lean形式化推进高效形式化证明

Joshua Ong Jun Leang, Zheng Zhao, Mihaela Cătălina Stoian, Qiyuan Xu, Haonan Li, Wenda Li, Shay B. Cohen, Eleonora Giunchiglia

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出Pythagoras-Prover系列,包括自回归和扩散模型,通过课程SFT、动态过滤和增强型Lean形式化(ALF)扩展验证数据,在MiniF2F-Test上以更少参数超越DeepSeek-Prover-V2。

Comments Pythagoras-Prover: Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11138 2026-06-10 cs.LG cs.NA math.NA 新提交 50%

First-Order Trajectory Matching: Fast Ensemble Predictions of Chaotic, Turbulent, Stochastic Systems

一阶轨迹匹配:混沌、湍流、随机系统的快速集成预测

Shreya Jha, Timo Schorlepp, Nicholas Geissler, Jules Berman, Benjamin Peherstorfer

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一阶轨迹匹配(FTM)方法,通过学习随机系统轨迹的一阶局部概率质量输运,实现低成本的集成预测,并捕捉通量、环流等轨迹量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11114 2026-06-10 cond-mat.mtrl-sci cond-mat.mes-hall 新提交 50%

Flower-like WO3-modified Vulcan carbon GDEs for photoelectro-Fenton process: Efficient ciprofloxacin degradation and mechanistic insights

花状WO3修饰Vulcan碳气体扩散电极用于光电Fenton过程:高效降解环丙沙星及机理研究

João Paulo C. Moura, Vanessa S. Antonin, Caio Machado Fernandes, Aline B. Trench, Erica S. Conrado, Michell O. Almeida, Kathia M. Honorio, Renata Colombo, Rafael Sotana, Ana M. P. Neto, Mauro C. Santos

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究制备了花状WO3修饰Vulcan碳气体扩散电极,在光电Fenton过程中高效降解环丙沙星,通过协同效应提升H2O2生成和污染物矿化,并揭示了降解机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07481 2026-06-08 cs.LG 新提交 50%

Drifting Models for Surrogate Flow Modeling

用于代理流建模的漂移模型

Chris R. Jung, Markus Dörr, Natalie Jüngling, Jennifer Niessner, Adam T. Müller, Nicolaj C. Stache

机构 * Center for Machine Learning (ZML)(机器学习中心(ZML)) Institute for Flow in Additively Manufactured Porous Structures (ISAPS)(添加剂制造多孔结构流动研究所(ISAPS)) Heilbronn University of Applied Sciences(海德堡应用科学大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出条件漂移框架,在VAE潜空间中进行漂移并利用标签感知掩码对齐边界条件,实现高质量单步生成,速度比迭代扩散快两个数量级。

Comments Accepted to the 2nd International Symposium AI and Fluid Mechanics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06789 2026-06-08 physics.plasm-ph 新提交 50%

Flow-Regulated Suprathermal Particle Acceleration in Weakly Collisional Astrophysical Plasmas

弱碰撞天体等离子体中的流调控超热粒子加速

Ji-Hoon Ha, Elena S. Volnova

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 利用一维Fokker-Planck框架研究弱碰撞等离子体中超热粒子群的形成,引入系统性速度空间漂移项描述流驱动的净能量化,发现速度空间扩散主导超热尾形成,而流漂移调控其效率和谱特性。

Comments 15 pages, 6 figures, Accepted for publication in JETP

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他图像生成 15 篇

2608.00562 2026-08-04 cs.CV 新提交 74%

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation

超越 token 级交叉熵:用于自回归图像生成的 Fréchet 分布后训练

Jinhua Zhang, Yisong Lin, Wei Long, Shuhang Gu

机构 * UESTC(电子科技大学)

专题命中 其他图像生成 :image generation(title);分类 cs.CV

AI总结 该研究针对自回归图像生成器预训练与评估的目标及上下文不匹配问题,提出 FD-loss 后训练方法,在 ImageNet 256×256 任务上大幅降低 FID 与 FD_r6,提升生成质量且无额外参数或推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28974 2026-08-03 cs.CV cs.AI 新提交 57%

RAID: Towards Robust AI-Generated Image Detection with Bit-Reversed Images

RAID:利用位反转图像实现鲁棒的AI生成图像检测

Renxi Cheng, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本研究提出RAID方法,通过位反转图像构建、梯度块选择与卷积分类器实现AI生成图像检测,在40多个基准上优于现有方法且速度快约100倍,还提供了理论分析与新数据集。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08434 2026-07-10 cs.CV 新提交 57%

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi Inc.(小米公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21304 2026-06-23 cs.CV 新提交 57%

A Test-time Actor-Critic Approach to News Images Generation

一种测试时的演员-评论家方法用于新闻图像生成

Damianos Galanopoulos, Vasileios Mezaris

机构 * Information Technologies Institute (ITI), Centre of Research and Technology Hellas (CERTH)(信息技术研究所(ITI),希腊研究与技术中心(CERTH))

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出ACIG方法,基于强化学习的Actor-Critic范式,在测试时通过反馈循环生成、评估和优化新闻图像提示,在MediaEval NewsImages 2026挑战中取得最佳结果。

Comments MediaEval 2026 Workshop, Amsterdam, NL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 57%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13625 2026-06-12 cs.CV 新提交 57%

Revisiting Vehicle Color Recognition in Long-Tailed Surveillance Scenarios

重新审视长尾监控场景中的车辆颜色识别

Vinícius Orrú, Bruno H. Foggiatto, Gabriel E. Lima, David Menotti, Rayson Laroca

机构 * Pontifical Catholic University of Paraná(巴拉那天主教大学) National High Court of Brazil(巴西国家高等法院) Federal University of Paraná(巴拉那联邦大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 针对监控场景中车辆颜色分布高度不平衡的问题,本文提出结合生成式数据增强、视觉表征、损失重加权等方法的综合方案,在UFPR-VeSV数据集上实现94.6%微平均和79.7%宏平均准确率,宏平均比近期文献提升8.2个百分点。

Comments Accepted for presentation at the 2026 International Conference on Pattern Recognition (ICPR) - V3SC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09400 2026-06-09 cs.CV 新提交 57%

vesselFM-CT: Segmenting All Blood Vessels in CT Images for System-Level Cardiovascular Analysis

vesselFM-CT:在CT图像中分割所有血管以实现系统级心血管分析

Bastian Wittmann, Chinmay Prabhakar, Suprosanna Shit, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出vesselFM-CT模型,通过迭代多步训练和TubeLoss损失函数,实现CT图像中从大血管到微小肠系膜血管的全分割,优于基线方法,支持系统级心血管分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16189 2026-08-18 cs.HC 新提交 50%

Artly: Exploring Digital Artists' Perceptions of AI-Generated Feedback

Artly:探索数字艺术家对AI生成反馈的看法

Ulvi Rajabli, Alexander Wiethoff, Zelun Tony Zhang

专题命中 其他图像生成 :image generation(abstract)

AI总结 本研究开发了结合个性化AI反馈与人类学习资源的Artly系统,通过被试间对比实验发现该系统受艺术家认可,能支持艺术成长,使用图像生成功能的用户创造力感知更强但新想法产出略低。

Journal ref Proceedings of the 14th Nordic Conference on Human-Computer Interaction (NordiCHI '26), October 03-07, 2026, Vaasa, Finland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09468 2026-08-11 cs.LG cs.AI 新提交 50%

MixFormer: Linear Transformer with Mixture of Memory Experts

MixFormer:带有记忆专家混合体的线性Transformer

Yu Guo, Lei Duan

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对现有线性Transformer主流方向状态空间模型的输入适应性与内存容量局限,论文提出带记忆专家混合体和时间感知线性注意力的MixFormer,在长序列生成任务上实现性能提升,为下一代网络基础设施提供更可持续的计算主干。

Comments 17 pages, 9 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03413 2026-08-05 cs.AI cs.ET 新提交 50%

Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems

能动人工智能:面向复杂系统的以决策为中心的架构

Zuojun Max Shen, Yuan Qu, Pujun Zhang, Anbang Liu, Yunhao Liang

专题命中 其他图像生成 :image generation(abstract)

AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02162 2026-08-04 cs.SE cs.AI cs.PL 新提交 50%

Lossless Tensor Compression as Program Synthesis

作为程序综合的无损张量压缩

Jieke Shi, Junda He, Wenjia Jiang, Weifeng Sun, Shidong Pan, Zhensu Sun, Chengran Yang, Peixin Zhang, Yifan Jia, Zhou Yang, Thong Hoang, Xiwei Xu, Zhenchang Xing, David Lo

专题命中 其他图像生成 :image generation(abstract)

AI总结 Brevis将无损张量压缩转化为程序综合,通过带类型的DSL与有界A*搜索优化压缩,在10类模型检查点上实现了超通用及专用压缩器的存储缩减,且压缩解压速度可观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20432 2026-07-24 cs.CL cs.PL 新提交 50%

Position: Natural Language Should Not Fully Replace Formal Languages

立场:自然语言不应完全取代形式语言

Eitan Wagner, Elisha Rosensweig, Omri Abend

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对自然语言能否完全取代形式语言的争议,引入基于“任务特异性”的形式框架并证明“特异性交叉定理”,通过跨模态案例分析表明二者各有优势,是互补工具,倡导开发混合系统。

Comments To be published in ICML 2026 (position track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15686 2026-07-20 cs.AI 新提交 50%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 其他图像生成 :image generation(abstract)

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00089 2026-07-02 cs.LG 新提交 50%

Representation as a Bottleneck for Mechanistic Interpretability: The Manifestation Unit Protocol

表征作为机械可解释性的瓶颈:Manifestation Unit 协议

Hussein Chouman, Wataru Sasaki, Tomokazu Matsui, Hirohiko Suwa, Keiichi Yasumoto

机构 * Ubiquitous Computing Systems Laboratory, Nara Institute of Science and Technology, Nara, Japan(奈良先端科学技术大学院大学普适计算系统实验室)

专题命中 其他图像生成 :generative vision(abstract)

AI总结 提出 Manifestation Unit 协议,将组件分析结果组织为结构化字段,通过混合检索实现可重用和可查询,在视觉和语言模型上验证了其优于非结构化基线,并揭示了核心字段。

Comments 65 pages. Interactive demos: https://manifestation-xai.github.io/manifestation-transformers/ , https://manifestation-xai.github.io/manifestation-cnn

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15338 2026-06-16 cs.RO 新提交 50%

SimWeaver: Zero-Shot RGB Sim-to-Real for Deformable Manipulation

SimWeaver:面向可变形操作的零样本RGB仿真到现实

Wenkang Hu, Haoran Wang, Yitong Li, Liu Liu, Mengao Zhao, Lai Jiang, Xincheng Tang, Junhang Wei, Zhengjie Shu, Zhendong Wang, Zhizhong Su, Huamin Wang, Ruigang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Horizon Robotics(地平线机器人) Style3D Research(Style3D研究院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 提出SimWeaver框架,通过200条仿真演示训练零样本RGB VLA策略,在5种可变形任务中达到91%平均真实成功率,无需遥操作或任务校准。

详情

展开后加载摘要…

URL PDF HTML 收藏