arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 15 信号源:cs.CV, cs.GR, cs.MM

1. 其他图像生成 15 篇

2608.00562 2026-08-04 cs.CV 新提交 74%

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation

超越 token 级交叉熵:用于自回归图像生成的 Fréchet 分布后训练

Jinhua Zhang, Yisong Lin, Wei Long, Shuhang Gu

机构 * UESTC(电子科技大学)

专题命中 其他图像生成 :image generation(title);分类 cs.CV

AI总结 该研究针对自回归图像生成器预训练与评估的目标及上下文不匹配问题,提出 FD-loss 后训练方法,在 ImageNet 256×256 任务上大幅降低 FID 与 FD_r6,提升生成质量且无额外参数或推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03471 2026-08-05 cs.CV 新提交 57%

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Hi-Token:用于生成式视觉定位的分层坐标分词

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

专题命中 其他图像生成 :generative vision(abstract);分类 cs.CV

AI总结 该研究提出Hi-Token分层坐标分词方法,结合基于几何的Hi-GAR奖励,在生成式视觉定位任务中提升了多模型多基准的定位性能,优于强专用基线。

Comments 15 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28974 2026-08-03 cs.CV cs.AI 新提交 57%

RAID: Towards Robust AI-Generated Image Detection with Bit-Reversed Images

RAID:利用位反转图像实现鲁棒的AI生成图像检测

Renxi Cheng, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本研究提出RAID方法,通过位反转图像构建、梯度块选择与卷积分类器实现AI生成图像检测,在40多个基准上优于现有方法且速度快约100倍,还提供了理论分析与新数据集。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08434 2026-07-10 cs.CV 新提交 57%

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi Inc.(小米公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21304 2026-06-23 cs.CV 新提交 57%

A Test-time Actor-Critic Approach to News Images Generation

一种测试时的演员-评论家方法用于新闻图像生成

Damianos Galanopoulos, Vasileios Mezaris

机构 * Information Technologies Institute (ITI), Centre of Research and Technology Hellas (CERTH)(信息技术研究所(ITI),希腊研究与技术中心(CERTH))

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出ACIG方法,基于强化学习的Actor-Critic范式,在测试时通过反馈循环生成、评估和优化新闻图像提示,在MediaEval NewsImages 2026挑战中取得最佳结果。

Comments MediaEval 2026 Workshop, Amsterdam, NL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 57%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13625 2026-06-12 cs.CV 新提交 57%

Revisiting Vehicle Color Recognition in Long-Tailed Surveillance Scenarios

重新审视长尾监控场景中的车辆颜色识别

Vinícius Orrú, Bruno H. Foggiatto, Gabriel E. Lima, David Menotti, Rayson Laroca

机构 * Pontifical Catholic University of Paraná(巴拉那天主教大学) National High Court of Brazil(巴西国家高等法院) Federal University of Paraná(巴拉那联邦大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 针对监控场景中车辆颜色分布高度不平衡的问题,本文提出结合生成式数据增强、视觉表征、损失重加权等方法的综合方案,在UFPR-VeSV数据集上实现94.6%微平均和79.7%宏平均准确率,宏平均比近期文献提升8.2个百分点。

Comments Accepted for presentation at the 2026 International Conference on Pattern Recognition (ICPR) - V3SC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09400 2026-06-09 cs.CV 新提交 57%

vesselFM-CT: Segmenting All Blood Vessels in CT Images for System-Level Cardiovascular Analysis

vesselFM-CT:在CT图像中分割所有血管以实现系统级心血管分析

Bastian Wittmann, Chinmay Prabhakar, Suprosanna Shit, Bjoern Menze

机构 * Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出vesselFM-CT模型,通过迭代多步训练和TubeLoss损失函数,实现CT图像中从大血管到微小肠系膜血管的全分割,优于基线方法,支持系统级心血管分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09468 2026-08-11 cs.LG cs.AI 新提交 50%

MixFormer: Linear Transformer with Mixture of Memory Experts

MixFormer:带有记忆专家混合体的线性Transformer

Yu Guo, Lei Duan

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对现有线性Transformer主流方向状态空间模型的输入适应性与内存容量局限,论文提出带记忆专家混合体和时间感知线性注意力的MixFormer,在长序列生成任务上实现性能提升,为下一代网络基础设施提供更可持续的计算主干。

Comments 17 pages, 9 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03413 2026-08-05 cs.AI cs.ET 新提交 50%

Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems

能动人工智能:面向复杂系统的以决策为中心的架构

Zuojun Max Shen, Yuan Qu, Pujun Zhang, Anbang Liu, Yunhao Liang

专题命中 其他图像生成 :image generation(abstract)

AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02162 2026-08-04 cs.SE cs.AI cs.PL 新提交 50%

Lossless Tensor Compression as Program Synthesis

作为程序综合的无损张量压缩

Jieke Shi, Junda He, Wenjia Jiang, Weifeng Sun, Shidong Pan, Zhensu Sun, Chengran Yang, Peixin Zhang, Yifan Jia, Zhou Yang, Thong Hoang, Xiwei Xu, Zhenchang Xing, David Lo

专题命中 其他图像生成 :image generation(abstract)

AI总结 Brevis将无损张量压缩转化为程序综合,通过带类型的DSL与有界A*搜索优化压缩,在10类模型检查点上实现了超通用及专用压缩器的存储缩减,且压缩解压速度可观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20432 2026-07-24 cs.CL cs.PL 新提交 50%

Position: Natural Language Should Not Fully Replace Formal Languages

立场:自然语言不应完全取代形式语言

Eitan Wagner, Elisha Rosensweig, Omri Abend

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对自然语言能否完全取代形式语言的争议,引入基于“任务特异性”的形式框架并证明“特异性交叉定理”,通过跨模态案例分析表明二者各有优势,是互补工具,倡导开发混合系统。

Comments To be published in ICML 2026 (position track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15686 2026-07-20 cs.AI 新提交 50%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 其他图像生成 :image generation(abstract)

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00089 2026-07-02 cs.LG 新提交 50%

Representation as a Bottleneck for Mechanistic Interpretability: The Manifestation Unit Protocol

表征作为机械可解释性的瓶颈:Manifestation Unit 协议

Hussein Chouman, Wataru Sasaki, Tomokazu Matsui, Hirohiko Suwa, Keiichi Yasumoto

机构 * Ubiquitous Computing Systems Laboratory, Nara Institute of Science and Technology, Nara, Japan(奈良先端科学技术大学院大学普适计算系统实验室)

专题命中 其他图像生成 :generative vision(abstract)

AI总结 提出 Manifestation Unit 协议,将组件分析结果组织为结构化字段,通过混合检索实现可重用和可查询,在视觉和语言模型上验证了其优于非结构化基线,并揭示了核心字段。

Comments 65 pages. Interactive demos: https://manifestation-xai.github.io/manifestation-transformers/ , https://manifestation-xai.github.io/manifestation-cnn

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15338 2026-06-16 cs.RO 新提交 50%

SimWeaver: Zero-Shot RGB Sim-to-Real for Deformable Manipulation

SimWeaver:面向可变形操作的零样本RGB仿真到现实

Wenkang Hu, Haoran Wang, Yitong Li, Liu Liu, Mengao Zhao, Lai Jiang, Xincheng Tang, Junhang Wei, Zhengjie Shu, Zhendong Wang, Zhizhong Su, Huamin Wang, Ruigang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Horizon Robotics(地平线机器人) Style3D Research(Style3D研究院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 提出SimWeaver框架,通过200条仿真演示训练零样本RGB VLA策略,在5种可变形任务中达到91%平均真实成功率,无需遥操作或任务校准。

详情

展开后加载摘要…

URL PDF HTML 收藏