arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2512.12465 2025-12-16 cs.LG cs.AI 67%

Exploring the Design Space of Transition Matching

探索过渡匹配的设计空间

Uriel Singer, Yaron Lipman

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文研究了过渡匹配中头部模块的设计,发现MLP头部结合特定时间加权和高频采样器在生成质量、训练和推理效率上达到最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07219 2025-12-16 cs.CR 67%

Approximate Gaussian Mapping for Generative Image Steganography

近似高斯映射用于生成性图像隐写术

Yuhua Xu, Wei Sun, Chengpei Tang, Jiaxing Lu, Jingying Zhou, Chen Gu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本文提出近似高斯映射用于生成性图像隐写术,通过调节噪声尺度和方差嵌入秘密信息,并通过两阶段解耦优化策略提升鲁棒性和安全性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12048 2025-12-02 cs.AI cs.HC cs.LG 67%

A Survey on Bridging EEG Signals and Generative AI: From Image and Text to Beyond

关于将EEG信号与生成式AI连接的综述:从图像和文本到更广泛的领域

Shreya Shukla, Jose Torres, Akshaj Murhekar, Christina Liu, Abhijit Mishra, Jacek Gwizdka, Shounak Roychowdhury

机构 * School of Information, The University of Texas at Austin, Austin, TX, USA(信息学院,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

AI总结 本综述探讨了将EEG信号转化为图像、文本和音频的生成式AI方法,分析了当前技术趋势与挑战,为未来研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07682 2025-11-12 cs.HC cs.AI 67%

Designing and Evaluating Malinowski's Lens: An AI-Native Educational Game for Ethnographic Learning

Michael Hoffmann, Jophin John, Jan Fillies, Adrian Paschke

机构 * Leibniz Supercomputing Centre(莱比锡超算中心) Stanford University(斯坦福大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

Comments 21 pages, 8 figures. Full preprint version; shorter version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05177 2025-11-10 cs.LG 67%

Associative Poisoning to Generative Machine Learning

Mathias Lundteigen Mohus, Jingyue Li, Zhirong Yang

机构 * Norwegian University of Science and Technology, Department of Computer Science(挪威科学技术大学计算机科学系)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04650 2025-11-07 cs.LG cs.DC 67%

Revisiting Federated Fine-Tuning: A Single Communication Round is Enough for Foundation Models

Ziyao Wang, Bowei Tian, Yexiao He, Zheyu Shen, Guoheng Sun, Yuhan Liu, Luyang Liu, Meng Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学彭福分校) Queen Mary University of London(伦敦玛丽女王大学) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10776 2025-10-28 cs.CR cs.AI 67%

ME: Trigger Element Combination Backdoor Attack on Copyright Infringement

Feiyu Yang, Siyuan Liang, Aishan Liu, Dacheng Tao

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments Finding unfinished issue in this work , still refining

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20350 2025-10-27 cs.CY cs.AI 67%

What Do AI-Generated Images Want?

Amanda Wasielewski

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07207 2025-10-27 cs.LG cs.NE 67%

Scaling can lead to compositional generalization

Florian Redhardt, Yassir Akram, Simon Schug

机构 * ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

Comments NeurIPS 2025 (Spotlight); Code available at https://github.com/smonsays/scale-compositionality

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10679 2025-10-20 cs.CL cs.AI 67%

LinEAS: End-to-end Learning of Activation Steering with a Distributional Loss

Pau Rodriguez, Michal Klein, Eleonora Gualdoni, Valentino Maiorca, Arno Blaas, Luca Zappella, Marco Cuturi, Xavier Suau

机构 * Apple(苹果公司) Sapienza(拉维尼恩大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06664 2025-10-09 cs.CL 67%

ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory

Yunzhong Xiao, Yangmin Li, Hewei Wang, Yunlong Tang, Zora Zhiruo Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17537 2025-10-06 cs.LG cs.AI cs.CR 67%

Rethinking the Vulnerability of Concept Erasure and a New Method

Alex D. Richardson, Kaicheng Zhang, Lucas Beerens, Dongdong Chen

机构 * School of Mathematics University of Edinburgh(数学学院爱丁堡大学) School of Mathematical and Computer Science Heriot-Watt University(数学与计算机科学学院赫瑞斯大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22638 2025-09-29 cs.CL cs.AI cs.LG 67%

Language Models Can Learn from Verbal Feedback Without Scalar Rewards

Renjie Luo, Zichen Liu, Xiangyan Liu, Chao Du, Min Lin, Wenhu Chen, Wei Lu, Tianyu Pang

机构 * Sea AI Lab(海智实验室) SUTD(新加坡科技设计大学) NUS(国立大学) NTU(南洋理工大学) University of Waterloo(滑铁卢大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14738 2025-09-19 cs.CL 67%

UnifiedVisual: A Framework for Constructing Unified Vision-Language Datasets

Pengyu Wang, Shaojun Zhou, Chenkun Tan, Xinghao Wang, Wei Huang, Zhen Ye, Zhaowei Li, Botian Jiang, Dong Zhang, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract)

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19256 2025-09-16 cs.HC cs.CY 67%

WeDesign: Generative AI-Facilitated Community Consultations for Urban Public Space Design

Rashid Mushkani, Hugo Berard, Shin Koseki

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07029 2025-09-10 cs.CY cs.AI 67%

The Impact of Artificial Intelligence on Traditional Art Forms: A Disruption or Enhancement

Viswa Chaitanya Marella, Sai Teja Erukude, Suhasnadh Reddy Veluru

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22499 2025-07-31 cs.LG cs.AI 67%

LoReUn: Data Itself Implicitly Provides Cues to Improve Machine Unlearning

Xiang Li, Qianli Shen, Haonan Wang, Kenji Kawaguchi

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15873 2025-06-23 cs.HC 67%

DeckFlow: Iterative Specification on a Multimodal Generative Canvas

Gregory Croisdale, Emily Huang, John Joon Young Chung, Anhong Guo, Xu Wang, Austin Z. Henley, Cyrus Omar

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13031 2025-06-12 cs.AI 67%

MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO

Yicheng Xiao, Lin Song, Yukang Chen, Yingmin Luo, Yuxin Chen, Yukang Gan, Wei Huang, Xiu Li, Xiaojuan Qi, Ying Shan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments Code: https://github.com/TencentARC/MindOmni

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24015 2025-06-02 eess.IV 67%

Semantics-Guided Generative Image Compression

Cheng-Lin Wu, Hyomin Choi, Ivan V. Bajić

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments 6 pages, 4 figures, IEEE ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10078 2025-05-15 q-bio.NC 67%

Spurious reconstruction from brain activity

Ken Shirakawa, Yoshihiro Nagano, Misato Tanaka, Shuntaro C. Aoki, Kei Majima, Yusuke Muraki, Yukiyasu Kamitani

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10146 2025-05-09 cs.LG cs.AI 67%

GeoUni: A Unified Model for Generating Geometry Diagrams, Problems and Problem Solutions

Jo-Ku Cheng, Zeren Zhang, Ran Chen, Jingyang Deng, Ziran Qin, Jinwen Ma

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Electronic, Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01495 2025-05-08 cs.CL 67%

Re-ReST: Reflection-Reinforced Self-Training for Language Agents

Zi-Yi Dou, Cheng-Fu Yang, Xueqing Wu, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00029 2025-05-02 cs.CL cs.AI 67%

Keep the General, Inject the Specific: Structured Dialogue Fine-Tuning for Knowledge Injection without Catastrophic Forgetting

Yijie Hong, Xiaofei Yin, Xinzhong Wang, Yi Tu, Ya Guo, Sufeng Duan, Weiqiang Wang, Lingyong Fang, Depeng Wang, Huijia Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Security Lab, Ant Group(蚂蚁集团安全实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19419 2025-03-12 cs.CL 67%

KAHANI: Culturally-Nuanced Visual Storytelling Tool for Non-Western Cultures

Hamna, Deepthi Sudharsan, Agrima Seth, Ritvik Budhiraja, Deepika Khullar, Vyshak Jain, Kalika Bali, Aditya Vashistha, Sameer Segal

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05476 2025-02-18 cs.HC cs.AI cs.ET 67%

Artworks Reimagined: Exploring Human-AI Co-Creation through Body Prompting

Jonas Oppenlaender, Hannah Johnston, Johanna Silvennoinen, Helena Barranha

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09307 2025-02-14 cs.CL cs.AI 67%

When the LM misunderstood the human chuckled: Analyzing garden path effects in humans and language models

Samuel Joseph Amouyal, Aya Meltzer-Asscher, Jonathan Berant

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09284 2025-01-20 cs.AI cs.CR 67%

SEAL: Entangled White-box Watermarks on Low-Rank Adaptation

Giyeong Oh, Saejin Kim, Woohyun Cho, Sangkyu Lee, Jiwan Chung, Dokyung Song, Youngjae Yu

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract)

Comments Author name corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17308 2025-01-20 cs.LG math.ST stat.TH 67%

Consistent estimation of generative model representations in the data kernel perspective space

Aranyak Acharyya, Michael W. Trosset, Carey E. Priebe, Hayden S. Helm

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04265 2024-11-11 cs.AI 67%

FLIRT: Feedback Loop In-context Red Teaming

Ninareh Mehrabi, Palash Goyal, Christophe Dupuy, Qian Hu, Shalini Ghosh, Richard Zemel, Kai-Wei Chang, Aram Galstyan, Rahul Gupta

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏