arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2839 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 98 篇

2606.26907 2026-06-29 cs.CV 新提交 83%

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Qwen-Image-Agent:弥合真实世界图像生成中的上下文差距

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu

机构 * Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation(Qwen-Image-Agent:弥合现实世界图像生成中的上下文缺口)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Qwen-Image-Agent框架,通过上下文感知规划和上下文接地,整合规划、推理、搜索、记忆和反馈,弥合用户上下文与生成上下文之间的差距,在IA-Bench等基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24081 2026-06-24 cs.CR cs.AI 新提交 82%

PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

PixJail:面向文本到图像越狱评估的自演化论文到流水线复现

Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州)) East China Normal University(华东师范大学) Shanghai Qi Zhi Institute(上海启智研究院) Wuhan University(武汉大学) Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI) CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI)) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

AI总结 提出PixJail框架,通过自演化论文到流水线代理,自动构建攻击模块和可运行评估流水线,忠实复现原始实验结果,平均误差仅2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20991 2026-06-23 cs.ET cs.AI 新提交 82%

Text-to-Image Generative AI for Modeling and Simulation: Methods, Opportunities, and Applications

面向建模与仿真的文本到图像生成式人工智能:方法、机遇与应用

Philippe J. Giabbanelli

机构 * National Center for Collaboration in Medical Modeling & Simulation and Office of Enterprise Research & Innovation(医学建模与模拟协作国家中心和企业研究与创新办公室)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract)

AI总结 本教程介绍文本到图像生成技术如何支持建模与仿真的多个任务,包括概念模型沟通、仿真结果可视化、教育材料生成及多尺度仿真中的异构模型接口,并提供实用工作流。

Comments To appear at the 2026 Winter Simulation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-07-20 cs.CV cs.AI cs.LG cs.MM 新提交 81%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV、cs.MM

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11452 2026-08-13 cs.CV cs.AI 新提交 79%

TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation

TangPoetryBench:面向诗歌到图像生成的多维度基准与基于评分规则的评估器

Haoqi Hu, Tongji Luo, Li Zhang, Boning Zhou

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究推出TangPoetryBench多维度基准与PAE评估器,解决T2I模型生成诗歌插图的评估难题,PAE性能接近Claude且可泛化,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03357 2026-08-05 cs.CV 新提交 79%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00598 2026-08-04 cs.MM cs.CY 新提交 79%

EmergencyBias: Bias in Text-to-Image Models under Emergency Scenarios

EmergencyBias:文本到图像模型在应急场景下的偏差

Haibo Tang, Linqi Zhang, Hongxin Huan, Chenwei Lin, Xian Xu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.MM

AI总结 本文定义了T2I模型在应急场景下的EmergencyBias,构建评估框架发现其存在人口统计学与行为偏差,提出ActionAlign方法可减少行为差异并保留图像质量。

Comments 15 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 79%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24215 2026-07-28 cs.CV 新提交 79%

TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation

TreeAdapter:用于细粒度物种图像生成的分层分类法引导适配器组合

Yuze Sun, Zhongjie Duan, Yingda Chen

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 针对通用文本到图像模型在生成稀有生物物种图像时性能下降的问题,提出TreeAdapter框架,利用分层分类数据,通过在分类树节点附加轻量级适配器及两阶段训练范式,实现准确的细粒度图像生成,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08201 2026-07-10 cs.CV cs.AI 新提交 79%

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation

TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割

Hyeonseop Song, Seokhun Choi, Hoseok Do

机构 * LG Electronics(LG电子)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。

Comments Accepted to ECCV 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 79%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25297 2026-06-25 cs.CV 新提交 79%

Minimalist Preprocessing Approach for Image Synthesis Detection

图像合成检测的极简预处理方法

Hoai-Danh Vo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(胡志明市国立大学理科大学) Vietnam National University, Ho Chi Minh City(胡志明市国立大学)

专题命中 文生图 :image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 提出一种基于梯度计算相邻像素波动的轻量级预处理方法,作为高通滤波器突出关键特征,在低端设备上实现与先进技术相当的检测精度。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23669 2026-06-23 cs.CV 新提交 79%

GeoFidelity-Bench: Evaluating Segment-Level Geographic Fidelity in Text-to-Image Street-View Generation

GeoFidelity-Bench:评估文本到图像街景生成中的片段级地理保真度

Kaizhen Tan, Hanzhe Hong, Siru Tao

机构 * Heinz College of Information Systems and Public Policy(信息系统与公共政策学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出GeoFidelity-Bench基准,通过参考面板排名测试文本到图像模型能否生成特定道路片段而非通用城市街景,发现添加街道和社区名称可提升检索准确率,但目标与最近邻片段间相似度差距近乎为零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18555 2026-06-18 cs.CV 新提交 79%

Rethinking Text-to-Image as Semantic-Aware Data Augmentation for Indoor Scene Recognition

重新思考文本到图像作为室内场景识别的语义感知数据增强

Trong-Vu Hoang, Quang-Binh Nguyen, Dinh-Khoi Vo, Hoai-Danh Vo, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Vietnam(越南国立大学胡志明市理科大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国立大学胡志明市分校)

专题命中 文生图 :text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 针对室内图像数据不足,提出利用稳定扩散生成合成图像进行数据增强,并通过扩散重建误差防止滥用,在MIT室内场景数据集上验证了有效性。

Comments MAPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14657 2026-06-15 cs.CV 新提交 79%

HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities

HPSv3++:跨扩散模型能力全谱系扩展奖励模型

Yijun Liu, Jie Huang, Zeyue Xue, Yuming Li, Ruizhe He, Haoran Li, Shijia Ge, Siming Fu

机构 * Tsinghua University(清华大学) JD Explore Academy(京东探索研究院) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 文生图 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 提出HPSv3++奖励模型框架,通过双维度偏好数据集HPDv3++和两阶段训练(正交梯度投影+无监督引导),提升对各类T2I模型及RL迭代的偏好预测能力,在多个基准上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14351 2026-06-15 cs.CV 新提交 79%

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

ForceForget: 通过强化概念移除增强文本到图像模型的安全性

Dong Han, Yong Li

机构 * Dong Han(董汉) Yong Li(李勇)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 针对文本到图像模型生成不安全内容的问题,提出基于强化学习优化概念擦除奖励的方法,通过安全适配器调节文本嵌入,在消除不安全内容的同时保持模型对安全语义的生成能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00973 2026-08-04 cs.CL 新提交 78%

Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

关注差距:基于文本到图像系统中过滤器-生成器差异的零查询越狱攻击

Wanguang Li, Zhaoxin Wang, Handing Wang

专题命中 文生图 :text-to-image(title,abstract)

AI总结 该研究针对文本到图像系统的零查询越狱问题,提出基于过滤器-生成器差异的框架,通过筛选与集成进化搜索提升攻击成功率,在六个黑盒管线及商业服务上效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26566 2026-07-30 cs.DC cs.AI 新提交 78%

ServerlessT2I: Efficient Text-to-Image Workflow Serving on a Serverless Platform

ServerlessT2I:在无服务器平台上实现高效的文生图工作流服务

Xiaoxiao Jiang, Suyi Li, Sheng Yao, Tianyu Feng, Lingyun Yang, Dapeng Nie, Haoran Yang, Wei Wang

专题命中 文生图 :text-to-image(title,abstract)

AI总结 ServerlessT2I是将T2I工作流分解为独立模型函数的无服务器系统,通过优化调度与内存利用,在相同GPU预算下提升请求率2倍,固定请求率下节省GPU资源达3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18724 2026-07-22 cs.AI 新提交 78%

One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization

一劳永逸?用于文本到图像提示优化的类型感知修复分配

Haoyue Liu, Xiaoyu Ma, Ye Chen, Shuguang Cui, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) XJTU-POLIMI Joint School, Xi’an Jiaotong University(西安交通大学-米兰理工大学联合学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究文本到图像提示优化问题,提出将语义提示优化制定为原子修复分配的方法,在无需训练的TARA框架中实例化,实验表明该方法在多个基准生成器单元中语义准确性最佳,且运行快、图像质量好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07827 2026-07-10 cs.CR 新提交 78%

Open Models, Open Risks: Measuring Unsafe Generation in Text-to-Image Models In the Wild

开放模型,开放风险:衡量实际应用中的文本到图像模型的不安全生成

Peilin Han, Yang Liu, Yilong Yang, Jingchun Zhang, Teng Li, Jianfeng Ma, Zhuo Ma

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究实际应用中的文本到图像模型的不安全生成问题,通过越狱视角进行大规模实证研究。引入高级ASR改进指标,评估200多个模型,发现安全退化不普遍不均匀,识别出高风险模型并追溯其发布背景,向Hugging Face报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21498 2026-06-23 cs.AI cs.LG 新提交 78%

Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

平衡GRPO自回归文本到图像后训练中的性能与多样性

Yuanhao Chiang, Hongbo Duan, Chunru Yang, Jiahua Pei, Yi Liu, Xueqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09151 2026-06-09 cs.CR 新提交 78%

Customization under Fire: Plugin Poisoning in Text-to-Image Ecosystem

战火中的定制化:文本到图像生态系统中的插件投毒

Jiahao Chen, Xing He, Yong Yang, Xinfeng Li, Chunyi Zhou, Junhao Li, Zhe Ma, Tianyu Du, Shouling Ji

专题命中 文生图 :text-to-image(title,abstract)

AI总结 针对文本到图像生态系统中LoRA插件的供应链风险,提出PoisonLoRA方法,实现概念劫持和任务注入两种攻击,在多个数据集上达到近100%攻击成功率且难以被检测。

Comments Accepted to ACM CCS'26 Cycle 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11343 2026-08-13 cs.AI cs.CV cs.IR cs.LG 新提交 74%

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比

Archan Dutta, Vyanktesh Kanungo

机构 * Westcliff University(韦克利夫大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09803 2026-06-09 cs.CV cs.GR cs.LG 新提交 73%

Echo-Memory: A Controlled Study of Memory in Action World Models

Echo-Memory:动作世界模型中记忆的受控研究

Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 提出Echo-Memory框架,通过控制变量法研究动作条件世界模型中的记忆机制,发现原始上下文容量和块状状态空间递归对开放域返回任务至关重要。

Comments 9 figures and 28 pages, Code at \href{https://github.com/Echo-Team-Joy-Future-Academy-JD/Echo-Memory}{this URL}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13112 2026-08-14 cs.CV 新提交 70%

Towards Physics-Faithful Generation of Scientific Diagrams

面向物理保真的科学图表生成

Minghui Zhang, Jinxin Shi, Yifan Chang, Liangliang Zhao, Yuandong Pu, Qian Yu, Ming Hu, Hanxiao Zhang, Yun Gu, Yirong Chen, Yu Qiao, Bo Zhang, Xiangchao Yan, Bin Fu, Yihao Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对现有文本到图像生成模型生成的科学图表存在物理错误的问题,提出Princigram生成器,通过结构化物理思维链实现物理保真的科学图表生成,在相关基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05210 2026-08-07 cs.CV cs.AI cs.CR 新提交 70%

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) Hewlett Packard Enterprise(惠普企业)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。

Comments 16 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 70%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23271 2026-07-28 cs.CV cs.AI 新提交 70%

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

CLIP 所知道但无法表达的:从冻结的中间特征中恢复否定信息

Chen-Yi Lu, Yueh-Shao Chen, Somali Chaterji

机构 * Purdue University(普渡大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 对比视觉语言模型如CLIP对否定不敏感,研究发现是表征坍缩所致。提出轻量级事后校正系统PeakPatch,在不改变预训练权重下恢复否定信号,通过特定网络提取信号、预测偏差向量等,经实验验证其有效性及泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 70%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06839 2026-07-09 cs.LG cs.CV 新提交 70%

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2:释放人工智能的神经网络多样性

Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani, Usha Shrestha, Yash Mittal, Roman Kochnev, Pritam Kadam, Mohsin Ikram, Harsh R. Moradiya, Alice Arslanian, Dmitry Ignatov, Radu Timofte

机构 * University of Würzburg(维尔茨堡大学)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 LEMUR 2旨在释放神经网络多样性,通过统一生成、评估和部署管道,利用多种方式生成超14000个不同架构及大量训练记录,采用特定管道进行自动部署和延迟基准测试,涵盖多模态任务,为LLM微调提供数据基础,推动相关新兴范式发展。

Comments 10 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏