arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3019 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 47 篇

2606.17557 2026-06-17 cs.CV 新提交 57%

Universal Image Restoration via Internalized Chain-of-Thought Reasoning

通过内化思维链推理的通用图像恢复

Yu Guo, Zhengru Fang, Shengfeng He, Senkang Hu, Yihang Tao, Phone Lin, Yuguang Fang

机构 * Hong Kong JC Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港城市大学智慧城市香港联合实验室及计算机科学系) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程学系)

专题命中 图像修复 :image editing(abstract);分类 cs.CV

AI总结 提出CoTIR框架,将思维链推理内化到单个预训练编辑模型中,通过可微拉格朗日优化实现混合退化下的通用图像恢复,在5.2M样本基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16396 2026-06-16 cs.CV eess.IV 新提交 57%

SP$^3$: Spherical Priors for Plug-and-Play Restoration

SP$^3$:用于即插即用恢复的球面先验

Sean Man, Ron Raphaeli, Matan Kleiner, Or Ronai

机构 * Technion – Israel Institute of Technology(以色列理工学院) Independent Researcher(独立研究员)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出SP$^3$算法,用球面编码器替代去噪器作为生成先验,通过半二次分裂实现快速图像恢复,速度比零样本扩散方法快3-630倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09516 2026-06-09 cs.CV 新提交 57%

SwiftVR: Real-Time One-Step Generative Video Restoration

SwiftVR:实时一步生成式视频恢复

Jiaqi Yan, Xiangyu Chen, Xinlin Zhong, Haibin Huang, Chi Zhang, Jie Liu, Jiantao Zhou, Xuelong Li

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出SwiftVR,一种流式一步生成式视频恢复框架,通过因果分块协议、无掩码移位窗口自注意力和轻量级恢复感知自编码器,在消费级GPU上实现实时高清视频恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07090 2026-06-08 cs.CV 新提交 57%

Detecting Temporally Localized Manipulations in Authentic Video Streams

检测真实视频流中的时间局部操纵

Okan Umur, Ali Emre Güşlü, Ibrahim Delibasoglu

机构 * Okan Umur Ali Emre Güşlü Ibrahim Delibasoglu

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对真实视频中插入短时逼真操纵片段难以检测的问题,提出新数据集并评估两种方法:基于DINOv3特征的线性探针和连续帧相似性方法,建立初步基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11572 2026-08-13 cs.LG physics.comp-ph 新提交 50%

RECAST: A Machine-Learning Framework for Correction and Super-Resolution of Coarse-Grid PDE Solvers

RECAST:用于粗网格PDE求解器校正与超分辨率的机器学习框架

Maryam Reza, Farbod Faraji

专题命中 图像修复 :diffusion(abstract)

AI总结 该研究提出机器学习框架RECAST,可在保留粗网格PDE演化的同时降低约50%-92%的时间平均相对误差,实现更粗网格的高精度PDE模拟,为高维数值模拟加速提供概念验证。

Comments 29 pages, 24 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 50%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 图像修复 :inpainting(abstract)

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27308 2026-07-31 cs.LG q-bio.NC 新提交 50%

ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution

ZUNA1.1:一种更灵活的用于去噪和超分辨率的脑电图(EEG)基础模型

Christopher Warner, Jonas Mago, JR Huml, Beren Millidge

机构 * Zyphra

专题命中 图像修复 :diffusion(abstract)

AI总结 研究推出3.8亿参数的EEG基础模型ZUNA1.1,其灵活性远超原模型ZUNA1,在EEG去噪与重建任务中性能达标且显著优于MNE包的球形样条插值,已以Apache 2.0许可开源发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25147 2026-07-29 cs.AI 新提交 50%

Inferring Missing Trajectory Data with Temporal Convolutional Networks

使用时间卷积网络推断缺失的轨迹数据

Ilinca Tiriblecea, Gabriel Turinici

机构 * CEREMADE, Université Paris Dauphine - PSL, CNRS(巴黎第九大学 - 巴黎文理研究大学、法国国家科学研究中心决策数学与经济实验室)

专题命中 图像修复 :inpainting(abstract)

AI总结 针对现实中轨迹数据常缺失的问题,提出用带对称扩张的时间卷积网络进行轨迹修复,放宽因果关系约束,利用组合损失训练,在含随机掩码片段的合成数据集上训练,取得良好的R²、MSE和MAE指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12571 2026-07-15 cs.RO 新提交 50%

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

TrustVLA:针对视觉-语言-动作后门的机制引导推理时防御

Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) D-Robotics(D-机器人公司) HUST(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图像修复 :inpainting(abstract)

AI总结 研究视觉-语言-动作模型中毒后门问题,通过两种攻击识别出紧凑因果足迹机制,基于此提出TrustVLA防御,能检测异常证据演变、定位支持并恢复观测,在多评估中降低攻击成功率且保持干净任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19161 2026-06-18 cs.RO 新提交 50%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14800 2026-06-16 stat.ME cs.LG eess.IV stat.ML 新提交 50%

Bridging data-driven priors via the score function for posterior sampling -- Comparative review and experimental study

通过得分函数桥接数据驱动先验进行后验采样——比较综述与实验研究

Elhadji Cisse Faye, Mame Diarra Fall, Sylvain Delchini, Nicolas Dobigeon

机构 * IDP, Univ Orléans(IDP,奥尔良大学) LITIS, Univ Rouen Normandie(LITIS,鲁昂-诺曼底大学) Bureau de Recherches Géologiques et Minières Orléans, France(奥尔良地质与矿业研究局,法国) IRIT, Univ Toulouse(图卢兹大学IRIT)

专题命中 图像修复 :inpainting(abstract)

AI总结 本文综述了贝叶斯逆问题中多种数据驱动先验如何通过得分函数统一,并展示其在采样算法中的有效集成,通过图像修复和超分辨率实验验证了方法的效率与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 73 篇

2607.07173 2026-07-09 cs.CV 新提交 90%

Stage-Aware Adaptation and Distribution Calibration for Subject-Driven Personalized Text-to-Image Generation

用于主题驱动的个性化文本到图像生成的阶段感知适应与分布校准

Wenyan Xu, Alizer Wong

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) ManXis(未知)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);personalized generation(abstract)

AI总结 研究主题驱动的个性化文本到图像生成问题,提出将其分解为训练端的 SPaRa 和推理端的 DCAL 两个互补组件的框架 SPaRa-DCAL,通过理论分析和实验表明该框架能提升相关指标,并指出应综合多方面评估个性化生成。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09244 2026-08-11 cs.CV 新提交 89%

In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation

用于高保真主体驱动文本到图像生成的耦合潜在噪声引导的循环内模型适配

Yushun Tang, Weiming Chen, Siyi Liu, Yi Zhang, Feng Wu, Zhihai He

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) Pengcheng Lab(鹏城实验室)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究针对主体驱动文本到图像生成中参考图像变化时模型难适配且难保持主体身份的问题,提出IMA方法,通过耦合潜在噪声损失引导循环内模型适配,提升了生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26171 2026-06-26 cs.CV cs.AI 新提交 85%

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

LCG: 基于稀疏关系注意力的一致长上下文图像生成

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出LCG框架,利用稀疏关系注意力(SRA)和路由一致性约束(RCC),在长序列图像生成中保持语义和外观一致性,并构建了大规模数据集LCCD进行训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11885 2026-07-14 cs.CV cs.GR 新提交 84%

Latent-Identity Tuning in Text-to-Image Personalization Models

文本到图像个性化模型中的潜在身份调整

Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 个性化与一致性 :text-to-image(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 研究文本到图像个性化模型中细粒度身份调整问题,利用预训练冻结编码器潜在空间,无需额外训练,通过揭示潜在语义方向实现局部、细粒度且语义连贯的面部编辑,经实验验证有效。

Comments Project page at: https://garibida.github.io/IdentityTuning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26742 2026-07-30 eess.AS cs.AI cs.SD 新提交 82%

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成

Carlos Muñoz-Romero, Jose A. Gonzalez-Lopez

专题命中 个性化与一致性 :diffusion(title,title_cn)

AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。

Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16866 2026-06-16 cs.CV 新提交 81%

Redirecting the Flow: Image Customization through Attention Distribution Shift

重定向流:通过注意力分布偏移实现图像定制

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 个性化与一致性 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出基于最大熵理论的Conditional Attention Distribution Shift方法,通过双分支架构CustomShift实现高效主题驱动图像生成,在DreamBooth和Custom101基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25622 2026-07-29 cs.CV 新提交 79%

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

超越面部一致性:具有整体身份保留的个性化人物图像生成

Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

机构 * Black Forest Labs(黑森林实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 研究个性化人物图像生成中面部保真度与外观一致性权衡问题,提出双分支基线及动态平衡缩放策略DBS,由自适应时间门控和区域感知优化组成,实验表明DBS比现有基线更好,为整体身份建模提供可控框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25390 2026-07-29 cs.CV 新提交 79%

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors

基于扩散先验的无噪声单步LoRA用于任务驱动的图像恢复

Jaeha Kim, Kyoung Mu Lee

机构 * Seoul National University(首尔国立大学) IPAI, Seoul National University(首尔国立大学IPAI)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对退化图像影响下游任务的问题,提出基于扩散先验的无噪声单步LoRA方法用于任务驱动的图像恢复,通过特定适配模块及新训练策略,经实验验证该方法在多任务上优于先前方法且具泛化能力。

Comments Code: https://github.com/JaehaKim97/NOLA-IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23673 2026-07-28 cs.CV 新提交 79%

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

用于多模态遥感图像生成的对比参数解缠

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) Unit 92728 of PLA(中国人民解放军92728部队)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10538 2026-07-14 cs.HC cs.CV cs.CY 新提交 79%

Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation

探索开源模型生态系统:艺术图像生成中创作者实践的实证研究

Yiluo Wei, Yupeng He, Qiming Ye, Gareth Tyson

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本文针对开源图像生成生态系统中创作者模型使用行为展开实证研究,构建含600万张图像及生成元数据的数据集,关联基础模型与LoRA模型使用情况,揭示其优劣势,公开数据集,为创作者和研究人员提供参考。

Comments Accepted to MM'26: The 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10165 2026-07-14 cs.CV cs.AI 新提交 79%

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

EmoStyle:用于情感图像生成的风格专家情感调节

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对情感感知艺术图像生成中训练与测试时属性不一致造成的控制差距问题,提出EmoStyle框架,利用语言模型推理器预测情感线索,编码情感字段指导生成,训练专用LoRA适配器结合风格表达情感,经视觉语言模型引导排序,在挑战赛中获佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06389 2026-07-08 cs.CV 新提交 79%

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration

FADRA:用于视频人脸识别的频率感知扩散与残差自适应

Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao

机构 * United Arab Emirates University (UAEU)(阿联酋大学) Ocean University of China (OUC)(中国海洋大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17619 2026-06-17 cs.CV 新提交 79%

RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation

RAVA: 检索增强的视角对齐用于主题驱动图像生成

Qiwei Yan, Zhiqiang Yuan, Chongyang Li, Jiapei Zhang, Ying Deng, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出RAVA框架,通过检索增强提供几何证据,解决跨主体视角对齐中的视角漂移和结构不匹配问题,在保持身份的同时实现可靠视角控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10617 2026-06-10 cs.CV 新提交 79%

SSR-Merge: Subspace Signal Routing for Training-Free LoRA Merging in Diffusion Models

SSR-Merge: 面向扩散模型中免训练的LoRA合并的子空间信号路由

Zhengxuan Wei, Yi Dong, Zonghui Li, Xianhui Lin, Xing Liu, Hong Gu, Shaofeng Zhang, Wenbin Li, Qi Fan

机构 * Stanford University(斯坦福大学)

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 提出子空间信号路由(SSR)方法,通过沿秩维度拼接LoRA构建统一子空间,利用逆相关矩阵去相关和方向引导矩阵分离信号,解决参数合并中的干扰问题,理论证明其等价于OLS最优解,并设计流式算法降低开销。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08446 2026-08-11 cs.AI 新提交 78%

TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation

TRACE-Memory:用于个性化生成的公共条件检索与效用感知证据接纳

Jing Wang, Zhu Wang, Yifan Guo, Yulong Yang, Yunji Liang

专题命中 个性化与一致性 :personalized generation(title,abstract)

AI总结 该研究针对个性化生成系统中记忆使用的效用问题,提出TRACE-Memory两阶段框架,经多阶段训练后在三类数据集的4500个任务上表现优于多种记忆使用方法,支持选择性个性化。

Comments 9 pages, 4 figures, and 6 tables. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25750 2026-07-29 cs.LG cs.CY 新提交 78%

Detecting CSAM Text-to-Image LoRAs From Weights

从权重中检测用于生成儿童性虐待材料的文本到图像的LoRA

David Demitri Africa, Cate Heine, Nadine Staes-Polet, Kimberly Mai

专题命中 个性化与一致性 :text-to-image(title);image generation(abstract)

AI总结 研究如何从权重中检测用于生成CSAM的文本到图像的LoRA,利用LoRA更新的左上角奇异向量形成的指纹$u_1$,以人类主体年龄为代理,发现其能识别训练内容、跨模型泛化且对良性内容不判断,可直接从权重筛选有害LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07533 2026-07-09 cs.RO 新提交 78%

Generating Personalized Lower-Limb Kinematics Across Walking Speeds Using Subject-Conditioned Diffusion

使用受主体条件约束的扩散生成跨步行速度的个性化下肢运动学

Diya Dinesh, Adrian Krieger, Changseob Song, Dongho Park, Aaron J. Young, Inseung Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 研究针对个性化外骨骼辅助需特定用户步态数据收集难的问题,提出受主体条件约束的残差扩散框架,能从单一已知速度步态序列生成未知速度下的个性化下肢运动学,减少数据收集负担,提升跨速度步态合成精度。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24119 2026-06-24 cs.LG cs.CL 新提交 78%

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

当Top-1失败时:为掩蔽扩散LM校准LoRA监控器

Lucky Verma, Pratik Yadav

机构 * Independent Researcher(独立研究员) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。

Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08460 2026-08-11 cs.CV 新提交 77%

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

InstructionCrafter:生成一致且高保真的视觉指令

Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui

机构 * University of Tsukuba(筑波大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于扩散的InstructionCrafter框架,通过空间冻结训练和两种适配器优化,实现了文本到分步视觉指令的生成,在多基准数据集上达成了最优性能且减少了噪声等问题,代码和模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏