arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2956 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 326 篇

2607.08879 2026-07-13 cs.CV 新提交 57%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交 57%

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 57%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05310 2026-07-07 cs.AI 新提交 57%

Evaluating and Understanding Model Editing for Medical Vision Language Models

医学视觉语言模型的模型编辑评估与理解

Guli Zhu, Chenwei Wu, Liyue Shen

机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交 57%

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02712 2026-07-07 cs.CV 新提交 57%

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

归一化物体坐标空间中用于生成视图合成的全局姿态控制

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon(亚马逊)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。

Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00527 2026-07-07 cs.AI 新提交 57%

AI Native Games: A Survey and Roadmap

AI原生游戏:综述与路线图

Zhiyue Xu, Fandi Meng, Kaijie Xu, Clark Verbrugge, Simon Lucas, Jian Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) Game AI Research Group, Queen Mary University of London, London, United Kingdom(伦敦女王学院游戏人工智能研究组)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文定义AI原生游戏为运行时生成式AI构成核心循环的游戏,提出G/N分类法分析53个实例,指出核心设计问题是将语义开放性组织为稳定游戏玩法,并给出路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交 57%

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00058 2026-07-02 cs.CV 新提交 57%

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

基于扩散的共生信息交互的联合医学图像增强与分割

Ying Chen, Jinyue Li, Qiankun Li

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Imperial Global Singapore, Imperial College London(伦敦帝国学院新加坡分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出DiSIINet,利用扩散模型和共生信息交互模块,在统一框架中实现图像增强与分割的相互促进,在多模态医学图像上取得显著性能提升。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 57%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 57%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交 57%

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交 57%

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27766 2026-06-29 cs.LG cs.AI cs.RO 新提交 57%

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

RS-Diffuser: 基于分布价值引导的风险敏感扩散规划

Shiqiang Gong

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出RS-Diffuser,一种结合扩散轨迹生成与分布价值评论家的风险敏感离线规划框架,通过尾部感知目标引导去噪过程,实现灵活的风险偏好行为,在风险敏感D4RL和机器人导航基准上达到最优性能。

Comments ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26551 2026-06-29 cs.CV 新提交 57%

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

PhyEditBench: 一个用于物理感知图像编辑的真实世界多阶段基准

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

机构 * Nanjing University(南京大学) SDU(山东大学) HRBEU(哈尔滨工程大学) SDUTCM(山东中医药大学) USTC(中国科学技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出PhyEditBench基准,通过分层分类和真实/反物理实例评估编辑模型的物理理解能力,并引入训练无关基线PhyWorld利用视频生成推理。

Comments 19 pages, 6 figures, 2 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27123 2026-06-26 cs.RO cs.CV 新提交 57%

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation

基于提议条件的闭环交通场景生成潜扩散模型

Shubham Vaijanath Phoolari, Aleyna Kara, Christoph Lauer, Steven Peters

机构 * CARIAD SE Technical University of Munich(慕尼黑工业大学) Institute of Automotive Engineering (FZD), TU Darmstadt(达姆施塔特工业大学汽车工程研究所(FZD))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出一种基于实例场景上下文和多模态提议先验的扩散框架,通过紧凑动作潜表示和提议初始化提升采样效率,实现闭环交通场景的逼真、安全且可控生成。

Comments Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26874 2026-06-26 cs.AI 新提交 57%

TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation

TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础

Zhixiang Lu, Xiwei Liu, Sifan Song, Changkai Ji, Anh Nguyen, Jionglong Su, Imran Razzak, Jinfeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学) University of Liverpool(利物浦大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25592 2026-06-25 cs.CV 新提交 57%

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

VPA-Guard:防御与基准测试图像到视频生成中的视觉提示攻击

Yining Sun, Haoyu Kang, Jiajun Wu, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

机构 * Tsinghua University(清华大学) Central South University(中南大学) South China Normal University(华南师范大学) ByteDance Inc.(字节跳动公司) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出首个针对图像到视频生成中视觉提示攻击的系统基准VVA-Bench,并设计检索增强自进化防御框架VPA-Guard,平均降低攻击成功率44.2%和危害评分73.4%。

Comments Dataset Page: https://huggingface.co/datasets/CSU-JPG/VVA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24441 2026-06-24 cs.CV 新提交 57%

S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing

S1-Omni-Image:面向科学图像理解、生成与编辑的统一模型

Qingxiao Li, Zikai Wang, Qingli Wang, Nan Xu

机构 * XScience Lab(XScience实验室) Wenge AI(文阁人工智能)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出S1-Omni-Image,基于S1-VL-32B和“先思考后生成”范式,统一实现科学图像的理解、生成与编辑,在多个基准上达到领先性能。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24313 2026-06-24 cs.AI 新提交 57%

Prob-BBDM: a Probabilistic Brownian Bridge Diffusion Model for MRI sequence image-to-image translation

Prob-BBDM:用于MRI序列图像到图像翻译的概率布朗桥扩散模型

Martin Valls, Pascal Bourdon, Christine Fernandez-Maloigne, Guillaume Herpe, David Helbert

机构 * University of Poitiers, CNRS, XLIM, France(波尔多大学,法国国家科学研究中心,XLIM,法国) University of Poitiers, CNRS, Laboratory of Applied Mathematics, France(波尔多大学,法国国家科学研究中心,应用数学实验室,法国) Poitiers University Hospital(波尔多大学医院) I3M common laboratory CNRS-Siemens Healthinners, Poitiers University Hospital and University of Poitiers, France(I3M共同实验室,法国国家科学研究中心-西门子医疗,波尔多大学医院和波尔多大学,法国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 提出基于概率布朗桥扩散模型(Prob-BBDM)的MRI序列图像翻译方法,通过变分编码器引导扩散机制,在BraTS 2021数据集上实现高效高质量合成,仅需4步扩散,SSIM达88.46%,PSNR达26.09 dB。

Journal ref Computerized Medical Imaging and Graphics, 2026, 130, pp.102745

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24081 2026-06-24 cs.CR cs.AI 新提交 57%

PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation

PixJail:面向文本到图像越狱评估的自演化论文到流水线复现

Leyi Sheng, Han Sun, Zhen Sun, Yuntao Yue, Jinlin Wu, Xinlei He, Jiaheng Wei

机构 * The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州)) East China Normal University(华东师范大学) Shanghai Qi Zhi Institute(上海启智研究院) Wuhan University(武汉大学) Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI) CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI)) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出PixJail框架,通过自演化论文到流水线代理,自动构建攻击模块和可运行评估流水线,忠实复现原始实验结果,平均误差仅2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23391 2026-06-23 cs.LG cs.AI 新提交 57%

Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting

分布感知的扩散-大语言模型用于鲁棒的超长期时间序列预测

Falguni Ghosh, Vahid Hashemi, Bernhard Kainz

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) Imperial College London(伦敦帝国学院) AUDI AG(奥迪股份公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出Diffusion-LLM框架,将条件扩散模型集成到基于LLM的预测流程中,学习未来数据条件分布并改善语义对齐,在超长期和少样本预测中显著优于现有LLM基线。

Comments 18 pages, 6 figures, 8 tables. Accepted at 35th International Conference on Artificial Neural Networks (ICANN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23270 2026-06-23 cs.CV 新提交 57%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20689 2026-06-23 cs.CV cs.LG 新提交 57%

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation

NeoJaundice-AI: 基于智能手机的新生儿黄疸检测,采用双输入深度学习与合成增强

Rahul Patel, Nirjala Jarpula

机构 * Indian Institute of Information Technology Surat(印度信息技术学院苏拉特分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出NeoJaundice-AI系统,通过双分支EfficientNet-B0处理皮肤和巩膜图像,融合手工YCbCr颜色特征,实现四类严重度分类和胆红素回归,采用合成黄疸生成和肤色归一化,在印度新生儿数据集上达到91.8%准确率。

Comments 7 pages, 10 figures, 8 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18591 2026-06-18 cs.CV 新提交 57%

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops

桥接创意意图与视觉质量:基于创作者驱动的循环视频生成与代理反馈循环

Denis Savytski, Aiden Lei, Heding Liu, Warren Yang, Sihan Liang, Alexander Liu, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校) The Harker School(哈克学校) Basis Independent Silicon Valley(硅谷贝斯独立学校) Saratoga High(萨拉托加高中)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CHIEF框架,通过人类-AI协作的迭代视频精炼,结合创作者驱动和代理主观反馈,提升长视频的叙事连贯性与创意方向。

Comments Accepted to the Workshop on Human-AI Co-Creativity at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17742 2026-06-17 cs.CV q-bio.NC 新提交 57%

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics

BrainWorld:一种用于全脑4D fMRI动力学的结构先验条件生成模型

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Xuanye Pan, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainWorld模型,利用结构MRI作为解剖先验条件,通过去噪过程生成全脑4D fMRI动态,在22个数据集上稳定生成400帧轨迹,并通过生成样本增强提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17675 2026-06-17 cs.CV 新提交 57%

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation

我们真的需要扩散吗?用于配对医学图像翻译的快速U-Net

Alicia Pirwass, Birte Glimm, Michael Munz, Hans-Joachim Wilke

机构 * Institute of Artificial Intelligence, Ulm University(乌尔姆大学人工智能研究所) Institute of Orthopaedic Research and Biomechanics, Centre for Trauma Research, University Hospital Ulm(乌尔姆大学医院创伤研究中心骨科研究与生物力学研究所) AI for Sensor Data Analytics Research Group, Ulm University of Applied Sciences(乌尔姆应用科学大学传感器数据分析人工智能研究组)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文比较轻量级4级U-Net与去噪扩散概率模型(DDPM)在从T2加权MRI估计脂肪分数任务上的性能,发现U-Net在精度和速度上均优于DDPM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 57%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16449 2026-06-17 cs.CV 新提交 57%

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

PermaVid: 通过解耦上下文记忆实现编辑下的一致视频生成

Shuai Yang, Bingjie Gao, Ziwei Liu, Jiaqi Wang, Dahua Lin, Tong Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出PermaVid框架,利用解耦为语义外观和几何结构的上下文记忆,结合编辑感知更新策略,实现编辑操作后视频的长期一致生成。

Comments Project page: https://ys-imtech.github.io/projects/PermaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16496 2026-06-16 cs.CL cs.LG 新提交 57%

REFLEX: Reflective Evolution from LLM Experience

REFLEX: 基于大语言模型经验的反思进化

Pan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出REFLEX框架,通过解耦视觉诊断与代码生成实现可审计的高效策略进化,在控制任务和天线阵列合成中展现优异样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏