arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2607.14557 2026-07-17 cs.AI 新提交 57%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14521 2026-07-17 cs.CV 新提交 57%

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

Uni-AdaVD:通过正交值分解实现视觉生成的通用概念擦除

Qifan Zhou, Yuan Wang, Yanbin Hao, Xiang Wang, Kuien Liu, Richang Hong, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉生成模型吸收不良概念问题,提出Uni-AdaVD框架,将多模态注意力值空间作为干预空间,结合正交值分解与自适应擦除移位抑制目标语义方向,实验证明其在单多概念擦除且保留非目标先验方面性能强大,为视觉生成模型提供安全机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14165 2026-07-17 cs.SE cs.AI cs.AR cs.LG 新提交 57%

Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation

迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体

Dimple Vijay Kochar, Hae-Seung Lee, Anantha P. Chandrakasan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 57%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12042 2026-07-15 cs.CV cs.LG 新提交 57%

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31946 2026-07-15 cs.CV 版本更新 57%

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

世界叙事模型:从像素采样到物理世界编排的高度可控视频生成范式转变

Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujin Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出世界叙事模型(WNM),将视频生成解耦为结构化物理叙事与像素渲染,通过协同代理将多模态输入转化为可编辑的4D世界表示,驱动基础模型生成符合创作者意图的视频,大幅提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 57%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10678 2026-07-14 cs.AI 新提交 57%

Personalized Emotional Intelligence in Generative AI through Symbolic Affective Reasoning

通过符号情感推理实现生成式人工智能中的个性化情商

Qing Lin, Mengmi Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究旨在解决生成式人工智能中缺乏个性化情感理解等问题,提出EROS混合框架,结合符号推理与深度学习,利用大规模数据集发现情感规则等,通过可扩展记忆库实现个性化,实验表明其能有效引发目标情感反应并适应个体偏好,为相关AI系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10535 2026-07-14 cs.CV 新提交 57%

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10159 2026-07-14 cs.AI 新提交 57%

UNIT: Unleash Large Language Models Potential for Graph Continual Learning

UNIT:释放大语言模型在图连续学习中的潜力

Tairan Huang, Yili Wang, Beibei Hu, Yiting Shi, Qiutong Li, Changlong He, Jianliang Gao

机构 * Central South University(中南大学) Hongkong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hunan Institute of Engineering(湖南工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对图连续学习面临的语义-结构分离和知识转移不平衡问题,提出UNIT框架,通过微调大语言模型、引入不确定感知锚点生成机制和结构融合建模,提升模型适应性与跨任务知识保留能力,在图连续学习任务中达最优性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10388 2026-07-14 cond-mat.mtrl-sci cs.AI 新提交 57%

The evolution of AI from image interpretation toward scientific inference in nanoparticle electron microscopy

人工智能在纳米颗粒电子显微镜中从图像解释到科学推理的演变

Evropi Toulkeridou, Jiafei Li, Leonardo Lari, Panagiotis Grammatikopoulos

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 综述纳米颗粒电子显微镜中人工智能从图像解释到科学推理的演变,围绕颗粒表征挑战,回顾从传统机器学习到多种先进方法,探讨整合多方面数据,评估现有方法利弊,强调其在下一代纳米颗粒表征及加速材料发现中的作用。

Comments Main article: 34 pages, 8 figures (including Graphical Abstract), 5 tables. Appendix: 18 pages, 1 figure, 4 tables. This manuscript has been submitted (after invitation) to Advanced Intelligent Discovery for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13184 2026-07-14 cs.CV 57%

Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process

Triad: 通过视觉专家引导的视觉标记器和制造过程增强基于LMM的异常检测

Yuanze Li, Shihao Yuan, Haolin Wang, Qizhang Li, Ming Liu, Chen Xu, Guangming Shi, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Lab(鹏城实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Triad通过引入视觉专家引导的标记器和制造过程,提升基于LMM的工业异常检测性能。

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 21917-21926. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交 57%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交 57%

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 57%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05310 2026-07-07 cs.AI 新提交 57%

Evaluating and Understanding Model Editing for Medical Vision Language Models

医学视觉语言模型的模型编辑评估与理解

Guli Zhu, Chenwei Wu, Liyue Shen

机构 * EECS, University of Michigan(密歇根大学电子工程与计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对现有多模态编辑基准不适配临床需求的问题,提出临床基准M3Bench,测试多类编辑方法的性能短板,为医学VLM部署后安全适配提供支撑。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Code and benchmark are available at https://github.com/BioMed-AI-Lab-U-Michgan/M3Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交 57%

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02712 2026-07-07 cs.CV 新提交 57%

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

归一化物体坐标空间中用于生成视图合成的全局姿态控制

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

机构 * The Chinese University of Hong Kong(香港中文大学) Amazon(亚马逊)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 针对现有生成模型在目标视图全局控制上的不足,提出在归一化物体坐标空间中精确相机控制的新方法,以单张或少量无姿态图像为输入,将视图合成视为图像编辑问题,提升了视图生成质量和保真度。

Comments Accepted to ECCV 2026. Project page https://lizb6626.github.io/GlobalNVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00527 2026-07-07 cs.AI 新提交 57%

AI Native Games: A Survey and Roadmap

AI原生游戏:综述与路线图

Zhiyue Xu, Fandi Meng, Kaijie Xu, Clark Verbrugge, Simon Lucas, Jian Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所) School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) Game AI Research Group, Queen Mary University of London, London, United Kingdom(伦敦女王学院游戏人工智能研究组)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文定义AI原生游戏为运行时生成式AI构成核心循环的游戏,提出G/N分类法分析53个实例,指出核心设计问题是将语义开放性组织为稳定游戏玩法,并给出路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22999 2026-07-07 stat.ML cs.AI cs.LG 版本更新 57%

JADAI: Jointly Amortizing Adaptive Design and Bayesian Inference

JADAI:联合摊销自适应设计与贝叶斯推理

Niels Bracher, Lars Kühmichel, Desi R. Ivanova, Xavier Intes, Paul-Christian Bürkner, Stefan T. Radev

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) TU Dortmund University(多特蒙德技术大学) University of Oxford(牛津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对设计变量可优化以最大化信息增益的参数估计问题,引入JADAI框架,通过端到端训练策略、历史网络和推理网络联合摊销贝叶斯自适应设计与推理,在标准基准测试中性能优越。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交 57%

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 57%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00058 2026-07-02 cs.CV 新提交 57%

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

基于扩散的共生信息交互的联合医学图像增强与分割

Ying Chen, Jinyue Li, Qiankun Li

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Imperial Global Singapore, Imperial College London(伦敦帝国学院新加坡分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出DiSIINet,利用扩散模型和共生信息交互模块,在统一框架中实现图像增强与分割的相互促进,在多模态医学图像上取得显著性能提升。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06299 2026-07-02 eess.IV cs.CV cs.LG stat.AP 版本更新 57%

Explainability in mulimodal deep transformation models for stroke outcome prediction

多模态深度转换模型在卒中结局预测中的可解释性

Lisa Herzog, Jonas Brändli, Maurice Schneeberger, Loran Avci, Nordin Dari, Martin Hänsel, Hakim Baazaoui, Pascal Bühler, Susanne Wegener, Beate Sick

机构 * University Hospital Zurich, Department of Neurology(苏黎世大学医院神经内科) Zurich University of Applied Sciences, Institute of Data Analysis and Process Design (IDP)(苏黎世应用科学大学数据分析与流程设计研究所) University of Zurich, Epidemiology, Biostatistics and Prevention Institute (EBPI)(苏黎世大学流行病学、生物统计学与预防研究所) Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出多模态深度转换模型,结合统计方法和神经网络,通过改进Grad-CAM和Occlusion实现图像分支的可解释性,在卒中功能结局预测中达到AUC 0.81。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 57%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 57%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交 57%

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交 57%

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15917 2026-07-01 cs.CV 版本更新 57%

Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions

通过具有代理执行的自适应任务重构使图像编辑更易于实现

Bo Zhao, Kairui Guo, Runnan Du, Haiyang Sun, Pengshan Wang, Huan Yang, Kun Gai, Yixin Cao, Wei Ji

机构 * Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09731 2026-07-01 cs.DC cs.AI 版本更新 57%

SMART: When is it Actually Worth Expanding a Speculative Tree?

SMART: 在什么情况下扩展推测树实际上是有价值的?

Lifu Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理大学)

专题命中 多模态生成 :MLLM(abstract_cn);分类 cs.AI

AI总结 SMART系统通过运行时树构建优化,提升生成速度,通过边际效益-成本分析,在不同硬件和批量规模下实现平均20%的额外加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏