arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2403.10853 2026-04-01 cs.LG cs.AI cs.CV 62%

GenOL: Generating Diverse Examples for Name-only Online Learning

GenOL:为名称-only在线学习生成多样化示例

Minhyuk Seo, Seongwon Cho, Minjae Lee, Diganta Misra, Hyeonbeom Choi, Seon Joo Kim, Jonghyun Choi

机构 * KU Leuven(鲁汶大学) Seoul National University(首尔大学) ELLIS(欧洲学习与智能系统实验室) MPI-IS Tübingen(马克斯·普朗克智能系统研究所图宾根) Yonsei University(延世大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对在线学习中数据分布偏移问题,提出GenOL框架,通过生成模型提升名称-only训练中图像的内在和跨模型多样性,优于传统监督和网络监督方法。

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO 62%

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 62%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00141 2026-03-27 cs.CV cs.AI cs.LG eess.IV 62%

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

从尺度到速度:面向图像编辑的自适应测试时间缩放

Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AMAP, Alibaba Group(阿里巴巴集团高德地图) University of Queensland(昆士兰大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 62%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI 62%

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04317 2026-03-24 cs.CV cs.CL 62%

WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AI

WiFi-GEN:利用生成式人工智能进行高分辨率室内成像

Jianyang Shi, Bowen Zhang, Amartansh Dubey, Ross Murch, Liwen Jing

机构 * Pengcheng Laboratory(鹏城实验室) College of Big Data and Internet(大数据与互联网学院) Shenzhen Technology University(深圳技术大学) Department of Electrical Engineering(电子工程系) Indian Institute of Technology Delhi(印度理工学院德里分校) Department of Electronic and Computer Engineering(电子与计算机工程系) HKUST(香港科技大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出WiFi-GEN,通过生成式人工智能将测量到的WiFi功率转换为高分辨率室内图像,其形状重建精度比物理模型方法高275%,且Frechet Inception Distance得分降低82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 62%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18896 2026-03-20 cs.CV cs.AI 62%

Translating MRI to PET through Conditional Diffusion Models with Enhanced Pathology Awareness

通过增强病理意识的条件扩散模型将MRI翻译为PET

Yitong Li, Igor Yakushev, Dennis M. Hedderich, Christian Wachinger

机构 * Lab for Artificial Intelligence in Medical Imaging, Institute for Diagnostic and Interventional Radiology, School of Medicine and Health, TUM Klinikum, Technical University of Munich (TUM)(人工智能医学成像实验室,诊断与介入放射学研究所,医学院与健康学院,TUM医院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Nuclear Medicine, School of Medicine and Health(核医学系,医学院与健康学院) Department of Neuroradiology, School of Medicine and Health(神经放射学系,医学院与健康学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PASTA框架,利用条件扩散模型生成高质量3D PET图像,通过双臂架构和多模态条件整合提升结构与病理细节的保留,使合成PET在阿尔茨海默病诊断中性能优于MRI,接近真实PET。

Comments Accepted by Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14837 2026-03-18 cs.CV cs.AI 62%

Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction

改进的图表到代码生成的迭代细化方法:基于结构化指令

Chengzhi Xu, Yuyang Wang, Lai Wei, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学) MIFA Lab(MIFA实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18328 2026-03-17 cs.CV cs.AI 62%

Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code

通过填补任意量化代码实现脑部MRI的虚拟全栈扫描

Yicheng Wu, Tao Song, Zhonghua Wu, Jin Ye, Zongyuan Ge, Wenjia Bai, Zhaolin Chen, Jianfei Cai

专题命中 多模态生成 :any-to-any(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CodeBrain框架,通过区域级全栈代码预测解决MRI模态缺失问题,提升数据完整性和临床实用性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14207 2026-03-17 cs.CV cs.AI 62%

DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution

DualTSR:统一的双扩散变压器用于场景文本图像超分辨率

Axi Niu, Kang Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DualTSR通过统一的双扩散目标解决文本图像超分辨率中的文本先验依赖和复杂架构问题,采用单多模态Transformer骨干网络,实现视觉与文本信息的交互,提升超分辨率效果与文本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14041 2026-03-16 cs.CV cs.AI 62%

BitDance: Scaling Autoregressive Generative Models with Binary Tokens

BitDance: 通过二进制令牌扩展自回归生成模型

Yuang Ai, Jiaming Han, Shaobin Zhuang, Weijia Mao, Xuefeng Hu, Ziyan Yang, Zhenheng Yang, Yali Wang, Huaibo Huang, Xiangyu Yue, Hao Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BitDance通过二进制令牌生成高熵表示,结合二进制扩散头和next-patch扩散方法,实现高效图像生成,达到最佳FID分数并显著提升推理速度。

Comments Code and models: https://github.com/shallowdream204/BitDance

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06214 2026-03-13 cs.CL cs.AI math-ph math.MP quant-ph 62%

Can Theoretical Physics Research Benefit from Language Agents?

理论物理研究能否从语言代理中受益?

Sirui Lu, Zhijing Jin, Terry Jingchen Zhang, Pavel Kos, J. Ignacio Cirac, Bernhard Schölkopf

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。

Comments 8+2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13756 2026-03-11 cs.CV cs.AI cs.LG 62%

RECODE: Reasoning Through Code Generation for Visual Question Answering

RECODE: 通过代码生成进行视觉问答的推理

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。

Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08059 2026-03-10 cs.CV cs.AI 62%

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

ImageEdit-R1: 通过强化学习提升多智能体图像编辑

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui

机构 * National University of Singapore(新加坡国立大学) Adobe Research(Adobe研究)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19195 2026-03-10 cs.CV cs.AI 62%

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

重新思考驾驶世界模型作为感知任务的合成数据生成器

Kai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei, Xiangyu Guo, Zhenxin Zhu, Kalok Ho, Lijun Zhou, Bohan Zeng, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Dream4Drive通过生成高质量的合成数据提升自动驾驶感知任务性能

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00790 2026-03-10 cs.CV cs.AI 62%

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云(AMAP))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06057 2026-03-09 cs.CV cs.AI cs.LG cs.SD 62%

TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation

TempoSyncDiff: 压缩时间一致扩散用于低延迟音频驱动说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh

机构 * Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能循环中心)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 TempoSyncDiff通过压缩扩散模型实现低延迟音频驱动说话头生成,结合教师-学生压缩和时间正则化以提高生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG 62%

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03657 2026-03-05 cs.CV cs.AI 62%

InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

InEdit-Bench:智能图像编辑模型中间逻辑路径的基准测试

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao

机构 * State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, Chinese Academy of Sciences(光学场操控科学与技术国家重点实验室,光学电子研究所,中国科学院) National Laboratory on Adaptive Optics(自适应光学国家实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 InEdit-Bench通过评估图像编辑模型在中间逻辑路径推理中的表现,揭示了现有模型在动态推理和多步骤演变建模方面的不足,推动更智能的多模态生成模型发展。

Comments CVPR findings. Project page: https://github.com/SZStrong1/InEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14341 2026-03-03 cs.CV cs.AI cs.CY cs.LG 62%

Towards Transferable Defense Against Malicious Image Edits

面向恶意图像编辑的可迁移防御

Jie Zhang, Shuai Dong, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) School of Computer Science, China University of Geosciences(中国地质大学(武汉)计算机学院)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 TDAE通过双模优化提升图像对恶意编辑的免疫性,实现跨模型的可迁移防御。

Comments 14 pages, 5 figures, accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02253 2026-03-03 cs.CV cs.AI cs.LG 62%

DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing

DragFlow: 通过基于区域的监督释放DiT先验以实现拖拽编辑

Zihan Zhou, Shilin Lu, Shuli Leng, Shaocong Zhang, Zhuming Lian, Xinlei Yu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DragFlow通过基于区域的监督利用FLUX先验,改进基于拖拽的图像编辑效果,实现对点式和区域式基线的超越。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16145 2026-03-03 cs.AI cs.CL 62%

SpiroLLM: Finetuning Pretrained LLMs to Understand Spirogram Time Series with Clinical Validation in COPD Reporting

SpiroLLM:通过临床验证在COPD报告中微调预训练大语言模型以理解肺功能时间序列

Shuhao Mei, Yongchao Long, Xiaoyu Xiao, Shan Cao, Xiaobo Han, Shijia Geng, Jinbo Sun, Yuxi Zhou, Shenda Hong

机构 * Guangzhou Institute of Technology, Xidian University, Xi’an, China(广州科技研究院,西安电子科技大学,中国) Department of Computer Science, Tianjin University of Technology, Tianjin, China(天津理工大学计算机学院,天津,中国) Department of Respiratory, The Second Hospital of Tianjin Medical University, China(天津医科大学第二医院呼吸科,中国) College of Pulmonary and Critical Care Medicine, Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院呼吸与危重症医学科,北京,中国) HeartVoice Medical Technology, Hefei, China(合肥心声医疗技术有限公司,中国) School of Life Science and Technology, Xidian University, Xi’an, China(西安电子科技大学生命科学与技术学院,中国) National Institute of Health Data Science, Peking University, Beijing, China(北京大学国家健康数据科学研究院,北京,中国) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院,北京,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SpiroLLM通过融合生理信号与大语言模型,实现对肺功能时间序列的解读,并在COPD诊断中展现出高准确性和稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12734 2026-03-03 cs.SD cs.AI cs.GR cs.HC eess.AS 62%

SounDiT: Geo-Contextual Soundscape-to-Landscape Generation

SounDiT:基于地理情境的声音景观到景观生成

Junbo Wang, Haofeng Tan, Bowen Liao, Albert Jiang, Teng Fei, Qixing Huang, Bing Zhou, Zhengzhong Tu, Shan Ye, Yuhao Kang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Tennessee, Knoxville(田纳西大学基洛纳分校) University of South Carolina(南卡罗来纳大学) Arizona State University(亚利桑那州立大学) University of Canterbury(坎特伯雷大学) Texas A&M University(德克萨斯A&M大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI、eess.AS

AI总结 SounDiT通过结合环境声音景观和地理情境条件,生成地理上一致的景观图像,并引入Place Similarity Score评估生成一致性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00155 2026-03-03 cs.CV cs.AI cs.IR 62%

EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection

EfficientPosterGen: 通过令牌压缩和准确违规检测的语义感知高效海报生成

Wenxin Tang, Jingyu Xiao, Yanpei Gong, Fengyuan Ran, Tongchuan Xia, Junliang Liu, Man Ho Lam, Wenxuan Wang, Michael R. Lyu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) Wuhan University(武汉大学) Beijing University of Posts and Telecommunications(北京邮电大学) Dalian Maritime University(大连海事大学) Renmin University of China(中国人民大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 EfficientPosterGen通过语义感知检索、视觉上下文压缩和无代理布局检测技术,实现高效且可靠的学术海报自动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23969 2026-03-02 cs.MM cs.CV 62%

MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation

MSVBench: 向多镜头视频生成的人机水平评估迈进

Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 MSVBench通过引入分层脚本和参考图像,提出混合评估框架,验证了视频生成模型的连贯性和吸引力,并展示了其在多镜头视频生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22624 2026-02-27 cs.CV cs.AI 62%

Instruction-based Image Editing with Planning, Reasoning, and Generation

基于指令的图像编辑与规划、推理和生成

Liya Ji, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态模型,通过链式思考规划、编辑区域推理和编辑,提升基于指令的图像编辑能力,以应对更复杂的真实场景。

Comments 10 pages, 7 figures

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, Page 17506--17515

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18022 2026-02-26 cs.CV cs.AI 62%

Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers

双通道注意力引导用于扩散变换器中无需训练的图像编辑控制

Guandong Li

机构 * iFLYTEK

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双通道注意力引导方法,通过同时操控键通道和值通道实现无需训练的图像编辑控制,显著提升编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20520 2026-02-25 cs.CV cs.AI 62%

How Do Inpainting Artifacts Propagate to Language?

图像修复伪影如何传播到语言?

Pratham Yashwante, Davit Abrahamyan, Shresth Grover, Sukruth Rao

机构 * UC San Diego(圣迭戈大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究图像修复伪影对视觉-语言模型语言生成的影响,通过两阶段诊断方法分析重建保真度与描述质量的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏