arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2605.08050 2026-05-11 cs.CV 57%

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

MoCoTalk: 多条件扩散与自适应路由的可控说话头生成

Xinyan Ye, Jiankang Deng, Abbas Edalat

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 MoCoTalk通过统一身份、头部姿态、面部表情和嘴部动态四个控制信号,提出自适应多条件路由框架,解决异构条件干扰问题,提升可控说话头生成的性能与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV 57%

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01480 2026-05-05 cs.CV 57%

AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT

AttnRouter:基于MMDiT的无训练图像编辑的类别级注意力路由

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AttnRouter,通过类别级路由表优化MMDiT的无训练图像编辑,实验显示其在CLIP-T+DINO-I复合指标上提升6.4%,且自动分类器在仅55%类别准确率下关闭98%的差距。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05081 2026-05-05 cs.AI 57%

MedGemma 1.5 Technical Report

MedGemma 1.5 技术报告

Andrew Sellergren, Chufan Gao, Fereshteh Mahvar, Timo Kohlberger, Fayaz Jamil, Madeleine Traverse, Alberto Tono, Bashir Sadjad, Lin Yang, Charles Lau, Liron Yatziv, Tiffany Chen, Bram Sterling, Kenneth Philbrick, Richa Tiwari, Yun Liu, Madhuram Jajoo, Chandrashekar Sankarapu, Swapnil Vispute, Harshad Purandare, Abhishek Bijay Mishra, Sam Schmidgall, Tao Tu, Anil Palepu, Chunjong Park, Tim Strother, Rahul Thapa, Yong Cheng, Preeti Singh, Kat Black, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Joelle Barral, Tris Warkentin, Shravya Shetty, Dale Webster, Sunny Virmani, David F. Steiner, Can Kirmizibayrak, Daniel Golden

机构 * Google Research and Google DeepMind(谷歌研究与谷歌深Mind)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 MedGemma 1.5 增强了医学影像处理、解剖定位和多时间点胸部X光分析能力,显著提升了3D MRI和CT分类精度,并在病理图像和临床知识推理中取得突破性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04106 2026-05-05 cs.AI 57%

InsTraj: Instructing Diffusion Models with Travel Intentions to Generate Real-world Trajectories

InsTraj: 通过旅行意图指导扩散模型生成真实世界轨迹

Yuanshao Zhu, Yuxuan Liang, Xiangyu Zhao, Liang Han, Xinwei Fang, Xun Zhou, Xuetao Wei, James Jianqiao Yu

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of York(约克大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 InsTraj通过自然语言描述指导扩散模型生成真实、多样且符合指令的轨迹,解决传统方法在理解和生成复杂用户意图及约束条件上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10571 2026-05-05 cs.CV 57%

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

AVI-Edit: 基于粒度感知掩码细化的音频同步视频实例编辑

Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(北京大学计算机学院视觉技术工程研究中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出AVI-Edit框架,通过粒度感知掩码细化和自反馈音频代理,实现音频同步的高质量视频实例编辑,提升了空间和时间控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV 57%

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 57%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 57%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25164 2026-04-29 cs.CV 57%

IAM: Identity-Aware Human Motion and Shape Joint Generation

IAM:基于身份的人体运动与形状联合生成

Wenqi Jia, Zekun Li, Abhay Mittal, Chengcheng Tang, Chuan Guo, Lezi Wang, James Matthew Rehg, Lingling Tao, Size An

机构 * UIUC(伊利诺伊大学香槟分校) Meta Reality Labs(Meta现实实验室) Brown University(布朗大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于身份的人体运动与形状联合生成框架,通过多模态信号建模身体形态与运动动态的关系,提升运动真实性和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24833 2026-04-29 cs.RO cs.AI cs.GR cs.LG 57%

MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives

MotionBricks: 可扩展的实时动作生成与模块化潜在生成模型及智能原语

Tingwu Wang, Olivier Dionne, Michael De Ruyter, David Minor, Davis Rempe, Kaifeng Zhao, Mathis Petrovich, Ye Yuan, Chenran Li, Zhengyi Luo, Brian Robison, Xavier Blackwell, Bernardo Antoniazzi, Xue Bin Peng, Yuke Zhu, Simon Yuen

机构 * NVIDIA Simon Fraser University(西蒙·弗雷泽大学) The University of Texas at Austin(得克萨斯大学奥斯汀分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出MotionBricks,通过模块化潜在生成模型和智能原语实现实时动作生成,解决工业应用中实时可扩展性和多模态控制的挑战,展示了高质量和实时性能。

Comments ACM Transactions on Graphics; SIGGRAPH 2026. Project page: https://nvlabs.github.io/motionbricks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24493 2026-04-28 cs.CV 57%

CA-IDD: Cross-Attention Guided Identity-Conditional Diffusion for Identity-Consistent Face Swapping

CA-IDD:跨注意力引导的身份条件扩散用于身份一致的面部交换

Md Shohel Rana, Tanoy Debnath

机构 * School of Computing(计算学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CA-IDD,一种基于扩散的面部交换方法,通过多尺度交叉注意力整合 gaze、身份和面部解析,提升身份一致性和视觉真实性,实现稳定训练和精细区域控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23651 2026-04-28 cs.CV 57%

Geometry-Conditioned Diffusion for Occlusion-Robust In-Bed Pose Estimation

基于几何条件的扩散模型用于抗遮挡的卧床姿态估计

Navid Aslankhani Khameneh, Marco Carletti, Cigdem Beyan

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) EVS - Embedded Vision Systems Srl(嵌入式视觉系统股份有限公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于几何条件的扩散模型,解决卧床姿态估计中遮挡问题,通过生成模型直接从骨骼关键点生成遮挡图像,提升遮挡鲁棒性。

Comments This is the preprint version of the paper. The final version has been accepted for publication in the Proceedings of the 20th IEEE International Conference on Automatic Face and Gesture Recognition (IEEE FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22609 2026-04-28 cs.AI 57%

CLIN-LLM: A Safety-Constrained Hybrid Framework for Clinical Diagnosis and Treatment Generation

CLIN-LLM:一种安全约束的混合框架,用于临床诊断和治疗生成

Md. Mehedi Hasan, Md. Abir Hossain, Farman Hossain Sayem, Bikash Kumar Paul, Ziaur Rahman, Mohammad Shorif Uddin, Rafid Mostafiz

机构 * Department of Information and Communication Technology(信息与通信技术系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 CLIN-LLM通过整合多模态患者编码、不确定性校准的疾病分类和检索增强的治疗生成,提高了临床诊断和治疗建议的准确性与安全性,取得了98%的准确率和F1分数,优于ClinicalBERT。

Comments 13 pages, 9 figures. Preprint version under review in the area of Artificial Intelligence (cs.CR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19858 2026-04-27 cs.CV 57%

Wan-Image: Pushing the Boundaries of Generative Visual Intelligence

Wan-Image:推动生成视觉智能的边界

Chaojie Mao, Chen-Wei Xie, Chongyang Zhong, Haoyou Deng, Jiaxing Zhao, Jie Xiao, Jinbo Xing, Jingfeng Zhang, Jingren Zhou, Jingyi Zhang, Jun Dan, Kai Zhu, Kang Zhao, Keyu Yan, Minghui Chen, Pandeng Li, Shuangle Chen, Tong Shen, Yu Liu, Yue Jiang, Yulin Pan, Yuxiang Tuo, Zeyinzi Jiang, Zhen Han, Ang Wang, Bang Zhang, Baole Ai, Bin Wen, Boang Feng, Feiwu Yu, Gang Wang, Haiming Zhao, He Kang, Jianjing Xiang, Jianyuan Zeng, Jinkai Wang, Junjie Zhou, Ke Sun, Linqian Wu, Pei Gong, Pingyu Wu, Ruiwen Wu, Tongtong Su, Wenmeng Zhou, Wenting Shen, Wenyuan Yu, Xianjun Xu, Xiaoming Huang, Xiejie Shen, Xin Xu, Yan Kou, Yangyu Lv, Yifan Zhai, Yitong Huang, Yun Zheng, Yuntao Hong, Zhe Zhang, Zhicheng Zhang

机构 * Wan Team(万团队) Alibaba Group(阿里巴巴集团)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Wan-Image通过统一多模态架构和大规模数据训练,实现从随意生成到专业级视觉工具的转变,具备超长文本渲染、多主体身份保持等专业能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21977 2026-04-27 cs.CV 57%

When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击

Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng

机构 * People’s Public Security University of China(中国人民公安大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。

Comments Accepted to CVPR 2026 main track(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21898 2026-04-27 cs.RO cs.AI 57%

Flexible Multitask Learning with Factorized Diffusion Policy

灵活的多任务学习与因子化扩散策略

Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Norwegian University of Science and Technology(挪威科学与技术大学) Columbia University(哥伦比亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21362 2026-04-24 cs.CV 57%

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

KD-CVG:一种基于知识的创意视频生成方法

Linkai Liu, Wei Feng, Xi Zhao, Shen Zhang, Xingye Chen, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Yuchen Zhou, Zipeng Guo, Chao Gou

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KD-CVG方法,通过构建广告创意知识库解决文本到视频模型在语义对齐和运动适应性方面的不足,提升创意视频生成效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02644 2026-04-23 cs.AI 57%

D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss

D2PPO:带有分散损失的扩散策略策略优化

Guowei Zou, Weibing Li, Hejun Wu, Yukun Qian, Yuhang Wang, Haitao Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出D2PPO,通过引入分散损失正则化来解决扩散策略中表示崩溃问题,提升复杂机器人操控任务的性能,实验表明其在预训练和微调中均取得显著改进。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(22): 18891-18899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20749 2026-04-23 cs.AI 57%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 57%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18967 2026-04-22 cs.CV 57%

Toward Clinically Acceptable Chest X-ray Report Generation: A Qualitative Retrospective Pilot Study of CXRMate-2

迈向临床可接受的胸部X光报告生成:CXRMate-2的定性回顾性试点研究

Aaron Nicolson, Elizabeth J. Cooper, Hwan-Jin Yoon, Claire McCafferty, Ramya Krishnan, Michelle Craigie, Nivene Saad, Jason Dowling, Ian A. Scott, Bevan Koopman

机构 * organization= Australian e-Health Research Centre, CSIRO Health organization= Princess Alexandra Hospital, Metro South Health , city= Brisbane , country= Australia organization= Queensland Digital Health Centre, University of Queensland , city= Brisbane , country= Australia Informatics Directorate, Metro South Hospital organization= School of Electrical Engineering Computer Science, University of Queensland , city= Brisbane , country= Australia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CXRMate-2模型,通过结构化多模态条件与强化学习实现胸部X光报告生成,经多数据集验证在性能和临床可接受性上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06663 2026-04-21 cs.CV 57%

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17385 2026-04-21 cs.CV 57%

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

SpatialImaginer: 向空间推理的自适应视觉想象迈进

Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) MiniMax Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialImaginer框架,通过结合文本推理与视觉想象,解决多模态大语言模型在空间推理中的鲁棒性问题,实验显示其在复杂空间任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17090 2026-04-21 cs.CV 57%

Marrying Text-to-Motion Generation with Skeleton-Based Action Recognition

将文本到动作生成与基于骨架的动作识别相结合

Jidong Kuang, Hongsong Wang, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CoAMD模型,结合骨架坐标进行动作理解和生成,实现统一的动作识别与生成,通过多模态动作识别器提供语义指导,实验表明其在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV 57%

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14605 2026-04-20 cs.CV 57%

Towards Design Compositing

面向设计合成

Abhinav Mahajan, Abhikhya Tripathy, Sudeeksha Reddy Pala, Vaibhav Methi, K J Joseph, Balaji Vasan Srinivasan

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Kharagpur(印度理工学院哈里科特) IIT Kanpur(印度理工学院坎普尔) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GIST,一种无需训练的身份保持图像合成器,用于提升组件到设计流程中的视觉和谐与美学质量。

Comments Accepted to CVEU workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21735 2026-04-20 cs.HC cs.AI 57%

Cognitive Agency Surrender: Defending Epistemic Sovereignty via Scaffolded AI Friction

认知代理退让:通过支架式AI摩擦捍卫认知主权

Kuangzhe Xu, Yu Shen, Longjie Yan, Yinghui Ren

机构 * Cyberspace Security University of China(中国网络安全大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示生成式AI导致认知代理退让的风险,提出支架式认知摩擦理论,通过多模态计算方法解耦决策与认知努力,以强化全球AI治理。

Comments 26 pages, 4 figure (one in appendix). This is a preprint of a perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏