arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-30 至 2026-03-30 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2603.25752 2026-03-30 cs.CL cs.SD eess.AS 84%

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。

Comments 19 pages

Journal ref neurocomputing2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22687 2026-03-30 cs.CV 83%

GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning

GeoTikzBridge:推动多模态代码生成在几何感知与推理中的发展

Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen, Yi Zhang, Errui Ding, Liang Li, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(九天研究院)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GeoTikzBridge框架,通过基于tikz的代码生成提升局部几何感知和视觉推理能力,利用两个互补数据集训练模型,实现多模态大语言模型在几何问题解决中的先进性能。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26348 2026-03-30 cs.CV cs.AI 81%

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15702 2026-03-30 cs.IT cs.CV cs.NI math.IT 79%

Editable-DeepSC: Reliable Cross-Modal Semantic Communications for Facial Editing

可编辑的深度语义通信:面向面部编辑的可靠跨模态语义通信

Bin Chen, Wenbo Yu, Qinshan Zhang, Tianqu Zhuang, Hao Wu, Yong Jiang, Shu-Tao Xia

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Editable-DeepSC,一种用于面部编辑的跨模态语义通信方法,通过联合编辑-信道编码和SNR感知信道编码,提升传输效率与编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 62%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 57%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 57%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26466 2026-03-30 cs.RO 50%

Adapt as You Say: Online Interactive Bimanual Skill Adaptation via Human Language Feedback

根据指令适应:通过人类语言反馈实现在线交互双臂技能适应

Zhuo Li, Dianxi Li, Tao Teng, Quentin Rouxel, Zhipeng Dong, Dennis Hong, Darwin Caldwell, Fei Chen

机构 * Collaborative and Versatile Robots (CLOVER) Laboratory, T-Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学T-Stone机器人研究所协作与多功能机器人(CLOVER)实验室) Department of Mechanical and Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系) Department of Advanced Robotics, Istituto Italiano di Tecnologia(意大利技术研究院先进机器人系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出BiSAIL框架,通过交互语言反馈实现零样本在线适应,提升双臂技能在任务变化中的适应性、泛化能力和跨身体可扩展性。

Comments 11 pages, 15 figures, submitted to IEEE TMECH

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22886 2026-03-30 cs.LG cs.RO 50%

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

任务标记:一种灵活的适应行为基础模型的方法

Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler

机构 * Technion(以色列理工学院) NVIDIA Research(英伟达研究院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出任务标记方法,通过强化学习学习任务特定编码器,使行为基础模型适应特定任务,同时保持灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏