arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6897 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6897 篇

2107.06281 2021-07-15 q-bio.NC cs.CV cs.LG 70%

Non-isomorphic Inter-modality Graph Alignment and Synthesis for Holistic Brain Mapping

Islem Mhiri, Ahmed Nebli, Mohamed Ali Mahjoub, Islem Rekik

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.01839 2021-05-06 cs.CV 70%

Encoder Fusion Network with Co-Attention Embedding for Referring Image Segmentation

Guang Feng, Zhiwei Hu, Lihe Zhang, Huchuan Lu

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.01483 2021-03-24 cs.CL 70%

JTAV: Jointly Learning Social Media Content Representation by Fusing Textual, Acoustic, and Visual Features

Hongru Liang, Haozheng Wang, Jun Wang, Shaodi You, Zhe Sun, Jin-Mao Wei, Zhenglu Yang

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.14944 2020-12-01 cs.CV 70%

Flood Detection via Twitter Streams using Textual and Visual Features

Firoj Alam, Zohaib Hassan, Kashif Ahmad, Asma Gul, Michael Reiglar, Nicola Conci, Ala AL-Fuqaha

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.14943 2020-12-01 cs.CV 70%

Floods Detection in Twitter Text and Images

Naina Said, Kashif Ahmad, Asma Gul, Nasir Ahmad, Ala Al-Fuqaha

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments 3 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.08698 2020-08-21 eess.IV cs.CV cs.LG 70%

Self-Supervised Ultrasound to MRI Fetal Brain Image Synthesis

Jianbo Jiao, Ana I. L. Namburete, Aris T. Papageorghiou, J. Alison Noble

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments IEEE Transactions on Medical Imaging 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.02632 2018-08-09 cs.CV cs.AI cs.CL cs.MM 70%

Question-Guided Hybrid Convolution for Visual Question Answering

Peng Gao, Pan Lu, Hongsheng Li, Shuang Li, Yikang Li, Steven Hoi, Xiaogang Wang

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 17 pages, 4 figures, accepted in ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.01233 2018-04-05 cs.CV 70%

Discriminative Cross-View Binary Representation Learning

Liu Liu, Hairong Qi

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV

Comments Published in WACV2018. Code will be available soon

Journal ref WACV2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.09526 2017-09-07 cs.CV 70%

Predicting Human Intentions from Motion Only: A 2D+3D Fusion Approach

Andrea Zunino, Jacopo Cavazza, Atesh Koul, Andrea Cavallo, Cristina Becchio, Vittorio Murino

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments accepted as poster at the 25th ACM Multimedia (ACM MM) 2017, Mountain View, California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18546 2026-08-20 cs.LG 新提交 67%

MARCUS: Missing-Aware Region Representation with Contextual Urban Signals for Rent Prediction

MARCUS:结合上下文城市信号的缺失感知区域表示用于租金预测

Chenya Huang, Bin Liang, Zhidong Li, Yuxi Lu, Kunqi Li, Justin Wang, Fang Chen

机构 * The Property Investors Alliance(房地产投资者联盟)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 针对城市区域表示中缺失数据的语义价值被忽略问题,提出缺失感知区域表示模型MARCUS,将缺失视为城市信号,在悉尼和纽约租金预测任务上较基线显著降低MAE,性能最优。

Comments 10 pages, 7 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 67%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn)

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新 67%

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03677 2026-07-07 cs.LG 版本更新 67%

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Uni-OPD:基于双视角方案的统一策略内蒸馏框架

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang, Chengquan Zhang, Zhuotao Tian, Han Hu, Yi Yang, Fei Wu, Hehe Fan

机构 * Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院) LLM Department, Tencent(腾讯大模型部门)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19670 2026-06-23 physics.ins-det physics.data-an 新提交 67%

PiMiX 2.0: AI-enhanced Data Fusion for Radiographic Imaging and Tomography

PiMiX 2.0: 人工智能增强的放射成像与断层扫描数据融合

Zhehui Wang, Shanny Lin, Nicholas Amano, Susan S. Glenn, Ramya Gurunathan, Katie Liu, Nathan E. Peterson, Michelle A. Espy, Adam Thompson, Amy J. Clarke, Ray T. Chen

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)

AI总结 提出AI增强的数据融合框架PiMiX 2.0,集成多实验多模态放射成像与断层扫描,支持自动数据摄取、3D/4D重建及物理感知解释,加速数据处理并提升可重复性。

Comments 9 pages, 4 figures, 1 table. Work presented in the 26th Topical Conference on High Temperature Plasma Diagnostics Conference, Cambridge, MA, USA (June 7 - 11, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12495 2026-06-12 cs.SD 新提交 67%

Missing-Token Prompted Reliability-Aware Fusion for Robust Polyglot Speaker Identification

缺失令牌提示的可靠性感知融合用于鲁棒多语种说话人识别

Peng Jia, Li Dai, Jia Li, Zhenzhen Hu, Ye Zhao, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 提出MRAF框架,通过可学习的缺失令牌和可靠性感知交叉注意力融合,解决多语种场景下跨语言泛化和人脸缺失时的鲁棒性问题,在POLY-SIM 2026测试集上取得高准确率。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05109 2026-06-04 cs.LG 67%

RePercENT: Scaling Disentangled Representation Learning Beyond Two Modalities

RePercENT:将解耦表示学习扩展到两种模态之外

Vasiliki Rizou, Pascal Frossard, Dorina Thanou

机构 * EPFL(瑞士联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 提出RePercENT框架,通过多模态即插即用架构和联合优化目标,实现超过两种模态的可扩展成对解耦,无需联合预训练并降低计算复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28231 2026-05-28 cs.RO cs.LG 67%

ProgVLA: Progress-Aware Robot Manipulation Skill Learning

ProgVLA:进度感知的机器人操作技能学习

Seungsu Kim, Jinyoung Choi, Seungmin Baek, Jean-Michel Renders

机构 * NAVER LABS(NAVER实验室) NAVER LABS Europe(NAVER实验室欧洲)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)

AI总结 提出ProgVLA,一种紧凑的视觉-语言-动作模型,通过显式表示任务进度和两阶段Perceiver重采样机制,在有限计算和内存下实现长序列多模态处理,并在多任务操作基准上达到或超越大模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11651 2026-05-27 cs.CV cs.AI cs.CL 67%

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

Hide to See: 面向VLM蒸馏中视觉锚定思维的推理前缀掩码

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) POSTECH(POSTECH大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出一种推理前缀掩码蒸馏框架,通过掩码学生模型的显著推理前缀,迫使其在推理过程中更依赖视觉证据,从而缓解长推理轨迹中的视觉遗忘问题,提升多模态推理性能。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12876 2026-05-14 cs.LG 67%

Certified Robustness under Heterogeneous Perturbations via Hybrid Randomized Smoothing

通过混合随机平滑实现异质扰动下的认证鲁棒性

Blaise Delattre, Hengyu Wu, Paul Caillon, Wei Yang Bryan Lim, Yang Cao

机构 * Department of Computer Science, School of Computing, Institute of Science Tokyo, Tokyo, Japan(东京科学研究所计算机科学系) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) PSL University, Paris, France(巴黎高等师范学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出统一的混合随机平滑框架,针对混合离散-连续输入,基于可解析的Neyman-Pearson联合最坏情况问题,提供闭式一维证书,扩展了高斯和离散随机平滑,应用于多模态安全过滤。

Comments ICML 2026. Code: https://github.com/tdsai-lab/hybrid-randomized-smoothing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12026 2026-04-15 cs.LG q-bio.BM q-bio.QM 67%

TriFit: Trimodal Fusion with Protein Dynamics for Mutation Fitness Prediction

TriFit:结合蛋白质动力学的三模态融合用于突变适应度预测

Seungik Cho

机构 * Department of Physics(物理系) Astronomy, Rice University, Texas, USA(天文学、里士满大学、德克萨斯州、美国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)

AI总结 TriFit通过三模态融合模块整合序列、结构和蛋白质动力学信息,利用四专家混合专家模型提升突变适应度预测性能,实现优于现有基线模型的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09886 2026-04-14 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

Not Your Stereo-Typical Estimator: Combining Vision and Language for Volume Perception

非典型立体视觉估计器:结合视觉与语言进行体积感知

Gautham Vinod, Bruce Coburn, Siddeshwar Raghavan, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出融合立体视觉隐式3D线索与自然语言显式先验知识的方法,通过多模态表示提升体积估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 67%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24857 2026-03-27 cs.CR cs.AI cs.CL cs.CV cs.LG 67%

AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective

在基础模型时代的人工智能安全:从统一视角的综合调查

Zhenyi Wang, Siyu Luan

机构 * University of Central Florida(中佛罗里达大学) University of Copenhagen(哥本哈根大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。

Comments Published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17088 2026-02-20 cs.LG 67%

MeGU: Machine-Guided Unlearning with Target Feature Disentanglement

MeGU:基于目标特征解耦的机器引导反学习

Haoyu Wang, Zhuo Huang, Xiaolong Wang, Bo Han, Zhiwei Lin, Tongliang Liu

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract)

AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 67%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06850 2026-02-09 cs.CV cs.AI cs.MM 67%

Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping

重新思考多条件DiTs:通过位置对齐和关键词范围消除冗余注意力

Chao Zhou, Tianyi Wei, Yiling Chen, Wenbo Zhou, Nenghai Yu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出PKA框架,通过位置对齐和关键词范围注意力消除多条件生成中的冗余,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12603 2026-01-29 cs.CV cs.AI cs.CL 67%

Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space

在暗中推理:在潜在空间中交织的视觉-文本推理

Chao Chen, Zhixin Ma, Yongqi Li, Yupeng Hu, Yinwei Wei, Wenjie Li, Liqiang Nie

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡管理学院) Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出IVT-LR方法,通过在潜在空间中交织视觉和文本信息,提升多模态推理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12227 2026-01-21 cs.LG 67%

Learning Longitudinal Health Representations from EHR and Wearable Data

从电子健康记录和可穿戴数据中学习纵向健康表示

Yuanyun Zhang, Han Zhou, Li Feng, Yilin Hong, Shi Li

机构 * University of the Chinese Academy of Sciences, Columbia University(中国科学院大学,哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出一种多模态基础模型,通过联合表示电子健康记录和可穿戴数据,提升纵向健康预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16124 2025-12-30 cs.HC cs.LG 67%

ZIA: A Theoretical Framework for Zero-Input AI

ZIA:零输入AI的理论框架

Aditi De

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥基分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)

AI总结 ZIA提出了一种基于多模态融合的零输入AI框架,通过整合生物信号和上下文数据实现前瞻性意图预测,提升实时推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22615 2025-12-25 cs.CV cs.AI cs.CL 67%

GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting

GaussianVision: 通过二维高斯散射从压缩图像表示中实现视觉-语言对齐

Yasmine Omri, Connor Ding, Tsachy Weissman, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GaussianVision通过二维高斯散射实现高效的视觉-语言对齐,提升边缘设备传输效率并优化多模态学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏