arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-15 至 2026-07-15 共收录 64 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2505.05736 2026-07-15 q-bio.QM cs.CL cs.CV cs.LG 81%

Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applications

通过偏好优化整合多模态知识以增强大语言模型的多模态知识转移(生物医学应用)

Zhanliang Wang, Da Wu, Quan Nguyen, Zhuoran Xu, Kai Wang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MINT通过偏好优化整合多模态知识,提升大语言模型在生物医学任务中的表现,特别是在罕见遗传疾病预测和组织类型分类中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08010 2026-07-15 cs.CV 版本更新 79%

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

CASHEW: 通过迭代轨迹聚合稳定多模态推理

Chaoyu Li, Fei Tao, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学) NewsBreak

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12065 2026-07-15 cs.RO cs.AI cs.CV 新提交 76%

Enabling 24-hour Agricultural Robotics: Unsupervised Day-to-Night Cross-Modal Image Translation for Nighttime Visual Navigation

实现24小时农业机器人技术:用于夜间视觉导航的无监督日夜跨模态图像翻译

Robel Mamo, Rajitha de Silva, Grzegorz Cielniak, Taeyeong Choi

机构 * LaSER Lab, Kennesaw State University(激光实验室,肯尼索州立大学) Lincoln Institute for Agri-Food Technology, University of Lincoln(林肯农业食品技术研究所,林肯大学)

专题命中 图文多模态 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 该研究针对农业机器人夜间视觉导航中大规模标注图像数据集难获取的问题,提出无监督图像翻译框架,整合CLIP模型并引入可见性掩码,复用白天语义标签训练模型,经实验验证提升了图像质量和下游语义分割性能。

Comments Accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12800 2026-07-15 cs.CV 新提交 70%

UniVR: Thinking in Visual Space for Unified Visual Reasoning

UniVR:用于统一视觉推理的视觉空间思考

Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 UniVR旨在从纯视觉演示中同时学习复杂推理、物理动力学和长期规划,核心是VR-GRPO强化学习范式。构建VR-X基准进行训练和评估,在VR-X上有25%的提升,还提高了多模态理解基准性能,相关资源已开源。

Comments Code and models are released at: https://maverickren.github.io/UniVR.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新 67%

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 62%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 57%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 57%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09483 2026-07-15 cs.AI 版本更新 57%

CrochetBench: Can Vision-Language Models Move from Describing to Doing in Crochet Domain?

CrochetBench:视觉语言模型能否在钩针领域从描述转向实践?

Peiyu Li, Xiaobao Huang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺特大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 探讨视觉语言模型在钩针领域从描述到实践的转变,采用CrochetPARADE DSL进行评估,涵盖多种任务,发现评估转变时性能下降,揭示模型局限性,为评估多模态模型过程能力提供新视角。

Comments ACL2026 main-long

Journal ref Proceedings of ACL 2026, Vol. 1, pp. 13229-13251

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2607.12820 2026-07-15 cs.CV 新提交 90%

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27706 2026-07-15 cs.MM 版本更新 83%

MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation

MAR3:多智能体识别、推理与反思用于参考音频视觉分割

Yuan Zhao, Zhenqi Jia, Yongqiang Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM

AI总结 本文提出MAR3框架,通过多智能体机制解决参考音频视觉分割中的表达难度识别、模态主导性分析及反思学习问题,提升分割精度。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12958 2026-07-15 cs.HC 新提交 78%

CD-MED: Cross-Domain Multimodal Emotion Descriptor for Visual Comparison of Digital Objects

CD-MED:用于数字对象视觉比较的跨域多模态情感描述符

Elnara Kadyrgali, Muragul Muratbekova, Pakizar Shamoi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究针对数字对象跨模态情感比较难题,提出CD-MED方法,通过各模态情感识别模型输出转化为共享描述符,在共同情感空间表示对象,实现跨域情感比较、检索、推荐及可视化。

Comments Submitted to 2026 Joint 14th International Conference on Soft Computing and Intelligent Systems and 27th International Symposium on Advanced Intelligent Systems (SCIS&ISIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-07-15 cs.CV 新提交 74%

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 67%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2607.09759 2026-07-15 cs.CV cs.AI 版本更新 81%

ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams

ReflectWorld-MM:一种面向实体的开放式视频流多媒体存储系统

Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo, Shenyi Shao, Chu Tang, Jingmin Chen, Li Pu

机构 * Rightly Robotics(Rightly机器人公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对开放式视频流存储问题,提出面向实体的多媒体存储系统ReflectWorld-MM,由感知前端、分层长期记忆和实际应用实现三部分构成,在六个相关基准测试中取得最佳准确率,优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11939 2026-07-15 cs.CV 新提交 79%

TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction

TSCA-Net:用于可解释多模态行人轨迹预测的时空团块注意力

Md Mustafizur Rahman, Guangchao Yang, A F M Abdun Noor, Md Imam Ahasan, Md Mahfuzur Rahman, Md Ariful Islam

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对拥挤环境中行人轨迹预测难题,提出TSCA-Net框架,含时空团块注意力、跨行人团块势、自适应KAN网格细化三个模块,经实验验证其性能最优,消融研究证实模块互补作用。

Comments 10 pages, 4 figures, 4 tables. Submitted to the IEEE International Conference on Data Mining (ICDM) 2026, Applied Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12774 2026-07-15 cs.CV cs.AI 新提交 62%

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

第11届ABAW挑战赛中的HSEmotion团队:多任务学习与矛盾/犹豫视频识别

Aleksei Bakin, Andrey V. Savchenko

机构 * Central University(中央大学) Sber AI Lab(Sber人工智能实验室) HSE University(俄罗斯高等经济研究大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 在第11届ABAW挑战赛中,团队用冻结轻量级面部提取器等方法进行多任务学习,在s - Aff - Wild2数据集上超ConvNeXt基线;扩展视听管道用于矛盾/犹豫视频识别,在BAH数据集上提升性能,无需微调重型骨干,展示了轻量级融合的优势。

Comments to be submitted to ABAW-11 workshop of ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11673 2026-07-15 cs.CV 版本更新 57%

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

ABot-3DWorld 0:一个用于探索任意 3D 空间的通用世界模型

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 介绍 ABot-3DWorld 0 通用多模态 3D 世界模型,核心是 SGP,通过特定流程将多模态输入转换为 3D 世界,用于通用 3D 内容创建,在开源方法中领先,多模态输入下场景保真度更高。

Comments Official Page: https://abot-world.amap.com/plaza

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 6 篇

2607.12764 2026-07-15 cs.CV 新提交 83%

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新 81%

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03581 2026-07-15 cs.CV cs.AI 版本更新 81%

PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition

PLGSA-Transformer:用于跨模态蒙面和非蒙面人脸识别的眼周地标引导注意力与遮挡自适应余弦阈值

Dana A Abdullah

机构 * Faculty of Engineering and Computer Science, Qaiwan International University(工程与计算机科学学院,卡伊万国际大学) Department of Information and Communication Technology Center (ICTC)-System Information, Ministry of Higher Education and Scientific Research(信息与通信技术中心(ICTC)-系统信息,高等教育与科学研究部)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对传统人脸识别系统在面部遮挡时的局限,提出PLGSA-Transformer框架。利用眼周地标引导注意力、混合CNN-Transformer分支建模及遮挡自适应余弦阈值,提升跨模态蒙面人脸识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16918 2026-07-15 cs.CV cs.AI 版本更新 79%

Xray-Visual Models: Scaling Vision models on Industry Scale Data

Xray-Visual模型:在产业级数据上扩展视觉模型

Shlok Mishra, Tsung-Yu Lin, Linda Wang, Hongli Xu, Yimin Liu, Michael Hsu, Chaitanya Ahuja, Hao Yuan, Jianpeng Cheng, Hong-You Chen, Haoyuan Xu, Chao Li, Sreya Dutta Roy, Abhijeet Awasthi, Jihye Moon, Don Husa, Michael Ge, Sumedha Singla, Arkabandhu Chowdhury, Phong Dingh, Satya Narayan Shukla, Yonghuan Yang, David Jacobs, Qi Guo, Jun Xiao, Xiangjun Fan, Aashu Singh

机构 * Meta-AI MIT(麻省理工学院) University of Maryland(马里兰大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 Xray-Visual通过三阶段训练流程和LLM2CLIP技术,在产业级数据上实现高效多模态视觉模型,取得最佳性能并提升鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12621 2026-07-15 cs.CV cs.IR 新提交 57%

Towards Vision-Free CIR: Attribute-Augmented Scoring and LLM-Based Reranking for Zero-Shot Composed Image Retrieval

迈向无视觉的合成图像检索:基于属性增强评分和基于大语言模型的重排的零样本合成图像检索

Ryotaro Shimada, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

机构 * The University of Tokyo(东京大学) Kioxia Corporation(铠侠株式会社)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究如何让无视觉方法有效处理合成图像检索任务,通过属性增强混合评分和基于大语言模型的重排两项关键技术构建框架,在开放域CIRR数据集实验中优于现有零样本方法,在FashionIQ上凸显语义推理与视觉匹配权衡,消融研究验证技术有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01506 2026-07-15 cs.LG 版本更新 50%

Beyond Logit Adjustment: A Residual Decomposition Framework for Long-Tailed Reranking

超越Logit调整:一种用于长尾重排的残差分解框架

Zhanliang Wang, Hongzhuo Chen, Quan Minh Nguyen, Mian Umair Ahsan, Kai Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) Children’s Hospital of Philadelphia(费城儿童医院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出残差分解框架,用于解决长尾分类中频繁类与稀有类的排序问题,通过分析残差分解的类内和类间组件,提出REPAIR方法以提升重排性能。

Comments Accepted into COLM 2026

Journal ref CONFERENCE ON LANGUAGE MODELING CONFERENCE ON LANGUAGE MODELING Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 81%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12965 2026-07-15 cs.RO 新提交 78%

MAMMOTH: A Multi-Modal End-to-End Policy for Off-Road Mobility Robust to Missing Modality

MAMMOTH:一种对缺失模态具有鲁棒性的越野移动多模态端到端策略

Ahaan Kotian, Shivani Subramanyan, Suresh Sundaram

机构 * Indian Institute of Science(印度科学研究所)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 研究针对非结构化越野环境自主导航难题,提出MAMMOTH多模态端到端策略。它融合多模态观测,用模态丢弃训练,还采用扩散策略学习联合概率分布,经实验验证性能优越,能提升避撞等能力及对缺失模态的泛化。

Comments Accepted to IROS 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 70%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28198 2026-07-15 cs.LG 版本更新 67%

Hierarchical Synthetic Tabular Data Generation: A Hybrid Top-Down and Bottom-Up Framework

层次化合成表格数据生成:一种自上而下与自下而上混合框架

Junfeng Nie, Alvin Jin, Xiaohui Chen

机构 * University of Southern California(南加州大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 提出一种层次化混合自上而下和自下而上(H-TDBU)框架,通过解耦语义结构与随机纹理,结合结构驱动的逻辑约束和轻量级表格生成器,在弱多模态金融基准上提升合成数据的语义一致性和统计保真度。

Comments Accepted as a poster at FMSD @ ICML 2026. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20101 2026-07-15 cs.SD cs.AI cs.MM 版本更新 62%

RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers

基于整流流的混合扩散变压器用于指令引导音频编辑

Liting Gao, Yonggang Zhu, Yaru Chen, Dongyu Wang, Shubin Zhang, Zhenbo Li, Jean-Yves Guillemaut, Wenwu Wang

机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(萨里大学视觉、语音与信号处理中心) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Fisheries College, Ocean University of China(中国海洋大学水产学院) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 提出混合两阶段扩散变压器架构,通过粗到细策略平衡全局语义对齐与局部细节编辑,在重叠音频事件和复杂指令任务上提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12042 2026-07-15 cs.CV cs.LG 新提交 57%

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏