arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-14 至 2026-07-14 共收录 135 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 15 篇

2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09773 2026-07-14 cs.AI cs.CL cs.LG 新提交 62%

EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

EvoCUA-1.5:用于多轮计算机使用智能体的在线强化学习

Mianqiu Huang, Taofeng Xue, Chong Peng, Jinrui Ding, Sicheng Fan, Jiale Hong, Yufei Gao, Xiaocheng Zhang, Linsen Guo, Xin Yang, Dengchang Zhao, Yuchen Xie, Peng Pei, Xunliang Xie, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮计算机使用智能体的在线强化学习问题,提出EvoCUA-1.5,通过STEPO、DTAC等方法应对多轮交互挑战,经实验验证其提高了训练稳定性和下游性能,为在线强化学习提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11646 2026-07-14 cs.CV cs.RO 新提交 57%

Event-RGB Adaptive Tracking for Nighttime Highway Perception

用于夜间高速公路感知的事件-RGB自适应跟踪

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) School of Intelligence Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学智能科学与工程学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对高速公路夜间低光条件下RGB感知性能差的问题,提出JEAT框架,通过自适应扩展卡尔曼滤波器动态融合事件流与RGB帧,还创建SEHN数据集,为多模态融合研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 57%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10369 2026-07-14 cs.RO cs.AI 新提交 57%

VINE: Taming Generative Control Policies for Reinforcement Learning

VINE:驯服强化学习中的生成控制策略

Rushuai Yang, Zhuo Han, Houlin Li, Hecheng Wang, Zhichao Wu, Rui Zhang, Zhaowei Zhang, Zihong Chen, Xiaohan Yan, Chiming Liu, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot(未知机构) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对流匹配策略在值梯度强化学习中训练不稳定的问题,提出VINE方法。该方法通过在去噪步骤重建插值状态,创建稳定可微路径,实现稳定的端到端值梯度优化,在相关基准和任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10098 2026-07-14 cs.CV cs.LG 新提交 57%

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

DynaFilter:用于卫星边缘智能的云驱动动态过滤

Ziyang Zhang, Jie Liu, Luca Mottola

机构 * Politecnico di Milano(米兰理工大学) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星边缘系统带宽受限等问题,设计DynaFilter动态过滤技术,通过建立云查询语义与压缩域特征的映射,让边缘设备在压缩域直接进行选择性RoI推理,实现减少数据量、节省带宽、降低能耗及加快推理延迟等效果。

Comments 15 pages, 23 figures, accepted by ACM MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23328 2026-07-14 cs.CL 版本更新 57%

Emotion Recognition in Sign Language Conversation

手语对话中的情感识别

Yusong Wang, Keyu Mao, Takao Obi, Minghao Shao, Kotaro Funakoshi

机构 * Institute of Science Tokyo(东京科学研究所) New York University(纽约大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对手语情感识别缺乏对话上下文的问题,提出eJSL Dialog数据集,并系统评估了从孤立视觉网络到多模态对话架构的模型,发现通用多模态对话情感识别模型在手语领域存在领域差距,需要开发面向手语的上下文感知视觉提取器并扩大对话数据集规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09746 2026-07-14 q-bio.QM eess.IV 新提交 50%

Longitudinal MRI template of the baboon brain from birth to adolescence

从出生到青春期的狒狒大脑纵向MRI模板

Katherine L. Bryant, Arnaud Le Troter, David Meunier, Yannick Becker, Scott A. Love, Siham Bouziane, Kep Kee Loh, Julien Sein, Luc Renaud, Olivier Coulon, Adrien Meguerditchian

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究针对狒狒大脑从出生到青春期的发育,提出BABACOOL方法创建多模态发育图谱,生成BaBa21纵向发育模板,还提供全自动生成中间年龄模板的方法,为狒狒数据归一化及相关研究提供便利。

Comments 21 pages, 6 Figures, 6 Supplementary Figures, In Press

Journal ref Imaging Neuroscience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 9 篇

2604.17889 2026-07-14 cs.CV 版本更新 85%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15868 2026-07-14 cs.CV 版本更新 83%

SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval

SOLAR:用于对称多模态检索的自监督联合学习

Wenjie Yang, Hang Yu, Yuyu Guo, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出SOLAR框架,通过自监督学习解决对称多模态检索问题,利用未标记数据提升模型性能,实验显示其在基准测试中优于现有方法。

Comments Accepted by ICML 2026. Code, model and benchmark are available at https://github.com/codefuse-ai/SOLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04969 2026-07-14 cs.IR cs.AI 版本更新 83%

MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

MG$^2$-RAG:多粒度图用于多模态检索增强生成

Sijun Dai, Qiang Huang, Xiaoxing You, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新 79%

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10909 2026-07-14 cs.IR 新提交 78%

Stream-aware Side Adaptation for Large Pre-trained Multimodal Embedding Models in Sequential Recommendation

用于序列推荐中大型预训练多模态嵌入模型的流感知侧适应

Junchen Fu, Kaiwen Zheng, Ioannis Arapakis, Wenhao Deng, Xin Xin, Joemon M. Jose, Xuri Ge

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对大型预训练多模态嵌入模型用于序列推荐时因域不对准性能不佳的问题,提出Stresa框架,通过流感知隐藏适配器融合和残差流适配器,有效解锁模型潜力,实验证明其性能优于标准侧适配器和基线。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10698 2026-07-14 cs.LG cs.CV 新提交 74%

On the modality gap and the contrastive loss in multi-modal representation learning

关于多模态表示学习中的模态差距和对比损失

Fabian Mager, Hiba Nassar, Lars Kai Hansen

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CV

AI总结 研究CLIP风格双编码器对比学习中的模态差距,发现是InfoNCE公式在低温下的模式失败所致。提出xNCE方法,使用跨模态和模态内负对比对,能缩小模态差距,提升零样本分类性能且不牺牲判别几何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19733 2026-07-14 physics.chem-ph cs.LG 版本更新 71%

NMIRacle: Multi-modal Generative Molecular Elucidation from IR and NMR Spectra

NMIRacle:从红外和核磁共振谱进行多模生成分子解析

Federico Ottomano, Yingzhen Li, Alex M. Ganose

机构 * Federico Ottomano Yingzhen Li Alex M. Ganose

专题命中 跨模态检索 :multi-modal(title)

AI总结 NMIRacle通过两阶段生成框架,利用红外和核磁共振光谱数据实现分子结构的高精度解析,优于现有方法并保持复杂性下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17906 2026-07-14 cs.IR cs.AI 57%

Bayesian Active Learning with Gaussian Processes Guided by LLM Relevance Scoring for Dense Passage Retrieval

基于LLM相关性评分的高斯过程引导的贝叶斯主动学习用于密集段落检索

Junyoung Kim, Anton Korikov, Jiazhou Liang, Justin Cui, Yifan Simon Liu, Qianfeng Wen, Mark Zhao, Scott Sanner

机构 * Sungkyunkwan University(成均馆大学) University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出BAGEL框架,通过高斯过程引导LLM相关性评分,解决传统方法在语义不同聚类中检索失败和相关性信号传播不足的问题,实验证明其在四个数据集上优于LLM重排序方法。

Comments ACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09697 2026-07-14 cs.LG 新提交 50%

Safe responses matter: Output-aware safety guardrail mitigate over-refusal in MLLMs

安全响应很重要:输出感知安全护栏减轻多模态大语言模型中的过度拒绝

Jiayi Li, Kun Zhan

机构 * Lanzhou University(兰州大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究多模态大语言模型安全机制权衡问题,提出输出感知安全护栏范式,通过在模型隐藏状态空间预测及多实例对比学习训练分类器,减少过度拒绝,匹配安全性能,保留模型效用与安全能力。

Comments Accepted to ECCV 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 21 篇

2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 81%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09892 2026-07-14 eess.IV cs.AI 新提交 79%

Next-Dense-Stride Prediction for Multimodal Autoregressive Visual Modeling

用于多模态自回归视觉建模的下密集步长预测

Chicago Y. Park, Jialin Mao, Xiaojian Xu, Taha Kass-Hout, Ulugbek S. Kamilov, Cao Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) GE HealthCare(通用电气医疗)

专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 研究提出DenseAR范式,将自回归图像生成重构成下密集步长预测,解决现有模型局限。基于此扩展为统一模型处理多模态和成像任务,在医学和自然图像验证,在多对比脑MRI及ImageNet上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10287 2026-07-14 cs.CV 新提交 79%

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

InterPet4D:用于宠物运动生成的多模态4D人宠交互数据集

Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

机构 * Institute of Science Tokyo(东京科学研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 因缺乏高质量数据集,人宠交互研究不足。本文提出InterPet4D多模态数据集及InterPetMoGen框架,通过同步多视图系统记录交互并标注,含多类型数据,所提模型FID得分11.21,优于基线,有效模拟人宠交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交 79%

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 77%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 74%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 70%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 57%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10678 2026-07-14 cs.AI 新提交 57%

Personalized Emotional Intelligence in Generative AI through Symbolic Affective Reasoning

通过符号情感推理实现生成式人工智能中的个性化情商

Qing Lin, Mengmi Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究旨在解决生成式人工智能中缺乏个性化情感理解等问题,提出EROS混合框架,结合符号推理与深度学习,利用大规模数据集发现情感规则等,通过可扩展记忆库实现个性化,实验表明其能有效引发目标情感反应并适应个体偏好,为相关AI系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10535 2026-07-14 cs.CV 新提交 57%

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10159 2026-07-14 cs.AI 新提交 57%

UNIT: Unleash Large Language Models Potential for Graph Continual Learning

UNIT:释放大语言模型在图连续学习中的潜力

Tairan Huang, Yili Wang, Beibei Hu, Yiting Shi, Qiutong Li, Changlong He, Jianliang Gao

机构 * Central South University(中南大学) Hongkong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hunan Institute of Engineering(湖南工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对图连续学习面临的语义-结构分离和知识转移不平衡问题,提出UNIT框架,通过微调大语言模型、引入不确定感知锚点生成机制和结构融合建模,提升模型适应性与跨任务知识保留能力,在图连续学习任务中达最优性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10388 2026-07-14 cond-mat.mtrl-sci cs.AI 新提交 57%

The evolution of AI from image interpretation toward scientific inference in nanoparticle electron microscopy

人工智能在纳米颗粒电子显微镜中从图像解释到科学推理的演变

Evropi Toulkeridou, Jiafei Li, Leonardo Lari, Panagiotis Grammatikopoulos

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 综述纳米颗粒电子显微镜中人工智能从图像解释到科学推理的演变,围绕颗粒表征挑战,回顾从传统机器学习到多种先进方法,探讨整合多方面数据,评估现有方法利弊,强调其在下一代纳米颗粒表征及加速材料发现中的作用。

Comments Main article: 34 pages, 8 figures (including Graphical Abstract), 5 tables. Appendix: 18 pages, 1 figure, 4 tables. This manuscript has been submitted (after invitation) to Advanced Intelligent Discovery for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13184 2026-07-14 cs.CV 57%

Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process

Triad: 通过视觉专家引导的视觉标记器和制造过程增强基于LMM的异常检测

Yuanze Li, Shihao Yuan, Haolin Wang, Qizhang Li, Ming Liu, Chen Xu, Guangming Shi, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Lab(鹏城实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Triad通过引入视觉专家引导的标记器和制造过程,提升基于LMM的工业异常检测性能。

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 21917-21926. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏