arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2509.25896 2026-03-11 cs.CV 83%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01555 2026-03-11 eess.IV cs.CV 83%

MGCR-Net:Multimodal Graph-Conditioned Vision-Language Reconstruction Network for Remote Sensing Change Detection

MGCR-Net:多模态图条件视觉-语言重建网络用于遥感变化检测

Chengming Wang, Guodong Fan, Jinjiang Li, Min Gan, C. L. Philip Chen

机构 * School of Computer Science and Technology, Shandong Technology and Business University(山东科技职业大学计算机科学与技术学院) School of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MGCR-Net通过多模态图条件视觉-语言重建机制提升遥感变化检测的语义交互能力。

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-15, 2026, Art no. 4701515

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 62%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21192 2026-03-11 cs.CV cs.AI 62%

When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models

当机器人服从补丁:对视觉-语言-动作模型的通用可转移补丁攻击

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Qixin Zhang, Bingquan Shen, Alex C. Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University(罗思实验室,跨学科研究生项目,南洋理工大学) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(罗思实验室,电子与电气工程学院,南洋理工大学) CCDS, Nanyang Technological University(CCDS,南洋理工大学) DSO National Laboratories(国防科学局实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UPA-RFAS框架,通过鲁棒特征、注意和语义方法,实现对视觉-语言-动作模型的通用可转移补丁攻击,揭示了基于补丁的攻击面并为未来防御提供基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09826 2026-03-11 cs.CV 57%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09566 2026-03-11 cs.CV 57%

GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning

GeoAlignCLIP: 通过多粒度一致性学习增强遥感中的细粒度视觉-语言对齐

Xiao Yang, Ronghao Fu, Zhuoran Duan, Zhiwen Lin, Xueyan Liu, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室,吉林大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 GeoAlignCLIP通过多粒度一致性学习提升遥感中细粒度视觉-语言对齐,构建RSFG-100k数据集并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03930 2026-03-11 cs.CV 57%

N-gram Injection into Transformers for Dynamic Language Model Adaptation in Handwritten Text Recognition

基于N-gram注入的Transformer在手写文本识别中的动态语言模型适应

Florent Meyer, Laurent Guichard, Yann Soullard, Denis Coquenet, Guillaume Gravier, Bertrand Coüasnon

机构 * ANTAI, Rennes, France(ANTAI研究院,法国里昂) Univ Rennes, CNRS, IRISA - UMR 6074, Rennes, France(里昂大学,法国国家科学研究中心,IRISA-UMR 6074,法国里昂)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出N-gram注入方法,用于在手写文本识别中动态调整Transformer的语言模型,以应对目标语料分布偏移问题,提升识别精度。

Comments Fix order of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08921 2026-03-11 cs.CV cs.LG 57%

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

视觉-语言模型编码临床指南以实现基于概念的医学推理

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi

机构 * Queen’s University(女王大学) University of British Columbia(不列颠哥伦比亚大学) McMaster University(麦马斯特大学) Vector Institute(向量研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2603.08967 2026-03-11 cs.CV eess.AS 86%

Can You Hear, Localize, and Segment Continually? An Exemplar-Free Continual Learning Benchmark for Audio-Visual Segmentation

你能持续地听、定位和分割吗?面向音频视频分割的无示例持续学习基准

Siddeshwar Raghavan, Gautham Vinod, Bruce Coburn, Fengqing Zhu

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出无示例持续学习基准和ATLAS模型,通过低秩锚定缓解灾难性遗忘,验证了在动态环境下音频视频分割的持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG 84%

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09809 2026-03-11 cs.CV 83%

RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding

RA-SSU:迈向细粒度音频视觉学习的区域感知声音源理解

Muyi Sun, Yixuan Wang, Hong Wang, Chen Su, Man Zhang, Xingqun Qi, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科技大学跨学科研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 RA-SSU通过构建细粒度音频视觉数据集和SSUFormer模型,实现区域感知的声音源理解,提升音频视觉学习的细粒度表现。

Comments Accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09084 2026-03-11 cs.CV 83%

OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing

OmniEdit: 一种无需训练的唇同步与音频视觉编辑框架

Lixiang Lin, Siyuan Jin, Jinshan Zhang

机构 * HiThink Research(HiThink研究机构) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 OmniEdit提出一种无需训练的框架,通过替换编辑序列和去除随机元素,实现唇同步与音频视觉编辑的高效稳定处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09212 2026-03-11 eess.AS 70%

Acoustic and Semantic Modeling of Emotion in Spoken Language

语音中情感的声学与语义建模

Soumya Dutta

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本研究通过联合建模声学与语义信息,提升语音中情感的理解与合成能力,提出情感意识的预训练框架和对话场景下的情感识别方法,以及无文本的语音情感风格转换技术。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06195 2026-03-11 cs.CL cs.AI cs.LG eess.AS 67%

Latent Speech-Text Transformer

潜在语音-文本变换器

Yen-Ju Lu, Yashesh Gaur, Wei Zhou, Benjamin Muller, Jesus Villalba, Najim Dehak, Luke Zettlemoyer, Gargi Ghosh, Mike Lewis, Srinivasan Iyer, Duc Le

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 潜在语音-文本变换器通过聚合语音标记为潜在块,提升计算效率并改善跨模态对齐,实现语音和文本性能的双重提升。

Comments Accepted to ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09627 2026-03-11 eess.AS 57%

Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models

Speech-Omni-Lite: 用于视觉-语言模型的便携式语音接口

Dehua Tao, Xuan Luo, Daxin Tan, Kai Chen, Lanqing Hong, Jing Li, Ruifeng Xu, Xiao Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 Speech-Omni-Lite通过轻量模块扩展视觉-语言模型,实现低成本语音理解和生成,同时保持原有性能,实验显示其在少量语音数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2508.10729 2026-03-11 cs.CV cs.AI 81%

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

EgoCross:多模态大语言模型跨领域眼动视频问答基准测试

Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 EgoCross提出一个跨领域眼动视频问答基准,评估多模态大语言模型在不同领域中的泛化能力,揭示现有模型在非日常领域任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09287 2026-03-11 cs.CV 79%

Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking

探索多模态感知融合与解耦时间传播用于多模态目标跟踪

Shilei Wang, Pujian Lai, Dong Gao, Jifeng Ning, Gong Cheng

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 MDTrack通过模态感知融合和解耦时间传播提升多模态目标跟踪性能,实现统一的模态处理和独立的时间信息捕捉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08927 2026-03-11 cs.CV cs.MM 62%

MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering

MEGC2026:面向视觉问答的微表情大奖挑战

Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, CAS & Department of Psychology, University of the Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室及中国科学院大学心理学系) School of Mathematical and Computer Sciences, Heriot-Watt University Malaysia(赫瑞-沃森大学马来西亚分校数学与计算机科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 MEGC2026通过视觉问答任务探索微表情识别,利用多模态大语言模型和大视觉-语言模型提升微表情分析能力。

Comments MEGC 2026 at IEEE FG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV 57%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09482 2026-03-11 cs.RO 50%

StyleVLA: Driving Style-Aware Vision Language Action Model for Autonomous Driving

StyleVLA: 驾驶风格感知的视觉语言动作模型用于自动驾驶

Yuan Gao, Dengyuan Hua, Mattia Piccinini, Finn Rasmus Schäfer, Korbinian Moller, Lin Li, Johannes Betz

专题命中 视频多模态 :multimodal(abstract)

AI总结 StyleVLA通过引入物理约束和混合损失,生成多样且物理合理的驾驶行为,优于现有专有和先进模型。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09070 2026-03-11 cs.RO 50%

3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model

通过语言模型从互联网视频中估计和分类3D无人机轨迹

Haoxiang Lei, Daotong Wang, Shenghai Yuan, Jianbo Su

专题命中 视频多模态 :cross-modal(abstract)

AI总结 本文提出通过语言模型从互联网视频中估计和分类无人机3D轨迹,无需人工标注,实现了高效的数据采集与轨迹推断。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2603.06698 2026-03-11 cs.CV 74%

Breaking the Geometric Bottleneck: Contrastive Expansion in Asymmetric Cross-Modal Distillation

突破几何瓶颈:不对称跨模态蒸馏中的对比扩展

Kabir Thayani

专题命中 跨模态检索 :cross-modal(title);分类 cs.CV

AI总结 本研究通过对比扩展方法解决不对称跨模态蒸馏中的维度坍缩问题,揭示了容量与密度之间的权衡关系。

Comments Introduced auxiliary InfoNCE objective to reverse dimensional collapse. Expanded experiments to DINOv2 teacher and CIFAR-100 dataset. 3 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09185 2026-03-11 cs.CL 57%

DEO: Training-Free Direct Embedding Optimization for Negation-Aware Retrieval

DEO:无训练直接嵌入优化用于否定感知检索

Taegyeong Lee, Jiwon Park, Seunghyun Hwang, JooYoung Jang

机构 * Department of Industrial Engineering, Hanyang University(工业工程系,翰阳大学) Department of Applied Data Science, Sungkyunkwan University(应用数据科学系,成均馆大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 DEO通过无训练的直接嵌入优化方法,提升了否定和排除感知检索的性能,尤其在多模态检索中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18384 2026-03-11 cs.CV 57%

LiDAR Remote Sensing Meets Weak Supervision: Concepts, Methods, and Perspectives

LiDAR遥感与弱监督学习:概念、方法与展望

Yuan Gao, Shaobo Xia, Pu Wang, Xiaohuan Xi, Sheng Nie, Cheng Wang

机构 * aircas.ac.cn(航空科学研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文从弱监督学习视角系统回顾了LiDAR遥感的最新进展,探讨了弱监督方法在数据解释、参数反演及跨域适应中的应用,并展望了WSL在提升LiDAR遥感性能与泛化能力方面的未来方向。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 235, May 2026, Pages 72-104

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 14 篇

2603.09877 2026-03-11 cs.CV 83%

InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing

InternVL-U: 使统一多模态模型在理解、推理、生成和编辑方面更加普及

Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Leyao Gu, Haomin Wang, Qi Wei, Jinhui Yin, Xue Yang, Zhihang Zhong, Qi Qin, Yi Xin, Bin Fu, Yihao Liu, Jiaye Ge, Qipeng Guo, Gen Luo, Hongsheng Li, Yu Qiao, Kai Chen, Hongjie Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Xiamen University(厦门大学) CUHK MMLab(香港中文大学MMLab)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 InternVL-U通过轻量级统一多模态模型,在保持强大生成能力的同时,实现了在理解、推理、生成和编辑方面的高效平衡。

Comments technical report, 61 pages, https://github.com/OpenGVLab/InternVL-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09931 2026-03-11 cs.CV cs.AI 81%

Adaptive Clinical-Aware Latent Diffusion for Multimodal Brain Image Generation and Missing Modality Imputation

自适应临床感知潜在扩散用于多模态脑图像生成与缺失模态插值

Rong Zhou, Houliang Zhou, Yao Su, Brian Y. Chen, Yu Zhang, Lifang He, Alzheimer's Disease Neuroimaging Initiative

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ACADiff通过自适应临床感知扩散模型,实现多模态脑图像生成与缺失模态插值,提升阿尔茨海默病诊断的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 79%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09536 2026-03-11 cs.HC cs.MM 79%

Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective

动态多模态表达生成用于基于大语言模型的教育代理:从用户体验视角

Ninghao Wan, Jiarun Song, Fuzheng Yang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于大语言模型的动态多模态表达生成方法,通过生成协调的语音和手势指令,提升教育代理的沉浸感和自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12130 2026-03-11 cs.CL 79%

PRISM of Opinions: A Persona-Reasoned Multimodal Framework for User-centric Conversational Stance Detection

观点PRISM:一种基于人设的多模态框架用于以用户为中心的对话立场检测

Bingbing Wang, Zhixin Bai, Zhengda Jin, Zihan Wang, Xintong Song, Jingjie Lin, Sixuan Li, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) Macau University of Science and Technology, Hong Kong, China(澳门科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 PRISM通过多模态和用户人设分析,提升对话立场检测的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05433 2026-03-11 cs.LG cs.NE 78%

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

多模态大语言模型辅助进化搜索用于程序化控制策略

Qinglong Hu, Xialiang Tong, Mingxuan Yuan, Fei Liu, Zhichao Lu, Qingfu Zhang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究提出多模态大语言模型辅助进化搜索方法,用于生成透明且可验证的程序化控制策略,通过结合视觉反馈与进化搜索提高策略发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏