arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4865 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4865 篇

2607.15713 2026-07-20 eess.SP cs.AI cs.LG 新提交 83%

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

地图作为提示:学习用于跨场景无线定位的多模态空间信号基础模型

Yong Chu, Xun Zhou, Zenglin Xu, Hui Wang, Yue Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 针对无线定位在不同环境中面临的挑战及现有方法的局限,提出多模态基础模型SigMap,通过循环自适应掩码策略和“地图即提示”框架学习无线表示并实现跨场景适应,实验证明其性能领先且零样本泛化能力强。

Comments 17pages, 9 figures, poster in International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03184 2026-07-07 cs.CV 新提交 83%

BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

BVS:用于细粒度感知的基于多模态大语言模型的贝叶斯视觉搜索

Geng Li, Yuxin Peng

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在超高分辨率图像细粒度感知的难题,提出BVS框架,将感知设为连续空间尺度流形上的全局优化问题,通过先验引导与后验校正提升性能。

Comments Accepted by ICML 2026. Project page with code: https://github.com/PKU-ICST-MIPL/BVS_ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17118 2026-06-17 cs.LG cs.AI 新提交 83%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08464 2026-06-09 cs.CV 新提交 83%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01856 2026-06-02 cs.DC cs.AI 83%

Boosting Multimodal Federated Learning via Chained Modality Optimization

通过链式模态优化提升多模态联邦学习

Zixin Zhang, Fan Qi, Shuai Li, Xiaoshan Yang, Changsheng Xu

机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) College of Computer Science, Inner Mongolia University, Hohhot, Inner Mongolia, China(内蒙古大学计算机学院)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态联邦学习中模态竞争导致全局模型次优的问题,提出FedMChain框架,通过分阶段优化、误差补偿正则化和稀疏符号引导聚合,提升预测性能并降低通信开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08868 2026-06-02 cs.LG cs.AI 83%

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力

Junru Zhang, Lang Feng, Haoran Shi, Xu Guo, Han Yu, Yabo Dong, Duanqing Xu

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28869 2026-05-29 cs.LG cs.AI 83%

Balancing Multimodal Learning through Label Space Reshaping

通过标签空间重塑平衡多模态学习

Xiaoyu Ma, Weijie Zhang, Yuanhao Gao, Han Miao, Yongjian Deng, Hao Chen

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态学习中模态不平衡问题,提出基于标签空间重塑的BMLR方法,通过均衡各模态映射难度来提升多模态性能。

Comments In process

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18359 2026-05-27 cs.CV 83%

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

RAVE: 重新分配大型多模态模型中的视觉注意力

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20796 2026-05-27 cs.CL cs.LG 83%

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

解析多模态上下文学习:现代Transformer中的模态不对称性与电路动力学

Yiran Huang, Karsten Roth, Quentin Bouniot, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) DeepMind(深Mind) Beijing University of Posts(北京邮电大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 通过可控实验,研究现代Transformer中多模态上下文学习的基本机制,发现模态间学习不对称性,并揭示其背后的归纳式电路机制。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18044 2026-05-19 cs.IR cs.MM 83%

Modality-Aware Identity Construction and Counterfactual Structure Learning for ID-Free Multimodal Recommendation

模态感知的身份构建与反事实结构学习用于无ID多模态推荐

Hongjian Ma, Wenxin Huang, Yan Zhang, Zhifei Li, Zheng Wang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出了一种名为MAIL的新型方法,通过模态感知的身份构建模块和反事实结构学习范式,解决无ID多模态推荐中身份表示静态和图学习不足的问题,提升了推荐准确率。

Comments 11 pages, 5 figures, submitted to IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13140 2026-05-14 cs.CV 83%

Multi-Modal Guided Multi-Source Domain Adaptation for Object Detection

多模态引导的多源领域适应用于目标检测

Sangin Lee, Seokjun Kwon, Jeongmin Shin, Namil Kim, Yukyung Choi

机构 * Sejong University(世宗大学) NAVER LABS(NAVER实验室) Artificial Intelligence and Robotics Institute (AIRI)(人工智能与机器人研究所(AIRI))

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MS-DePro方法,通过深度引导定位和多模态引导提示学习,提升多源领域适应性能,实现目标检测的最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20223 2026-04-10 cs.LG cs.AI 83%

MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning

多模态PFN:扩展先验数据拟合网络以进行多模态表格学习

Wall Kim, Chaeyoung Song, Hanul Kim

机构 * Samsung Electronics(三星电子) Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 其他多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24004 2026-03-26 cs.CL 83%

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

基于表格的思考:通过神经符号推理增强多模态表格理解

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21944 2026-03-24 cs.CV 83%

Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection

Group3D: 基于多模态大语言模型的开放词汇3D目标检测语义分组

Youbin Kim, Jinho Park, Hogun Park, Eunbyung Park

机构 * Department of Artificial Intelligence, Sungkyunkwan University(成均馆大学人工智能系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 其他多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Group3D通过将语义约束整合到实例构建过程中,解决多视角开放词汇3D目标检测中的几何过合并问题,实现语义与几何一致性融合的检测框架。

Comments 24 pages, 7 figures, Project page: https://ubin108.github.io/Group3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13978 2026-03-17 cs.CV 83%

When Visual Privacy Protection Meets Multimodal Large Language Models

当视觉隐私保护与多模态大语言模型相遇

Xiaofei Hui, Qian Wu, Haoxuan Qu, Majid Mirmehdi, Hossein Rahmani, Jun Liu

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在提供便利性的同时如何保护视觉隐私,提出基于黑盒模型的优化框架,通过帕累托最优和关键历史增强优化实现隐私与性能的平衡。

Journal ref Int J Comput Vis (IJCV) 134, 167 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25934 2026-03-17 cs.CV 83%

UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression

UniMMAD: 一种基于MoE驱动特征解压的多模态多类别异常检测统一框架

Yuan Zhao, Youwei Pang, Lihe Zhang, Hanqi Liu, Jiaming Zuo, Huchuan Lu, Xiaoqi Zhao

专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniMMAD通过MoE驱动的特征解压机制,实现多模态和多类别异常检测的统一,解决传统方法在领域变化和内存占用上的不足,提升检测效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20197 2026-03-13 cs.LG cs.AI 83%

Controllable Exploration in Hybrid-Policy RLVR for Multi-Modal Reasoning

混合策略强化学习可调节探索用于多模态推理

Zhuoxu Huang, Mengxi Jia, Hao Sun, Xuelong Li, Jungong Han

机构 * Aberystwyth University(阿伯里斯特维斯大学) Institute of Artificial Intelligence (TeleAl)(人工智能研究所) China Telecom(中国电信) Tsinghua University(清华大学)

专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23830 2026-03-13 cs.DC cs.AI 83%

OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training

OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练

Yijie Zheng, Bangjun Xiao, Lei Shi, Xiaoyang Li, Faming Wu, Tianyu Li, Xuefeng Xiao, Yang Zhang, Yuxuan Wang, Shouda Liu

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09995 2026-03-06 eess.IV cs.CV 83%

Graph-Based Multi-Modal Light-weight Network for Adaptive Brain Tumor Segmentation

基于图的多模态轻量网络用于自适应脑肿瘤分割

Guohao Huo, Ruiting Dai, Zitong Wang, Junxin Kong, Hao Tang

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学)

专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于图的多模态轻量网络GMLN-BTS,通过多尺度语义提取、图结构建模和体素细化上采样模块,实现高精度且资源高效的脑肿瘤分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19188 2026-02-24 cs.CV 83%

PositionOCR: Augmenting Positional Awareness in Multi-Modal Models via Hybrid Specialist Integration

PositionOCR: 通过混合专家整合增强多模态模型的位置意识

Chen Duan, Zhentao Guo, Pei Fu, Zining Wang, Kai Zhou, Pengfei Yan

专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 PositionOCR通过整合文本定位专家与LLM的上下文能力,提升多模态模型在文本定位和定位任务中的位置准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13469 2026-02-20 cs.HC cs.AI 83%

How Multimodal Large Language Models Support Access to Visual Information: A Diary Study With Blind and Low Vision People

多模态大语言模型如何支持视障人士获取视觉信息:一项与盲人和低视力人士的日记研究

Ricardo E. Gonzalez Penuela, Crescentia Jung, Sharon Y Lin, Ruiying Hu, Shiri Azenkot

机构 * Cornell University(康奈尔大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究探讨了多模态大语言模型如何通过视觉助手技能支持视障人士获取视觉信息,并发现其在实际应用中的表现及改进方向。

Comments 24 pages, 17 figures, 7 tables, appendix section, to appear main track CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15580 2026-02-18 cs.AI 83%

How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning

视觉如何转化为语言:多模态推理的逐层信息论分析

Hongxuan Wu, Yukun Zhang, Xueqing Zhou

机构 * Duke kunshan University, Duke University(杜克昆山大学、杜克大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Fudan University, Shanghai, China(复旦大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究通过逐层信息论分析揭示多模态Transformer中视觉信息如何转化为语言,发现视觉独特信息早期峰值,语言独特信息在晚期层主导预测,跨模态协同较低,且任务依赖性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04486 2026-02-05 cs.CL 83%

Beyond Unimodal Shortcuts: MLLMs as Cross-Modal Reasoners for Grounded Named Entity Recognition

超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别

Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。

Comments GMNER

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20120 2026-01-30 cs.CV 83%

Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability Disproportion

从缓解分类能力失衡角度重新思考多模态学习

QingYuan Jiang, Longfei Huang, Yang Yang

机构 * Nanjing University of Science and Technology(南京理工大学) State Key Lab. for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于提升原理的多模态学习方法,通过动态平衡弱强模态的分类能力以缓解模态不平衡问题。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04459 2026-01-21 cs.CL cs.LG 83%

Uncertainty-Aware Collaborative System of Large and Small Models for Multimodal Sentiment Analysis

面向大规模和小规模模型的不确定性感知协作系统用于多模态情感分析

Shiqin Han, Manning Gao, Menghua Jiang, Yuncheng Jiang, Haifeng Hu, Sijie Mai

机构 * School of Computer Science, South China Normal University(计算机科学学院,华南师范大学) School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) School of Electronics and Information Technology, Sun Yat-sen University(电子与信息工程学院,中山大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本文提出U-ACS系统,通过整合UBM与MLLMs,利用不确定性感知机制提升多模态情感分析的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10294 2026-01-06 cs.CV 83%

A Mutual-Structure Weighted Sub-Pixel Multimodal Optical Remote Sensing Image Matching Method

一种互结构加权的子像素多模光学遥感图像匹配方法

Tao Huang, Hongbo Pan, Nanxi Zhou, Siyuan Zou, Shun Zhou

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于相位一致性互结构加权的子像素多模光学遥感图像匹配方法,通过粗到细的框架提升匹配精度,实测平均精度达0.4像素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05187 2025-12-02 cs.NI cs.AI cs.LG 83%

Resource-Efficient Beam Prediction in mmWave Communications with Multimodal Realistic Simulation Framework

毫米波通信中基于多模态真实模拟框架的高效波束预测

Yu Min Park, Yan Kyaw Tun, Eui-Nam Huh, Walid Saad, Choong Seon Hong

机构 * Department of Computer Science and Engineering, Kyung Hee University(计算机科学与工程系,庆尚大学) Bradley Department of Electrical and Computer Engineering, Virginia Tech(电气与计算机工程系,弗吉尼亚理工大学) Department of Electronic Systems, Aalborg University(电子系统系,奥尔堡大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模态真实模拟框架的资源高效学习框架,通过跨模态关系知识蒸馏算法,利用雷达数据实现高精度波束预测,同时降低计算复杂性和对多模态传感器数据的依赖。

Comments 13 pages, 9 figures, Submitted to IEEE Transactions on Mobile Computing on Dec. 01, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21120 2025-11-27 cs.LG cs.AI 83%

Learning Cell-Aware Hierarchical Multi-Modal Representations for Robust Molecular Modeling

学习细胞感知的层次多模态表示以实现稳健的分子建模

Mengran Li, Zelin Zang, Wenbin Xing, Junzhou Chen, Ronghui Zhang, Jiebo Luo, Stan Z. Li

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 CHMR通过联合建模分子与细胞反应的层次依赖关系,提升分子建模的稳健性和生物学基础。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02205 2025-11-05 cs.LG cs.CV 83%

OmniField: Conditioned Neural Fields for Robust Multimodal Spatiotemporal Learning

Kevin Valencia, Thilina Balasooriya, Xihaier Luo, Shinjae Yoo, David Keetae Park

机构 * UCLA(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) Brookhaven National Laboratory(布鲁克海文国家实验室)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 25 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21906 2025-10-28 cs.NE cs.AI 83%

Structure-Aware Cooperative Ensemble Evolutionary Optimization on Combinatorial Problems with Multimodal Large Language Models

Jie Zhao, Kang Hao Cheong

机构 * School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏