arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4868 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4868 篇

2607.05943 2026-07-08 cs.AI 新提交 79%

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能

Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学多媒体实验室) THU(清华大学) HKU(香港大学) PKU(北京大学) NTU(南洋理工大学) CASIA(中国科学院自动化研究所) ECNU(华东师范大学) HIT(哈尔滨工业大学) LMU(慕尼黑大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态搜索智能体多跳推理的挑战,提出SearchEyes,用类型化知识图谱构建模拟搜索世界,通过感知-知识链采样路径并保留元数据,采用跳锚策略优化,在六个基准测试中取得最优性能。

Comments Project page: https://github.com/Frostlinx/SearchEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08949 2026-07-08 cs.CV 版本更新 79%

Tuned Reverse Distillation: Enhancing Multimodal Industrial Anomaly Detection with Crossmodal Tuners

调谐反向蒸馏:使用跨模态调谐器增强多模态工业异常检测

Xinyue Liu, Jianyuan Wang, Biao Leng, Shuo Zhang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of Education(教育部智能仿生无人系统重点实验室) School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文针对多模态工业异常检测问题,提出基于多分支设计的调谐反向蒸馏方法,通过为各模态设独立分支及设计跨模态调谐器,增强模态交互,能更精细检测异常,实验验证其在多模态异常检测和定位上达最优性能。

Comments Accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新 79%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27652 2026-06-29 cs.AI 新提交 79%

MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy

MER-R1:通过慢-快思维协同的多模态情感推理

Zhiyuan Han, Beier Zhu, Wenwen Tong, Chengwei Qin, Xinyi Wang, Jiayu Zhang, Jiangnan Chen, Hewei Guo, Dongchuan Ran, Lewei Lu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MER-R1强化学习框架,利用慢-快思维互补性优化多模态情感识别,通过双目标解耦和置信度校准联合优化召回率与精确度,实现SOTA性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22195 2026-06-23 cs.CV eess.SP 新提交 79%

Resolving Multi-Target Association in OFDM-based ISAC via Vision-aided Multi-Modal Learning

基于OFDM的ISAC中通过视觉辅助多模态学习解决多目标关联

Meng Hua, Chenghong Bian, Deniz Gunduz

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系) Department of Electrical and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电气与计算机工程系)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出视觉辅助OFDM-ISAC框架,融合无线与视觉模态,通过深度联合源信道编码传输图像、YOLOv5检测目标特征,并利用多模态网络与延迟-多普勒图关联,解决多目标模糊和分辨率限制,实现16cm定位RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15160 2026-06-16 cs.CV cs.LG 新提交 79%

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

DLWM: 多样化潜在世界模型用于高效多模态推理

David Huang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DLWM框架,结合潜在空间推理与强化学习,通过多样化潜在假设和资源感知策略提升多模态推理效率,准确率提升2-5%,内存减少24%。

Comments Preprint. 9 pages main text, 15 pages total including appendix, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20066 2026-06-16 eess.SP cs.AI 79%

A Multi-Modal Non-Invasive Deep Learning Framework for Progressive Prediction of Seizures

一种用于癫痫发作渐进预测的多模态非侵入式深度学习框架

Ali Saeizadeh, Douglas Schonholtz, Joseph S. Neimat, Pedram Johari, Tommaso Melodia

机构 * Institute for the Wireless Internet of Things, Northeastern University, Boston, MA, U.S.A.(无线物联网研究所,东北大学,波士顿,马萨诸塞州,美国) University of Louisville, Louisville, KY, U.S.A.(路易斯维尔大学,路易斯维尔,肯塔基州,美国)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于非侵入式多模态传感器网络的深度学习框架,用于癫痫发作的渐进预测,通过提高预测精度和实时处理能力,实现95%的灵敏度和98%的特异度。

Comments 4 pages, 5 figures, Proceedings of the IEEE 20th International Conference on Body Sensor Networks (BSN), October 2024

Journal ref 2024 IEEE 20th International Conference on Body Sensor Networks (BSN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06572 2026-06-12 cs.LG cs.AI 版本更新 79%

Hellinger Multimodal Variational Autoencoders

Hellinger多模态变分自编码器

Huyen Vo, Isabel Valera

机构 * Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) MPI-SWS, Saarland Informatics Campus(萨尔兰信息学校区Max Planck研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出基于Hellinger距离的矩匹配近似方法HELVAE,避免子采样,在多模态变分自编码器中实现更优的生成一致性与质量权衡。

Comments Accepted at AISTATS 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11977 2026-06-11 cs.CV 新提交 79%

ParseFixer: An Agentic Framework for Document Parsing via Selective Multimodal Correction

ParseFixer: 一种通过选择性多模态校正的文档解析智能体框架

LeKai Yu, Hao Liu, Kun Wang, Zhiran Li, Ruping Cao, Fan Liu, Yupeng Hu

机构 * Shandong University(山东大学) Southeast University(东南大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ParseFixer框架,结合全页骨干解析和智能体选择性校正,通过验证-回滚机制修复高价值解析错误,在DataMFM挑战赛文档解析任务中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11794 2026-06-11 cs.LG cs.AI 新提交 79%

Multimodal Ordinal Modeling of Alzheimer's Disease Severity Using Structural MRI and Clinical Data

使用结构MRI和临床数据的阿尔茨海默病严重程度的多模态序数建模

Boris-Stephan Rauchmann, Jonathan Laib, Buse Ercik, Robert Perneczky, Sergio Altares-López

机构 * Department of Neuroradiology, LMU University Hospital, Ludwig Maximilian University of Munich(神经放射科,慕尼黑路德维希-马克西米利安大学医院,慕尼黑路德维希-马克西米利安大学) Department of Psychiatry and Psychotherapy, LMU University Hospital, Ludwig Maximilian University of Munich(精神病学与心理治疗系,慕尼黑路德维希-马克西米利安大学医院,慕尼黑路德维希-马克西米利安大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种注意力增强的多模态序数回归框架,整合MRI、人口统计学和遗传数据,用于自动且可解释的AD严重程度分期,在ADNI等数据集上验证,序数模型在相邻阶段准确率(0.970)和与临床分期一致性(QWK 0.549)上表现最佳。

Comments 18 pages. Submitted to journal for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02568 2026-06-11 cs.AI 版本更新 79%

MLaGA: Multimodal Large Language and Graph Assistant

MLaGA: 多模态大语言与图助手

Dongzhe Fan, Yi Fang, Jiajin Liu, Djellel Difallah, Qiaoyu Tan

机构 * New York University(纽约大学) New York University Shanghai(纽约大学上海) New York University Brooklyn(纽约大学布鲁克林) Virginia Polytechnic Institute and State University(弗吉尼亚理工大学) New York University Abu Dhabi(纽约大学阿布扎克)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MLaGA模型,通过结构感知多模态编码器和指令微调,将大语言模型扩展到多模态图数据,在监督和迁移学习任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07801 2026-06-09 cs.AI 新提交 79%

Improving Multimodal Reasoning via Worst Dimension Optimization

通过最差维度优化改进多模态推理

Haocheng Lv, Huaping Zhang, Qiuchi Li, Lei Li, Chunxiao Gao

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出最差维度优化方法,通过识别并优先优化推理路径中最差的约束维度,提升多模态推理的整体有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21122 2026-06-08 cs.CV 79%

NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation

NoisyGRPO:通过噪声注入和贝叶斯估计激励多模态Co T推理

Longtian Qiu, Shan Ning, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 NoisyGRPO通过引入可控噪声增强探索并利用贝叶斯框架建模优势估计,提升多模态大语言模型的泛化能力和鲁棒性,尤其在小规模模型上表现突出。

Comments Accepted by Neurips 2025, Project page is available at https://artanic30.github.io/project_pages/NoisyGRPO/

Journal ref Advances in Neural Information Processing Systems 38 (2026) 124239-124267

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06249 2026-06-05 cs.CV cs.LG 79%

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

GRAMformer: 通过体积多模态交叉注意力实现任意顺序模态交互

Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecommunications, Sapienza University of Rome(信息工程、电子与电信系,罗马萨皮恩扎大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出体积多模态交叉注意力(VMA)机制,通过计算查询与多模态键向量的联合几何体积来建模任意顺序的模态交互,并集成到新型多模态Transformer架构GRAMformer中,提升多模态学习的有效性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.10379 2026-06-04 cs.GR cs.CV cs.NA math.NA 79%

Multi-modal 3D Shape Reconstruction Under Calibration Uncertainty using Parametric Level Set Methods

在校准不确定性下利用参数水平集方法进行多模态3D形状重建

Moshe Eliasof, Andrei Sharf, Eran Treister

机构 * Computer Science Department, Ben-Gurion University of the Negev(本古里安大学计算机科学系)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种参数化水平集方法,用于在存在校准不确定性时从多模态数据中重建3D形状,该方法能够有效处理不同数据模态,如稀疏点集、体素切片、2D照片等,并在复杂对象的紧凑表示和校准噪声鲁棒性方面取得了显著贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01012 2026-06-02 cs.AI cond-mat.mtrl-sci 79%

Property Prediction of Stacked Bilayer Materials: A Multimodal Learning Approach

堆叠双层材料的性质预测:一种多模态学习方法

An Vuong, Minh-Hao Van, Chen Zhao, Xintao Wu

机构 * University of Arkansas(亚拉巴马大学) Baylor University(贝勒大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出一种多模态学习方法,通过联合建模不同材料层间的界面,预测给定配置下垂直堆叠产生的性质,实验证明其有效性和高效性。

Comments Accepted to the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02528 2026-06-02 cs.AI cs.LG 79%

Multimodal Function Vectors for Visual Relations

视觉关系的多模态函数向量

Shuhao Fu, Esther Goldberg, Ying Nian Wu, Hongjing Lu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 通过因果中介分析提取多模态函数向量,操纵注意力头以改善视觉关系推理,并实现零样本和微调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29590 2026-05-29 cs.MM 79%

State-Anchored Complete-View Distillation for Robust Conversational Multimodal Emotion Recognition

状态锚定的完整视图蒸馏用于鲁棒对话多模态情感识别

Zhaoyan Pan, Xiangdong Li, Wenke Wu, Mengting Ma, Ye Lou, Ji Zhou, Jiatong Pan, Wei Zhang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 提出CoRe-KD框架,通过完整视图教师蒸馏和状态锚定对齐,结合非言语冲突暴露,解决对话多模态情感识别中模态缺失和冲突问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24684 2026-05-26 cs.LG cs.AI 79%

Beyond the Aggregation Dilemma: Prior-Retaining Decoupled Learning for Multimodal Graphs

超越聚合困境:多模态图的先验保持解耦学习

Hao Yan, Xuanru Wang, Jun Yin, Shirui Pan, Senzhang Wang, Chengqi Zhang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态属性图学习中强制聚合导致性能反转的聚合困境,提出解耦双路径架构SUPRA,通过保持先验特征的独立性和轻量级共享GNN捕获结构协同,并辅以深度监督缓解梯度饥饿,实现SOTA性能且显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05877 2026-05-21 cs.CL 79%

iReasoner: Trajectory-Aware Intrinsic Reasoning Supervision for Self-Evolving Large Multimodal Models

iReasoner: 一种面向轨迹的内在推理监督方法,用于自演化的大多模态模型

Meghana Sunil, Manikandarajan Venmathimaran, Muthu Subash Kavitha

机构 * Vellore Institute of Technology(韦洛雷理工学院) School of Information and Data Sciences(信息与数据科学学院) Nagasaki University(长崎大学) Loughborough University(洛桑大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出iReasoner,一种自演化框架,通过显式引导推理链和奖励内部一致性来提升大模型的隐式推理能力,在无监督设置下实现了多模态推理基准的性能提升。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04872 2026-05-19 stat.ML cs.AI cs.LG 79%

Multi-layer Cross-attention is Provably Optimal for Multi-modal In-context Learning

多层交叉注意力是多模态上下文学习中可证明最优的

Nicholas Barnfield, Subhabrata Sen, Pragya Sur

机构 * Harvard University(哈佛大学)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文研究了多模态上下文学习中多层交叉注意力机制的理论最优性,证明了在多模态数据下,交叉注意力机制在梯度流优化下可达到贝叶斯最优,同时指出单层线性自注意力无法在任务分布下统一恢复贝叶斯最优预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV 79%

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12556 2026-05-14 cs.CV 79%

M2Retinexformer: Multi-Modal Retinexformer for Low-Light Image Enhancement

M2Retinexformer:多模态Retinexformer用于低光图像增强

Youssef Aboelwafa, Hicham G. Elmongui, Marwan Torki

机构 * Alexandria University, Egypt(亚历山大大学,埃及)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出M2Retinexformer,通过融合深度线索、亮度先验和语义特征,改进低光图像增强效果,实验表明优于现有方法。

Comments Accepted at 2026 IEEE International Conference on Image Processing (ICIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11934 2026-05-13 cs.CV 79%

Interactive State Space Model with Cross-Modal Local Scanning for Depth Super-Resolution

交互式状态空间模型与跨模态局部扫描用于深度超分辨率

Chen Wu, Ling Wang, Zhuoran Zheng, Xiangyu Chen, Jingyuan Xia, Weidong Jiang, Jiantao Zhou

机构 * National University of Defense Technology(国防科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) University of Macau(澳门大学)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出交互式状态空间模型,通过跨模态局部扫描实现RGB与深度特征的细粒度语义交互,提升深度超分辨率的效率与语义交互能力。

Comments ISCAS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21678 2026-05-05 cs.AI cs.LG 79%

Agentic Learner with Grow-and-Refine Multimodal Semantic Memory

具有生长与细化多模态语义记忆的智能学习者

Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(AIML,阿德莱德大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ViLoMem框架,通过双流记忆系统整合视觉与逻辑知识,提升多模态任务表现,减少重复错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00644 2026-05-04 cs.LG cs.AI 79%

Learning Multimodal Energy-Based Model with Multimodal Variational Auto-Encoder via MCMC Revision

通过MCMC修订学习多模态能量模型与多模态变分自编码器

Jiali Cui, Zhiqiang Lao, Heather Yu

机构 * Futurewei Technologies Inc(未来联合技术公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出通过MCMC修订将多模态EBM、共享潜在生成器和联合推断模型的学习过程交织,提升多模态数据生成的质量与一致性。

Comments Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24987 2026-04-29 cs.AI 79%

Assessing Y-Axis Influence: Bias in Multimodal Language Models on Chart-to-Table Translation

评估Y轴影响:多模态语言模型在图表到表格翻译中的偏差

Seok Hwan Song, Azher Ahmed Efat, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨了多模态语言模型在图表到表格翻译中因Y轴信息不平衡导致的偏差问题,提出FairChart2Table框架,发现数字长度、刻度数量、值范围及刻度格式等影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21032 2026-04-24 cs.CV 79%

Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning

通过引导输入和推理链解锁多光谱数据以多模态模型

Dahun Kim, Ganesh Satish Mallya, Anelia Angelova

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的方法,将多光谱数据引入标准RGB-only LMMs的推理流程中,提升性能。通过适应非RGB输入并注入领域特定信息和推理链推理,实现多模态模型在遥感任务中的零样本性能提升。

Comments Accepted to IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19489 2026-04-22 cs.CV cs.CY 79%

Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

大规模识别候选人:用于推特视觉政治沟通的多模态大语言模型

Michael Achmann-Denkler, Mario Haim, Christian Wolff

机构 * Media Informatics Group University of Regensburg(媒体信息学组莱比锡大学) Department of Media and Communication Ludwig-Maximilians-Universität Munich, Germany(媒体与传播系路德维希-马克西米利安大学慕尼黑,德国)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文评估了专用机器学习模型和新兴多模态大语言模型在视觉政治沟通分析中的能力,展示了GPT-4o在识别领先政治人物和计数中的优越性能。

Comments An earlier version was presented at #SMSociety 2024 (London)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14738 2026-04-21 cs.CL 79%

AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning

AutoRubric: 基于评分标准的生成奖励用于忠实的多模态推理

Mengzhao Jia, Zhihan Zhang, Ignacio Cases, Zheyuan Liu, Meng Jiang, Peng Qi

机构 * University of Notre Dame(内布拉斯加大学) Uniphore

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 AutoRubric通过整合可验证奖励学习与过程级监督,利用自动收集的评分标准生成奖励,实现多模态推理的高保真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏