arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4878 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 4878 篇

2608.14377 2026-08-17 cs.CL cs.CV 新提交 62%

A Survey of Large Models in Sports

体育领域的大模型综述

Yichen Xu, Jianzhe Ma, Chuhan Wang, Zhonghao Cao, Liangyu Chen, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该文综述体育领域大模型的任务应用、数据集基准,分析挑战与未来方向,为大模型驱动的体育智能研究与发展提供基础。

Comments 36 pages, 4 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09935 2026-08-04 cs.CL cs.AI 版本更新 62%

Unpacking Hateful Memes: Presupposed Context and False Claims

解析仇恨表情包:预设语境与虚假主张

Weibin Cai, Jiayu Li, Reza Zafarani

机构 * Syracuse University(Syracuse大学)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文针对仇恨表情包检测中忽略仇恨本质的问题,提出含PCM与FACT模块的SHIELD框架,实验显示其检测性能优于现有最优方法,且可用于假新闻检测等任务。

Comments Accepted to SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25324 2026-07-29 cs.CV cs.AI 新提交 62%

Balanced Soft mixture-of-expert model for Glaucoma Detection

用于青光眼检测的平衡软专家混合模型

Sai Venkatesh Chilukoti, Krishna Rauniyar, Min Shi, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) School of Computing and Informatics(计算与信息学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对青光眼检测,提出含三个专家及负载平衡损失的平衡软专家混合模型,解决多模态学习问题,其性能通过AUC衡量,超越多种基线和模型,还可推广至其他疾病检测。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 62%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 62%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01554 2026-07-20 cs.SD cs.AI eess.AS 62%

MOSS Transcribe Diarize Technical Report

MOSS 语音转录与说话人识别技术报告

MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14769 2026-07-17 cs.CL cs.AI cs.MA 新提交 62%

Dialogue Summarization with Emotion Dynamics Using Topic- and Participant-Centric Decomposition

使用以主题和参与者为中心的分解方法进行具有情感动态的对话摘要

Linyun Xiang, Mark Neerincx, Stephanie Tan

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对对话摘要问题,提出基于改进分层智能体链方法的框架,从主题和参与者两个视角分解对话,结合自动推断情感生成摘要,并引入情感轨迹指标评估,实验表明其框架能生成含语义和情感内容的摘要,凸显方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09140 2026-07-09 cs.LG cs.AI cs.CV 62%

Learning to Explore for Stochastic Gradient MCMC

为随机梯度MCMC学习探索

SeungHyun Kim, Seohyeon Jung, Seonghyeon Kim, Juho Lee

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种元学习策略,使SGMCMC能够高效探索多模态后验分布,提升采样效率并优于传统SGMCMC方法。

Journal ref Proceedings of the 41st International Conference on Machine Learning, Proceedings of Machine Learning Research 235:24015-24039, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14761 2026-07-08 cs.LG cs.AI cs.CV 版本更新 62%

Universal Algorithm-Implicit Learning

通用算法隐式学习

Stefano Woerner, Seong Joon Oh, Christian F. Baumgartner

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对当前元学习方法局限性,引入理论框架定义实际通用性及算法显隐式学习。提出基于Transformer的TAIL算法,有随机投影等创新,在少样本基准测试中性能领先,能推广到未见领域和模态,处理更多类别任务且节省计算成本。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06056 2026-06-05 cs.CY cs.AI cs.CV 62%

Using street view images and visual LLMs to predict heritage values for governance support: Risks, ethics, and policy implications

利用街景图像和视觉大语言模型预测遗产价值以支持治理:风险、伦理与政策影响

Tim Johansson, Mikael Mangold, Kristina Dabrock, Anna Donarelli, Ingrid Campo-Ruiz

机构 * RISE Research Institutes of Sweden AB(瑞典RISE研究机构) Malmö University(马尔默大学) Forschungszentrum Jülich GmbH(朱利奇研究中心) Uppsala University(乌普萨拉大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究利用街景图像和视觉大语言模型评估瑞典建筑遗产价值,以支持建筑翻新计划的制定,探讨了方法中的问题、潜在改进以及使用LLM数据的伦理风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-05-27 cs.AI cs.CV 62%

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18904 2026-05-20 cs.LG cs.AI cs.CL 62%

Dynamic Model Merging Made Slim

动态模型合并的轻量级方法

Guodong Du, Wanyu Lin

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiDi-Merging方法,通过可微分的秩分配平衡共享和专家参数,实现更高效的动态模型合并,在参数量上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16397 2026-05-19 cs.CV cs.AI 62%

Trajectory-Aware Adaptive Inference in Object Detection Models

轨迹感知的自适应推理在目标检测模型中

Grigorios Papanikolaou, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电子与计算机工程系,国家技术大学亚历山大学院,希腊) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学,西罗斯,希腊)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用GPS轨迹数据优化目标检测模型的推理过程,通过引入早退机制减少计算成本,提升实时感知效率。

Comments Accepted to the MuseKDE workshop of the IEEE MDM 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24082 2026-04-28 cs.CR cs.AI cs.CL 62%

Jailbreaking Frontier Foundation Models Through Intention Deception

通过意图欺骗突破前沿基础模型

Xinhe Wang, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种多轮欺骗方法,通过模拟良性意图和模型一致性,引导模型生成有害输出,并揭示了未被注意到的para-jailbreaking漏洞。

Comments Accepted at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09591 2026-04-23 cs.CV cs.AI 62%

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

变分视觉问答用于不确定性感知的选择性预测

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。

Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16587 2026-04-21 cs.CV cs.AI 62%

Real-Time Visual Attribution Streaming in Thinking Model

多模态思维模型中的实时视觉归因流

Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

机构 * Seil Kang Woojung Han Junhyeok Kim Jinyeong Kim Youngeun Kim Seong Jae Hwang

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于多模态思维模型实时视觉归因流的近似框架,通过学习从注意力特征中直接估计语义区域的因果效应,实现轻量级学习而非暴力计算的高保真归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15488 2026-04-20 cs.LG cs.AI cs.CL 62%

FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models

FineSteer: 一种用于大语言模型推理时细粒度引导的统一框架

Zixuan Weng, Jinghuai Zhang, Kunlin Cai, Ying Li, Peiran Wang, Yuan Tian

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FineSteer框架,通过条件引导和细粒度向量合成两个阶段实现高效引导,保留模型效用并提升引导效果,实验显示其在安全性和真实性基准上表现优异。

Comments Accepted by ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09711 2026-04-14 cs.CV cs.CL 62%

Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality

在多模态大语言模型中实现模态专精以在缺失模态下实现鲁棒的虚假新闻检测

Kai Qian, Weijie Shi, Jiaqi Wang, Mengze Li, Hao Chen, Yue Cui, Hanghui Guo, Ziyi Liu, Jia Zhu, Jiajie Xu

机构 * Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学) Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) The Hong Kong University of Science and Technology(香港科技大学) FiT, Tencent(腾讯FiT) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Education, Zhejiang Normal University(浙江师范大学教育学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出在多模态大语言模型中通过头级专精机制提升鲁棒性,以应对缺失模态下的虚假新闻检测,通过保留模态专精能力与利用稀疏单模注释提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07725 2026-04-13 cs.AI cs.CL 62%

Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution

Squeeze Evolve:无验证者演化的统一多模型协调

Monishwaran Maheswaran, Leon Lakhani, Zhongzhu Zhou, Shijia Yang, Junxiong Wang, Coleman Hooper, Yuezhou Hu, Rishabh Tiwari, Jue Wang, Harman Singh, Qingyang Wu, Yuqing Jian, Ce Zhang, Kurt Keutzer, Tri Dao, Xiaoxia Wu, Ben Athiwaratkun, James Zou, Chenfeng Xu

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Together AI

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Squeeze Evolve框架,通过动态分配模型能力提升无验证者演化的多样性与效率,实验证明其在多个基准测试中显著降低成本并提升性能。

Comments 40 Pages, Project Page: https://squeeze-evolve.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02903 2026-04-06 cs.CV cs.AI 62%

RayMamba: Ray-Aligned Serialization for Long-Range 3D Object Detection

RayMamba:基于射线对齐的长距离3D目标检测串行化

Cheng Lu, Mingqian Ji, Shanshan Zhang, Zhihao Li, Jian Yang

机构 * School of Computer Science and Technology, Nanjing University of Science and Technology(南京理工大学计算机科学与技术学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RayMamba通过射线对齐策略优化稀疏场景下的3D目标检测,提升远距离场景的上下文建模效率,实现mAP和NDS的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02991 2026-04-03 cs.CV cs.AI 62%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04923 2026-04-01 cs.CV cs.AI 62%

REN: Anatomically-Informed Mixture-of-Experts for Interstitial Lung Disease Diagnosis

REN:基于解剖学的专家混合模型用于间质性肺病诊断

Alec K. Peltekian, Halil Ertugrul Aktas, Gorkem Durak, Kevin Grudzinski, Bradford C. Bemiss, Carrie Richardson, Jane E. Dematte, G. R. Scott Budinger, Anthony J. Esposito, Alexander Misharin, Alok Choudhary, Ankit Agrawal, Ulas Bagci

机构 * Department of Computer Science, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院计算机科学系) Division of Pulmonary and Critical Care Medicine, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院肺与危重症医学科) Division of Rheumatology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院风湿病科) Simpson Querrey Lung Institute for Translational Science, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院辛普森·奎雷转化科学肺研究所) Department of Electrical and Computer Engineering, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院电气与计算机工程系) Machine & Hybrid Intelligence Lab, Department of Radiology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院放射科机器与混合智能实验室)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出REN模型,通过解剖学指导的专家混合框架提升间质性肺病诊断性能,结合多模态门控机制和深度学习特征,实现更精确的病理变化建模。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26737 2026-03-31 cs.CV cs.AI 62%

Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning

超越静态视觉标记:结构化的顺序视觉推理

Guangfu Guo, Xiaoqian Lu, Yue Feng, Mingming Sun

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21054 2026-03-24 cs.LG cs.AI cs.MM 62%

Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios

在多媒体场景中,有害视觉内容操纵对虚假信息检测的重要性

Bing Wang, Ximing Li, Changchun Li, Jinjin Chi, Tianze Li, Renchu Guan, Shengsheng Wang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学高级技术学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出一种新颖的多模态虚假信息检测方法,通过捕捉视觉内容操纵特征和意图特征,提升虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05542 2026-03-19 cs.DB cs.AI cs.ET cs.GR cs.HC cs.MM 62%

Human-Data Interaction, Exploration, and Visualization in the AI Era: Challenges and Opportunities

人工智能时代的人机交互、探索与可视化:挑战与机遇

Jean-Daniel Fekete, Yifan Hu, Dominik Moritz, Arnab Nandi, Senjuti Basu Roy, Eugene Wu, Nikos Bikakis, George Papastefanatos, Panos K. Chrysanthis, Guoliang Li, Lingyun Yu

机构 * Northeastern Univ., USA(东北大学) Ohio State Univ., USA(俄亥俄州立大学) Columbia Univ., USA(哥伦比亚大学) Athena RC, Greece(雅典娜研究组) Tsinghua Univ., China(清华大学) Xi’an Jiaotong-Liverpool Univ., China(西安交通大学利物浦大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文探讨人工智能发展带来的挑战,分析用户与数据互动的新方式,并提出构建以人为中心的AI系统的新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10010 2026-03-12 cs.CL cs.AI 62%

FERRET: Framework for Expansion Reliant Red Teaming

FERRET:扩展依赖的红队框架

Ninareh Mehrabi, Vitor Albiero, Maya Pavlova, Joanna Bitton

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 FERRET框架通过多方面的扩展机制,提升多模态对抗对话的有效性和效率,优于现有红队方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04002 2026-03-05 cs.CV cs.AI 62%

Discriminative Perception via Anchored Description for Reasoning Segmentation

通过锚定描述实现的判别感知用于推理分割

Tao Yang, Qing Zhou, Yanliang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03975 2026-03-05 cs.AI cs.CV 62%

Phi-4-reasoning-vision-15B Technical Report

Phi-4-reasoning-vision-15B 技术报告

Jyoti Aneja, Michael Harrison, Neel Joshi, Tyler LaBonte, John Langford, Eduardo Salinas

机构 * Microsoft Research(微软研究院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Phi-4-reasoning-vision-15B 是一个紧凑型开放式权重多模态推理模型,通过系统数据处理和架构优化,在减少计算资源的同时实现高效推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00565 2026-03-03 cs.CV cs.AI cs.CR 62%

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

MIDAS: 多图像分散与语义重建用于对抗多模态大语言模型

Yilian Liu, Xiaojun Jia, Guoshun Nan, Jiuyang Lyu, Zhican Chen, Tao Guan, Shuyuan Luo, Zhongyi Zhai, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MIDAS通过多图像分散与语义重建技术,提升对抗多模态大语言模型的劫持性能,达到81.46%的平均攻击成功率。

Journal ref The Fourteenth International Conference on Learning Representations(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19319 2026-02-24 cs.MM cs.AI cs.CR cs.DB cs.DC 62%

Health+: Empowering Individuals via Unifying Health Data

Health+: 通过统一健康数据赋能个体

Sujaya Maiyya, Shantanu Sharma, Avinash Kumar

机构 * University of Waterloo(滑铁卢大学) New Jersey Institute of Technology(新泽西理工学院) Independent Researcher(独立研究者)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 Health+ 是一个以用户为中心的多模态健康数据管理系统,通过统一数据和智能推荐,提升个体对健康信息的控制与管理能力。

Comments This paper has been accepted in ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏