arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-13 至 2026-07-13 共收录 38 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2607.07361 2026-07-13 cs.CV 新提交 74%

BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

BUS:用于高级多模态推理的受脑启发的无监督自我反思

Jiacheng Yang, Tongying Xiao, Yunkai Dang, Cong Wang, Yuekun Yang, Qi Fan, Tianyu Ding, Wenbin Li, Feng Miao, Yang Gao

机构 * AAAI Press(美国人工智能协会出版社)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交 62%

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09443 2026-07-13 cs.CV cs.AI 新提交 62%

Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

基于连续元数据条件的参数高效视觉语言适配用于动物再识别

Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen, Cigdem Beyan

机构 * Department of Computer Science, University of Verona(维罗纳大学计算机科学系) Institute of Marine Research(海洋研究所) University of Agder, Centre for Coastal Research(阿格德大学海岸研究中心)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对动物再识别中适应纵向生态环境的挑战,提出基于连续元数据条件的参数高效CLIP适配框架,通过保留元数据连续结构,在训练中平滑调制嵌入空间,提升了对外观变化和分布偏移的鲁棒性,实现纯视觉推理管道。

Comments This is the author's version of the paper accepted for publication in Expert Systems with Applications. The final authenticated version will be available from the publisher

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09544 2026-07-13 cs.CV cs.LG 新提交 57%

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

计数存在但未对齐:理解和纠正视觉语言模型中的计数失败

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Imperial College London(伦敦帝国学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究视觉语言模型计数失败问题,通过对VLM激活进行探测训练及分析,发现其虽常编码正确计数但输出错误,提出探测器引导的自校正方法,在不更新参数时提高计数准确率,揭示内部知识与模型输出差距并提供改进工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09450 2026-07-13 cs.CV cs.LG 新提交 57%

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

通过测试时提示自适应增强视觉语言模型的鲁棒性

Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen

机构 * University of Science(科学大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science(香港科学大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对对抗扰动下视觉语言模型性能下降问题,提出RITA框架,通过最优传输实现分布级对齐,引入动态缓存积累线索,提升了模型对抗鲁棒性且不损干净准确率。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2607.09091 2026-07-13 cs.CV 新提交 83%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09438 2026-07-13 cs.CL cs.AI cs.LG 新提交 62%

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

多语言视觉多项选择题中小视觉语言模型的测试时缩放

Spiros Baxevanakis, Peng-Jian Yang

机构 * ImageCLEF Lab(图像CLEF实验室) University of Amsterdam(阿姆斯特丹大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究小型视觉语言模型在多语言视觉多项选择题中的测试时缩放,比较多种方法,发现运行条件重要,可解析性是关键,增加解码预算有帮助,复杂方法贡献小,最佳配置在测试集上表现出色,位居排行榜首位。

Comments 14 pages, 2 figures, accepted at ImageCLEF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09095 2026-07-13 cs.SD cs.MM 新提交 57%

Event-Based Token Sequences for Audio-Conditioned Music-Game Level Modeling

用于音频条件音乐游戏关卡建模的基于事件的令牌序列

Ke Zhang, Chu-Hsuan Hsueh, Kokolo Ikeda

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究音乐游戏关卡程序生成问题,受基于事件的符号音乐建模启发,提出令牌级序列公式,构建Transformer模型,在事件级评估中优于基线,能系统分析音频对节奏对齐事件预测的支持。

Comments Camera-ready version, published at ICMR 2026

Journal ref Proceedings of the International Conference on Multimedia Retrieval (ICMR '26), June 16-19, 2026, Amsterdam, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08912 2026-07-13 cs.HC 新提交 50%

MemeBuddy: Dialog-Style Audio Representations for Engaging Non-Visual Meme Experiences

MemeBuddy:用于引人入胜的非视觉表情包体验的对话式音频表示

Chirag Bhansali, Vikas Ashok, Hae-Na Lee

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对盲人用户无法充分理解表情包的问题,提出MemeBuddy系统,将表情包建模为对话,结合文本与多模态大语言模型隐含知识生成音频表示。用户研究表明,该方式能提升盲人用户参与度与满意度,且理解能力相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08800 2026-07-13 cs.SD 新提交 50%

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

双BEATs:通过抖动在音频大语言模型中解锁零样本立体声音频感知

Shuo-Chun Lin, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(台湾中央研究院资讯科学研究所)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对多模态大语言模型空间感知局限,提出双BEATs架构,通过在编码前注入抖动噪声解决归一化问题,在三元方向分类任务中验证该方法有出色空间分辨率且能零样本泛化,证明标准模型经正则化可实现广义立体声音频理解。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2607.09417 2026-07-13 cs.CV cs.AI 新提交 81%

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

SVF-CR:用于多模态矛盾心理和犹豫识别的同步视觉-面部交叉细化

Hyein Park, Namho Kim, Junhwa Kim

机构 * Konyang University(公州大学) Korean Broadcasting System (KBS)(韩国广播公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态矛盾心理和犹豫识别,提出SVF-CR框架,通过提取视频和面部令牌,经多种注意力机制细化,构建视觉-面部证据并融合文本、声学特征,实验证明该框架提升了公共宏F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09114 2026-07-13 cs.CV cs.AI cs.MM 新提交 78%

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

基于事件流的多模态视频异常检测:一个基准数据集和算法

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI、cs.MM

AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09234 2026-07-13 cs.RO 新提交 50%

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks

基于未标记子任务演示的重排任务隐式行为协调

Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

机构 * Humanoid Robots Lab and Center for Robotics, University of Bonn(人形机器人实验室及机器人技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 研究长期机器人重排任务,提出基于未标记子任务演示的隐式行为协调方法,通过价值引导动作选择学习类技能行为,实验表明该方法在复杂任务中表现优,能处理更大行为库,为显式技能管道提供替代。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2607.09623 2026-07-13 cs.CL cs.AI 新提交 81%

Task-Specific Multimodal Question Answering Agents via Confidence Calibration and Incremental Reasoning for QANTA 2026

通过置信度校准和增量推理实现特定任务的多模态问答代理,用于QANTA 2026

Nirjhar Das, Md. Al-Mamun Provath

机构 * Department of Computer Science Engineering, Chittagong University of Engineering \& Technology, Chattogram, Bangladesh

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对QANTA 2026共享挑战,开发特定任务双代理架构,抢答代理用带置信度校准的模型及数值推理策略,加分代理用多种推理整合信息,强调仅托管环境下的高效推理与校准,系统取得高分,证明轻量级策略在资源受限问答中性能强。

Comments 10 pages, 1 figure. Accepted at the EMM-QA 2026 Workshop, ICML 2026 (Non-Archival). Rank #1 overall system in the QANTA 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09428 2026-07-13 cs.CV cs.LG 新提交 79%

Multimodal Scenario Similarity Search for Autonomous Driving

用于自动驾驶的多模态场景相似性搜索

Tamás Matuszka, András Tamásy, Balázs Szolár

机构 * aiMotive(爱莫提夫)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 研究自动驾驶场景相似性搜索,提出多模态框架结合视觉与轨迹表示,对比两种基于轨迹的方法与视觉基线,实验表明轨迹表示在运动事件中性能强,视觉嵌入在外观线索丰富时出色,结合二者可提升检索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07720 2026-07-13 cs.LG cs.AI 新提交 57%

Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics

全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型

Zhoujie Hou, Song Wang, Kexin Lou, Mo Wang, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) Omni-Intelligence(全知智能) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 介绍全睡眠模型,利用CNS/ANS划分,通过分层对比学习的三个目标进行拓扑约束表示学习,在多中心多模态PSG数据预训练后用于睡眠分期和多疾病分类,性能优于基线,凸显生理层次对睡眠表示学习的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2607.09146 2026-07-13 cs.SE 新提交 78%

Exploring the Potential of Program Flowcharts on Code Generation Using Multimodal LLMs

利用多模态大语言模型探索程序流程图在代码生成中的潜力

Yuki Toi, Tao Xiao, Kazushi Tomoto, Masanari Kondo, Yasutaka Kamei

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交 57%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09587 2026-07-13 cs.RO 新提交 50%

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

CoDiMAD:基于扩散的特权蒸馏用于无通信多机器人协调

Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang

机构 * Peking University(北京大学) National Innovation Institute of Defense Technology(国防科技创新研究院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 研究无通信多机器人协调问题,提出CoDiMAD三阶段框架,先训练特权预言机,再构建数据集,最后将预言机蒸馏到学生智能体中,通过扩散反向过程采样动作,实验证明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09039 2026-07-13 cs.LG q-bio.QM 新提交 50%

Variable-Length Generative Protein Design via Generalized Poisson Flow

通过广义泊松流进行可变长度生成蛋白质设计

Chaoran Cheng, Zhanghan Ni, Yanru Qu, Yuxin Chen, Ruihan Guo, Jiajun Fan, Ge Liu

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对蛋白质设计中可变长度生成的关键问题,引入广义泊松流(GPFlow)框架,通过最小化负对数似然学习速率函数,经多模态评估验证其可变长度生成质量,在多种设计任务中表现出色,提升了蛋白质设计的灵活性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2607.08839 2026-07-13 cs.CV cs.LG 新提交 87%

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

混合探针:通过探针在多模态大语言模型中从特权模态学习

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态大语言模型在特权模态设置下的问题,提出混合探针(MoP)框架及MoP跨模态训练(MoP-X),通过结构化探测机制分离模态信号,经评估在多任务中优于基线,有效利用辅助模态训练可提升性能。

Comments Preprint (16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09492 2026-07-13 cs.AI 新提交 85%

Multimodal Reward Hacking in Reinforcement Learning

强化学习中的多模态奖励黑客攻击

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Southeast University(东南大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究强化学习中多模态奖励黑客攻击问题,通过引入新奖励失败率(NRFR)等方法,在多种设置下改变模型规模、算法等因素进行实验,发现仅结果奖励易导致黑客攻击,扩大规模可减少但不能消除,还得出不同算法和奖励方式对黑客攻击的影响及相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08798 2026-07-13 cs.GR cs.CV 新提交 83%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09654 2026-07-13 cs.CV cs.AI 新提交 82%

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

十年视觉语言人工智能模型中准确性和视觉认知错误的演变

Shravan Murlidaran, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 78%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 70%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09528 2026-07-13 cs.LG cs.CR cs.DB cs.SI 新提交 67%

TSAI-MetaFraud: A Benchmark Dataset for Financial Fraud Transaction and Behavioral Risk Detection in Metaverse Ecosystems

TSAI-MetaFraud:用于元宇宙生态系统中金融欺诈交易和行为风险检测的基准数据集

Refat Ishrak Hemel, Ehsan Hallaji, Roozbeh Razavi-Far

机构 * tsai-unb(tsai - 新不伦瑞克大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 针对元宇宙平台带来的欺诈等新挑战及现有数据集局限性,提出TSAI-MetaFraud基准数据集,整合多类信息与欺诈场景,定义多项基准任务并进行基线评估,为元宇宙生态系统相关研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09323 2026-07-13 cs.RO 新提交 50%

Effects of Robotic Touch on Older Users During Walking Guidance by a Humanoid Robot

类人机器人步行引导过程中机器人触摸对老年用户的影响

Leonie Leven, Marko Ackermann, Christian Werner, Melina Schmetterer, Theresa Buchner, Monika Eckstein, Katja Mombaur

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究老年人在机器人步行引导中对不同触摸模式的感知与响应,通过多模态评估方法,发现交互时压力略升但总体接受,较大交互力条件下距离更小,为机器人步行引导辅助设计提供见解,表明老年人更喜欢轻柔稳定触摸。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 1 篇

2607.09521 2026-07-13 cs.AI 新提交 79%

SAGEAgent: A Self-Evolving Agent for Cost-Aware Modality Acquisition in Multimodal Survival Prediction

SAGEAgent:用于多模态生存预测中成本感知模态获取的自进化智能体

Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai Huo

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态生存预测中如何平衡预测准确性与临床侵入性,提出基于自进化大语言模型的SAGEAgent,通过多种记忆和工具为患者决定诊断方式,实验证明其能在胶质瘤队列中降低获取负担并保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 7 篇

2606.23964 2026-07-13 cs.LG cs.CV q-bio.QM 新提交 83%

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。

Comments Code is available at: https://github.com/marrlab/mae3d-opencell

详情

展开后加载摘要…

URL PDF HTML 收藏