arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-27 至 2026-07-27 共收录 50 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2607.22293 2026-07-27 cs.CV 新提交 83%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21970 2026-07-27 cs.CV cs.AI 新提交 73%

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

TextSLIP:用于医学报告生成的文本自监督CLIP

Haoyu Jiang, Ziping Cong

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有CLIP方法在医学报告生成中语义监督不足问题,提出TextSLIP框架,通过模态内文本对比学习增强CLIP,经实验验证其在报告生成指标上有改进,表明文本级对比学习对改善医学视觉-文本对齐有潜力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 57%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18311 2026-07-27 cs.CV 版本更新 57%

Improving Large Vision-Language Models' Understanding for Flow Field Data

提升大型视觉-语言模型对流场数据的理解能力

Xiaomei Zhang, Hanyu Zheng, Xiangyu Zhu, Jinghuan Wei, Junhong Zou, Zhen Lei, Zhaoxiang Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 FieldLVLM通过场感知语言生成策略和数据压缩多模态模型调优,提升大型视觉-语言模型对流场数据的理解能力。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29968 2026-07-27 cs.DB 版本更新 50%

CLIP: Lightweight Cosine-Law-Based Inverted-List Pruning for IVF-Based Vector Search

CLIP:基于余弦定律的轻量级倒排列表剪枝技术用于IVF向量搜索

Yitong Song, Shuhang Lu, Pengcheng Zhang, Jianliang Xu

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对IVF向量搜索中粗粒度执行导致高延迟的问题,提出基于余弦定律的轻量级剪枝技术CLIP,支持簇间和簇内剪枝,显著减少不必要的簇和向量访问,并开发了IVF-CLIP、HIVF-CLIP和LSM-IVF三种变体,实验表明剪枝率达78%,效率提升最高141%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2602.22085 2026-07-27 cs.HC 版本更新 71%

SocialPulse: On-Device Detection of Social Interactions in Naturalistic Settings Using Smartwatch Sensing

SocialPulse: 使用智能手表多模态感知在自然环境中检测社交互动

Md Sabbir Ahmed, Kaitlyn Dorothy Petz, Noah French, Tanvi Lakhtakia, Aayushi Sangani, Mark Rucker, Xinyu Chen, Bethany A. Teachman, Laura E. Barnes

专题命中 音频语音多模态 :multimodal(title)

AI总结 本文提出了一种在设备上检测自然环境中社交互动的方法,通过智能手表的多模态感知技术,实现了对多种社交互动的准确识别,并在真实场景中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21944 2026-07-27 cs.HC 新提交 50%

VisionPulse: A Virtual Reality System Enabling Accessible Discovery and Navigation for Blind and Low Vision Users

VisionPulse:一个为盲人和低视力用户实现无障碍发现与导航的虚拟现实系统

Samuel Martin, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对盲人和低视力用户在VR中自由探索受限的问题,提出VisionPulse系统,让用户通过自然动作和多模态反馈探索虚拟环境,经实验验证该系统受用户青睐,为包容性VR设计提供了参考。

Comments accepted to ACM ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 1 篇

2607.22264 2026-07-27 cs.LG 新提交 78%

Autoregressive EHR Foundation Models with Multimodal Inputs

具有多模态输入的自回归电子健康记录基础模型

Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 研究在自回归电子健康记录基础模型中纳入多模态的方法,通过特定模态潜在压缩和门控交叉注意力框架,研究压缩单模态序列及预训练编码器选择对性能的影响,实验表明精心设计架构及临床评估的必要性。

Comments 5 pages excluding references and supplements, 2 figures and 2 tables, Proceedings of the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning, Seoul, South Korea

Journal ref ICML2026 workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2607.10023 2026-07-27 cs.SD cs.LG cs.MM 版本更新 83%

Local Multimodal Music Alignment from Global Supervision

基于全局监督的局部多模态音乐对齐

Irmak Bukey, Zachary Novack, Jongmin Jung, Dasaem Jeong, Chris Donahue

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 研究如何利用全局监督实现局部多模态音乐对齐,提出FuSiLi方法,通过基于Sinkhorn的软对齐操作局部特征,结合传统全局相似性微调预训练编码器,在跨模态检索和帧级对齐任务中表现出色,优于多种基线。

Comments ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-07-27 cs.CL cs.AI 新提交 81%

Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2607.21908 2026-07-27 cs.MM 新提交 92%

Unsupervised Multimodal Intent Discovery via MLLM-Guided Concept Generation and Semantic Propagation

通过MLLM引导的概念生成和语义传播进行无监督多模态意图发现

Yunjin Gu, Qianrui Zhou, Hua Xu

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.MM

AI总结 该研究针对无监督多模态意图发现缺乏语义监督及可解释性差的问题,提出MCSP方法,通过MLLM引导的对比推理获取语义概念,再经语义传播生成伪标签,实验证明其性能优于现有方法且能产生可解释的簇。

Comments Accepted at ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08797 2026-07-27 cs.CV 版本更新 79%

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18504 2026-07-27 cs.LG cs.AI cs.CV 版本更新 79%

Now We Know? A Systematic Comparison of TerraMind and THOR

我们现在知道了吗?TerraMind和THOR的系统比较

Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling, Johannes Jakubik, Arnt-Børre Salberg, Theodor Forgaard, Nicolas Longepe, Valerio Marsocci

机构 * University of Münster(明斯特大学) IBM Research(IBM研究院) Norwegian Computing Center(挪威计算中心)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV、cs.AI

AI总结 通过对TerraMind和THOR两个地理空间基础模型对比,研究其在补丁大小、解码器复杂性等方面的差异轴,发现架构设计选择对性能差异影响更大,体现互补投资策略,还得出假设和诊断消融方法,有望推广到未来模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22531 2026-07-27 cs.CV 新提交 57%

Twins: Learn to Predict Unified Representations with Focal Loss

Twins:使用焦点损失学习预测统一表示

Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

机构 * Tencent-Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。

Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03499 2026-07-27 eess.IV cs.CV 版本更新 57%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21661 2026-07-27 cs.RO 新提交 50%

GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation

GRACE:通过组合扩散-MPPI后验均值估计实现无梯度机器人动作生成

Leesai Park, Jiho HOng, Sanghyun Kim

机构 * School of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程学院) Advanced Institute of Convergence Technology (AICT)(融合技术高级研究院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究提出GRACE方法,通过组合扩散-MPPI后验均值估计,仅用前向成本评估引导预训练扩散策略,构建成本条件引导后验并估计均值,在模拟和真实机器人上验证,比基线方法成功率高,能避免部署时障碍物。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 16 篇

2607.22014 2026-07-27 cs.AI cs.CL cs.CV cs.RO 新提交 82%

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

用于空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22352 2026-07-27 cs.CV cs.AI eess.IV 新提交 81%

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

时间反转成像:用于重建过去人类与环境交互的多模态基准和框架

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出时间反转成像范式,通过TRACE-HEI数据集及多模态推理方法,从热、紫外和可见光谱中残余物理印记推断过去人类与环境交互,为时间反转成像奠定基础,开辟场景理解新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21998 2026-07-27 cs.CV 新提交 79%

Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models

医学检查表:评估多模态模型对医学图像的理解

Bannapol Limanond, Masanori Suganuma, Takayuki Okatani

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍医学检查表这一基准测试,通过给模型一张图像及一正一误两个标题进行二元测试,可统一评估不同多模态模型,验证其对医学概念的理解,评估其处理分布外输入的能力,用其评估四个先进模型发现它们理解图像能力待提升。

Comments Accepted for publication in IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15670 2026-07-27 cs.CV 版本更新 79%

PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

PixDLM:一种用于无人机推理分割的双路径多模态语言模型

Shuyan Ke, Yifan Mei, Changli Wu, Yonghan Zheng, Jiayi Ji, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。

Comments Accepted to CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22006 2026-07-27 cs.CY econ.GN q-fin.EC stat.AP 新提交 78%

Unfit for stranding assessment: a panel-scale multimodal-LLM audit of building-decarbonisation disclosure (BeDA)

不适用于搁浅评估:建筑脱碳披露(BeDA)的面板规模多模态大语言模型审计

Jingyi Xu, Minghui Cheng, Anchen Sun

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究建筑脱碳披露情况,引入多模态大语言模型工具BeDA审计全球公司面板。发现多数披露不适用,存在报告差距,BeDA分数可靠,可监测该差距,为可执行的建筑搁浅法规提供支持,是筛选工具非预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21986 2026-07-27 cs.RO 新提交 78%

Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping

Mag4D-SLAM数据集:用于定位和映射的重复遍历多模态4D地磁数据集

Bibhutibhusan Nayak, Hyoseok Ju, Giseop Kim

机构 * Department of Robotics and Mechatronics Engineering, DGIST(大邱庆北科学技术院机器人与机电工程系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 该研究提出Mag4D-SLAM这一首个大规模室外地磁SLAM数据集,含多传感器同步测量与地面真值姿态。通过重复遍历实验分析磁场重复性等特性,支持偏航漂移缓解等研究,还能开启地磁传感补充其他模态及应对特殊情况的新研究。

Comments Accepted to IROS 2026. 8 pages, 8 figures. *Bibhutibhusan Nayak and Hyoseok Ju contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21780 2026-07-27 cs.CL cs.AI cs.CV 新提交 78%

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Khondo:孟加拉语表格文档分组拆分的多模态基准测试

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) CCDS, Independent University, Bangladesh(孟加拉国独立大学计算与通信科学系) Amazon GenAI(亚马逊生成式人工智能)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对孟加拉语表格文档分组拆分难的问题,引入多模态基准测试Khondo,涵盖多种拼接方案和行政领域。通过对语言模型零样本评估及对照分析,发现页面排列是主要挑战,语言有影响,确立页面顺序重建问题并提供基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 62%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21964 2026-07-27 cs.RO cs.AI 新提交 57%

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

ACME:一个多文化、多实体的社会导航数据集

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对现有社会导航数据集缺乏文化等多样性的问题,引入ACME数据集,通过多国多地多机器人实体大规模收集数据,提供多种数据便于学习与预测,经分析其能捕捉更具挑战场景及更广泛行人行为。

Comments 24 Pages, 19 Figures, Submitted to IJRR on June 29th 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21611 2026-07-27 cs.HC cs.AI 新提交 57%

A Systematic Survey on Image Description Techniques for STEM Domains

关于STEM领域图像描述技术的系统综述

Marco Cardia, Letizia Angileri, Marina Buzzi, Giulio Galesi, Barbara Leporini

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 综述20项关于AI描述STEM视觉的研究,关注可及性和人机交互。分析目标视觉类型等多方面内容,指出从静态转向交互式多模态系统,同时存在事实不准确等挑战,最后概述人机交互关键研究方向。

Comments This is the Author's Original Manuscript of an article accepted for publication in International Journal of Human-Computer Interaction, published by Taylor and Francis. The Version of Record is available at DOI 10.1080/10447318.2026.2668031

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12447 2026-07-27 cs.LG cs.AI 版本更新 57%

The Computational Basis of Confidence in Large Language Models

大语言模型中置信度的计算基础

Dharshan Kumaran, Viorica Patraucean, Maks Ovsjanikov, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) École Polytechnique(巴黎综合理工学院) Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10356 2026-07-27 cs.LG cs.AI eess.SP 57%

MATNet: Multi-Level Fusion Transformer-Based Model for Day-Ahead PV Generation Forecasting

MATNet:基于多层级融合Transformer的日前光伏发电预测模型

Matteo Tortora, Francesco Conte, Gianluca Natrella, Paolo Soda

机构 * Department of Naval, Electrical, Electronics Telecommunications Engineering, University of Genoa, Via all’Opera Pia 11a, 16145 Genoa, Italy Unit of Innovation, Entrepreneurship \& Sustainability, Department of Engineering, University Campus Bio-Medico of Rome Via Alvaro del Portillo 21, 00128 Rome, Italy Computer Systems Department of Engineering, University Campus Bio-Medico of Rome Via Alvaro del Portillo 21, 00128 Rome, Italy

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出一种基于多层级融合Transformer的多模态架构MATNet,通过多级联合融合和软注意力机制利用历史光伏数据与气象数据,在日前多步光伏发电预测中显著优于基线模型(RMSE 0.0445,相对提升约65%),并展现出对缺失数据的鲁棒性和跨域零样本泛化能力。

Journal ref Frontiers in Artificial Intelligence. 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19596 2026-07-27 cs.CV 57%

PC2Model: ISPRS benchmark on 3D point cloud to model registration

PC2Model:ISPRS基准在点云到模型配准

Mehdi Maboudi, Said Harb, Jackson Ferrao, Kourosh Khoshelham, Yelda Turkan, Karam Mawas

机构 * 1 Institute of Geodesy

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PC2Model基准,通过结合模拟点云与真实扫描数据,解决点云到模型配准中的稀疏性、噪声等问题,提升跨领域模型泛化能力。

Comments ISPRS Congress 2026, Toronto

详情

展开后加载摘要…

URL PDF HTML 收藏