arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-25 至 2026-06-25 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3 篇

2606.25174 2026-06-25 cs.LG cs.CV eess.IV 新提交 83%

An iterative energy-based multimodal transformer for joint retrieval of wheat soil moisture, leaf area index, and plant height from Sentinel-1 and Sentinel-2 time series

基于迭代能量多模态Transformer的Sentinel-1与Sentinel-2时序联合反演小麦土壤水分、叶面积指数和株高

Shubham Kumar Singh, Peilei Fan, Suraj A. Yadav, Rajendra Prasad, Prashant K Srivastava

机构 * Department of Urban and Environmental Policy and Program, Tufts University(Tufts大学城市与环境政策与项目系) Electrical and Computer Engineering Department, Mississippi State University(密苏里州立大学电气与计算机工程系) Department of Physics, Indian Institute of Technology (BHU)(印度理工学院(BHU)物理系) Institute of Environment and Sustainable Development, Banaras Hindu University(巴纳尔斯赫尔大学环境与可持续发展研究所)

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出迭代能量Transformer(iEBT),通过嵌入多模态预测器并迭代更新目标向量,从Sentinel-1和Sentinel-2时序数据中联合反演土壤水分、叶面积指数和株高,在印度瓦拉纳西实测数据上取得高精度,并利用终端能量作为质量诊断指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10702 2026-06-25 cs.CV cs.AI 版本更新 81%

Backbone-Conditional Behavior of Modality Gating in Multi-Modal Prostate MRI Segmentation: A 5-Fold Cross-Validation and Gate Mechanism Analysis

模态隔离门控融合:用于稳健多模态前列腺MRI分割的架构无关方法

Yongbo Shu, Wenzhao Xie, Shanhu Yao, Zirui Xin, Luo Lei, Kewen Chen, Aijing Luo

机构 * The Second Xiangya Hospital of Central South University(中南大学湘雅医学院第二医院) The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院) School of Life Sciences, Central South University(中南大学生命科学学院) Hunan Provincial Key Laboratory of Medical Information Research (Central South University)(湖南省医学信息研究重点实验室(中南大学)) Hunan Provincial Clinical Medical Research Center for Cardiovascular Intelligent Medicine(湖南省心血管智能医学临床医学研究中心)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出模态隔离门控融合(MIGF)方法,通过独立编码流和门控阶段提升多模态前列腺MRI分割的鲁棒性,实验表明其在不同模态缺失和伪影情况下均有效。

Comments Major revision. Single-fold analysis replaced by 5-fold cross-validation (180 trained models) plus a direct gate-mechanism analysis; conclusions updated to show that modality gating is backbone-conditional. Supersedes v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新 57%

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 10 篇

2606.20300 2026-06-25 cs.CV 新提交 83%

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

CMDS-AD: 跨模态双流解耦用于少样本异常检测

Junhao Cai, Junyu Chen, Deyu Zeng, Junhao Pang, Qiwei Liang, Xiaopin Zhong, Zongze Wu

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。

Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03211 2026-06-25 cs.CV cs.NI eess.SP 交叉投稿 79%

Channel-adaptive Cross-modal Generative Semantic Communication for Point Cloud Transmission

面向点云传输的信道自适应跨模态生成式语义通信

Wanting Yang, Zehui Xiong, Qianqian Yang, Ping Zhang, Merouane Debbah, Rahim Tafazolli

机构 * IEEE

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出GenSeC-PC框架,通过跨模态语义编码融合图像与点云,结合信道自适应联合编解码和扩散模型加速,实现低信噪比下的鲁棒点云传输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交 74%

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新 70%

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25740 2026-06-25 cs.CV cs.AI 新提交 62%

Point Cloud Diffusion with Global and Local Reconstruction for Instance-Level 3D Anomaly Detection

基于全局与局部重建的点云扩散用于实例级3D异常检测

Linchun Wu, Qin Zou, Jiwen Lu, Qingquan Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Automation, Tsinghua University(清华大学自动化系) Guangdong Artificial Intelligence and Digital Economy Laboratory (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出PCDiff框架,通过实例级多模态条件生成弱缺陷异常,并采用联合局部-全局重建算法恢复前景缺陷同时保持背景正常结构,在3D异常检测中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25390 2026-06-25 cs.CV cs.AI 新提交 62%

Anatomically-conditioned Latent Diffusion Model for Data-Efficient Few-Shot Cross-Domain 3D Glioma MRI Synthesis

解剖条件约束的潜在扩散模型用于数据高效的小样本跨域3D胶质瘤MRI合成

Salman Shaik, Truong Thanh Hung Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(新不伦瑞克大学分析无处不在实验室,加拿大)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出解剖条件约束的潜在扩散模型(ALDM),通过两阶段框架(3D变分自编码器学习解剖先验,ControlNet引导的潜在扩散生成结构一致体积)在仅16张目标图像的小样本设置下优于GAN基线,实现FID 85.40和分类AUC 0.987。

Comments Published in Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25592 2026-06-25 cs.CV 新提交 57%

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

VPA-Guard:防御与基准测试图像到视频生成中的视觉提示攻击

Yining Sun, Haoyu Kang, Jiajun Wu, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

机构 * Tsinghua University(清华大学) Central South University(中南大学) South China Normal University(华南师范大学) ByteDance Inc.(字节跳动公司) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出首个针对图像到视频生成中视觉提示攻击的系统基准VVA-Bench,并设计检索增强自进化防御框架VPA-Guard,平均降低攻击成功率44.2%和危害评分73.4%。

Comments Dataset Page: https://huggingface.co/datasets/CSU-JPG/VVA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 57%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17773 2026-06-25 cs.CV 版本更新 57%

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass: 面向图像到视频生成的长期鲁棒图像水印

Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 针对图像引导视频生成中源图像追踪缺失的问题,提出跨模态水印框架I2VWM,通过视频模拟噪声层和光流对齐模块增强水印的时间鲁棒性,在开源和商业模型上验证了效果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25754 2026-06-25 cs.RO 新提交 50%

Stage-Aware and Roughness-Constrained Diffusion Policy for Multi-Stage Robotic Polishing

阶段感知与粗糙度约束的扩散策略用于多阶段机器人抛光

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Tiange Wu, Guoqiang Guo, Haoyuan Zhou, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Shanghai Spaceflight Precision Machinery Institute(上海航天精密机械研究所)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出阶段感知与粗糙度约束扩散策略(SRDP),通过多模态观测推断阶段后验并约束去噪过程,实现无外部标签的阶段一致动作生成,提升多阶段抛光质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 13 篇

2606.25763 2026-06-25 cs.CV 新提交 84%

ShutterMuse: Capture-Time Photography Guidance with MLLMs

ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导

Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma

机构 * Fudan University(复旦大学) StepFun

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。

Comments Project Page:https://lijayutnt.github.io/ShutterMuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 84%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 81%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26079 2026-06-25 cs.CL cs.CV cs.LG 新提交 81%

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models

相同证据,不同答案:多模态大语言模型中的顺序敏感性审计

Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24755 2026-06-25 eess.SY cs.SY 版本更新 78%

Asymmetry-Aware Routing for Industrial Multimodal Monitoring: A Diagnostic Framework

面向工业多模态监测的非对称感知路由:一个诊断框架

Sungwoo Kang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出非对称感知路由框架,通过三步诊断(单模态性能差距、门权重归因、模态损坏测试)决定多模态融合策略,在三个数据集上验证了其有效性。

Comments A subsequent extension of this analysis to a larger corpus found that the heterogeneity predictor is collinear with the industrial-versus-general domain split, so the corresponding effect is not identifiable on the available data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 73%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25527 2026-06-25 cs.LG 新提交 67%

Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

超越一刀切:基于诊断的在线强化学习与离线先验知识

Guozheng Ma, Lu Li, Zilin Wang, Pierre-Luc Bacon, Dacheng Tao

机构 * Nanyang Technical University(南洋理工大学) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文提出诊断驱动的张力管理框架,通过三种功能角色表征离线先验知识如何重塑在线优化,并展示跨领域证据,解决先验知识有效性随部署变化的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 62%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25701 2026-06-25 cs.CV 新提交 57%

Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray

Falcon: X射线中组合推理的功能组装与语言

Yonathan Michael, Mohamad Alansari, Natnael Takele, Andreas Henschel, Naoufel Werghi

机构 * Khalifa University(哈利法大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对X射线安检中威胁来自分散组件功能兼容性的问题,提出Falcon框架,通过结构化安全状态表示实现组合威胁推理,并构建Falcon-X基准验证其有效性。

Comments Accepted at ECCV2026; Project Page: https://yonathan-kiflom.github.io/FALCON/page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25245 2026-06-25 cs.CV 新提交 57%

OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos

OrthoTrack:基于公开正射影像的连续六自由度无人机轨迹估计

Oussema Dhaouadi, Zuria Bauer, Johannes Michael Meier, Olaf Wysocki, Marc Pollefeys, Daniel Cremers

机构 * ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Microsoft(微软公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出OrthoTrack,利用公开正射影像和表面模型实现无训练、实时、无漂移的连续六自由度无人机轨迹估计,无需GPS或后处理对齐。

Comments ECCV 2026 - Project page: http://orthotrack.ethz.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 57%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 57%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25761 2026-06-25 cs.LG math.OC 新提交 50%

Bridging Spherical Black-Box Optimizers

桥接球形黑箱优化器

Johannes Ackermann, Stefano Peluchetti

机构 * The University of Tokyo(东京大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 将进化策略、共识优化和积分优化统一为理论框架,通过引入混合优化器控制平坦偏好和模态,在连续控制和语言模型合并任务中提升性能与鲁棒性。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态Agent 3 篇

2402.00735 2026-06-25 math.OC 82%

Multimodal urban transportation network equilibrium including intermodality and shared mobility services

多模式城市交通网络均衡包含换乘和共享出行服务

Khadidja Kadem, Mostafa Ameli, Mahdi Zargayouna, Latifa Oukhellou

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)

AI总结 本文研究多模式交通系统中共享出行服务对交通均衡的影响,提出包含多种出行方式的交通分配模型,通过混合整数双曲线性规划方法分析用户均衡与系统最优之间的差异。

Journal ref European Transport Research Review, 18, 41 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 70%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25645 2026-06-25 eess.IV cs.CV cs.HC 版本更新 70%

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

Colon-Bench:一种用于全流程结肠镜视频中可扩展密集病变标注的智能工作流

Abdullah Hamdi, Changchun Yang, Xin Gao

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科学与技术大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出Colon-Bench,通过多阶段智能工作流实现全流程结肠镜视频的密集病变标注,包含528个视频、14类病变、30万+边界框等,并评估多模态大模型在病变分类、开放词汇视频目标分割和视频视觉问答上的性能。

Comments published at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态训练与对齐 10 篇

2606.24963 2026-06-25 cs.CV cs.LG 新提交 87%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏