An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV
Comments Released at LLaVA Model Zoo: https://github.com/haotian-liu/LLaVA/blob/main/docs/MODEL_ZOO.md
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV
Comments Released at LLaVA Model Zoo: https://github.com/haotian-liu/LLaVA/blob/main/docs/MODEL_ZOO.md
DIFFCZSL:基于扩散表示正则化的组合零样本学习
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 DIFFCZSL将预训练扩散模型的生成先验注入基于CLIP的组合零样本学习流程,通过对比对齐提升性能,在两类设置下均优于强基线,凸显了扩散表示与视觉-语言模型的互补优势。
基于增强型视觉-语言对齐的临床可信医学图像描述生成研究
机构 * Chung-Ang University(中央大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。
Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication
Holtercare-Bench:用于评估长期动态心电图分析的多模态基准
机构 * Zhejiang University(浙江大学) ; Beijing Institute of Technology(北京理工大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。
幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构
机构 * IES Parquesol(帕尔奎索尔学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。
Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: https://doi.org/10.5281/zenodo.20649714
FACET:在终端任务合成中保留源意图与可执行状态
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 FACET是保留源意图与可执行状态的终端任务合成框架,可生成高质量任务并提升Terminal-Bench 2.1上的智能体微调性能,为任务合成提供关键原则。
SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器
机构 * Faculty of Information Technology(信息技术学院) ; University of Jyväskylä(于韦斯屈莱大学) ; Adobe Research(奥多比研究院) ; University of Helsinki(赫尔辛基大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。
面向资源受限农村地区多模态临床筛查的云边协同系统
机构 * University of Michigan(密歇根大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard Medical School(哈佛医学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。
Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)
MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器
机构 * Meta
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。
Comments Accepted to ECCV 2026
多模态对比学习中的表达能力
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。
RecurrentGPT:通过Transformer中的循环调制实现表达性深度
机构 * The German University in Cairo(开罗德国大学) ; Technical University of Munich(慕尼黑工业大学) ; Cerebras Systems Inc.(赛布拉斯系统公司)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。
迈向AI历史学家:从原始资料中进行代理信息提取
机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) ; Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) ; Faculty of Music, University of Oxford(牛津大学音乐学院) ; Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)
专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI
AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。
SEER:基于选择性视觉-文本压缩的长上下文推理
机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Cambridge(剑桥大学) ; University of Technology Sydney(悉尼科技大学) ; The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。
Comments COLM 2026, Third Conference on Language Modeling
Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 提出Gaussian-JEPA,通过预测高斯令牌块潜在表示实现自监督学习,在多类任务上优于重构预训练,为3D高斯表示提供有效学习目标
Comments Joint-embedding predictive representation learning for 3D Gaussian Splatting
MEDR:基于多信号事件建模与动态重评分的查询无关帧选择
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。
Comments 9 pages, 2 figures, 3 tables
SMA:谁说的?半黑盒RAG控制中的成员泄露审计
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.AI
AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。
基于分布式联合隐空间构建的多视图表示学习
机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 该研究针对分布式多视图表示学习的客户端协调问题,推导了基于MDL的泛化界,提出分布式高斯乘积混合先验方法,经多组实验验证了其有效性。
当API“说错”语言:重新审视多语言工具使用的后训练
机构 * Amazon(亚马逊)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。
XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器
机构 * Hankuk University of Foreign Studies(韩国外国语大学) ; Noah’s Farm(诺亚农场) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Capital One AI Foundations(Capital One AI 基金会)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。
Comments 18 pages, 4 figures
E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。
SapiensID 2.0:将人类识别基础模型与人类感知对齐
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。
基于自标注区域对齐的细粒度CLIP微调
机构 * City University of Hong Kong(香港城市大学) ; Hong Kong University of Science & Technology(香港科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对CLIP在细粒度表示上的局限,提出SFF-CLIP方法,仅用图像-文本对输入,通过运行时区域-短语对齐方案提升其细粒度表示能力,在相关任务中性能显著提升且维持原CLIP图像级任务表现。
Clarity:稀疏性感知概念瓶颈模型中的灵活性与可解释性权衡
机构 * Department of Statistics, University of Economics and Business(经济与商业大学统计系) ; UMR TETIS, Inria, EVERGREEN, University of Montpellier(蒙彼利埃大学)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG
AI总结 研究探讨了概念瓶颈模型中稀疏性对语义对齐的影响,提出Clarity指标衡量下游性能与概念激活稀疏性和精度的相互作用,通过实验揭示灵活性与可解释性之间的关键权衡。
Journal ref Transactions on Machine Learning Research (2026)
GeoRoute:面向交通未来帧预测的几何感知混合推理方法
机构 * Vietnamese-German University(越南-德国大学) ; University of Science, Ho Chi Minh City(胡志明市科学大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
SI-Edit:面向草图-指令引导的像素级精度局部图像编辑
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) ; City University of Macau(澳门城市大学) ; Meitu Inc(美图公司)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。
Comments accepted by ACM MM 2026
显微镜下的梯度:对内存高效梯度计算方法的资源利用基准测试
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG
AI总结 该研究针对四种Transformer架构,测试五种梯度优化器在三种内存策略下的资源利用,发现梯度累积效果最优,Adam并非普遍最优,梯度检查点效果依赖架构,为模型训练部署提供实用指南。
VLZip:用于交错长上下文建模的统一视觉与文本压缩方法
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。
面向计算高效的Transformer适配的电路微调
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 提出电路微调(CFT)框架,通过电路发现选择ViT待微调子图,仅微调该子图,可大幅降低训练FLOPs与时间,在多类视觉任务上验证了有效性。
面向恶劣天气去除的退化感知跨模态补偿提示学习
机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) ; School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) ; The Hong Kong Polytechnic University(香港理工大学) ; University of California, San Francisco(加利福尼亚大学旧金山分校) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 该研究针对恶劣天气导致图像退化影响视觉系统可靠性的问题,提出 DCMPC-Net 模型,通过跨模态提示补偿实现鲁棒的恶劣天气图像修复,性能优于现有最先进方法。
Comments Accepted for publication in IEEE Transactions on Image Processing. The code is available at: https://github.com/fanamber831/DCMPC-Net
描述到评分:一种用于图像复杂度评估的文本引导框架
机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。
Comments Accepted by Pattern Recognition