Random Direct Preference Optimization for Radiography Report Generation
Valentin Samokhin, Boris Shirokikh, Mikhail Goncharov, Dmitriy Umerenkov, Maksim Bobrin, Ivan Oseledets, Dmitry Dylov, Mikhail Belyaev
机构
*
Artificial Intelligence Research Institute (AIRI)(人工智能研究院)
;
Skolkovo Institute of Science and Technology(斯克罗夫学院)
;
Institute for Information Transmission Problems(信息传输问题研究所)
专题命中
VLM训练与架构
:visual language model(abstract);分类 cs.CV、cs.AI
Exploration with Foundation Models: Capabilities, Limitations, and Hybrid Approaches
Remo Sasso, Michelangelo Conserva, Dominik Jeurissen, Paulo Rauber
机构
*
School of Electronic Engineering and Computer Science(电子工程与计算机科学学院)
专题命中
VLM训练与架构
:VLM(abstract);分类 cs.AI、cs.LG
Comments16 pages, 7 figures. Accepted for presentation at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on the Foundations of Reasoning in Language Models (FoRLM)
机构
*
Shenzhen Technology University(深圳科技大学)
;
University of Washington(华盛顿大学)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
Yicheng Ji, Jun Zhang, Heming Xia, Jinpeng Chen, Lidan Shou, Gang Chen, Huan Li
机构
*
The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室)
;
Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
;
Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
;
School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)
Journal refProceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics, Human Language Technologies, Long Papers, pp. 10497-10518
True Multimodal In-Context Learning Needs Attention to the Visual Context
Shuo Chen, Jianzhe Liu, Zhen Han, Yan Xia, Daniel Cremers, Philip Torr, Volker Tresp, Jindong Gu
机构
*
LMU Munich(慕尼黑大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Siemens AG(西门子股份公司)
;
University of Science and Technology of China(中国科学技术大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse可靠性人工智能卓越学院)
;
University of Oxford(牛津大学)
专题命中
VLM训练与架构
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Decouple before Align: Visual Disentanglement Enhances Prompt Tuning
Fei Zhang, Tianfei Zhou, Jiangchao Yao, Ya Zhang, Ivor W. Tsang, Yanfeng Wang
机构
*
Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学)
;
School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Beijing Institute of Technology(北京理工大学)
;
A*STAR Centre for Frontier AI Research(A*STAR前沿人工智能研究中心)