arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-24 至 2026-04-24 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 3 篇

2603.07961 2026-04-24 cs.CV 77%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21082 2026-04-24 cs.CL cs.LG 57%

Weighting What Matters: Boosting Sample Efficiency in Medical Report Generation via Token Reweighting

权重什么重要:通过标记重加权提升医学报告生成的样本效率

Alexander Weers, Daniel Rueckert, Martin J. Menten

机构 * TUM School of Computation, Information and Technology(慕尼黑技术大学计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文通过标记重加权方法提升医学报告生成的样本效率,实验表明在眼科报告生成中,该方法在较少训练数据下也能获得高质量报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20854 2026-04-24 cs.IR cs.AI 57%

ERA: Evidence-based Reliability Alignment for Honest Retrieval-Augmented Generation

ERA:基于证据的可靠性对齐用于诚实检索增强生成

Sunguk Shin, Meeyoung Cha, Byung-Jun Lee, Sungwon Park

机构 * Korea University(韩国大学) Gauss Labs Inc.(Gauss实验室)

专题命中 VLM训练与架构 :grounding(abstract_cn);分类 cs.AI

AI总结 本文提出ERA框架,通过将置信度估计从标量概率转为显式证据分布,提升RAG系统中的回避行为,有效区分知识冲突与不确定性,实验表明在标准基准和定制泛化数据集上表现优异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏