arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-20 至 2026-04-20 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2604.15781 2026-04-20 cs.HC 80%

ReVis: Towards Reusable Image-Based Visualizations with MLLMs

ReVis:面向基于图像的可视化可重用性的方法

Xiaolin Wen, Changlin Li, Manusha Karunathilaka, Can Liu, Fangzhuo Jin, Yong Wang

专题命中 其他VLM :MLLM(summary_cn,abstract)

AI总结 ReVis通过引入领域特定语言和MLLM管道,实现复杂可视化的灵活重用,支持分解与再现,并通过交互界面实现数据更新与编码定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00114 2026-04-20 cs.CV cs.AI cs.LG 75%

1S-DAug: One-Shot Data Augmentation for Robust Few-Shot Generalization

1S-DAug:一种用于鲁棒少样本泛化的单次数据增强

Yunwei Bai, Ying Kiat Tan, Yao Shu, Tsuhan Chen

机构 * National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他VLM :vision language model(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出1S-DAug,一种基于单例图像生成多样且忠实变体的生成增强算子,通过结合传统几何扰动、受控噪声注入和去噪扩散过程,提升少样本分类性能,实现在多个基准测试中提升20%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16175 2026-04-20 cs.AI cs.CV 62%

MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation

MARCH:多智能体放射科临床层级用于CT报告生成

Yi Lin, Yihao Ding, Yonghui Wu, Yifan Peng

机构 * Weill Cornell Medicine(韦尔·科恩医学中心) University of Western Australia(西澳大学) University of Florida(佛罗里达大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MARCH通过模拟放射科专业层级,采用多智能体框架提升CT报告生成的临床准确性和语言准确性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏