arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-29 至 2026-06-29 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 1 篇

2601.04390 2026-06-29 cs.AI 版本更新 70%

SciFig: Towards Automating Editable Figure Generation for Scientific Papers

SciFig:面向科学论文的可编辑图形自动生成

Siyuan Huang, Yifan Zhou, Yutong Gao, Zi Yin, Juyang Bai, Xinxin Liu, Rama Chellappa, Chun Pong Lau, Cheng Peng, Sayan Nag, Shraman Pramanick

机构 * Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Independant Researcher(独立研究者) Tsinghua University(清华大学) University of Central Florida(佛罗里达中央大学) City University of Hong Kong(香港城市大学) Adobe Research(Adobe研究)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出SciFig多智能体框架,从科学文本自动生成可编辑的高质量方法图,通过分解规划、布局、渲染和迭代优化,在435个基准上优于基线,平均10分钟生成可编辑图形。

详情

展开后加载摘要…

URL PDF HTML 收藏