arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2408.15998 2025-03-04 cs.CV cs.AI cs.LG cs.RO 75%

Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders

Min Shi, Fuxiao Liu, Shihao Wang, Shijia Liao, Subhashree Radhakrishnan, Yilin Zhao, De-An Huang, Hongxu Yin, Karan Sapra, Yaser Yacoob, Humphrey Shi, Bryan Catanzaro, Andrew Tao, Jan Kautz, Zhiding Yu, Guilin Liu

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Github: https://github.com/NVlabs/Eagle, HuggingFace: https://huggingface.co/NVEagle

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07240 2023-08-25 cs.CV cs.AI cs.LG 75%

Test-Time Adaptation for Visual Document Understanding

Sayna Ebrahimi, Sercan O. Arik, Tomas Pfister

专题命中 文档图表理解 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at TMLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03884 2026-08-05 cs.CV cs.CL 新提交 74%

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

BanglaWild:面向OCR和视觉-语言模型的野外孟加拉语场景文本识别基准

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV

AI总结 研究发现现有孟加拉语场景文本识别基准的不足,推出含2535张图像的BanglaWild基准,评估15个VLMs和3个OCR系统等,揭示视觉误识别为主要错误来源等结论,代码数据将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14251 2026-07-01 cs.CV 版本更新 74%

LightOnOCR: A 1B End-to-End Multilingual Vision-Language Model for State-of-the-Art OCR

LightOnOCR: 一个用于最先进OCR的10亿参数端到端多语言视觉语言模型

Said Taghadouini, Adrien Cavaillès, Baptiste Aubertin

机构 * LightOn

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV

AI总结 提出1B参数的端到端多语言视觉语言模型LightOnOCR-2,通过大规模高质量蒸馏训练,在OlmOCR-Bench上达到最先进结果,模型大小仅为先前最佳模型的1/9,速度更快,并扩展了输出格式以预测嵌入图像的归一化边界框。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18774 2026-05-20 cs.IR cs.AI 74%

M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models

M3DocDep: 多模态、多页、多文档依赖分块方法基于大视觉-语言模型

Joongmin Shin, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research, Korea University(韩国大学人智AI研究所) Computer Science and Engineering, Konkuk University(konkuk大学计算机科学与工程系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 文档图表理解 :vision-language model(title);分类 cs.AI

AI总结 本文提出M3DocDep,一种基于大视觉-语言模型的多模态、多页、多文档依赖分块方法,通过恢复块级依赖并构建分块,提高了长多页多模态文档的检索和问答质量。

Comments Accepted to CVPR2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22283 2025-11-27 cs.CV 74%

Rule-Based Reinforcement Learning for Document Image Classification with Vision Language Models

基于规则的强化学习用于文档图像分类与视觉语言模型

Michael Jungo, Andreas Fischer

机构 * University of Applied Sciences and Arts Western Switzerland(西瑞士应用艺术大学) University of Fribourg(弗里堡大学)

专题命中 文档图表理解 :vision language model(title);分类 cs.CV

AI总结 本文提出基于规则的强化学习方法,用于提升文档图像分类任务的泛化能力,通过不同场景验证其在处理超出分布数据时的优势。

Comments Code available at https://github.com/jungomi/vision-finetune

Journal ref Document Analysis and Recognition - ICDAR 2025 Workshops. pp. 292-309. Cham: Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01215 2025-09-03 cs.CV 74%

POINTS-Reader: Distillation-Free Adaptation of Vision-Language Models for Document Conversion

Yuan Liu, Zhongyin Zhao, Le Tian, Haicheng Wang, Xubing Ye, Yangxiu You, Zilin Yu, Chuhan Wu, Xiao Zhou, Yang Yu, Jie Zhou

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV

Comments Accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13155 2025-06-19 cs.CV cs.CL cs.MM 74%

Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding

Chuwei Luo, Guozhi Tang, Qi Zheng, Cong Yao, Lianwen Jin, Chenliang Li, Yang Xue, Luo Si

机构 * Alibaba Group(阿里巴巴集团) School of Electronic and Information Engineering(电子与信息工程学院) South China University of Technology(华南理工大学)

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV

Comments IJDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10127 2025-04-01 cs.CV 74%

PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models

Runze He, Bo Cheng, Yuhang Ma, Qingxiang Jia, Shanyuan Liu, Ao Ma, Xiaoyu Wu, Liebucha Wu, Dawei Leng, Yuhui Yin

专题命中 文档图表理解 :vision language model(title);分类 cs.CV

Comments 15 pages, 12 figures, project page: https://360cvgroup.github.io/PlanGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16586 2025-02-25 cs.CV 74%

Multimodal Large Language Models for Text-rich Image Understanding: A Comprehensive Review

Pei Fu, Tongkun Guan, Zining Wang, Zhentao Guo, Chen Duan, Hao Sun, Boming Chen, Jiayao Ma, Qianyi Jiang, Kai Zhou, Junfeng Luo

专题命中 文档图表理解 :multimodal large language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19117 2024-05-30 cs.CV 74%

ChartFormer: A Large Vision Language Model for Converting Chart Images into Tactile Accessible SVGs

Omar Moured, Sara Alzalabny, Anas Osman, Thorsten Schwarz, Karin Muller, Rainer Stiefelhagen

专题命中 文档图表理解 :vision language model(title);分类 cs.CV

Comments Accepted at ICCHP 2024. Codes will be available at https://github.com/nsothman/ChartFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02499 2023-07-07 cs.CL cs.AI 74%

mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding

Jiabo Ye, Anwen Hu, Haiyang Xu, Qinghao Ye, Ming Yan, Yuhao Dan, Chenlin Zhao, Guohai Xu, Chenliang Li, Junfeng Tian, Qian Qi, Ji Zhang, Fei Huang

专题命中 文档图表理解 :multimodal large language model(title);分类 cs.AI

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 73%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24973 2026-07-31 cs.CV cs.AI cs.CL 版本更新 73%

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

MinerU-Popo:结构化文档解析的通用后处理模型

Bangrui Xu, Ziyang Miao, Xuanhe Zhou, Yiming Lin, Zirui Tang, Xiaomeng Zhao, Fan Wu, Cheng Tan, Fan Wu, Bin Wang, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of California, Berkeley(加州大学伯克利分校)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。

Comments The code is available at https://github.com/opendatalab/MinerU-Popo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03650 2026-07-07 cs.CV cs.AI 新提交 73%

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

Enshuo Hsu, Jin Zhou, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)

专题命中 文档图表理解 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 73%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交 73%

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交 73%

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04498 2026-06-09 cs.LG cs.CV 版本更新 73%

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation

IGenBench:文本到信息图生成可靠性基准测试

Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) UESTC University of Virginia(弗吉尼亚大学) HKUST(GZ)(香港科技大学(广州)) Cornell University(康奈尔大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20731 2026-06-03 cs.CV cs.AI stat.AP 73%

TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design

TASTE:一个由设计师标注的AI生成图形设计多维偏好数据集

Haonan Zhu, Elad Hirsch, Alexandria Minetti, Allison Nulty, Purvanshi Mehta

机构 * Lica World(Lica世界) Contra.Work Inc.(Contra.Work公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对现有偏好数据集仅提供单一整体评价的不足,本文构建了TASTE多维偏好数据集,由两组专业设计师对四个文本到图像模型的输出按九项标准排序,并提出了无准则信号验证框架和偏好模型基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01393 2026-06-02 cs.CL cs.AI cs.CV 73%

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

Dr. DocBench:专家级与困难文档解析的综合基准

Minglai Yang, Xinyan Velocity Yu, Pengyuan Li, Xinyu Guo, Zhenting Qi, Konwoo Kim, Longtian Ye, Xiaolong Luo, Jinhe Bi, Henry Zhang, Haris Riaz, Xuan Zhang, Yunze Xiao, Bangya Liu, Tom Tang, Yunfei Zhao, Qunshu Lin, Zihan Wang, Minghao Liu, Michael Lingzhi Li, Yilun Du, Jesse Thomason, Rogerio Feris, Alex Pentland, Zexue He

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Harvard University(哈佛大学) IBM Research(IBM研究院) University of Arizona(亚利桑那大学) Duke University(杜克大学) UC Berkeley(加州大学伯克利分校) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。

Comments 27 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27223 2026-06-02 cs.CV cs.AI 73%

EuraGovExam: A Multilingual Multimodal Benchmark from Real-World Civil Service Exams

EuraGovExam:来自现实世界公务员考试的多语言多模态基准

Jaeseong Kim, Chaehwan Lim, Sang Hyun Gil, Suan Lee

机构 * School of Computer Science / Data Intelligence Lab(计算机科学学院/数据智能实验室)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一个包含8000多道真实公务员考试题目的多语言多模态基准EuraGovExam,要求模型直接从图像中进行布局感知的跨语言推理,当前最先进的视觉语言模型准确率仅达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21771 2026-05-28 cs.CV cs.AI 73%

MMTABREAL: Real-World Benchmark for Multimodal Table Understanding

MMTABREAL:多模态表格理解的真实世界基准

Prasham Titiya, Jainil Trivedi, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态表格理解,构建了包含500个真实表格和4021个问答对的人工筛选基准MMTABREAL,评估发现现有模型在视觉定位、空间对齐和多步推理上存在20-40%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL 73%

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21169 2026-04-07 cs.MM cs.AI cs.CL cs.CV 73%

Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction

文档解析揭示:结构信息提取的技术、挑战与前景

Qintong Zhang, Bin Wang, Victor Shea-Jay Huang, Junyuan Zhang, Zhengren Wang, Hao Liang, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了文档解析研究,系统分类了现有方法,探讨了布局分析、多类型内容识别及VLM驱动的解析模型发展,总结了评估指标与挑战,提出了更准确可扩展的文档智能系统方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23511 2026-03-26 cs.CL cs.AI cs.CV 73%

DISCO: Document Intelligence Suite for COmparative Evaluation

DISCO:用于比较评估的文档智能套件

Kenza Benkirane, Dan Goldwater, Martin Asenov, Aneiss Ghodsi

机构 * Parexel AI Labs(Parexel人工智能实验室)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 DISCO通过评估OCR流水线和视觉语言模型在不同文档类型上的表现,揭示了任务和文档特性对性能的影响,为选择文档处理策略提供依据。

Comments Accepted at the ICLR 2026 Workshop on Multimodal Intelligence (MMIntelligence). 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23438 2026-03-02 cs.CV cs.AI 73%

DesignSense: A Human Preference Dataset and Reward Modeling Framework for Graphic Layout Generation

DesignSense: 一种用于图形布局生成的人类偏好数据集和奖励建模框架

Varun Gopal, Rishabh Jain, Aradhya Mathur, Nikitha SR, Sohan Patnaik, Sudhir Yarram, Mayur Hemani, Balaji Krishnamurthy, Mausoom Sarkar

机构 * MDSR, Adobe(MDSR,Adobe)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 DesignSense通过人类偏好数据集和奖励建模框架提升图形布局生成的质量和效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07645 2026-02-10 cs.CV cs.AI 73%

From Dead Pixels to Editable Slides: Infographic Reconstruction into Native Google Slides via Vision-Language Region Understanding

从死像素到可编辑幻灯片:通过视觉-语言区域理解将信息图转换为原生Google幻灯片

Leonardo Gonzalez

机构 * Trilogy AI Center of Excellence(Trilogy AI卓越中心)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 通过视觉-语言区域理解,将信息图转换为可编辑的Google幻灯片,实现元素恢复和布局保真度的高精度转换。

Comments Accepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15872 2025-10-21 cs.AR cs.AI cs.LG 73%

Multimodal Chip Physical Design Engineer Assistant

Yun-Da Tsai, Chang-Yu Chao, Liang-Yeh Shen, Tsung-Han Lin, Haoyu Yang, Mark Ho, Yi-Chen Lu, Wen-Hao Liu, Shou-De Lin, Haoxing Ren

机构 * National Taiwan University(国立台湾大学) NVIDIA Research(NVIDIA研究)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01174 2025-10-02 cs.CV cs.AI cs.CL cs.HC cs.MM 73%

Code2Video: A Code-centric Paradigm for Educational Video Generation

Yanzhe Chen, Kevin Qinghong Lin, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(Show实验室,新加坡国立大学)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://showlab.github.io/Code2Video/

详情

展开后加载摘要…

URL PDF HTML 收藏