arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 81 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 81 篇

2606.14025 2026-06-15 cs.CV 新提交 70%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 67%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他VLM :multimodal large language model(abstract,abstract_cn)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23611 2026-06-23 cs.CV cs.AI cs.LG 新提交 67%

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

面向视觉-语言场景的迭代自过滤数据选择

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10932 2026-08-12 cs.CV cs.AI 新提交 62%

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

基于几何知识蒸馏的时序锚定组合式相机运动理解

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

专题命中 其他VLM :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05233 2026-08-07 cs.AI cs.CV 新提交 62%

Coherence-Oriented Dream Scene Visualisation

面向连贯性的梦境场景可视化

Azra Açıl, Simon Colton

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。

Comments short paper accepted at ICCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02803 2026-08-05 cs.CV cs.AI 新提交 62%

SAGE: Semantic Explainability of Attention-Based Survival Models in Computational Pathology

SAGE:计算病理学中基于注意力的生存模型的语义可解释性

Abdallah Lamane, Abdul Rahman Diab, Ren-Chin Wu, William Lotter

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出SAGE框架,可从ABMIL模型提取全局语义解释,在7个TCGA癌症队列的生存预测中恢复预后特征,揭示癌症特异性生物学,为病理学家解释模型行为提供支持。

Comments Proceedings of the MICCAI Workshop on Interpretability of Machine Intelligence in Medical Image Computing (iMIMIC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00714 2026-08-04 cs.CV cs.AI 新提交 62%

Coverage-Driven Adaptive Keyframe Selection for Video Understanding

面向视频理解的覆盖驱动型自适应关键帧选择

Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28269 2026-07-31 cs.CV cs.AI cs.MM 新提交 62%

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证

Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini

机构 * Università Politecnica delle Marche(马尔凯理工大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 62%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03900 2026-07-07 cs.CV cs.LG 新提交 62%

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

USE:一种用于测试时提示调整的统一自集成框架

Siru Jiang, Jian Liang, Ran He, Tieniu Tan

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) Nanjing University(南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22352 2026-06-23 cs.LG cs.AI 新提交 62%

On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning

稀疏性-存储-精度权衡在简约激活字典学习中的研究

Zihui Zhao, Yuanbo Tang, Yang Li

机构 * Tsinghua University, Institute of Data and Information(清华大学数据与信息研究院) Shenzhen Key Laboratory of Ubiquitous Data Enabling(深圳泛在数据赋能重点实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出简约激活字典学习(PADL)的结构化生成模型解释,推导出稀疏性、存储成本与重建精度之间的权衡关系,并开发出无需手动调参的高效算法,在视觉基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 62%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17118 2026-06-17 cs.LG cs.AI 新提交 62%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 62%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09868 2026-06-10 cs.LG cs.AI 新提交 62%

SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs

SPACE: 面向多模态大语言模型的无源代理锚点概念擦除

Zhijing Zhang, Jiaqi Ding, Qianshan Wei, Nan Zhou, Jiaqi Li, Yongliang Wu, Tongxin Zhu, Xiaolin Fang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 57%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11425 2026-08-13 cs.CV 新提交 57%

VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

视觉语言模型(VLMs)在水下图像重建的系统评估中胜出

Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-12 cs.CV cs.MM 新提交 57%

MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10154 2026-08-12 cs.CL cs.AI 新提交 57%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08402 2026-08-11 cs.CV 新提交 57%

Agentic AI-powered flexible fiber-bundle endoscopy for high-resolution NIR-II fluorescence imaging in vivo

智能体驱动的柔性光纤束内窥镜用于体内高分辨率近红外二区(NIR-II)荧光成像

Yanzhao Shi, Yuanhua Liu, Sixin Xu, Wayne Jason Li, Yuyuan Chen, Danyang Xu, Zhisheng Wu, Hanze Yu, Ian Yu-Hong Wong, Simon Ying-Kit Law, Hongjie Dai, Liangqiong Qu, Feifei Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 该研究开发了AI驱动的柔性光纤束内窥镜平台,通过光学-计算协同设计及GAME流水线提升NIR-II成像分辨率,实现体内生物样本高分辨率成像,为临床转化奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06467 2026-08-10 cs.CV 新提交 57%

Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition

用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 57%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 57%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00284 2026-08-04 cs.RO cs.AI 新提交 57%

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

基于富有表现力的机器人头部的自适应人机交互混合注意力估计流程

Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

机构 * Technological University of Uruguay(乌拉圭科技大学) Ostfalia University of Applied Sciences(奥斯特法利亚应用科技大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 该研究提出结合几何与语义感知层的混合注意力估计流程,通过有限状态机调节自适应人机交互,经10人40次试验验证其交互启动可靠、暂停行为一致且输出信息非冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29192 2026-08-03 cs.CV 新提交 57%

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

用于小样本遥感场景分类的局部一致直推式信息最大化

Karim El Khoury, Benoît Gérin, Benoît Macq, Christophe De Vleeschouwer

机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。

Comments Accepted at ECCVW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 57%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 57%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 57%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19767 2026-07-23 cs.AI 新提交 57%

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

基于智能识别与生成的电子元件符号与引脚封装数据库

Yichen Shi, Yuzhi Liu, Zhuofu Tao, Li Huang, Yuhao Gao, Ting-Jung Lin, Lei Hel

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Shanghai Jiao Tong University(上海交通大学) BTD Technology(BTD科技)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏