arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2604.09532 2026-04-13 cs.CV cs.AI 73%

Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise

见仁见智:在标签噪声下鲁棒的视觉引导跨模态提示学习

Zibin Geng, Xuefeng Jiang, Jia Li, Zheng Li, Tian Wen, Lvhua Wu, Sheng Sun, Yuwei Wang, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) PCALab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院PCALab, VCIP)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPrompt框架,通过跨模态注意力机制将视觉语义注入提示表示,提升在标签噪声下的鲁棒性,实验表明其在多个数据集上表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22451 2026-04-09 cs.CV cs.AI 73%

Countering the Over-Reliance Trap: Mitigating Object Hallucination for LVLMs via a Self-Validation Framework

对抗过度依赖陷阱:通过自验证框架缓解LVLMs中的物体幻觉

Shiyu Liu, Xinyi Wen, Zhibin Lan, Ante Wang, Jinsong Su

专题命中 幻觉与鲁棒性 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自验证框架,通过验证生成描述中物体存在的可信度,缓解LVLMs中的物体幻觉问题,在图像描述任务中取得显著改进。

Comments Code is available at https://github.com/Liushiyu-0709/SelfVal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14735 2026-04-09 q-fin.CP cs.AI cs.CV 73%

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

PyFi: 通过对抗代理实现金字塔式金融图像理解的愿景语言模型

Yuqun Zhang, Yuxuan Zhao, Sijia Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Yantai Research Institute, Harbin Engineering University(哈尔滨工程大学烟台研究院)

专题命中 幻觉与鲁棒性 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 PyFi通过对抗代理生成的金字塔结构数据集,提升VLM在金融图像理解中的推理能力,实验显示模型在复杂金融问题上的准确率提升19.52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24079 2026-03-26 cs.CV cs.AI cs.CR 73%

When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm

当理解成为风险:新兴图像生成范式中的真实性与安全性风险

Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Xi’an Jiaotong University(西安交通大学) Flexera(Flexera公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。

Comments Accepted by CVPR 2026. 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14099 2026-03-16 cs.CV cs.AI 73%

FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

FAPE-IR:面向全场景图像修复的频率感知规划与执行框架

Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji

机构 * Tianjin University(天津大学) University of Macau(澳门大学) City University of Hong Kong(香港城市大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FAPE-IR框架,通过频率感知规划与执行模块,结合多模态大语言模型和LoRA-MoE架构,实现统一且可解释的全场景图像修复,实验显示其在七项任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09125 2026-03-11 cs.CV cs.AI 73%

QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model

QUSR: 一种基于质量感知和不确定性引导的图像超分辨率扩散模型

Junjie Yin, Jiaju Li, Hanfa Xing

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 QUSR通过引入质量感知先验和不确定性引导噪声生成模块,提升图像超分辨率在复杂场景下的真实感和细节还原能力。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04325 2026-03-05 cs.CV cs.LG 73%

Scalable Evaluation of the Realism of Synthetic Environmental Augmentations in Images

可扩展性评估合成环境增强图像的真实性

Damian J. Ruck, Paul Vautravers, Oliver Chalkley, Jake Thomas

机构 * Advai Ltd(Advai有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种可扩展框架,用于评估合成环境增强图像的真实性,发现生成式AI在大多数条件下优于基于规则的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 73%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19539 2026-02-24 cs.CV cs.CR cs.LG 73%

Can a Teenager Fool an AI? Evaluating Low-Cost Cosmetic Attacks on Age Estimation Systems

青少年能否欺骗AI?评估低成本的外貌攻击对年龄估计系统的影响

Xingyu Shen, Tommy Duong, Xiaodong An, Zengqi Zhao, Zebang Hu, Haoyu Hu, Ziyou Wang, Finn Guo, Simiao Ren

机构 * Reality Inc UC Berkeley(伯克利大学) Duke University(杜克大学) Georgia Tech(佐治亚理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) UC San Diego(南加州大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究评估了低成本外貌攻击对年龄估计系统的影响,发现合成胡须等修改可使AI将未成年人误判为成年人,视觉-语言模型的鲁棒性略低于专门模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18729 2026-02-24 cs.CV cs.AI 73%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18520 2026-02-24 cs.CV cs.AI 73%

Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams

Sketch2Feedback: 用于学生STEM图表的基于语法规则的反馈框架

Aayam Bansal

机构 * IEEE

专题命中 幻觉与鲁棒性 :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 Sketch2Feedback通过结合语法规则和视觉语言模型,提高了学生STEM图表反馈的准确性与可靠性,展示了语法规则与端到端方法的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01769 2026-02-04 cs.LG cs.AI 73%

IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination

IRIS: 隐式奖励引导的内部筛选以缓解多模态幻觉

Yuanshuai Li, Yuping Yan, Jirui Han, Fei Ming, Lingjuan Lv, Yaochu Jin

机构 * Department of Artificial Intelligence, Westlake University, Hangzhou, China(人工智能系,西湖大学,杭州,中国) Sony Research, Sony(索尼研究,索尼)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 IRIS通过隐式奖励引导内部筛选,有效缓解多模态大语言模型的幻觉问题,无需外部反馈且性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04136 2026-02-04 cs.CV cs.AI 73%

UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval

UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索

Hongyu Guo, Xiangzhao Hao, Jiarui Guo, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)

专题命中 幻觉与鲁棒性 :visual language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01452 2026-02-03 cs.CV cs.AI 73%

Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles

跨范式评估基于注视的语义物体识别用于智能车辆

Penghao Deng, Jidong J. Yang, Jiachen Bian

机构 * Smart Mobility & Infrastructure Laboratory(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过三种方法评估基于注视的语义物体识别,发现大型VLM在识别小型安全关键物体上表现优异,但传统检测器在实时性上更高效。

Comments 21 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20689 2026-01-29 cs.CV cs.AI 73%

Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework

解耦感知与校准:一种标签高效的图像质量评估框架

Xinyue Li, Zhichao Zhang, Zhiming Xu, Shubo Xu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Baidu(百度)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LEAF通过蒸馏多模态大语言模型的感知先验,实现轻量级图像质量评估,减少对人类标注的依赖,同时保持与人类注释的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15549 2026-01-23 cs.CV cs.AI 73%

VIOLA: Towards Video In-Context Learning with Minimal Annotations

VIOLA:迈向最小标注的视频情境学习

Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(Keio大学) Keio AI Research Center(Keio人工智能研究中心) NVIDIA(NVIDIA公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VIOLA通过结合最小专家监督和大量未标注数据,实现高效视频情境学习,显著提升低资源环境下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06460 2026-01-13 cs.CV cs.AI cs.CL 73%

Tone Matters: The Impact of Linguistic Tone on Hallucination in VLMs

语气至关重要:语言语气对VLMs幻觉影响的研究

Weihao Hong, Zhiyuan Jiang, Bingyu Shen, Xinlei Guan, Yangyi Feng, Meng Xu, Boyang Li

机构 * Department of Computer Science and Technology, Kean University(计算机科学与技术系,凯恩大学) Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了提示语气对VLMs幻觉的影响,通过Ghost-100数据集发现幻觉率与提示强度非线性相关,揭示模型在处理结构性强制时的局限性。

Comments 10 pages, 6 figures, WACV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01042 2026-01-12 cs.CV cs.CR cs.LG 73%

Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach

视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法

Linhao Huang, Xue Jiang, Zhiqiang Wang, Wentao Mo, Xi Xiao, Yong-Jie Yin, Bo Han, Feng Zheng

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21999 2025-12-29 cs.CV cs.LG 73%

Look Closer! An Adversarial Parametric Editing Framework for Hallucination Mitigation in VLMs

更仔细地看!一种对抗性参数编辑框架用于减轻视觉语言模型中的幻觉

Jiayu Hu, Beibei Li, Jiangwei Xia, Yanjun Qin, Bing Ji, Zhongshi He

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种对抗性参数编辑框架,通过激活-定位-编辑-对抗范式减轻视觉语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20168 2025-12-24 cs.CR cs.AI cs.LG 73%

Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography

奥德赛:通过双隐写术对集成多模态大语言模型系统的商业系统进行劫持

Songze Li, Jiameng Cheng, Yiming Li, Xiaojun Jia, Dacheng Tao

机构 * S3IC-Lab(S3IC实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 奥德赛通过双隐写术劫持多模态大语言模型集成系统,揭示现有安全过滤器的局限性,实现高达99%的攻击成功率。

Comments This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17902 2025-12-22 cs.CV cs.AI cs.CR 73%

Adversarial Robustness of Vision in Open Foundation Models

开放基础模型中视觉的对抗鲁棒性

Jonathon Fox, William J Buchanan, Pavlos Papadopoulos

机构 * Blockpass ID Lab(Blockpass ID 实验室) Edinburgh Napier University(爱丁堡纳皮尔大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了LLaVA-1.5-13B和Llama 3.2 Vision-8B-2在视觉输入下的对抗鲁棒性,发现Llama 3.2 Vision在高扰动水平下性能下降更小,表明视觉模态是降级开放权重VLMs的可行攻击向量。

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 73%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20379 2025-11-17 cs.CV cs.CL cs.LG 73%

Leveraging NTPs for Efficient Hallucination Detection in VLMs

Ofir Azachi, Kfir Eliyahu, Eyal El Ani, Rom Himelstein, Roi Reichart, Yuval Pinter, Nitay Calderon

机构 * Department of Data and Decision Science, Technion - Israel Institute of Technology(数据与决策科学系,技术学院-以色列理工学院) Faculty of Computer and Information Science, Ben-Gurion University of the Negev(计算机与信息科学系,贝内-约尔根大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted to The First Workshop on Confabulation, Hallucinations, & Overgeneration in Multilingual & Precision-critical Setting - AACL-IJCNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09018 2025-11-13 cs.CV cs.AI 73%

Causally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMs

Liu Yu, Zhonghao Chen, Ping Kuang, Zhikun Feng, Fan Zhou, Lan Wang, Gillian Dobbie

机构 * University of Auckland(奥克兰大学) China Scholarship Council(中国留学基金委)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments 9 pages, published to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02677 2025-10-06 cs.AI cs.LG 73%

ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks

Zhaorun Chen, Xun Liu, Mintong Kang, Jiawei Zhang, Minzhou Pan, Shuang Yang, Bo Li

机构 * University of Chicago(芝加哥大学) University of Illinois(伊利诺伊大学) Virtue AI Meta

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments 60 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23879 2025-09-30 cs.CV cs.AI cs.CL cs.MM 73%

PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications

Hitesh Laxmichand Patel, Amit Agarwal, Srikant Panda, Hansa Meghwani, Karan Dua, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15803 2025-09-22 cs.CV cs.AI 73%

CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models

Fangjian Shen, Zifeng Liang, Chao Wang, Wushao Wen

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangzhou, China(工程学院,中山大学,广州,中国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 7 figures, submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02708 2025-09-04 cs.LG cs.AI cs.CL 73%

Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios

Yunkai Dang, Mengxi Gao, Yibo Yan, Xin Zou, Yanggan Gu, Jungang Li, Jingyu Wang, Peijie Jiang, Aiwei Liu, Jia Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团)

专题命中 幻觉与鲁棒性 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09085 2025-08-13 cs.NI cs.AI cs.LG 73%

Dynamic Uncertainty-aware Multimodal Fusion for Outdoor Health Monitoring

Zihan Fang, Zheng Lin, Senkang Hu, Yihang Tao, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07648 2025-08-12 cs.RO cs.AI cs.LG 73%

Grasp-HGN: Grasping the Unexpected

Mehrshad Zandigohar, Mallesham Dasari, Gunar Schirner

专题命中 幻觉与鲁棒性 :vision language model(abstract);LLaVA(abstract);分类 cs.AI、cs.LG

Comments Paper accepted at ACM Transactions on Embedded Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏