arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-22 至 2026-04-22 共收录 59 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2604.19643 2026-04-22 cs.RO 67%

A Gesture-Based Visual Learning Model for Acoustophoretic Interactions using a Swarm of AcoustoBots

基于手势的视觉学习模型用于声学聚沉交互的声学机器人群

Alex Lin, Lei Gao, Narsimlu Kemsaram, Sriram Subramanian

机构 * Department of Computer Science University College London London United Kingdom(计算机科学系伦敦大学学院伦敦英国) Department of Artificial Intelligence University of Malaya Kuala Lumpur Malaysia(人工智能系马来大学吉隆坡马来西亚) University College London(伦敦大学学院) University of Malaya(马来大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文提出基于手势的视觉学习框架,实现无接触人-机器人群交互,通过多模态AcoustoBot平台实现手势识别与触觉、音频、悬浮等模态映射,验证准确率提升至98%。

Comments This paper has been accepted for publication in the Proceedings of the 2026 4th International Conference on Robotics, Control and Vision Engineering (RCVE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18591 2026-04-22 cs.HC cs.AI 57%

SPRITE: From Static Mockups to Engine-Ready Game UI

SPRITE:从静态草图到引擎-ready的游戏UI

Yunshu Bai, RuiHao Li, Hao Zhang, Chien Her Lim, Ming Yan, Mengtian Li

机构 * Shanghai University(上海大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 SPRITE通过整合视觉语言模型与结构化YAML表示,将静态截图转化为可编辑的引擎资产,提升了游戏UI开发的效率和准确性。

Comments CHI EA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19536 2026-04-22 cs.RO 50%

LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation

LiveVLN: 突破视觉语言导航中的停止与前进循环

Xiangchen Wang, Weiye Zhu, Teng Wang, TianTian Geng, Zekai Zhang, Zhiyuan Qi, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Spatialtemporal AI(时空AI)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 LiveVLN通过增强预训练视觉语言导航器,实现更连续的具身导航,减少等待时间并提升动作可用性,实验证明在真实部署中显著提升执行效率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19081 2026-04-22 cs.SE 50%

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

通过多模态推理主动检测多窗口场景中的GUI缺陷

Xinyao Zhang, Rui Wang, Jinhao Cui, Haotian Huang, Wei Xue, Wenhua Hu, Jianwen Xiang, Rui Hao

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

AI总结 本文提出一种端到端框架,通过主动触发多窗口状态,利用多模态大语言模型检测定位GUI缺陷,实验表明多窗口设置显著增加布局缺陷暴露,方法在应用和细粒度层面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 10 篇

2604.18164 2026-04-22 cs.CL cs.AI cs.CV 91%

MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

MM-JudgeBias:一个评估MLLM-as-a-Judge中组合偏见的基准

Sua Lee, Sanghee Park, Jinbae Im

机构 * Seoul National University(首尔国立大学) NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能实验室)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-JudgeBias基准,通过引入控制扰动和两个互补指标,评估MLLM-as-a-Judge中的组合偏见,揭示了九种偏见类型,并发现现有模型存在模态忽视和评估倾向性问题。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV 85%

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 85%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG 82%

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18942 2026-04-22 cs.CL 78%

Disparities In Negation Understanding Across Languages In Vision-Language Models

多语言中否定理解差异在视觉-语言模型中的表现

Charikleia Moraitaki, Sarah Pan, Skyler Pulling, Gwendolyn Flusche, Kumail Alhamoud, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨了视觉-语言模型在不同语言中对否定理解的差异,通过多语言基准测试发现,CLIP在非拉丁文字语言表现不佳,而MultiCLIP在多语言中表现更优,SpaceVLM在部分语言中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05437 2026-04-22 cs.CL 78%

Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models

一旦正确,仍错误:多语言视觉-语言模型中的反事实幻觉

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈姆丹·本·哈马德大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 研究探讨多语言视觉-语言模型在文化背景下反事实幻觉的问题,提出M²CQA基准测试,通过17个中东国家图像和多语言对比陈述评估模型性能,发现阿拉伯语尤其在方言中反事实幻觉率显著上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV 74%

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 57%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19300 2026-04-22 cs.SD cs.AI 57%

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

HalluAudio:大型音频-语言模型中幻觉检测的综合基准

Feiyu Zhao, Yiming Chen, Wenhuan Lu, Daipeng Zhang, Xianghu Yue, Jianguo Wei

机构 * College of Intelligence and Computing, Tianjin University, China(天津大学智能计算学院) ASUS Intelligent Cloud Services, Singapore(ASUS智能云服务)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 HalluAudio是首个大规模评估语音、环境声音和音乐中幻觉的基准,包含5000多对人工验证的问答对,通过对抗性提示和混合音频条件系统诱导幻觉,评估准确率、幻觉率、偏差等,揭示了大型音频-语言模型在声音接地、时间推理和音乐属性理解上的缺陷。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19083 2026-04-22 cs.CR cs.AI 57%

ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

ProjLens: 揭示项目器在多模态模型安全中的作用

Kun Wang, Cheng Qian, Miao Yu, Lilan Peng, Liang Lin, Jiaming Zhang, Tianyu Zhang, Yu Cheng, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 ProjLens通过分析多模态大语言模型中的后门攻击机制,揭示了项目器在安全漏洞中的关键作用,发现后门注入参数编码于低秩子空间,并通过实验验证了激活机制的差异。

Comments 18 pages ,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 11 篇

2505.20279 2026-04-22 cs.CV cs.CL 93%

VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

VLM-3R:融合指令对齐3D重建的视觉-语言模型

Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan

机构 * UT Austin(德克萨斯大学奥斯汀分校) XMU(厦门大学) TAMU(德克萨斯大学阿灵顿分校) UCR(加州大学河滨分校) UNC(北卡罗来纳大学教堂山分校) Meta UCLA(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出VLM-3R,通过融合3D重建指令微调,实现单目视频的3D空间辅助与具身推理,提升了视觉-空间推理和时间3D上下文理解的准确性和可扩展性。

Comments Project Page: https://vlm-3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 87%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 VLM训练与架构 :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19145 2026-04-22 cs.CV cs.AI 81%

ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪

Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carizon Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对自动驾驶中多视角相机和多帧视频输入的计算开销问题,ST-Prune提出无训练的时空令牌修剪框架,通过MTP和RSP模块有效压缩时空冗余,实现90%令牌减少下的近无损性能。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20323 2026-04-22 cs.RO cs.AI 77%

PhysMem: Scaling Test-time Physical Memory for Robot Manipulation

PhysMem:为机器人操作扩展测试时的物理内存

Haoyang Li, Yang You, Hao Su, Leonidas Guibas

机构 * Stanford University(斯坦福大学) UC San Diego(圣地亚哥大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 PhysMem通过测试时交互学习物理原理,提升机器人在不同环境下的物体操控能力,实验显示其在真实任务和模拟中均优于传统经验检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11665 2026-04-22 cs.CL 75%

Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge

多任务强化学习用于增强多模态大语言模型作为裁判

Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

机构 * Meta AI Hong Kong University of Science and Technology(香港科技大学) Emory University(埃默里大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出MT-RL-Judge框架,通过多任务强化学习优化多模态大语言模型作为裁判,提升判断一致性和与人类偏好的相关性,并在分布外任务中展现鲁棒泛化能力。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08564 2026-04-22 cs.AI cs.CV cs.LG 75%

How to Teach Large Multimodal Models New Skills

如何向大型多模态模型传授新技能

Zhen Zhu, Yiming Gong, Yao Xiao, Yaoyao Liu, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了如何在不丧失原有能力的前提下通过序列微调向大型多模态模型传授新技能,提出两种有效的微调方法以平衡学习与遗忘。

Comments In submission. Code is available at https://github.com/jessemelpolio/LMM_CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19406 2026-04-22 cs.CV cs.AI 73%

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18975 2026-04-22 cs.MA 67%

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game

门控协调:Minecraft游戏中的高效多智能体协作

HuaDong Jian, Chenghao Li, Haoyu Wang, Jiajia Shuai, Jinyu Guo, Yang Yang, Chaoning Zhang

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn)

AI总结 本文提出门控协调机制,通过分离私有状态与公共协调状态,减少通信噪声,提升多智能体在Minecraft中的协作效率与任务完成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG 62%

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18757 2026-04-22 cs.CV cs.AI 62%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19405 2026-04-22 cs.CL 50%

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 4 篇

2604.18610 2026-04-22 cs.NE cs.AI 83%

SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression

基于脉冲的多模态大语言模型:通过模态特定的时间尺度和时间压缩

Han Xu, Zhiyong Qin, Di Shang, Jiahong Zhang, Xuerui Qiu, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 University of Chinese Academy of Sciences 3 Beijing Academy of Artificial Intelligence 4 Zhongguancun Academy 5 Peking University 6 Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology 7 Spiking Intelligence Lab, Tianqiao \& Chrissy Chen Institute [0.5em] Equal contribution Corresponding authors

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出SpikeMLLM,首个基于脉冲的多模态大语言模型框架,通过模态特定时间尺度和时间压缩技术,在减少时间步数的同时保持高性能,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16822 2026-04-22 cs.CV cs.AI 73%

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

ReefNet:一个大规模数据集和基准,用于细粒度珊瑚礁识别

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xiang Li, Fabio Marchese, Sara Beery, Burton H. Jones, Francesca Benzoni, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒·阿齐兹科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReefNet,一个大规模珊瑚礁图像数据集,用于细粒度识别。通过专家验证和过滤,构建了高置信度基准子集,揭示了多模态模型在生物多样性监测中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02200 2026-04-22 cs.NE cs.AI cs.CV cs.LG 67%

Learning Evolution via Optimization Knowledge Adaptation

通过优化知识适应学习进化

Chao Wang, Lingling Li, Licheng Jiao, Jiaxuan Zhao, Fang Liu, Shuyuan Yang

机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education(教育部智能感知与图像理解重点实验室) International Research Center for Intelligent Perception and Computation(智能感知与计算国际研究中心) Xidian University(西安电子科技大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出OKAEM模型,通过注意力机制参数化进化算子,实现优化知识的预训练和自适应优化,提升进化算法的知识转移与在线适应能力。

Comments This work has been accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19489 2026-04-22 cs.CV cs.CY 57%

Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

大规模识别候选人:用于推特视觉政治沟通的多模态大语言模型

Michael Achmann-Denkler, Mario Haim, Christian Wolff

机构 * Media Informatics Group University of Regensburg(媒体信息学组莱比锡大学) Department of Media and Communication Ludwig-Maximilians-Universität Munich, Germany(媒体与传播系路德维希-马克西米利安大学慕尼黑,德国)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文评估了专用机器学习模型和新兴多模态大语言模型在视觉政治沟通分析中的能力,展示了GPT-4o在识别领先政治人物和计数中的优越性能。

Comments An earlier version was presented at #SMSociety 2024 (London)

详情

展开后加载摘要…

URL PDF HTML 收藏