arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-08 至 2026-07-08 共收录 29 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2605.30794 2026-07-08 cs.CV cs.AI 版本更新 82%

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) Beijing University of Technology, China(北京理工大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。

Comments accept by iclm2026, add github link

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 82%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07089 2026-07-08 cs.CV 版本更新 70%

RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent

RS-Agent:通过智能代理实现遥感任务自动化

Wenjia Xu, Zijian Yu, Boyang Mu, Jiuniu Wang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(网络与交换技术国家重点实验室,北京邮电大学,中国) City University of HongKong, Hong Kong 999077, China(香港城市大学,中国) School of Geographic Sciences, Hunan Normal University, Changsha 410081, China(地理科学学院,湖南师范大学,中国)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在遥感任务中的局限,提出RS-Agent智能代理,通过结构化任务规划等连接用户意图与遥感流程,含四个组件及两种方法,实验显示其在多任务中显著优于现有模型,证明结合两者用于智能地理空间分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 6 篇

2510.13808 2026-07-08 cs.CV 版本更新 87%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新 79%

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新 57%

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 57%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09696 2026-07-08 cs.CV 版本更新 57%

ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试

Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) University of Alberta(阿尔伯塔大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Northeastern University(东北大学) Astadeus College of Southern Maryland(马里兰州南部学院) University of Geneva(日内瓦大学) University of Oregon(俄勒冈大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新 50%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 7 篇

2604.09927 2026-07-08 cs.CV 版本更新 87%

BLPR: Robust License Plate Recognition under Viewpoint and Illumination Variations via Confidence-Driven VLM Fallback

BLPR: 通过置信度驱动的VLM回退实现视点和光照变化下的鲁棒车牌识别

Guillermo Auza Banegas, Diego Calvimontes Vera, Natalia Condori Peredo, Edwin Salcedo, Sergio Castro Sandoval

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出BLPR框架,通过合成数据预训练和真实数据微调提升Bolivian车牌识别鲁棒性,引入轻量视觉语言模型作为置信度回退机制,实现89.6%的字符识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23020 2026-07-08 cs.CV cs.AI 版本更新 84%

OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding

OpenGround:基于规划的开放世界3D视觉定位在线感知

Wenyuan Huang, Zhenyu Zhang, Zhao Wang, Zhou Wei, Ting Huang, Fang Zhao, Jian Yang

机构 * Nanjing University, School of Intelligent Science and Technology(南京大学智能科学与技术学院) China Mobile Zijin Innovation Institute(中国移动紫金创新院)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV、cs.AI

AI总结 针对开放世界3D视觉定位中现有方法的局限,提出OpenGround框架,集成任务链规划与上下文引导感知,还构建OpenTarget数据集。实验表明其在多个数据集上性能优异,在开放世界评估中有显著提升。

Comments ECCV2026, 46 pages, 13 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23876 2026-07-08 cs.CV cs.AI 版本更新 81%

Rethinking Visual Autoregressive Sampling with Information-Grounding Guidance

基于信息基础引导的视觉自回归采样再思考

Ky Dan Nguyen, Hoang Lam Tran, Anh-Dung Dinh, Daochang Liu, Weidong Cai, Xiuying Wang, Chang Xu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 研究基于下一尺度预测的自回归模型在图像生成中因信息不一致致引导信号分散问题,提出信息基础引导(IGG)框架,通过动态加权将引导锚定到语义重要令牌,在相关任务中生成更优图像,有效纠正基于AR的方法。

Comments Accepted to The Forty-Third International Conference on Machine Learning (ICML 2026); 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04703 2026-07-08 cs.HC 版本更新 67%

Bounded Autonomy: Controlling LLM Characters in Live Multiplayer Games

有界自主性:控制游戏中的LLM角色

Yunjia Guo, Jinghan Zhu, Siyu Wang, Haixin Qiao

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出有界自主性架构,通过三种接口控制游戏中的LLM角色,使其在多人互动中保持可执行性和社会一致性,并通过实验验证其有效性。

Comments 9 pages, 5 figures, 5 tables; manuscript unchanged from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19216 2026-07-08 cs.CV cs.AI cs.LG 版本更新 67%

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

DreamPartGen: 通过协作潜在去噪实现语义引导的部件级3D生成

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou

机构 * University of Illinois Urbana - Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DreamPartGen通过协作潜在去噪实现语义引导的部件级3D生成,引入双部件潜在和关系语义潜在,提升几何和语义一致性,实现高质量文本对齐的3D合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20735 2026-07-08 cs.AI cs.LO 版本更新 57%

Implementing Metric Temporal Answer Set Programming

实现度量时态回答集编程

Arvid Becker, Pedro Cabalar, Martin Diéguez, Susana Hahn, Javier Romero, Torsten Schaub

机构 * University of Potsdam, Germany(波恩大学) University of Corunna, Spain(科鲁纳大学) University of Angers, France(昂热大学) Potassco Solutions, Germany(Potassco解决方案)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究如何实现度量时态回答集编程,利用带差异约束的ASP扩展处理时间相关方面,有效解耦度量ASP与时间粒度,解决处理细粒度时间约束时的可扩展性问题,使解决方案不受时间精度影响。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31480 2026-07-08 cs.CL 版本更新 50%

Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task

语言模型可以组合性地解析指代,但这并非其天然优势:以个人关系任务为例

Bart Evelo, Meaghan Fowlie, Denis Paperno

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过个人关系任务,比较人类与大型语言模型在外延任务(确定指称对象)和内涵任务(结构化表示意义)上的表现,发现人类更擅长外延任务而LLM更擅长内涵任务,表明缺乏指称基础是LLM模拟人类语言理解的关键缺失。

Comments A pre-MIT Press publication version. Paper accepted to Transactions of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2605.29655 2026-07-08 cs.CV cs.GR 版本更新 77%

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Tencent America(腾讯美国)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 62%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 2 篇

2605.18419 2026-07-08 cs.CV cs.AI 版本更新 79%

Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology

面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习

Franciskus Xaverius Erick, Johanna Paula Müller, Bernhard Kainz

机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)

专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14152 2026-07-08 cs.CL cs.AI cs.CR cs.CY 版本更新 57%

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

ROK-FORTRESS:衡量地缘政治转译对国家安全和公共安全的影响

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q. Knight, Joseph Brandifino, Max Fenkell

机构 * Scale AI

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出ROK-FORTRESS基准,通过英韩语言对和美韩地缘政治轴,评估语言与地缘政治交互对国家安全的影响,发现韩语版本存在压制效应,且模型间表现差异显著。

Comments 16 pages main text + appendix (74 pages total), 4 figures and 2 tables in main text; dataset at https://huggingface.co/datasets/ScaleAI/ROK-FORTRESS_public

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 7 篇

2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 95%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 VLM训练与架构 :LLaVA(title,title_cn);MLLM(title,title_cn);multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01642 2026-07-08 cs.RO 版本更新 90%

FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models

FailSafe: 视觉-语言-动作模型中的失败推理与恢复

Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);LLaVA(summary_cn,abstract);vision-language model(abstract)

AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。

Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29431 2026-07-08 cs.AI 版本更新 85%

FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models

FADE: 通过减少大型视觉语言模型中的语言先验主导性来缓解幻觉

Yichen Guo, Kai Tang, Fenglai Lin, Yiding Sun, Dongxu Zhang, Wenya Wang, Lin William Cong, Shanghang Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过分析信息流,发现FFN模块在关键层引入语言先验,主导视觉证据,导致幻觉;提出无需训练的FADE方法衰减FFN输出,有效缓解幻觉并保持推理效率。

Comments 18 pages, 5 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02401 2026-07-08 cs.CV 版本更新 81%

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

超人:统一骨骼与视觉用于人体运动感知与生成

Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) Sony R&D Center(索尼研发中心) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25451 2026-07-08 cs.LG 版本更新 77%

BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

BigMac: 打破多模态大语言模型训练中的计算与内存帕累托前沿

Zili Zhang, Chengxu Yang, Shenglong Zhang, Chenyu Wang, Yufan Zhang, Tuo Dai, Zhouyang Li, Yuhong Ge, Chao Jin, Xin Jin, Yuliang Liu

机构 * Peking University(北京大学) Independent Researcher(独立研究员) Xiaohongshu, Inc(小红书公司)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.LG

AI总结 提出BigMac训练流水线,通过嵌套编码器和生成器计算到LLM流水线中,同时优化计算效率和内存使用,打破帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27932 2026-07-08 cs.CV 版本更新 77%

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

动态聚类数据采样用于高效且长尾感知的视觉-语言预训练

Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出动态聚类采样方法DynamiCS,通过动态调整数据分布平衡语义长尾概念,降低训练成本并提升长尾概念表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新 50%

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 2 篇

2604.11539 2026-07-08 cs.CV cs.AI 版本更新 62%

CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space

CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性

Sohwi Lim, Lee Hyoseok, Jungjoon Park, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。

Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新 57%

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏