arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-26 至 2026-06-26 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 2 篇

2602.22284 2026-06-26 cs.LG 版本更新 85%

BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning

BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型

Mingi Kim, Yongjun Kim, Jungwoo Kang, Hyungki Kim

机构 * Chungnam National University(全南国立大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02564 2026-06-26 cs.CV 版本更新 85%

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

VLMs 是视频推理的好老师:通过自适应测试时优化

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。

Comments Project Page: https://VLM-as-Teacher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉定位与Grounding 3 篇

2601.11906 2026-06-26 cs.RO 版本更新 86%

Visual-Language-Guided Task Planning for Horticultural Robots

面向园艺机器人的视觉-语言引导任务规划

Jose Cuaran, Kendall Koe, Aditya Potnis, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) the Department of Agricultural and Biological Engineering(农业与生物工程系) National Center for Supercomputing Applications(国家超级计算中心)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(abstract);grounding(abstract)

AI总结 提出一种模块化框架,利用视觉语言模型(VLM)主动查询异构数据源来引导机器人任务规划,在单作和混作环境中进行短期和长期作物监测任务基准测试,发现零样本VLM在短期任务中表现稳健(成功率87%),但长期多目标任务成功率低于10%,且依赖噪声语义地图时性能下降。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15347 2026-06-26 eess.IV cs.MM 版本更新 75%

Symmetric Entropy-Constrained Video Coding for Machines

面向机器的对称熵约束视频编码

Yuxiao Sun, Meiqin Liu, Chao Yao, Qi Tang, Jian Jin, Weisi Lin, Frederic Dufaux, Yao Zhao

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract)

AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。

Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03371 2026-06-26 cs.CL 版本更新 50%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 1 篇

2605.16932 2026-06-26 cs.RO 版本更新 50%

BAT-Nav: Budget-Aware Arbitration and Termination for Long-Horizon Semantic Navigation

MORN: 为资源理性长周期导航的元认知目标-目标调节

Xi Lin, Kangyi Wu, Jiayi Li, Jiaqiao Tang, Qingrong He, Lin Zhao

机构 * LCSR Lab, Johns Hopkins University(约翰霍普金斯大学LCSR实验室) Xi’an Jiaotong University(西安交通大学) JD Explore Academy, Beijing, China(京东探索研究院,北京,中国)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 本文提出MORN,一种基于双过程理论的元认知导航架构,通过引入资源理性机制,解决传统导航系统在长周期任务中因缺乏全局资源意识导致的资源浪费问题,提升了目标完成率和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 2 篇

2512.04238 2026-06-26 cs.CV 版本更新 83%

6 Fingers, 1 Kidney: Natural Adversarial Medical Images Reveal Critical Weaknesses of Vision-Language Models

6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点

Leon Mayer, Piotr Kalinowski, Caroline Ebersbach, Marcel Knopp, Tim Rädsch, Evangelia Christodoulou, Annika Reinke, Fiona R. Kolbinger, Lena Maier-Hein

机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) Medical Faculty, Heidelberg University(海德堡大学医学院) Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡) Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ)) Engineering Faculty, Heidelberg University(海德堡大学工程学院) School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院) Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院) Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院) National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作) Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出AdversarialAnatomyBench基准,测试25个视觉语言模型在罕见解剖变异上的表现,发现准确率从71%降至28%,且模型缩放和干预无法解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12343 2026-06-26 cs.LG cs.AI cs.CV 版本更新 82%

Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models

通过层间一致性聚合缓解大型视觉-语言模型中的幻觉

Kai Tang, Jinhao You, Yichen Guo, Yiding Sun, Dongxu Zhang, Wenya Wang, Hanze Li, Tao Luo, Renyuan Li, Xiande Huang, Shanghang Zhang

机构 * Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) University of Electronic Science and Technology of China(电子科技大学) De Artificial Intelligence Lab(人工智能实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出训练无关的解码方法DCLA,通过聚合前层表示构建动态语义参考并纠正语义偏差层,增强层间一致性,在多个LVLM和基准上显著降低幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 7 篇

2506.15681 2026-06-26 cs.CL 版本更新 88%

GenRecal: Generation after Recalibration from Large to Small Vision-Language Models

GenRecal:从大到小视觉语言模型的校准后生成

Byung-Kwan Lee, Ryo Hachiuma, Yong Man Ro, Yu-Chiang Frank Wang, Yueh-Hua Wu

机构 * NVIDIA KAIST(韩国成均馆大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 提出GenRecal通用蒸馏框架,通过校准器对齐异构VLM特征,实现从大到小模型的有效知识迁移,在多个基准上超越大规模开源和闭源VLM。

Comments Project page: https://byungkwanlee.github.io/GenRecal-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11625 2026-06-26 cs.CV cs.AI 版本更新 84%

MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models

MedPruner: 面向高效3D医学图像理解的免训练层次化令牌剪枝框架

Shengyuan Liu, Zanting Ye, Yunrui Lin, Chen Hu, Wanting Geng, Xu Han, Bulat Ibragimov, Yefeng Zheng, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Southern Medical University(南方医科大学) Jiangnan University(江南大学) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学) University of Copenhagen(哥本哈根大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MedPruner,一种免训练、模型无关的层次化令牌剪枝框架,通过帧间锚点过滤和动态信息核选择,在保留不到5%视觉令牌时保持甚至提升模型性能,显著降低计算开销。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06080 2026-06-26 cs.CV cs.CY cs.HC 版本更新 81%

AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired

AIDEN:面向视障人士的AI助手设计与初步研究

Luis Marquez-Carpintero, Francisco Gomez-Donoso, Zuria Bauer, Bessie Dominguez-Dager, Alvaro Belmonte-Baeza, Mónica Pina-Navarro, Francisco Morillas-Espejo, Felix Escalona, Miguel Cazorla

机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV

AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。

Journal ref IEEE Access 14 (2026) 80406-80420

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新 79%

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10244 2026-06-26 cs.CV cs.LG 版本更新 79%

Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective

从自动标注视角解决半监督少样本学习

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A\&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出SWIFT方法,通过温度锐化softmax输出和分阶段训练,利用视觉语言模型和开放数据,在半监督少样本学习中显著提升性能,接近监督学习水平。

Comments Accepted to ECCV 2026. Website and code: https://tian1327.github.io/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00813 2026-06-26 cs.CV 版本更新 77%

Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

生成一个Paracosm用于免训练零样本组合图像检索

Tong Wang, Yunhan Zhao, Shu Kong

机构 * University of Macau(澳门大学) UC Irvine(伊丽莎白女王大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出Paracosm方法,通过大多模态模型直接生成“心理图像”并构建合成域,实现免训练的零样本组合图像检索,在多个基准上达到最优性能。

Comments Accepted to ECCV 2026. Website and code: https://leowangtong.github.io/Paracosm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 77%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏