arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-27 至 2026-05-27 共收录 100 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 6 篇

2604.11467 2026-05-27 cs.AI cs.HC cs.LG 62%

From Attribution to Action: A Human-Centered Application of Activation Steering

从归因到行动:激活导向的人本应用

Tobias Labarta, Maximilian Dreyer, Katharina Weitz, Wojciech Samek, Sebastian Lapuschkin

机构 * Fraunhofer Heinrich-Hertz-Institut(弗劳恩霍夫 Heinrich-Hertz 研究所) Technische Universität Berlin(柏林技术大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出结合SAE归因与激活导向的交互式工作流,通过专家访谈验证其能促进从检查到干预的转变,并揭示组件抑制等调试策略及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22190 2026-05-27 cs.LG cs.AI cs.CL 62%

GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL

GUI-Libra:训练原生GUI代理进行推理与行动——基于动作感知监督和部分可验证强化学习

Rui Yang, Qianhui Wu, Zhaoyang Wang, Hanyang Chen, Ke Yang, Hao Cheng, Huaxiu Yao, Baolin Peng, Huan Zhang, Jianfeng Gao, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出GUI-Libra训练方案,通过动作感知SFT和部分可验证RL中的KL正则化,解决GUI代理在长程导航任务中推理与定位冲突及部分可验证性问题,显著提升步骤准确率和任务完成率。

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26503 2026-05-27 cs.CV 57%

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

面向视觉-语言导航的不确定性感知高斯地图

Jianzhe Gao, Rui Liu, Yuxuan Xu, Tongtong Cao, Yingxue Zhang, Zhanguang Zhang, Sida Peng, Yi Yang, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) Department of Foundation model, 2012 Labs, Huawei(基础模型部门,2012实验室,华为) Noah’s Ark Lab, 2012 Labs, Huawei(诺亚方舟实验室,2012实验室,华为) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 提出不确定性感知高斯地图,通过显式建模几何、语义和外观三种感知不确定性并融入观测空间,提升视觉-语言导航中智能体的决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 13 篇

2605.26992 2026-05-27 cs.CV 85%

On the Robustness of Machine Unlearning for Vision-Language Models

机器遗忘在视觉-语言模型中的鲁棒性研究

Yujie Lin, Kaidi Jia, Jiayao Ma, Chengyi Yang, Jinsong Su

机构 * Xiamen University(厦门大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文首次系统调查了视觉-语言模型机器遗忘的鲁棒性,通过提出三种攻击范式揭示现有方法往往隐藏而非彻底移除目标知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26501 2026-05-27 cs.CV cs.AI 84%

Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization

揭示视觉-语言模型的脆弱性:通过纹理约束扰动和跨模态优化的多模态对抗协同

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 提出多模态对抗协同框架,通过纹理约束的通用对抗扰动和可学习的文本提示扰动,在黑盒设置下联合优化,揭示视觉-语言模型在多模态攻击下的脆弱性。

Comments Publish in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26283 2026-05-27 cs.CV cs.LG 81%

Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening

卷积、Transformer、混合模型及视觉语言模型在多病种视网膜筛查中的基准测试

Durjoy Dey, Aymane Ajbar, Yuhong Yan

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Concordia University(康科迪亚大学) Ebovir Biotechnologie Inc.(Ebovir生物技术公司)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究在RFMiD数据集上对四种模型家族的12种架构进行基准测试,评估其在多病种视网膜筛查中的性能,发现基于注意力的模型(如SwinTiny、CoAtNet0、MaxViTTiny)在二元筛查和多标签分类中表现最佳,视觉语言模型与CNN基线相当但未超越最优Transformer和混合模型。

Comments 12 pages, 3 figures, accepted at ICMHI 2026, 10th International Conference on Medical and Health Informatics, Kyoto, Japan. To appear in ACM Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14702 2026-05-27 cs.AI cs.CV cs.RO 73%

Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving

Drive-P2D:自动驾驶中视觉语言模型的渐进式感知到决策基准

Zecong Tang, Zixu Wang, Yifei Wang, Weitong Lian, Tianjian Gao, Haoran Li, Tengju Ru, Lingyi Meng, Zhejun Cui, Yichen Zhu, Qi Kang, Kaixuan Wang, Yu Zhang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Drive-P2D基准,通过分离推理与答案的协议,在目标、场景和决策三个层级上评估视觉语言模型的感知到决策能力,并分析错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27136 2026-05-27 cs.CV 70%

Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

利用视觉信号实现视觉-语言生成中鲁棒的词元级不确定性

Joseph Hoche, David Brellmann, Gianni Franchi

机构 * AMIAD, Pôle Recherche, Palaiseau(AMIAD研究部,帕莱索)

专题命中 幻觉与鲁棒性 :vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型不确定性量化中视觉信息利用不足的问题,提出基于视觉锚定的词元级不确定性量化框架VIG-TUQ,通过加权语言不确定性与视觉锚定分数,无需训练即可提升不确定性估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26158 2026-05-27 cs.CR cs.AI cs.LG 62%

Furina: Fragmented Uncertainty-Driven Refusal Instability Attack

Furina: 碎片化不确定性驱动的拒绝不稳定攻击

Tongxi Wu, Jian Zhang, Yang Gao

机构 * School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 通过揭示大语言模型安全行为存在不稳定区域,提出多指标诊断框架并开发Furina攻击方法,利用碎片化场景提示诱导不确定性放大,实现高效越狱。

Comments This work is accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-05-27 cs.CV cs.AI 62%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04711 2026-05-27 cs.CR cs.AI cs.LG 62%

SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking

SWAP:通过顺序水印实现软提示的版权审计

Wenyuan Yang, Yichen Sun, Changzheng Chen, Zhixuan Chu, Jiaheng Zhang, Yiming Li, Dacheng Tao

机构 * Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 针对软提示的版权保护问题,提出一种基于顺序水印的审计方法SWAP,通过将水印嵌入到更复杂的输出分布顺序空间中,实现无害且鲁棒的版权验证。

Comments This paper has been accepted by the International Journal of Computer Vision (IJCV), 2026. The first two authors contributed equally to this work. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 57%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26944 2026-05-27 cs.RO cs.CV 57%

Object Pose and Shape Estimation for Grasping: Does it Work?

用于抓取的目标姿态与形状估计:有效吗?

Pavan Karke, Kushal Shah, Gaurav Singh, Md Faizal Karim, K Madhava Krishna, Rajat Talak

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过对比端到端抓取合成方法与模块化方法(先估计目标姿态和形状再采样抓取),评估现有姿态和形状估计方法在抓取任务中的有效性。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12564 2026-05-27 cs.CL cs.AI 57%

Sell Me This Stock: Unsafe Recommendation Drift in LLM Agents

卖给我这支股票:LLM智能体中的不安全推荐漂移

Zekun Wu, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究LLM智能体在多轮金融推荐中因工具输出被操纵而产生风险不匹配推荐的问题,通过实验揭示评估盲区并分析机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19450 2026-05-27 cs.CR cs.AI 57%

Red-Teaming Claude Opus and ChatGPT-based Security Advisors for Trusted Execution Environments

对基于Claude Opus和ChatGPT的TEE安全顾问进行红队测试

Kunal Mukherjee, Spandan Mukherjee

机构 * Virginia Tech(弗吉尼亚理工大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对TEE安全顾问角色下的LLM助手(ChatGPT-5.2和Claude Opus-4.6),提出TEE-RedBench评估方法,发现提示诱导的失败可跨模型迁移(最高12.02%),并通过LLM-in-the-loop流水线减少80.62%的失败。

Comments Accepted for publication in ACM CAIS '26 Workshop on AI Discovery in the Wild (AID-Wild)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00944 2026-05-27 cs.CY 50%

Auditing the Reliability of Multimodal Generative Search

审计多模态生成式搜索的可靠性

Erfan Samieyan Sahneh, Luca Maria Aiello

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 通过大规模审计Gemini 2.5 Pro系统,发现3.7%至18.7%的基于视频的生成式搜索声明未被引用来源支持,主要失败模式为不可验证的特异性与夸大声明。

Comments 14 pages, LaTeX, typos corrected, adding Data Availability section + examples in appendix, New plot(overview)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 21 篇

2605.27332 2026-05-27 cs.SE cs.AI cs.CV 91%

EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering

EdgeFlow: 基于边缘图增强的VLM流程图处理用于工业需求工程

Zhifei Dou, Shabnam Hassani, Ou Wei

机构 * Huawei Research Canada(华为加拿大研究)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 提出EdgeFlow方法,通过向视觉语言模型(VLM)输入添加Canny边缘图作为结构先验,无需训练数据或微调即可提升流程图到Mermaid代码的转换精度,在工业数据集上节点F1提升17.39%,边F1提升16.94%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26533 2026-05-27 cs.CV cs.AI cs.CL cs.LG 86%

A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection

一种用于工业检测中自动缺陷推理与报告生成的混合视觉-语言架构

Malikussaid, Imad Gohar

机构 * School of Computing, Telkom University(Telkom大学计算机学院) Faculty of Engineering and Technology, School of Computing and Artificial Intelligence(工程与技术学院,计算与人工智能学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种解耦的边缘可部署管道,结合YOLO26-x-obb检测器、确定性编码模块和QLoRA微调的Qwen-2.5-1.5B模型,实现风电叶片缺陷定位与结构化报告生成,在BLEU-4、幻觉率和专家评分上显著优于零样本VLM基线。

Comments 23 pages, 6 figures, 9 equations, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27315 2026-05-27 cs.CL 82%

Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

真实图像,更差判断:评估视觉-语言模型在具体性和意象性上的表现

Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn)

AI总结 本文通过具体性和意象性评分任务,发现真实图像上下文不仅未提升视觉-语言模型与人类判断的一致性,反而在视觉证据相关性低时加剧偏差,并表明推理时聚焦文本指令可缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14664 2026-05-27 cs.CV 81%

MiVE: Multiscale Vision-language features for reference-guided video Editing

MiVE:用于参考引导视频编辑的多尺度视觉语言特征

Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

机构 * MT Lab, Meitu Inc., Beijing 100083, China(美图实验室,美图公司,北京100083,中国) Department of Computer Science and Technology, BNRist, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing 100084, China(计算机科学与技术系,BNRist,IDG/麦戈文脑研究学院,清华大学,北京100084,中国) Beijing University of Posts(北京邮电大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出MiVE框架,利用VLM的多尺度层次特征(早期层保留空间细节,深层编码全局语义)统一到自注意力扩散Transformer中,解决模态间隙和细粒度信息丢失问题,在参考引导视频编辑中达到SOTA性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26601 2026-05-27 cs.CV 79%

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI 79%

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12271 2026-05-27 cs.CV 77%

Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

超越文本提示:视觉到视觉生成作为统一范式

Yaofang Liu, Kangning Cui, Meng Chu, Zhaoqing Li, Suiyun Zhang, Jean-Michel Morel, Xiaodong Cun, Haoxuan Che, Rui Liu, Raymond H. Chan

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Celia Research HK(Celia研究香港) Great Bay University(大湾大学) Lingnan University(岭南大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出视觉到视觉(V2V)生成范式及无需训练的V2V-Zero框架,通过利用视觉页面隐藏状态替代文本条件,在多个任务上达到或接近优化后的文本到图像性能。

Comments Project Page: https://yaofang-liu.github.io/V2V_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27195 2026-05-27 cs.CL 75%

EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization

EpiCurveBench: 评估视觉语言模型在流行病曲线数字化中的表现

Thomas Berkane, Maimuna S. Majumder

机构 * Computational Health Informatics Program(计算健康信息学项目) Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院及哈佛医学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对现有图表数据提取基准中忽略时间序列结构的问题,提出包含1000张真实流行病曲线图像的EpiCurveBench基准和基于动态规划的EpiCurveSimilarity评估指标,实验表明最强模型仅达52.3% ECS,且ECS能更好区分模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26376 2026-05-27 cs.CV cs.AI cs.LG 75%

BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma

BioFact-MoE:基于生物学因子分解的混合专家模型用于肝细胞癌的视觉-语言预后建模

Junlin Yang, Tian Yu, Nicha C. Dvornek, Yuexi Du, Peiyu Duan, Annabella Shewarega, Lawrence H. Staib, James S. Duncan, Julius Chapiro

机构 * Department of Radiology \& Biomedical Imaging, Department of Biomedical Engineering, Department of Electrical Engineering, Department of Statistics \& Data Science Yale University, New Haven, CT, 06510, USA

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出BioFact-MoE框架,通过生物学监督的混合专家模型显式分解肝脏和肿瘤因子,在肝细胞癌预后预测中提升准确性和生物学可解释性。

Comments Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27194 2026-05-27 cs.CL cs.CV cs.LG 73%

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

并非所有标记都同等重要:基于关键标记监督的动态上下文向量蒸馏用于长医学报告生成

Ning Wu, Rui Liu, Xinkun Lin, Weixing Chen, Jinxi Xiang, Tao Wei, Lina Yao, Mingjie Li

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出DIVE框架,通过关键标记监督和状态条件动态引导,解决长文本生成中标记级蒸馏忽略关键标记的问题,在医学报告生成任务上取得最佳性能。

Comments Preprint. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26807 2026-05-27 cs.SE cs.AI 70%

HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

HTMLCure:将浏览器体验转化为面向交互式HTML的状态引导修复

Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

机构 * Beihang University(北京航空航天大学) IQuest Research(IQuest研究院) Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出HTMLCure框架,通过浏览器交互执行、状态感知诊断和闭环修复引擎,从大规模HTML页面中筛选并修复可修复页面,显著提升SFT数据质量和模型性能。

Comments 27 pages, 11 figures. Code: https://github.com/wuyuVerse/HTMLCure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26244 2026-05-27 cs.CV cs.MM cs.SD 70%

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

LongAV-Compass:面向分钟级音视频生成在T2AV、I2AV和V2AV上的统一评估

Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Nanjing University(南京大学) SJTU(上海交通大学) HKUST(GZ)(香港科技大学(广州)) Shanghai AI Lab(上海人工智能实验室) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化所) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有评估协议局限于短片段的问题,提出LongAV-Compass基准,通过284个测试用例和统一评估框架,系统评估分钟级音视频生成在文本、图像、视频条件下的质量、一致性和对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05204 2026-05-27 cs.CV 70%

D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

D-OPSD:用于连续调优步蒸馏扩散模型的在线自蒸馏方法

Dengyang Jiang, Xin Jin, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Ruoyi Du, Xiangpeng Yang, Qilong Wu, Zhen Li, Peng Gao, Harry Yang, Steven Hoi

机构 * The Hong Kong University of Science and Technology(香港科技大学) Z-Image Team, Alibaba Group(阿里集团Z-Image团队) University of California, San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出D-OPSD,一种在线自蒸馏训练范式,使步蒸馏扩散模型在监督微调中保持少步推理能力,通过让模型同时作为教师和学生,利用不同上下文条件(学生仅文本特征,教师多模态特征)最小化预测分布,学习新概念和风格而不牺牲原有少步能力。

Comments Project Page: https://vvvvvjdy.github.io/d-opsd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26941 2026-05-27 cs.IR cs.MM 67%

The 2nd EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval

第二届EReL@MIR研讨会:面向多模态信息检索的高效表示学习

Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Xi Wang, Qijiong Liu, Qian Li, Joemon M. Jose

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn)

AI总结 本研讨会旨在探讨多模态基础模型在信息检索中的效率瓶颈,并提出通过组织学术与工业界交流,推动高效表示学习的新方法、度量标准和基准。

Comments Accepted as a workshop proposal at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏