arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-13 至 2026-04-13 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2604.09494 2026-04-13 cs.CL cs.AI cs.IR cs.LG 62%

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

RecaLLM:通过显式上下文检索解决‘思维迷失’现象

Kyle Whitecross, Negin Rahimi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RecaLLM通过交替推理与显式上下文检索解决推理过程中因长上下文导致的检索性能下降问题,显著提升了RULER和HELMET基准测试表现。

Comments Code, data, and models available at https://github.com/kswhitecross/RecaLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI 62%

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08956 2026-04-13 cs.CV cs.LG 62%

Low-Data Supervised Adaptation Outperforms Prompting for Cloud Segmentation Under Domain Shift

低数据监督适应在云分割领域优于提示

Harshith Kethavath, Weiming Hu

机构 * University of Georgia(佐治亚大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了在遥感影像云分割任务中,低数据监督微调优于提示方法,发现使用少量标注数据可显著提升性能,而提示方法效果有限。

Comments 10 pages, 6 figures, to be published in EarthVision @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09037 2026-04-13 cs.CV cs.CL cs.HC 57%

SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos

SiMing-Bench:从连续交互评估临床技能视频中的过程正确性

Xiyang Huang, Jiawei Lin, Keying Wu, Jiaxin Huang, Kailai Yang, Renxiong Wei, Cheng zeng, Jiayi Xiang, Ziyan Kuang, Min Peng, Qianqian Xie, Sophia Ananiadou

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Center for Language and Information Research, Wuhan University(武汉大学语言与信息研究中心) Southwest Jiaotong University(西南交通大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Manchester(曼彻斯特大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 SiMing-Bench旨在评估多模态大语言模型在临床技能视频中通过连续交互更新过程状态的能力,通过医师标注的数据集和标准化评分标准,揭示模型在过程级判断上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08597 2026-04-13 cs.DB cs.AI 57%

STIndex: A Context-Aware Multi-Dimensional Spatiotemporal Information Extraction System

STIndex:一种基于上下文的多维时空信息提取系统

Wenxiao Zhang, Yu Liu, Qiang sun, Yihao Ding, Sirui Li, Yanbing Liu, Jin B. Hong, Wei Liu

机构 * The University of Western Australia(西澳大利亚大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Murdoch University(莫道克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 STIndex通过多维时空数据仓库提升无结构数据的提取效率,结合大语言模型实现上下文感知提取,提升时空实体识别精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27979 2026-04-13 cs.CV 57%

RetinexDualV2: Physically-Grounded Dual Retinex for Generalized UHD Image Restoration

RetinexDualV2:基于物理的双Retinex用于通用超高清图像恢复

Mohab Kishawy, Jun Chen

机构 * McMaster University(麦克马斯特大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出RetinexDualV2,一种统一的双分支框架,用于超高清图像恢复。通过任务特定物理模块提取退化感知先验,结合物理条件多头自注意力机制,实现鲁棒的反射和光照校正,展现卓越的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19704 2026-04-13 cs.CV 57%

RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models

RADSeg: 通过凝聚模型提升参数和计算效率的零样本开放词汇分割

Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 RADSeg利用凝聚视觉基础模型RADIO,同时提升mIoU、延迟和参数效率,实现更高效的零样本开放词汇分割。

Comments Accepted to CVPR'26 Findings Code at https://radseg-ovss.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与屏幕智能体 8 篇

2508.16165 2026-04-13 cs.SE cs.AI cs.HC 83%

Investigating Multimodal Large Language Models to Support Usability Evaluation

探究多模态大语言模型以支持可用性评估

Sebastian Lubos, Alexander Felfernig, Damian Garber, Gerhard Leitner, Julian Schwazer, Manuel Henrich

机构 * Graz University of Technology(格拉茨技术大学) University of Klagenfurt(克拉根福大学) UNiQUARE Software Development GmbH(UNiQUARE软件开发有限公司)

专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型在可用性评估中的应用,通过优先级问题框架识别并排名可用性问题,比较了MLLM与专家评估结果,展示了交互可视化工具,并提出整合MLLM评估到实际开发流程的概念。

Comments To appear in the Proceedings of IEA/AIE 2026, Springer LNAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09155 2026-04-13 cs.LG cs.AI 73%

CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation

CORA: 为保障移动GUI自动化设计的符合性风险控制代理

Yushi Feng, Junye Du, Qifan Wang, Zizhan Ma, Qian Niu, Yutaka Matsuo, Long Feng, Lequan Yu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学)

专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 CORA通过统计保障减少有害操作,利用Guardian模型评估行动风险并校准执行/中止边界,结合Goal-Lock机制和Phone-Harm基准验证其在自主GUI执行中的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09535 2026-04-13 cs.CV 70%

EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks

EgoTL:用于长时任务的目视思考链

Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan

机构 * UMN(明尼苏达大学) TAMU(德克萨斯农工大学) Brown University(布朗大学) McGill University(麦吉尔大学) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学) Northwestern University(西北大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。

Comments https://ego-tl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 62%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02241 2026-04-13 cs.CV cs.RO 57%

UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models

UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪

Qiyao Zhang, Shuhua Zheng, Jianli Sun, Chengxiang Li, Xianke Wu, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Sanya(三亚学院) Beijing University of Posts and Telecommunications(北京邮电大学) Hunan University(湖南大学) Beihang University(北京航空航天大学) Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19396 2026-04-13 cs.AI 57%

EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration

EchoTrail-GUI: 通过批评者引导的自我探索构建可操作的记忆以改进GUI代理

Runze Li, Yuwen Zhai, Bo Xu, LiWu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出EchoTrail-GUI框架,通过动态记忆系统提升GUI代理任务成功率和效率,验证了结构化记忆在GUI自动化中的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09462 2026-04-13 cs.RO 50%

Adaptor: Advancing Assistive Teleoperation with Few-Shot Learning and Cross-Operator Generalization

Adaptor:通过少样本学习和跨操作者泛化提升辅助远程操作

Yu Liu, Yihang Yin, Tianlv Huang, Fei Yan, Yuan Xu, Weinan Hong, Wei Han, Yue Cao, Xiangyu Chen, Zipei Fan, Xuan Song

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) IO-AI TECH

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 Adaptor通过少样本学习和跨操作者泛化方法,提升辅助远程操作中意图识别的鲁棒性,实验表明其在真实和模拟基准上表现优异,具备低方差和跨操作者泛化能力。

Comments Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09442 2026-04-13 cs.CL 50%

UIPress: Bringing Optical Token Compression to UI-to-Code Generation

UIPress:将光学令牌压缩引入UI到代码生成

Dasen Dai, Shuoqi Li, Ronghao Chen, Huacan Wang, Biao Wu, Qizhen Lan

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) University of Technology Sydney(悉尼科技大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出UIPress,一种轻量级学习压缩模块,通过结合深度可分离卷积、元素引导的空间重加权和Transformer细化,将UI截图的视觉令牌从约6700压缩到256,结合LoRA实现表示差距桥接,提升效率并优于现有方法。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与鲁棒性 8 篇

2604.09529 2026-04-13 cs.CV cs.AI cs.CL 86%

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

VL-Calibration:解耦的大型视觉-语言模型推理置信度校准

Wenyi Xiao, Xinchi Xu, Leilei Gan

机构 * Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);visual reasoning(abstract);grounding(abstract)

AI总结 本文提出VL-Calibration,通过强化学习框架解耦视觉和推理置信度,提升大视觉-语言模型的校准与视觉推理准确率。

Comments 24 pages, ACL 2026 Main. Repository: https://github.com/Mr-Loevan/VL-Calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21472 2026-04-13 cs.CV cs.CL cs.MM 83%

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

通过自适应注意力校准缓解大视觉-语言模型中的幻觉

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出CAAC框架,通过解决空间感知偏差和模态偏差,提升大视觉-语言模型在长文本生成中的准确性和视觉对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09067 2026-04-13 cs.CV cs.AI 81%

Enhancing the Safety of Medical Vision-Language Models by Synthetic Demonstrations

通过合成演示增强医疗视觉-语言模型的安全性

Zhiyu Xue, Reza Abbasi-Asl, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC San Francisco(加州大学旧金山分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种新的推理时防御策略,通过合成临床演示提升模型安全性,同时平衡安全与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09017 2026-04-13 cs.NI 78%

Multimodal Large Language Model Enabled Robust Beamforming for HAP Downlink Communications

多模态大语言模型赋能的HAP下行链路鲁棒波束成形

Xiaoyu Xing, Peng Yang, Guoquan Tao, Dingyi Lu, Zehui Xiong, Xianbin Cao

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束成形框架,通过飞行 telemetry 预测HAP姿态并实现鲁棒下行通信,提升用户服务比和总速率22.1%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09532 2026-04-13 cs.CV cs.AI 73%

Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise

见仁见智:在标签噪声下鲁棒的视觉引导跨模态提示学习

Zibin Geng, Xuefeng Jiang, Jia Li, Zheng Li, Tian Wen, Lvhua Wu, Sheng Sun, Yuwei Wang, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) PCALab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院PCALab, VCIP)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisPrompt框架,通过跨模态注意力机制将视觉语义注入提示表示,提升在标签噪声下的鲁棒性,实验表明其在多个数据集上表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09024 2026-04-13 cs.CV cs.AI cs.CR cs.LG 67%

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection

别让我看图片:通过视觉提示注入防止多模态大语言模型分析图片

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出ImageProtector,通过在图像中嵌入精心设计的微小扰动,使多模态大语言模型在分析时产生拒绝响应,同时评估了三种潜在的防御措施,发现它们在降低ImageProtector效果的同时影响模型性能。

Comments Appeared in ACL 2026 main conference

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08645 2026-04-13 cs.CV cs.AI cs.LG cs.RO 67%

3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

3D-VCD:通过视觉对比解码缓解3D-LLM具身代理中的幻觉

Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出3D-VCD,一种用于缓解3D具身代理幻觉的视觉对比解码框架,通过构造扭曲的3D场景图来提升 grounded 推理能力,实验表明其在3D-POPE和HEAL基准上有效。

Comments 8 pages, 6 figures, Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09253 2026-04-13 cs.CV cs.AI 62%

Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization

Mosaic: 通过多视图集成优化实现对闭源视觉语言模型的多模态劫持

Yuqin Lan, Gen Li, Yuanze Hu, Weihao Shen, Zhaoxin Fan, Faguo Wu, Xiao Zhang, Laurence T. Yang, Zhiming Zheng

机构 * Beihang University(北京航空航天大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mosaic框架,通过多视图集成优化减少对单一代理模型的依赖,提升对闭源VLMs的多模态劫持效果,实验显示其在安全基准上的攻击成功率和毒性均达到最优。

Comments 14pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. VLM训练与架构 8 篇

2503.14075 2026-04-13 cs.CV cs.CL 85%

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models

通过蒸馏和强化学习生长多头Twig以加速大视觉-语言模型

Zhenwei Shao, Mingyang Wang, Weijun Zhang, Zhou Yu, Wenwen Pan, Yan Yang, Tao Wei, Hongyuan Zhang, Jun Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, School of Computer Science, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,计算机学院,杭州电子科技大学) Li Auto Inc.(理想汽车) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出TwigVLM,通过在基础VLM早期层上生长轻量模块Twig,结合 Twig 引导的 token 剪枝和自推测解码策略,实现更高的准确性和速度。实验表明, TwigVLM 在剪枝88.9%的视觉token后仍保持96%的原始性能,并在生成长响应时达到154%的速度提升。

Comments An extended version of our ICCV paper at ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html" target="_blank" rel="noopener">https://openaccess.thecvf.com/content/ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08846 2026-04-13 cs.LG cs.AI cs.CL cs.CV 83%

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

字典对齐的概念控制用于保护多模态大语言模型

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学) Amazon(亚马逊) University of Central Florida(中佛罗里达大学)

专题命中 VLM训练与架构 :LLaVA(abstract);InternVL(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出字典对齐的概念控制框架,通过定制概念字典和稀疏自编码器实现对多模态大语言模型激活的精细控制,提升安全性的同时保持通用能力。

Comments Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06832 2026-04-13 cs.CL 82%

Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM

Fast-dVLM: 通过直接转换自回归VLM实现高效的块扩散VLM

Chengyue Wu, Shiyi Lan, Yonggan Fu, Sensen Gao, Jin Wang, Jincheng Yu, Jose M. Alvarez, Pavlo Molchanov, Ping Luo, Song Han, Ligeng Zhu, Enze Xie

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) MIT(麻省理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出Fast-dVLM,通过直接转换自回归VLM实现高效的块扩散VLM,采用KV-cache兼容并行解码和推测块解码,提升推理效率。实验表明其生成质量与自回归模型相当,且通过SGLang和FP8量化实现6倍以上的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18600 2026-04-13 cs.CV cs.AI cs.LG 75%

Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment

链式放大:通过尺度自回归和偏好对齐实现极端超分辨率

Bryan Sangwoo Kim, Jeongsol Kim, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Chain-of-Zoom框架,通过自回归链和多尺度提示实现极端超分辨率,利用GRPO优化文本提示对齐人类偏好,实验显示标准4x扩散模型在CoZ下可实现256倍以上高质量放大。

Comments NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV 70%

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07956 2026-04-13 cs.AI 70%

MONETA: Multimodal Industry Classification through Geographic Information with Multi Agent Systems

MONETA:通过地理信息和多智能体系统进行多模态行业分类

Arda Yüksel, Gabriel Thiem, Susanne Walter, Patrick Felka, Gabriela Alves Werb, Ivan Habernal

机构 * Trustworthy Human Language Technologies(可信人类语言技术实验室) Technical University of Darmstadt, Germany(德国达姆施塔特工业大学) Deutsche Bundesbank(德国联邦银行) Frankfurt University of Applied Sciences, Germany(德国法兰克福应用技术大学) Research Center for Trustworthy Data Science and Security, Ruhr University Bochum, Germany(德国波鸿鲁尔大学可信数据科学与安全研究中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出MONETA,首个基于文本和地理空间数据的多模态行业分类基准,利用多智能体系统提升分类精度,实现62.10%和74.10%的分类性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏