arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-10 至 2026-07-10 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2607.02300 2026-07-10 cs.CV cs.SE 新提交 87%

Search-based Testing of Vision Language Models for In-Car Scene Understanding

基于搜索的车内场景理解视觉语言模型测试

Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco

机构 * BMW Group, Technical University of Munich(宝马集团、慕尼黑技术大学) Technical University of Munich(慕尼黑技术大学) Technical University of Munich, fortiss GmbH(慕尼黑技术大学、fortiss GmbH)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 提出ISU-Test方法,结合渲染场景生成与搜索测试,通过优化场景参数自动生成多样化车内场景,评估VLM在问答和字幕任务中的性能,相比随机生成故障率提高10倍,故障覆盖率提高3.6倍。

Comments Accepted at the Industry Track of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 86%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交 57%

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2607.08059 2026-07-10 cs.LG cs.AI 新提交 84%

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

当思考有害时:视觉语言模型推理链中的认知信号

Mayank Singal

专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。

Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08024 2026-07-10 cs.CV cs.AI cs.LG cs.RO 新提交 83%

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

APIVOT:具有交错视觉语言思维的自适应规划

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。

Comments Project Page: https://emilyzjin.github.io/projects/apivot.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08233 2026-07-10 cs.AI cs.CV 新提交 62%

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

玩禅道世界:在主动视觉概念归纳中挑战人工智能代理

Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting

机构 * AIML Lab, TU Darmstadt(人工智能机器学习实验室,达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Psychology of Information Processing, TU Darmstadt(信息处理心理学,达姆施塔特工业大学) Centre for Cognitive Science, TU Darmstadt(认知科学中心,达姆施塔特工业大学) Cornell University(康奈尔大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学研究所,SIC组) German Center for AI (DFKI)(德国人工智能研究中心)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究构建智能系统时代理感知、假设形成及实验设计问题,提出禅道世界环境,评估多种代理方法,发现预测标签精度与恢复潜在规则无关,感知和归纳是不同瓶颈,基于视觉语言模型的代理实验无信息,还收集人类数据揭示差距及改进途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07761 2026-07-10 cs.AI 新提交 57%

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

对齐临床需求与人工智能能力:医学推理大语言模型综述

Qi Peng, Jiatong Li, Sirui Huang, Yiyang Jiang, Kaisong Gong, Ronger Ding, Shijie Ye, Changmeng Zheng, Yi Cai, Xiaobo Yang, Jin Huang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University(香港大学) South China University of Technology(华南理工大学) University of Toronto(多伦多大学) Peking Union Medical College Hospital(北京地坛医院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 综述医学大语言模型在医疗领域的进展,提出双视角方法,连接临床实践与计算方法,建立五级能力方案并关联推理模式与医学任务,引入基准数据集并报告模型结果,讨论进展与挑战及未来方向。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 50%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2607.08522 2026-07-10 cs.LG 新提交 81%

Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data

停止猜测何时停止测试:用足够的数据进行高效模型评估

Ofir Arviv, Kristjan Greenewald, Yotam Perlitz, Hadar Mulian, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);分类 cs.LG

AI总结 研究指出固定大小基准用于模型评估效率低,提出自适应评估框架,结合序贯测试统计范式与定制停止标准,在Open VLM Leaderboard上展示能自适应管理效率与可靠性权衡,降低计算成本并保持统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08267 2026-07-10 cs.CV 新提交 70%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 57%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08288 2026-07-10 cs.CR cs.AI 新提交 57%

From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure

从遗留文档到OSCAL:基于MCP的代理管道,用于关键基础设施中的威胁情报驱动的持续合规性

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对关键基础设施运营技术环境无法主动扫描但需主动系统反馈的问题,提出基于MCP的多代理管道,将自然语言描述转换为知识图谱和OSCAL工件,架构解耦推理与检索,降低风险,在场景中取得一定召回率并生成报告,虽有错误但可人工审查。

Comments Accepted for publication at the 2026 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Lisbon, Portugal, August 3-5, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08268 2026-07-10 cs.AI cs.CL 新提交 57%

Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment

不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏

Vinay Kumar Chaganti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。

Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08028 2026-07-10 cs.AI cs.CL cs.SE 新提交 57%

From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents

从提示到契约:用于可审计企业大语言模型代理的 harness 工程

Joongho Ahn, Moonsoo Kim

机构 * AI Leadership Research Center(人工智能领导力研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。

Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07763 2026-07-10 cs.LG 新提交 57%

Unlocking Temporal Generalization in Hamiltonian Video Dynamics Models

解锁哈密顿视频动力学模型中的时间泛化

Eli Laird, Corey Clark

机构 * Department of Computer Science, Southern Methodist University(南卫理公会大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究世界模型在可变时间分辨率下预测动力学的问题,利用哈密顿生成网络(HGN),指出其在非保守环境中时间泛化失效的问题及原因,通过针对性修复实现稳定动力学预测,推荐连续时间视频生成中时间泛化的策略。

Comments To appear in the 1st Workshop on Physics-Aware Video Generation and Restoration at the 28th International Conference on Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06127 2026-07-10 cs.CL 新提交 50%

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

衡量共享决策的实践(OPTION12):对用于更好隐私和可持续性的开源小型语言模型(OS - sLLMs)的调查

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt, Anne Stiggelbout, Suzan Verberne

机构 * Leiden University Medical Centre(莱顿大学医学中心) The Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究利用Observer OPTION12框架,对开源小型语言模型进行共享决策自动评估,聚焦隐私保护与本地部署。通过专家注释临床咨询评估多个模型,发现通用领域模型表现更好,还引入共识框架,为隐私保护的人在回路SDM评估提供基础。

Comments Pilot study. Preliminary findings on open-source smaller LLMs for OPTION12 shared decision-making assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 50%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2607.08359 2026-07-10 cs.RO cs.AI 新提交 57%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 2 篇

2606.17482 2026-07-10 cs.CV 新提交 70%

SPHINX: First Explain, Then Explore

SPHINX: 先解释,再探索

Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai

机构 * University of Florida(佛罗里达大学) University of Debrecen(德布勒恩大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

AI总结 提出SPHINX闭环框架,通过可解释AI分析驾驶策略的失败模式,并利用视觉语言模型生成针对性对抗场景,提升自动驾驶策略鲁棒性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 57%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 6 篇

2607.08029 2026-07-10 cs.LG 新提交 79%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08193 2026-07-10 cs.LG cs.AI 新提交 73%

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程

Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

机构 * Sapienza University of Rome(罗马第一大学) Sony AI(索尼人工智能)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08312 2026-07-10 cs.LG 新提交 70%

Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix

用于语言基础世界模型的写保护离散瓶颈:一种结构限制及充分修复

Jiayi Fang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 VLM训练与架构 :VLM(abstract);grounding(abstract);分类 cs.LG

AI总结 研究语言与世界模型离散符号系统的交互问题,提出防止基于Gumbel-softmax的离散符号瓶颈失败的三个约束,经实验验证该方法能实现高基础准确率,且修复参数少、无需微调。

Comments 20 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08027 2026-07-10 cs.CL cs.AI 新提交 70%

Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention

通过幂变换和符号保留分数聚合与自适应特征保留对大语言模型进行结构化剪枝

Ryota Kobayashi, Tsubasa Hirakawa, Takayoshi Yamashita, Hironobu Fujiyoshi, Yasunori Ishii, Tomoyuki Okuno, Kazuki Kozuka

机构 * Chubu University(楚ubu大学) Panasonic Holdings Corporation(松下电器控股公司)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对大语言模型结构化剪枝,改进自适应特征保留技术。结合幂变换、符号保留分数聚合及异常值去除方法,解决应用中出现的分布不匹配等问题。实验表明该方法能保持准确率,通过结构化剪枝加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交 67%

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 57%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 1 篇

2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 62%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏