S-GRPO: Unified Post-Training for Large Vision-Language Models
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
通过语义-几何保持实现视觉-语言模型的持续学习
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。
Comments Accepted by IEEE TCSVT 2026
扩大视觉-语言模型规模不足以缓解偏见
机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。
统一视觉-语言模型中的对抗鲁棒模型专家
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。
超越视觉歧义:通过详细长文本引导具有挑战性场景下的鲁棒单目深度估计
机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对单目深度估计的视觉歧义问题,提出CapDepth框架,通过详细长文本引导,在非朗伯表面和恶劣天气下的深度误差较现有最优方法分别降低25.0%和22.0%。
Comments Accepted to ACM MM 2026
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract_cn);分类 cs.CV
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
重新思考本地计算机使用智能体的推理时扩展:失败模式与计算权衡
机构 * Hanyang University(汉阳大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 本文针对本地计算机使用智能体的推理时扩展开展系统实证研究,评估多款模型在OSWorld基准上的表现,揭示其边际收益递减、失败模式转变等规律,提出高效本地智能体的设计方向。
MarkushGlyph与OCSRGlyph:改进的化学结构识别
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本研究将化学结构识别视为图像到文本转换任务,提出OCSRGlyph与MarkushGlyph模型,前者优化OCSR性能,后者针对Markush结构采用整体视觉语言建模,还提出新指标解决Markush结构翻译的准确性判定问题。
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
VCE:通过视觉对比编辑实现LVLMs的零成本幻觉抑制方法
机构 * Huazhong University of Science and Technology(华中科技大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院) ; China Telecom(中国电信)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出VCE方法,通过分析模型对对比视觉扰动的响应,利用SVD分解激活模式以抑制幻觉倾向,有效减少多基准测试中的物体幻觉,同时保持计算效率。
Comments ICASSP 2026
Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 16657-16661
一种基于神经代理的多方法框架用于鲁棒机翼设计优化
专题命中 幻觉与鲁棒性 :VLM(abstract_cn)
AI总结 本文提出一种基于神经代理的多方法框架,用于提高机翼设计的鲁棒性和效率,通过多种优化算法提升空气动力学性能。