Extended to Reality: Prompt Injection in 3D Environments
扩展到现实:3D环境中的提示注入
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
扩展到现实:3D环境中的提示注入
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。
合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试
机构 * NAVER Cloud(NAVER云) ; KAIST AI(韩国科学技术院人工智能)
专题命中 其他VLM :multimodal large language model(abstract,abstract_cn)
AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。
BeyondMasks:评估视频对象移除中的因果与物理一致性
机构 * Bilkent University(毕尔肯大学) ; Koç University(科克大学) ; Hacettepe University(哈杰泰佩大学) ; KUIS AI Center(KUIS人工智能中心)
专题命中 其他VLM :vision language model(abstract);分类 cs.CV
AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。
Comments ECCV 2026 Project Page: this https URL (https://yigitekin.github.io/BeyondMasks/)