DepthScape: Authoring 2.5D Designs via Depth Estimation, Semantic Understanding, and Geometry Extraction
DepthScape: 通过深度估计、语义理解和几何提取进行2.5D设计创作
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 DepthScape通过深度估计、语义理解和几何提取,实现2.5D设计创作,提升视觉真实感与动态效果。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
DepthScape: 通过深度估计、语义理解和几何提取进行2.5D设计创作
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 DepthScape通过深度估计、语义理解和几何提取,实现2.5D设计创作,提升视觉真实感与动态效果。
增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。
CoC-VLA: 深入研究对抗域转移以实现可解释的自动驾驶 via 链式因果视觉语言动作模型
机构 * Lanzhou University(兰州大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 幻觉与鲁棒性 :VLM(abstract)
AI总结 CoC-VLA通过链式因果视觉语言动作模型实现对抗域转移,提升自动驾驶的可解释性和长尾场景处理能力。
针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。
Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases
具有信任意识的多模态数据融合用于产量估计:贝鲁特2020爆炸的案例研究
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 本文提出一种基于贝叶斯分数后验框架的多模态数据融合方法,用于估计爆炸产量,通过信任权重校准不同观测数据,提升不确定性量化和抗偏差能力。
Comments 19 pages, 4 figures, supplementary material, journal
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
Comments Accepted at AAAI 2026
机构 * Department of Electrical and Systems Engineering, Washington University in St. Louis(电气与系统工程系,华盛顿大学圣路易斯分校)
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
专题命中 幻觉与鲁棒性 :vision language model(abstract)
Comments Accepted for presentation at CORL 2025. Code, models, and data are available at https://search-tta.github.io/
专题命中 幻觉与鲁棒性 :grounding(abstract)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)
机构 * PRé Sustainability B.V.(PRé可持续性公司) ; Amazon(亚马逊)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * Department of Electrical Engineering, Faculty of Engineering at Shoubra, Benha University, Cairo 11629, Egypt(电气工程系,谢布拉工程学院,本海大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
Comments Preprint
专题命中 幻觉与鲁棒性 :vision language model(abstract)
Comments The experiments in the paper need to be further supplemented, and more methods should be considered for expansion
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; OmnAI Lab(OmnAI实验室)
专题命中 幻觉与鲁棒性 :grounding(abstract)
专题命中 幻觉与鲁棒性 :grounding(abstract)
Comments Accepted by EMNLP 2025
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * 1 Institute of Automation, Chinese Academy of Sciences, Beijing, China ; 2 School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China ; 3 Nanjing Artificial Intelligence Research of IA, Nanjing, China ; 4 University of Chinese Academy of Sciences,Nanjing, Nanjing, China ; 5 Nanjing University of Information Science \& Technology, Nanjing, China
专题命中 幻觉与鲁棒性 :grounding(abstract)
Comments Accepted to IJCNN 2025
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
Comments 7 pages, 3 figures, submitted to EMNLP 2025 and ECAT Research Workshop 2025
专题命中 幻觉与鲁棒性 :vision language model(abstract)
机构 * University of Waterloo(滑铁卢大学) ; Toronto Metropolitan University(多伦多 Metropolitan 大学)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * School of Software Technology Zhejiang University Hangzhou Zhejiang China(软件技术学院浙江大学杭州浙江中国) ; Zhejiang University(浙江大学)
专题命中 幻觉与鲁棒性 :MLLM(abstract)
Comments Accepted at ACM MM 2025 Main Conference
机构 * Department of Mechanical Systems Engineering(机械系统工程系) ; Nagoya University(名古屋大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
Comments 8 pages, 8 figures
机构 * University of Southern California(南加州大学) ; Bogazici University(博鲁斯大学) ; Capital One(Capital One公司)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * University of Exeter Business School(埃克塞特大学商学院)
专题命中 幻觉与鲁棒性 :grounding(abstract)
Comments 56 pages 5 images
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
Comments Accepted to AsiaCCS 2025 @ SCID
机构 * Brown University(布朗大学) ; Northeastern University(东北大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * Georgia Tech(佐治亚理工学院) ; The University of Hong Kong(香港大学) ; Stanford University(斯坦福大学)
专题命中 幻觉与鲁棒性 :VLM(abstract)
Comments ACL 2025