Learning Adaptive Dexterous Grasping from Single Demonstrations
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Tsinghua University(清华大学) ; Hillbot
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Tsinghua University(清华大学) ; Hillbot
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
机构 * ByteDance Inc.(字节跳动公司)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * IIT Delhi(德里印度理工学院) ; TCS Research Labs(塔塔咨询公司研究实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments 26 pages
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Seoul National University(首尔国立大学) ; Kim & Chang AI&IT System Center(金·昌AI&IT系统中心) ; Waddle Corporation(Waddle公司)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Beihang University(北京航空航天大学)
专题命中 幻觉与鲁棒性 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ACL2025 Main
机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) ; Computer Science, Beijing Jiaotong University(北京交通大学计算机科学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025, Highlight
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments Accepted in IEEE Internet of Things Journal
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments 43 pages, 20 figures
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments Project page: https://sites.google.com/stanford.edu/sentinel. 35 pages, 9 figures. Accepted to the Conference on Robot Learning (CoRL) 2024
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Page: https://puzzleavatar.is.tue.mpg.de/, Code: https://github.com/YuliangXiu/PuzzleAvatar, Video: https://youtu.be/0hpXH2tVPk4
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :visual language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments In Springer Proceedings. International Conference On Big Data, Machine Learning and Applications 2021. http://bigdml.nits.ac.in/
通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 幻觉与鲁棒性 :MLLM(abstract,comments);visual reasoning(abstract);分类 cs.CV
AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。
Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io
Fast-dDrive:面向自动驾驶的高效块扩散视觉语言模型
机构 * Peking University(北京大学) ; NVIDIA ; The University of Hong Kong(香港大学) ; MIT(麻省理工学院)
专题命中 幻觉与鲁棒性 :VLM(title)
AI总结 提出Fast-dDrive,一种块扩散视觉语言动作模型,通过语义单元内双向细化与跨单元因果约束,结合结构化令牌冻结、分段感知训练和推测解码,实现高保真轨迹规划与高效推理,在WOD-E2E和nuScenes上达到最优性能,推理速度提升12倍。
评估在用户压力下指令调优语言模型的证据基础
机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) ; Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)
专题命中 幻觉与鲁棒性 :grounding(title)
AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。
专题命中 幻觉与鲁棒性 :multimodal large language model(title)
Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process
专题命中 幻觉与鲁棒性 :multimodal large language model(title)
Comments 12 pages
专题命中 幻觉与鲁棒性 :vision language model(title)
专题命中 幻觉与鲁棒性 :multimodal large language model(title)
Comments 9+6 pages, Submitted to ACL 2024
专题命中 幻觉与鲁棒性 :grounding(title)
Comments EMNLP 2021 18 pages
Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别
机构 * University of Oulu(奥卢大学) ; Peking University(北京大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。
Comments Accepted by ACM MM 2026
TrustCLIP:通过对抗性重建学习隐私视觉特征
机构 * Meta ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; University of Tübingen(图宾根大学) ; National University of Singapore(新加坡国立大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。
Comments https://atnikos.github.io/trustclip/ Update affiliations