IPL: Leveraging Multimodal Large Language Models for Intelligent Product Listing
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
Comments The code will be made public at https://github.com/ShujinWu-0814/MACAROON
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)
Comments 12 pages, 9 figures, EMNLP 2024 Findings
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
Comments Accepted in EMNLP 2024. 29 pages, 22 figures
专题命中 幻觉与鲁棒性 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to EMNLP 2024 Main Conference. Project website: https://feiwang96.github.io/mDPO
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
Comments Accepted to EMNLP Findings 2024
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
Comments 10 pages
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract)
Comments 10 pages,7 figures
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)
用于长 horizon 双臂任务与运动规划的接地视觉语言解释器
机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) ; The University of Tokyo(东京大学) ; University of Hamburg(汉堡大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI
AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。
Comments IROS 2026
LabRobFail:化学自动驾驶实验室中机器人故障分析的基准
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。
Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo
MED-DSLC:通过域监督和对数校准进行多专家域分类
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型在多域零样本分类中存在的问题,提出MED-DSLC方法,结合域监督训练和域内对数缩放,恢复全局对数可比性,是轻量级方案,经实验验证可提升准确率、鲁棒性和可扩展性。
Comments Accepted to ECCV 2026. Code is available at https://github.com/Leonard-Zeng/MED-DSLC
病理学组合检索的组织病理学多模态嵌入
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。
Comments Accepted by ECCV 2026
REALM: 面向物理世界视觉语言模型的统一红队基准
机构 * University of Central Florida(中佛罗里达大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。
Comments 20 pages, 5 figures. Preprint
从驾驶视频到可模拟场景
机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) ; Computer Vision Center (CVC), UAB(UAB计算机视觉中心)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV
AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。
Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026
MLLMs 先正确后错误:追踪并纠正后层文本偏见
机构 * National University of Defense Technology(国防科技大学) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Intelligent Game and Decision Lab(智能博弈与决策实验室)
专题命中 幻觉与鲁棒性 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 发现多模态大语言模型在中间层形成正确视觉预测,但最终输出时被文本覆盖,通过检测预测方向变化(85%失败转向文本,89%成功转向视觉)提出无训练方法CALRD,在冲突基准上提升高达9.4%。
Comments Accepted at IJCAI 2026. 16 pages, 10 figures
多模态大语言模型评判器的对抗鲁棒性
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; State Key Laboratory of Virtual Reality Technology and System, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; State Key Laboratory of Software Development Environment, Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院软件开发环境国家重点实验室) ; School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出RobustMLLMJudge框架评估多模态大语言模型作为评判器时的对抗鲁棒性,并设计MGSIA攻击方法,通过语义诱导和高分流形对齐生成可迁移的分数膨胀扰动,揭示其脆弱性。
弥合法医图像检索中的模态差距
机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) ; Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。
Comments 23 pages, 5 figures, paper submitted to Elsevier journal
4DPC$^2$hat: 面向动态点云理解的失败感知自举学习
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出首个针对动态点云理解的多模态大语言模型4DPC$^2$hat,通过构建大规模跨模态数据集4DPC$^2$hat-200K和引入Mamba增强的时间推理模块及失败感知自举学习策略,显著提升了动作理解与时间推理能力。
Comments Accept by ICML 2026
AGILE: 通过代理生成从视频重建手-物体交互
机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Zhejiang University of Technology(浙江工业大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出AGILE框架,利用视觉语言模型引导生成完整物体网格,结合锚定-跟踪策略和接触感知优化,从单目视频鲁棒重建手-物体交互,生成可直接用于仿真的资产。
Comments 16 pages, SIGGRAPH 2026
SoC: 测试时提示调优的语义正交校准
机构 * MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学) ; LIVIA, ILLS, ÉTS Montréal(LIVIA,ILLs,蒙特利尔ÉTS)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型测试时提示调优中校准被忽视的问题,提出基于Huber的正则化方法SoC,在保持语义邻近性的同时实现平滑的原型分离,从而改善校准性能并保持判别能力。
Journal ref CVPR 2026
关于RL微调VLMs的鲁棒性和链式思维一致性
机构 * Apple(苹果公司) ; OpenAI
专题命中 幻觉与鲁棒性 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.LG
AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。
Comments ICML 2026
通过黎曼流匹配对预训练视觉语言模型进行知识不确定性量化
机构 * Department of Information Technology, Uppsala University, Uppsala, Sweden(瑞典乌普萨拉大学信息科技系) ; Science for Life Laboratory, Uppsala University, Uppsala, Sweden(瑞典乌普萨拉大学生命科学实验室)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG
AI总结 本文提出REPVLM方法,通过黎曼流匹配在视觉语言模型嵌入的超球面流形上计算概率密度,以量化模型的知识不确定性,并在分类和异常检测中取得显著效果。
Journal ref Forty-Third International Conference on Machine Learning, 2026
当零样本射手作弊时:通过激活引导提升年龄估计
机构 * BIFOLD & TU Berlin(BIFOLD与柏林技术大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG
AI总结 本文研究了基于视觉语言模型的零样本年龄估计中出现的'身份捷径'现象,提出激活引导方法以提高年龄估计的准确性,减少均方误差达25%。
基于排名的校准:可靠多模态强化学习
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) ; Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)
专题命中 幻觉与鲁棒性 :InternVL(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG
AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。
何时行动、提问或学习:不确定性感知的策略引导
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG
AI总结 本文提出不确定性感知策略引导框架,通过联合推理任务语义不确定性和低层动作可行性,选择执行高置信度动作、通过自然语言查询澄清任务歧义或请求动作干预修正低层策略,提升机器人部署性能。
Comments To appear in Robotics: Science and Systems 2026
不要看数字:视觉锚定偏差与视觉语言模型中的分层表示
机构 * M. Shalankin
专题命中 幻觉与鲁棒性 :VLM(summary_cn);vision-language model(abstract);分类 cs.AI
AI总结 研究揭示视觉锚定对VLM性能评估的系统性偏差,通过分层分析发现不同层的表示差异及架构依赖的融合机制。
GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs
机构 * Beihang University(北航大学) ; Zhongguancun Laboratory(中关村实验室) ; Peking University(北京大学)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。
零样本二元视觉语言安全分类中的提示诱导分数方差
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Independent(独立)
专题命中 幻觉与鲁棒性 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。
Comments Preprint. 19 pages, 5 figures