Exploring Audio Hallucination in Egocentric Video Understanding
探索第一人称视频理解中的音频幻觉
机构 * Meta ; University Of Maryland, College Park(马里兰大学学院公园分校)
AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。
Comments Accepted to ICASSP 2026
高校专区
探索第一人称视频理解中的音频幻觉
机构 * Meta ; University Of Maryland, College Park(马里兰大学学院公园分校)
AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。
Comments Accepted to ICASSP 2026
美国报纸中AI的使用普遍存在、不均衡且很少披露
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; Simon Fraser University(西蒙 Fraser大学) ; UMass Amherst(马萨诸塞大学阿姆赫斯特分校) ; Pangram Labs(Pangram实验室)
AI总结 研究通过分析18.6万篇文章发现,约9%的新闻文章包含AI生成内容,且在小型本地报纸和特定主题中更常见,但AI使用情况很少被披露,凸显了对透明度和编辑标准更新的迫切需求。
Comments ACL Camera Ready
机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Utah(犹他大学) ; Northeastern University(东北大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。
Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm
OpenVO:具有时间动态意识的开放世界视觉里程计
机构 * University of Maryland, College Park, USA(马里兰大学帕克分校)
AI总结 OpenVO通过时间动态信息编码和3D几何先验,提升在有限输入条件下对单目行车记录仪视频的现实尺度自我运动估计,实现鲁棒轨迹数据集构建。
Comments Main paper CVPR 2026
大语言模型真的能识别你的名字吗?
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Google Research(谷歌研究) ; Carnegie Mellon University(卡内基梅隆大学) ; Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) ; University of Maryland, College Park(马里兰大学学院市分校)
AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。
Comments ACM FAccT '26