VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar
VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。
通过概念解释CLIP零样本预测
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) ; Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) ; Orbital ; DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) ; Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) ; Technical University of Munich (TUM)(慕尼黑工业大学) ; Helmholtz Munich(亥姆霍兹慕尼黑中心) ; MCML ; MDSI ; Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。
Comments Accepted to CVPR 2026
逐步引导的跨模态推理用于指代图像分割
机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; University of Electronic Science and Technology of China(电子科技大学) ; Wuhan Vocational College of Software and Engineering(武汉软件工程职业学院)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出PPCR框架,通过语义理解-空间定位-实例分割流程,改进指代图像分割中语言描述与视觉表示的连接,提升分割精度。
简化开放词汇人类-物体交互检测
机构 * South China University of Technology(华南理工大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出SL-HOI框架,基于DINOv3模型简化开放词汇人类-物体交互检测,通过融合特征和跨注意力机制提升性能,实验显示在SWiG-HOI和HICO-DET基准上达到最新水平。
激励时间感知的自体视频理解模型
机构 * Virginia Tech(弗吉尼亚理工大学) ; Apple(苹果公司) ; Harvard University(哈佛大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; UC Davis(加州大学戴维斯分校)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。
Comments 11 pages, 4 figures
基于推理的异常检测与定位:图像级监督
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。
Comments Accepted to CVPR 2026
GUIDED: 通过识别、检测和辨别实现细粒度理解的细粒度开放词汇物体检测
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Meituan(美团) ; GuangDong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) ; Research Institute, Sun Yat-sen University(中山大学深圳研究院)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 GUIDED通过分解框架解决细粒度提示中主体与属性的语义纠缠问题,通过分离定位与识别任务提升细粒度开放词汇物体检测性能。
Comments NIPS2025
OVSegDT:用于开放词汇物体目标导航的分割Transformer
机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) ; MIRAI ; NUST MISIS(国立研究型技术大学MISIS)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)
AI总结 本文提出OVSegDT,一种轻量级Transformer策略,通过语义分支和熵自适应损失调节解决开放词汇物体目标导航中的过拟合和安全问题,提升泛化能力。
用于交互式森林变化分析的视觉-语言代理
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。
Comments 5 pages, 4 figures, Accepted into IGARSS 2026
FigEx2: 科学复合图像的视觉条件化面板检测与标注
机构 * University of Pittsburgh(匹兹堡大学) ; UPMC Hillman Cancer Center(UPMC希尔曼癌症中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对科学复合图像中缺乏标注的问题,FigEx2通过视觉条件化框架直接从图像生成面板标注,提升下游预训练和检索性能,同时引入噪声感知门控融合模块和分阶段SFT+RL策略。
从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。
Comments 10 pages, 5 figures, Accepted to CVPR 2026
双向多模态提示学习与尺度感知训练用于少样本多类异常检测
机构 * Yonsei University(延世大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。
Comments accepted to CVPR 2026
MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉
机构 * University of Southern California(南加州大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。
Comments CVPR 2026. Project Page: https://mod-dpo.github.io/
守护天空:反无人机方法的全面调查、基准测试与未来方向
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。
Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages
基于大模型和模糊决策树的AI生成图像通用检测
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出结合轻量级特征感知检测器与大模型的模糊决策树框架,提升AI生成图像检测的准确性和泛化能力。
Synonymix:生成模拟的统一群体人格
机构 * Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出Synonymix,通过图抽象和融合构建统一群体人格,实现群体层面的交互与模拟,验证了在社会调查中保留行为信号并保障隐私。
Comments 6 pages (excluding appendix), 3 figures, CHI'26 Extended Abstract (Poster)
发现的终结:AI搜索如何在酒店与中介之间重新分配权力
机构 * Blossom AI
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文研究AI搜索如何通过意图-来源分歧影响酒店发现,发现体验型查询更依赖非OTA来源,挑战传统中介主导地位。
Comments 13 pages, 10 tables, Accepted to the 10th Hospitality Finance & Economics Conference (HFE 2026), Tokyo, Japan
从去学习到去品牌化:一个商标安全的文本到图像生成基准测试
机构 * Jagiellonian University(雅盖隆大学) ; IDEAS Research Institute(IDEAS研究所)
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV
AI总结 本文提出去品牌化任务,通过细粒度去除商标和隐含结构特征,同时保持语义连贯性,并构建基准数据集和评估框架,解决现有品牌检测器无法捕捉抽象商标的问题。
基于PDE图扩散的多模态图网络建模用于人-物交互检测
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。
Defend:用于同行评审的自动化反驳与最小作者指导
机构 * TCS Research(塔塔咨询服务研究实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出DEFEND工具,通过作者引导的结构化推理生成反驳,提升事实准确性与反驳力度,对比三种方法显示其有效性。
面向内在感知的单目三维物体检测
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文提出MonoIA框架,通过语言引导表示建模和适应相机内在变化,实现鲁棒的三维物体检测,实验表明在KITTI等基准上取得新突破。
Comments This paper is accepted by CVPR 2026
Journal ref CVPR 2026
TriDF:评估可解释深度伪造检测的感知、检测和幻觉
机构 * National Taiwan University(国立台湾大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; Jilin University(吉林大学) ; VinUniversity
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。
Comments CVPR 2026
从问题到查询:一种基于AI的多智能体框架用于空间文本到SQL
机构 * Geoinformation and Big Data Research Laboratory, Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学地理系地理信息与大数据研究实验室) ; Institute for Computational and Data Sciences and Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学计算与数据科学研究所及地理系)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出一种基于AI的多智能体框架,解决空间文本到SQL中的复杂问题,通过分阶段解释、模式绑定、逻辑规划和执行审查提升空间查询的鲁棒性。
Synergy: 一个下一代通用智能体用于开放性智能体网络
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出Synergy,一个用于开放性智能体网络的通用智能体架构,强调智能体间的协作、身份管理和持续进化,以实现开放网络中的社会集成。
Comments A tech report of a general-purpose agent architecture and human-agent society, 21 pages, 5 figures
代理图示学:迈向高能物理中自主符号计算
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出Diagrammatica,通过HEPTAPOD框架扩展实现LLM代理的多步骤理论计算。通过工具约束计算和知识接地方法,实现符号计算的精确性与可验证性,验证了在高能物理中的应用效果。
Comments 54 pages, 6 figures
从听到的意见到 lived 的意见:利用 grounded LLM 代理在经济环境中模拟意见动态
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出一种基于经济环境的LLM代理框架,通过模拟个体经济经历影响意见动态,揭示个体与群体意见变化的机制及经济因素对极化的影响。
AltChart: 通过多预训练任务增强基于视觉语言模型的图表摘要
专题命中 文档图表理解 :VLM(title);vision-language model(abstract);分类 cs.CV
AI总结 本文提出AltChart数据集和方法,通过多预训练任务提升VLM在图表摘要中的表现,评估四种主流模型的可访问性。
Comments Concerns about reproducibility of the train results and dataset availability
HighlightBench:科学文档中基于标记的表格推理基准测试
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of California, Merced(加州大学默塞德分校) ; University of Queensland(昆士兰大学)
专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出HighlightBench,用于评估文档中基于标记的表格推理能力,通过五个任务家族分解评估,并提供可复现的基准流程,揭示模型在视觉提示与符号推理一致性下的稳定性问题。
A$^3$:迈向广告审美评估
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) ; School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。
Comments Accepted to CVPR 2026
SpatialAnt:通过主动场景重建与视觉预判实现自主零样本机器人导航
机构 * Fudan University(复旦大学) ; University of Southern California(南加州大学) ; Adelaide University(阿德莱德大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 SpatialAnt通过主动场景重建和视觉预判机制,解决零样本机器人导航中自建场景的不完整和噪声问题,提升导航性能。
Comments 10 pages, 4 figures, 5 tables. Homepage: https://imnearth.github.io/Spatial-X/