Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ECCV2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ECCV2024
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Accepted by ACL Findings (2024). Dataset available at https://huggingface.co/datasets/ygong/BloomVQA
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 29 pages (include Appendix) Published in ICLR
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments The 38th Annual AAAI Conference on Artificial Intelligence
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2022. Project Website: https://ashkamath.github.io/FIBER_page
专题命中 视觉定位与Grounding :visual language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments v2, added references to concurrent work and acknowledgments
专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments 5 pages, 2 figures, 1 results chart
Journal ref JAIIO - JORNADAS ARGENTINAS DE INFORMATICA 2022
专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
专题命中 视觉定位与Grounding :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments 9 pages, 2 figures
CoT Referring: 通过 grounded 推理改进指称表达任务
机构 * Adobe Research(Adobe研究院) ; Northeastern University(东北大学)
专题命中 视觉定位与Grounding :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.AI
AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。
Comments MLLM, Referring Expression Segmentation
专题命中 视觉定位与Grounding :MLLM(abstract,comments);grounding(abstract);分类 cs.CV
Comments NeurIPS 2024 (Oral). Website at https://cambrian-mllm.github.io
将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。
CodeOCR: 关于视觉语言模型在代码理解中的有效性
机构 * Shanghai Jiao Tong University China ; Hohai University China ; Singapore Management University Singapore ; Imperial College London United Kingdom ; East China Normal University \& Shanghai Innovation Institute China ; Chongqing University China ; Shanghai Jiao Tong University ; Hohai University ; Singapore Management University ; Imperial College London ; East China Normal University \& Shanghai Innovation Institute ; Chongqing University
专题命中 视觉定位与Grounding :vision language model(title)
AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。
Comments ISSTA 2026 camera ready. Code and data are available at https://github.com/YerbaPage/CodeOCR
无免费标签:缺乏人类基准的LLM作为评判的局限性
机构 * Kensho Technologies ; MIT(麻省理工学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。
GARDRec:面向大语言模型推荐的决策级图接地方法
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。
Comments 18 pages, 2 figures
KAMR:基于知识对齐多跳检索的接地生成
专题命中 视觉定位与Grounding :grounding(title)
AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。
Comments Accepted by COLM'26
惊奇理论是同义反复的(缺乏理性基础)
机构 * ETH Zürich(苏黎世联邦理工学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 研究惊奇理论,指出其在无额外约束时是同义反复,任何难度模式都与某语言模型一致,无法证伪。长期被隐含假设掩盖,近期实证削弱该假设。结论是打破同义反复需理性主义干预,相关语言模型应源自非经验驱动模型。
Comments Under "Review" at ARR
RuleChef:将LLM任务知识扎根于可人工编辑的规则
机构 * KR Labs(KR实验室) ; TU Wien(维也纳工业大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。
Comments 8 pages
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
机构 * KR Labs(KR实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; TU Wien(维也纳工业大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。
Comments 8 pages
将生成式策略基于物理:面向机器人控制的优化引导扩散
机构 * ETH Zurich(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出推理时优化框架,通过将扩散引导建模为约束优化问题,在采样中施加物理可行性约束,无需重训练即可提升机器人任务成功率。
通过说话人日志条件将口语大语言模型扩展到多说话人音频
专题命中 视觉定位与Grounding :grounding(title)
AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。
Comments Accepted to Interspeech 2026
VRA:在电压受限致动器中接地离散时间联合加速度
机构 * Department of Mechanical and Automation Engineering(机械与自动化工程系) ; Hong Kong Embodied AI Lab(香港具身AI实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出VRA方法,通过将运动学加速度与电压受限致动器物理相联系,解决在电压受限情况下不可实现的加速度问题,实验表明该方法能消除不可实现的加速度,恢复一致的近约束执行并减少约束引起的振荡。
Comments 10 pages, Accepted by RSS 2026
它会流行吗?基于开放网络的微视频流行度预测
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出了一种基于开放网络的微视频流行度预测方法,通过引入实时开放网络上下文来提升预测准确性,展示了WEBSHORTS数据集和SHORTS-CAST框架在预测微视频流行度方面的有效性。
Comments Working Progress
接触导向策略:具备生成接触基础的灵活视觉-触觉策略
机构 * Purdue University(普渡大学) ; Meta Reality Labs Research(Meta现实实验室) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出Contact-Grounded Policy,通过预测机器人状态和触觉反馈的耦合轨迹,生成接触基础的灵活视觉-触觉策略,优于现有基线方法。
从语音到空间:利用增强现实进行共享视图中话语的定位
机构 * Center for Visual Computing, Stony Brook University(石溪大学视觉计算中心)
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出Speech-to-Spatial框架,通过语音指令生成空间定位的AR指导,无需额外线索或人工标注,提升任务效率和可用性。
Comments 11 pages, 6 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026