arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-12 至 2026-03-12 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 9 篇

2603.10978 2026-03-12 cs.CV cs.AI 91%

GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations

GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉

Boyuan Chen, Minghao Shao, Siddharth Garg, Ramesh Karri, Muhammad Shafique

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);vision language model(abstract);VLM(abstract)

AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV 85%

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 70%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10675 2026-03-12 cs.RO 67%

Cybo-Waiter: A Physical Agentic Framework for Humanoid Whole-Body Locomotion-Manipulation

Cybo-Waiter:一个人形全身体态运动- manipulation的物理代理框架

Peng Ren, Haoyang Ge, Chuan Qi, Cong Huang, Hong Li, Jiang Zhao, Pei Chi, Kai Chen

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 Cybo-Waiter提出了一种人形全身体态运动-操作的物理代理框架,通过多对象3D几何监督和条件诊断提升任务执行的鲁棒性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10279 2026-03-12 cs.LG 57%

Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF

生成推荐系统的鲁棒性训练:为何指数奖励加权SFT优于RLHF

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出指数奖励加权SFT方法,通过直接优化观测奖励,有效解决生成推荐系统中的鲁棒性训练问题,理论和实验证实其在噪声环境下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00681 2026-03-12 cs.CV 57%

Adaptive Event Stream Slicing for Open-Vocabulary Event-Based Object Detection via Vision-Language Knowledge Distillation

面向视觉语言知识蒸馏的自适应事件流切片用于开放词汇事件基物体检测

Jinchang Zhang, Zijun Li, Jiakai Lin, Guoyu Lu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于视觉语言知识蒸馏的事件流切片方法,利用CLIP的语义理解实现事件数据上的开放词汇物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11997 2026-03-12 cs.CL 50%

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

SAGE: 一种面向多轮智能体评估的上下文知识引导用户模拟器

Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SAGE通过整合业务上下文知识,提出一种多轮智能体评估的用户模拟框架,生成更真实的交互并提高错误检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-03-12 cs.GT 50%

Quantal Response Equilibrium as a Measure of Strategic Sophistication: Theory and Validation for LLM Evaluation

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins, Jon Chun

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments 25 pages, 8 figures, submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07304 2026-03-12 cs.DB 50%

Tursio for Credit Unions: Structured Data Search with Automated Context Graphs

Tursio 用于信用社:基于自动上下文图的结构化数据搜索

Shivani Tripathi, Ravi Shetye, Shi Qiao, Alekh Jindal

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Tursio 通过自动上下文图技术,实现信用社等受监管行业结构化数据的自然语言查询与高效搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏