arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-14 至 2026-08-14 共收录 20 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 20 篇

2608.12781 2026-08-14 cs.CV 新提交 89%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 视觉定位与Grounding :MLLM(title_cn,summary_cn);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12748 2026-08-14 cs.CV 新提交 79%

Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding

扩展表示多样性:用于视觉定位的调制注意力与重构正则化

Junyi Hu, Tian Bai, Fengyi Wu, Yian Huang, Wei Wen, Zaoli Li, Junli Lin, Xingchen Li, Zhenming Peng, Yi Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对指代表达理解模型跨数据集泛化能力有限的问题,提出含mACH与JEPA辅助流的架构及Objects365-Caption数据,实现了强泛化与具竞争力的REC性能。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-14 cs.CV cs.CL 新提交 79%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

LingKai Bu

专题命中 视觉定位与Grounding :grounding(title);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12683 2026-08-14 cs.RO cs.CV 新提交 79%

FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

FUSE:通过自适应语义-几何证据获取实现主动功能可供性接地

Zhou Chen, Sathyanarayanan N. Aakur

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 该研究提出主动功能可供性接地任务,构建FUSE框架结合不确定性驱动探索与摊销规划器,基于Habitat基准验证其在非神示接地中性能最优且计算量降低1.33倍。

Comments Under review. 15 Pages. 9 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13216 2026-08-14 cs.HC 新提交 78%

CogChat: Knowledge Graph-Augmented Conversational AI with Heterogeneous Graph Transformer for Cognitive Grounding in Design Generation

CogChat:结合知识图谱与异构图变换器的对话式人工智能,用于设计生成中的认知接地

Jiin Choi, Kyung Hoon Hyun

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 本研究提出结合异构图变换器的CogChat框架,以设计师专属动态知识图谱为基础,提升设计对话的上下文保留度与意图解读效果,降低认知负荷,为LLM交互的长期上下文管理提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12894 2026-08-14 cs.CL 新提交 78%

BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

BavGround:巴伐利亚区域文化接地与方言能力基准

Jophin John, Michael Hoffmann, Jan Fillies, Michael A. Hedderich, Barbara Plank

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13343 2026-08-14 cs.CV 新提交 77%

AmalthAI: An Open-Source Computer Vision Platform for Cultural Heritage

AmalthAI:面向文化遗产的开源计算机视觉平台

Christos Chatzisavvas, Stelios Alvanos, Efstratios Politis, Panagiotis Rigas, Thomas Pappas, Ioannis Giannoukos, Nikolaos Mitianoudis, Agata Ulanowska, Katarzyna Żebrowska, Nazarij Buławka, Christina Margariti, George Pavlidis, Chairi Kiourt, Anestis Koutsoudis, Vassilis Katsouros, George Ioannakis

机构 * Democritus University of Thrace(德谟克利特色雷斯大学) Athena Research Center(雅典娜研究中心) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) University of Warsaw(华沙大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 AmalthAI是面向文化遗产领域专家的开源计算机视觉平台,通过集成Kubeflow、Katib等工具,支持数据集管理、模型训练与推理,可保障敏感考古数据安全,已在黏土织物印痕数据集上验证其功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02711 2026-08-14 cs.CV 版本更新 77%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract_cn);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 70%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12721 2026-08-14 cs.CV 新提交 70%

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09200 2026-08-14 cs.CV 版本更新 70%

NBA_Streaming: A Large-Scale Benchmark for Fine-Grained Basketball Commentary Generation in Continuous Streams

NBA_Streaming:用于连续流中细粒度篮球评论生成的大规模基准测试

Lifang Wu, Yuyang Wu, Yangdong Gao, Fengyu Liu, Ya Jing, Liang Wang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有篮球评论生成方法与数据集不适用于连续流的局限,推出大规模基准NBA_Streaming,提出因果两阶段框架,可有效提升在线细粒度篮球评论生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交 67%

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 57%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13186 2026-08-14 cs.CV 新提交 57%

SketchSense: Learning to Interpret Imperfect Sketch Guidance for Image Inpainting

SketchSense:学习解释用于图像修复的不完美草图引导

Zian Yang

机构 * Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SketchSense是同步去噪RGB与结构流的框架,通过双向注意力融合等技术解释不完美草图引导,在图像修复的质量和结构保真度上较现有方法有显著提升。

Comments 10 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13119 2026-08-14 cs.CV 新提交 57%

QuISE: Defense against Typographic Attacks on VLMs via Query-Irrelevant Semantic Editing

QuISE:通过查询无关语义编辑防御视觉语言模型的排版攻击

Shubin Lu, Jiaqi Yin, Yihao Huang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对VLMs的排版攻击问题,提出模型无关无训练的黑盒防御方法QuISE,通过文本定位、语义替换及答案一致性判断提升防御性能,在多基准和模型上取得良好效果。

Comments 10 pages, 7 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13018 2026-08-14 cs.AI 新提交 57%

Foundations of MT-PDCL: Measure-Theoretic Probabilistic Definite Clause Logic

MT-PDCL的基础:测度论概率确定性子句逻辑

Costin Bădică, Amelia Bădică

机构 * University of Craiova(克拉约瓦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出测度论概率确定性子句逻辑(MT-PDCL),通过引入连续可测空间上的精确Lebesgue积分,突破了传统概率逻辑编程的有限域限制,实现了兼具表达能力与纯声明式语法的可微推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12549 2026-08-14 cs.CV 新提交 57%

StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

StrAD:面向长视频音频描述生成的流式方法与基准

Julian Spravil, Sebastian Houben, Sven Behnke

机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics, University of Bonn(波恩大学机器人中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03314 2026-08-14 cs.CV cs.CL 版本更新 57%

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

CoLA: 跨模态低秩适配用于多模态下游任务

Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Atito

机构 * Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心) University of Surrey(塞维利亚大学) Surrey Institute for People-Centred AI(以人为本的人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出CoLA框架,通过引入跨模态适配路径扩展LoRA,实现双流架构中单模态基础模型的高效多模态适配,在视觉-语言和音频-视觉任务上分别提升约3%和2%的相对性能。

Comments Accepted by ICML 2026, 17 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12951 2026-08-14 cs.SD 新提交 50%

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

VoxAudio:基于多奖励自回归流匹配的发声音频合成

Wenxiang Guo, Changhao Pan, Ziyue Jiang, Fei Wu, Zhou Zhao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12707 2026-08-14 cs.RO 新提交 50%

SAP-Nav: Spatial Semantic Representation Meets Active Perception for Hierarchical Open-Vocabulary Object Navigation

SAP-Nav:空间语义表示与主动感知结合的分层开放词汇对象导航

Xuetong Pei, Jian Liu, Vidura Munasinghe, Bo Miao, U-Xuan Tan, Wenrui Ding, Na Zhao

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出SAP-Nav框架,结合空间语义表示与主动感知,解决分层开放词汇对象导航问题,在基准测试中性能最优且真实场景可行,无需特定训练或预计算场景地图。

详情

展开后加载摘要…

URL PDF HTML 收藏