arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2568 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 764 篇

2608.09475 2026-08-11 cs.CV 新提交 57%

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09316 2026-08-11 cs.CV 新提交 57%

MemeMind: Reference-Guided Trace Construction for Offline Context Optimization

MemeMind:用于离线上下文优化的参考引导轨迹构建

Run Yang, Weihang Wang, Boheng Sheng, Yuchen He, Jielei Zhang, Pengyu Chen, Zhiyu Wu, Qiang Sun, Huyang Sun, Longwen Gao

机构 * Bilibili(哔哩哔哩) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MemeMind针对离线上下文优化中失败rollout缺失成功示例的问题,通过参考引导构建工具轨迹,在梗解读任务上提升了Qwen3-VL模型的性能。

Comments 24 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09139 2026-08-11 cs.CV 新提交 57%

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

CodecArena:基于视觉强化学习的编解码器质量评估

Jiaye Fu, Weiqi Li, Qiankun Gao, Yanchen Zhao, Xiandong Meng, Jian Zhang, Siwei Ma, Jiaqi Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对视频编码主流指标无法准确评估内容保真度的问题,提出首个视频编码质量评估视觉-语言框架CodecArena,采用视觉强化学习方案优化,构建相关数据集与基准,在源不相交内容上实现优于现有方法的人类判断一致性。

Comments The project page is: https://jyfu-vcl.github.io/codecarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08844 2026-08-11 cs.CV 新提交 57%

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)

基于文本提示的Segment Anything Model 3(SAM3)实现无掩码标注的内镜图像手术器械分割

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于SAM3与微调Qwen的两阶段框架,无需标注即可实现内镜图像的手术器械实例级分割,在EndoVis数据集上性能优于直接使用SAM3,为无标注分割提供了新方向。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08126 2026-08-11 cs.LG cs.CL 新提交 57%

Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk

准确集成,脆弱叙事:多尺度堆叠与LLM生成信用风险解释的保真度审计

Gregorius Reynaldi Pratama, Kuo-Kun Tseng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本研究构建多尺度堆叠集成预测模型并测试LLM生成信用风险解释的保真度,发现预测性能提升有限,LLM生成的解释存在事实错误,需对生成解释进行验证。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 57%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07631 2026-08-11 cs.SD cs.AI cs.MM 新提交 57%

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

PACE:面向基于大语言模型的全双工语音对话的播放对齐上下文引擎

Shibo Wang, Zicheng Zhang, Libo Wang, Junfeng Ma

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对全双工语音对话的生成上下文错位问题,提出了中间件层PACE,通过将模型上下文锚定到客户端播放边界解决该问题,在GCM-Bench等数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-11 cs.CL cs.AI 新提交 57%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi, Zhang Junming, Duan Ranjie, Xia Qiaolin, Wang Hao, Lu Yu, Shi Haibo, Ma Xingjun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07504 2026-08-11 cs.HC cs.AI econ.GN q-fin.EC 新提交 57%

Innovating with Generative AI: A Human Bottleneck Framework

生成式AI助力创新:人类瓶颈框架

Julian De Freitas, Ayelet Israeli, Gideon Nave, Artem Timoshenko, Olivier Toubia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出人类瓶颈框架,分析生成式AI对创新过程各阶段瓶颈的影响,区分瓶颈类型并探讨AI对传统创新流程的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07015 2026-08-10 cs.CV 新提交 57%

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06913 2026-08-10 cs.CV 新提交 57%

MuST-VAD: Mutual Structured Learning for Video Anomaly Detection

MuST-VAD:用于视频异常检测的互结构化学习

Satoshi Hashimoto, Hitoshi Nishimura, Mori Kurokawa

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MuST-VAD是用于弱监督视频异常检测的互结构化学习框架,通过检测器与LVLM的双向知识交换,在UCF-Crime数据集上显著提升了检测精度,AP优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05983 2026-08-07 cs.CV 新提交 57%

Universal Concept Disruption for SAM3 Image Segmentation

用于SAM3图像分割的通用概念干扰

Hao Wang, Yuxuan Zhang, Wei Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM3图像分割的对抗鲁棒性空白,提出通用概念干扰(UCD)攻击方法,在多数据集上显著降低SAM3的分割性能,且扰动可跨SAM3.1及视频推理迁移,仅有限恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05219 2026-08-07 cs.AI 新提交 57%

When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents

当特权指导出现错位:面向多轮智能体的状态匹配路由与语境化自蒸馏

Junzhuo Liu, Weiwei Li, Jun Ling, Peng Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对多轮智能体特权指导的状态-参考不匹配问题,提出SMRC-SD方法,通过状态匹配路由与语境化自蒸馏提升了ALFWorld和WebShop任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04750 2026-08-06 cs.CV cs.CL cs.MM 新提交 57%

Simile Understanding in Text-to-Image Models: An Evaluation Framework

文本到图像模型中的明喻理解:一个评估框架

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

机构 * The University of Tokyo(东京大学) Nara Institute of Science and Technology(奈良科学技术研究所) Chungnam National University(忠南国立大学) Institute of Science Tokyo(东京科学大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对文本到图像模型常混淆明喻喻体与本体的问题,提出含受控数据集、YOLO指标及Diffusion Lens分析的评估框架,实验发现模型存在字面化失败模式并讨论了缓解策略。

Comments Accepted as a full paper at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04424 2026-08-06 cs.CV 新提交 57%

Thinking with Anchors: Grounded and Efficient Document Reasoning

基于锚点思考:接地且高效的文档推理

Sichen Zhu, Yuchen Zhu, Wenzhuo Xu, Jason Kuen, Wanrong Zhu, Jing Shi, Xuan Shen, Quanyi Wang, Yiwei Wang, Yujun Cai, Bing Shuai, Qin Zhang, Yongxin Chen, Shilong Liu, Molei Tao, Jiuxiang Gu

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学) Adobe(奥多比公司) ZJU(浙江大学) NUIST(南京信息工程大学) SEU(东南大学) Physion Labs(Physion实验室) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 该研究提出面向推理的ADOPD 2026数据集,将多类文档元素转化为视觉锚点,支持区域语义标注、统一视觉-语言接地等能力,解决现有模型在文档计数任务上的不足,推动文档理解向锚点接地的智能方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04077 2026-08-06 cs.AI cs.CL 新提交 57%

FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

FinProBench:基于专业交付物衍生的角色基准评估金融AI智能体

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究推出FinProBench金融AI智能体基准及RGRC角色基准构建流程,实验显示RGRC在角色专业化角色评估上优于仅提示方法,角色级复用基准可大幅减少工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03911 2026-08-05 cs.CV 新提交 57%

UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution

UniEvo-RS:基于代表性示例驱动原型演化的全提示统一遥感分割

Kunquan Zhang, Peilang Li, Xikun Hu, Yunkai Yang, Yushan Zou, Zhiwei Zhang, Runmin Dong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 UniEvo-RS是配备代表性示例驱动原型演化的全提示统一遥感分割框架,通过多指令提示数据集与原型演化机制,在批量标注中对未见过的类别实现无需训练的精度提升,性能达当前最优。

Comments 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03715 2026-08-05 cs.LG cs.CE 新提交 57%

Amortized Interventional Forecasting for Multivariate CIR Processes

多元CIR过程的摊销干预预测

Andreas Sauter, Sumit Sourabh, Drona Kandhai, Erman Acar

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文针对多元CIR过程,提出摊销干预预测框架CIR-ACTIVA,可估计因果效应、预测多horizon冲击响应,在CDS利差测试中优于基线,能解答观测型方法无法处理的假设性查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03655 2026-08-05 cs.CL cs.AI 新提交 57%

Decoupling Generation and Selection for Budget-Constrained Faithful Summarization

面向预算约束的忠实摘要生成:解耦生成与选择

Zeyu Wang, Guanghua Wang, Meng Xu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对摘要式模型的事实不一致等问题,提出解耦生成与选择的模块化框架,在多数据集上提升了事实性,仅参考重叠分数略有降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03581 2026-08-05 cs.CY cs.AI 新提交 57%

AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

跨研究社区的AI辅助同行评审:从评审人AI政策到大语言模型评审质量

Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber, Kryštof Olík, Georg Groh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究调研111个顶尖AI/NLP会议及医学期刊的AI评审政策,评估ICLR 2026和《自然·通讯》的AI评审质量,发现AI评审存在系统性缺陷,主张采用多维度评估。

Comments 30 pages, 19 figures, 10 tables. Currently under peer review. GitHub link for code and data is given in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02598 2026-08-04 cs.CV 新提交 57%

VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification

VR3D:面向空地行人重识别的视角鲁棒3D表示学习

Chao Ji, Shiyu Xuan, Zechao Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文针对空地行人重识别的视角偏差问题,提出VR3D框架,通过视角鲁棒3D表示交互与可靠性感知融合技术,在三个基准数据集上实现了优于现有方法的性能,CARGO数据集Rank-1提升5.63%。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 57%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01977 2026-08-04 cs.CV 新提交 57%

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

SVGEval:用于文本到SVG生成中感知质量基准测试与评估的视觉基础框架

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) School of Integrated Circuits (School of Information Science and Electronic Engineering), Shanghai Jiao Tong University(上海交通大学集成电路学院(信息科学与工程学院)) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对文本到SVG生成评估的缺陷,提出视觉基础的SVGEval基准,发现多模态模型在几何布局判断上的差距,训练出可解释的SVG质量评分器,为SVG生成评估改进提供支撑。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 57%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 57%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01175 2026-08-04 cs.AI 新提交 57%

The Graph Language: How Knowledge Graphs Speak to Large Language Models

图语言:知识图谱如何与大语言模型对话

Giuseppe Pirrò

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对知识图谱与大语言模型融合的挑战,提出GRALAN模型,通过关系令牌实现KG在LLM语义空间的适配,在问答任务中显著优于现有方法,为KG-LLM融合提供新范式。

Comments Accepted to ISWC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 57%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00009 2026-08-04 cs.CL cs.AI 新提交 57%

AgentMemBench: A Systematic Benchmark for Evaluating Long-Term Memory Management Strategies in Conversational AI Agents

AgentMemBench:用于评估对话AI智能体长期记忆管理策略的系统基准

Ahmed Cherif

机构 * Sofrecom(索弗雷科姆)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究构建了AgentMemBench基准,评估五种记忆策略及两款现有系统,发现外部键值存储(EKV)在长程对话记忆任务中表现最优,但存在内存占用成本,同时公开了全部可复现资源。

Comments 22 pages, 3 figures submitted on Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28649 2026-08-03 cs.HC cs.AI 新提交 57%

COSI-Lab: Conference Living Lab for Modeling Multi-Perspective Multimodal Social Intention

COSI-Lab:用于建模多视角多模态社会意图的会议生活实验室

Zonghuan Li, Litian Li, Arthur Mercier, Gara Dorta, Balint Dioszegi, Jose Morales-Vargas, Chenxu Hao, Ivan Kondyurin, Vanessa Begemann, Nale Lehmann-Willenbrock, Bernd Dudzik, Saunaq Chakrabarty, Sotiris Vacanas, Laura Cabrera-Quirós, Anne L. J. ter Wal, Vitaliy Popov, Jorge Castro-Godínez, Chirag Raman, Stephanie Tan, Hayley Hung

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 COSI-Lab构建了含32名学者的会议多模态数据集,提出表观意图推理任务及相关标注、分析、基准等贡献,助力智能系统处理主观感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28509 2026-07-31 cs.CV 新提交 57%

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

RefCaptioner:多参考图像接地的视频字幕生成

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。

Comments https://github.com/pkucs-Ltf/RefCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏